AutoArk

Audio8-TTS-0.1B

为端侧部署设计的 170M 参数零样本语音模型

2026 年 09 月 10 日

即刻接入API
Audio8-TTS-0.1B

The smallest zero-shot TTS worth running.
一个为端侧部署设计的 170M 参数零样本语音模型。

0.1B 面向本地 CPU、低内存设备和离线环境,把零样本音色条件压缩进 170M 参数的主生成模型,并围绕 ONNX Runtime 提供完整的推理路径。它的价值在于用紧凑预算保留一条可用的声音生成链路。

保留 DualAR,换掉 Slow AR 主干

0.1B 保留与 0.6B 相同的语义到声学交接方式。Slow AR 负责按帧推进语义 token;Fast AR 读取它的隐藏状态,沿 10 层 RVQ 补齐声学码本。不同之处在于 Slow AR 使用Falcon-H1 混合式主干,把注意力层与 Mamba 2 状态空间层结合起来,将宽度降到 512,同时维持长程状态和帧内声学解码之间的契约。

组件配置
主模型170M 参数,不计音频解码器
Slow AR24 层,宽度 512,8 个注意力头,2 个 KV 头;Mamba d_state=64
Fast AR4 层,宽度 512
声学表示10 个码本,每个码本 4,096 个条目
神经音频编解码器44.1 kHz,每个模型帧 2,048 个采样点;约 120M 参数
上下文最多 2,048 个打包后的文本/音频位置

170M 表示主生成模型规模;要真正输出波形,独立的 codec decoder 仍需计入存储和内存预算。

ONNX INT8:让端侧链路真正落地

Audio8-TTS-0.1B ONNX INT8 并非简单的量化权重。它将 Slow AR、Fast AR 的逐 token 图、FP16 音频编解码器、显式循环状态和 CPU 推理接口组合成一条可由 ONNX Runtime 调度的路径。模型下载后不需要 CUDA、PyTorch 或 Transformers。

模块运行时表示作用
Slow ARINT8 逐 token 图显式传递注意力与 Mamba 状态;valid-prefix attention 限制有效前缀计算
Fast ARINT8 逐 token 图逐帧生成 10 层声学码本
音频编码器 / 解码器FP16注册参考音色与还原 44.1 kHz 波形
输出波形FP32、单声道交给本地文件、PCM 流或服务接口
端侧运行参考

在 Linux x86_64 测试平台上,加载后常规推理约占用 0.4 GiB。8 线程主机的 Slow AR 每个 token 约 19 ms,Fast AR 每帧约 8 ms;这些数字会随 ONNX Runtime 构建、分配器、线程数和硬件变化。

把音色注册移出热路径

普通合成只需要 Slow AR、Fast AR 和 codec decoder。创建新音色时,系统才加载 codec encoder,把参考录音和准确文本转换成可复用的 voice codes;完成注册后即可卸载 encoder,再恢复日常合成。音色注册是一次性的生命周期操作,而不是每个请求都要承担的常驻成本。

从模型文件到服务边界,CLI、本地 HTTP、流式 PCM、音色注册和 OpenAI 兼容接口均已覆盖。