Hojo-TTS-Light-40M — AX650/NPU3 预编译模型 + C++ SDK
Hojo-TTS-Light-40M 中文/英文 TTS(24kHz,15 音色)在爱芯 AX650/NPU3 上的预编译部署包。 全链路 NPU:LM(ax-llm s4/W4A16)+ fine_local + decoder。
内容
models/:预编译模型lm_v1_60fix/:LM 10 层 decode-only axmodel + post + embedding(Pulsar2 6.0 llm_build,s4/W4A16)fine_local.axmodel(INT8,cos 0.9997)decoder_sq.axmodel(SmoothQuant+U16,mag 0.998+ / phase 0.95-0.97)- 音色 / 词典 / speaker_vecs / id2code / speaker_embeds
bin/:C++ 可执行(AX650/aarch64)hojo_tts_text:纯 C++ 文本 → wav(内部完成 tokenizer + embedding 预处理)hojo_tts_cpp/tts_driver:调试用
用法(板端)
./bin/hojo_tts_text \
models models/lm_v1_60fix/embed_tokens.bin models/speaker_embeds.bin \
models/lm_v1_60fix models/fine_local.axmodel models/decoder_sq.axmodel \
models/speaker_vecs.bin 0 models/id2code.bin \
"Hello, this is a test of the Hojo TTS system." voice_0 out.wav
输出 out.wav(24kHz)。音色索引 0-14(voice_ids 见 models/Hojo-TTS-Light-40M-voice.npz)。
示例音频(24kHz WAV,板端真实生成)
中文示例(voice 0):
英文示例(voice 0):
精度
- LM step0 logits cos 0.972(vs fp32 ONNX),top1 精确命中;decode ~162 tok/s
- 全链路 RTF≈0.4;端到端音频正常
复现
模型转换与 C++ SDK 构建源码见 GitHub:ml-inory/hojo-tts-light.axera