Hojo-TTS-Light-40M — AX650/NPU3 预编译模型 + C++ SDK

Hojo-TTS-Light-40M 中文/英文 TTS(24kHz,15 音色)在爱芯 AX650/NPU3 上的预编译部署包。 全链路 NPU:LM(ax-llm s4/W4A16)+ fine_local + decoder。

内容

  • models/:预编译模型
    • lm_v1_60fix/:LM 10 层 decode-only axmodel + post + embedding(Pulsar2 6.0 llm_build,s4/W4A16)
    • fine_local.axmodel(INT8,cos 0.9997)
    • decoder_sq.axmodel(SmoothQuant+U16,mag 0.998+ / phase 0.95-0.97)
    • 音色 / 词典 / speaker_vecs / id2code / speaker_embeds
  • bin/:C++ 可执行(AX650/aarch64)
    • hojo_tts_text:纯 C++ 文本 → wav(内部完成 tokenizer + embedding 预处理)
    • hojo_tts_cpp / tts_driver:调试用

用法(板端)

./bin/hojo_tts_text \
  models models/lm_v1_60fix/embed_tokens.bin models/speaker_embeds.bin \
  models/lm_v1_60fix models/fine_local.axmodel models/decoder_sq.axmodel \
  models/speaker_vecs.bin 0 models/id2code.bin \
  "Hello, this is a test of the Hojo TTS system." voice_0 out.wav

输出 out.wav(24kHz)。音色索引 0-14(voice_ids 见 models/Hojo-TTS-Light-40M-voice.npz)。

示例音频(24kHz WAV,板端真实生成)

中文示例(voice 0):

英文示例(voice 0):

精度

  • LM step0 logits cos 0.972(vs fp32 ONNX),top1 精确命中;decode ~162 tok/s
  • 全链路 RTF≈0.4;端到端音频正常

复现

模型转换与 C++ SDK 构建源码见 GitHub:ml-inory/hojo-tts-light.axera

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support