Loading
CamelliaV の BLOG
0%
INITIALIZING
通过qwen-tts为文章生成音频
DOC_ID // 32cca1ONLINE

通过qwen-tts为文章生成音频

2026-6-1
UPDATED: 2026-6-7
技术分享
READ 2 MIN/COUNT 605
#开发
CamelliaV の BLOG
🎮
配合notion mcp生成文章summary与callout,然后结合内容形成完整文稿,推送tts生成音频

环境配置

  • 参考项目
  • clone下来用Agent结合start脚本里相关设置,通过本地mise下uv进行环境搭建,后续通过start脚本启动

使用配置

  • float16精度推理,sdpa加速,最大token数拉满(尽量一次生成,整个语音的衔接好些,且在最开始的几s容易表现不佳,多端意味着有更多“开头几s”)
notion image
notion image

使用 - 克隆生成

  • 情感上与声音相似度上不如indextts,gpt-sovits,但好在没有电音效果
  • 使用1.7B模型
notion image
  • 文本上可以提前改改
    • 如果需要按行分段生成,可以合并一些标题到段落开头,用。连接
    • 、有时候讲话过渡略快,用,可能好点
    • 数字实测有概率念错 - 左侧有概率为:一 (百,吐字不清)二八 需要直接写出念出来的文字
    • 百分号与小数同上,比如左侧6.7%有概率为:百分六七
    • 多音符号也需要明确写出对应文字,各行之和有概率念成:各“形”之和,为确保不念错音,可以换成“杭”,图2的1M同理,可能成1“m”(英文m音)而不是1兆
notion image
notion image
  • 中英夹杂用auto,两边都可以正常发音,提供参考音频,时长不适合长(无明显提升,显存占用提升倒是明显)
notion image
  • 8G卡可跑,如果混合模式(应用全放集显,独显保持空载)6G应该也能跑

效果

  • 都带有一定的底噪
  • 优化文本版本
  • 原始文本版本
  • NF4量化优化文本版本(有较为明显的性能下降)

文稿可进一步改进的点

  • 最后靠分号分割效果并不是特别好,没有很体现五个点分点,可以考虑用一 二等枚举点进行衔接
  • 开头几s效果不好,可以考虑填充一段开头文本,然后最终音频里剪掉
 
NAVIGATION // Related Articles
Loading...
© 2024-2026 CamelliaV