配合notion mcp生成文章summary与callout,然后结合内容形成完整文稿,推送tts生成音频
环境配置
- 参考项目
- clone下来用Agent结合start脚本里相关设置,通过本地mise下uv进行环境搭建,后续通过start脚本启动
使用配置
- float16精度推理,sdpa加速,最大token数拉满(尽量一次生成,整个语音的衔接好些,且在最开始的几s容易表现不佳,多端意味着有更多“开头几s”)


使用 - 克隆生成
- 情感上与声音相似度上不如indextts,gpt-sovits,但好在没有电音效果
- 使用1.7B模型

- 文本上可以提前改改
- 如果需要按行分段生成,可以合并一些标题到段落开头,用。连接
- 、有时候讲话过渡略快,用,可能好点
- 数字实测有概率念错 - 左侧有概率为:一 (百,吐字不清)二八 需要直接写出念出来的文字
- 百分号与小数同上,比如左侧6.7%有概率为:百分六七
- 多音符号也需要明确写出对应文字,各行之和有概率念成:各“形”之和,为确保不念错音,可以换成“杭”,图2的1M同理,可能成1“m”(英文m音)而不是1兆


- 中英夹杂用auto,两边都可以正常发音,提供参考音频,时长不适合长(无明显提升,显存占用提升倒是明显)

- 8G卡可跑,如果混合模式(应用全放集显,独显保持空载)6G应该也能跑
效果
- 都带有一定的底噪
- 优化文本版本
- 原始文本版本
- NF4量化优化文本版本(有较为明显的性能下降)
文稿可进一步改进的点
- 最后靠分号分割效果并不是特别好,没有很体现五个点分点,可以考虑用一 二等枚举点进行衔接
- 开头几s效果不好,可以考虑填充一段开头文本,然后最终音频里剪掉

