Methodology · Voice

AI 配音方法论

克隆音色 × 情感导演 × 去 AI 味工程化
v1.0 · 2026-08-13 · 实测验证:百炼 Qwen3-TTS / CosyVoice v3.5-plus · 案例:双人小剧场《掉金豆豆》
TTS 不是"文本转语音",是"导演配音" —— 你导得越细,AI 味越少

🎧 案例

《掉金豆豆》v3 · 双人对话小剧场(50s)
克隆音色 duan × role2 · 情感标签 + 逐句导演词 + 随机变速/间隙 + EQ 去电味 + 结尾淡出
句角色情感处理
1老婆(role2)[抽泣] + 委屈控诉、声音发颤
2老公(duan)[轻笑] + 心疼宠溺
3老婆[抽泣] + 哭腔加重、拖长尾音
4老公低声下气、语速放慢
5老婆[破涕为笑] + 鼻音未消带笑
6老公[大笑] + 豪爽
7老婆软糯收尾 + 全局 1.8s 淡出

🧠 模型全景

模型提供方特长短板场景
cosyvoice-v3.5-plus百炼(阿里通义)声音复刻 + 方言指令 + 情感标签 + 情绪指令,一个模型全包仅云端、付费克隆配音、多角色
qwen3-tts-flash百炼方言预置音色(川/粤/津/京),HTTP 一次调用,97ms 首包不支持情绪指令(静默忽略)快速方言
qwen3-tts-instruct-flash百炼自然语言控情绪(1600 token 指令)仅普通话音色情绪配音
qwen3-tts-vc百炼克隆基本只保普通话克隆(普通话)
Qwen3-TTS 开源版fal 托管0.6B/1.7B 开源,3 秒克隆,跨语言 SOTA1.7B 需 GPU;fal $0.09/千字符海外/跨语言克隆
VoxCPM2本地(面壁)免费、CPU 可跑、9 方言RTF ~3x,无指令控制日常语音回复
ElevenLabs海外表现力顶流贵、中文一般英文向

百炼音色速查

音色口音人设
Eric四川话成都男,跳脱市井
Sunny四川话川妹子,甜
Rocky粤语幽默阿强
Peter天津话相声捧哏
Dylan北京话北京青年
Cherry / Vivian / Serena / Uncle_Fu普通话日常主力

🧭 选型决策树

要什么?
├─ 免费日常回复 → VoxCPM2 本地
├─ 方言(川/粤/津/京…)→ qwen3-tts-flash + 方言音色
├─ 语气/情绪 → qwen3-tts-instruct-flash(⚠️ 仅普通话)
├─ 方言+情绪 → 方言音色 + 文本写口语化(指令不支持叠加)
├─ 克隆任意人 → cosyvoice-v3.5-plus
└─ 克隆+方言+情绪 → 只有 cosyvoice-v3.5-plus 一个选项

铁律:口音是音色级的,指令改不了口音(Cherry 永远不会说四川话);克隆要 15 秒以上干净人声。

🎭 情感强化三层

L1 指令导演词

不要写"温柔",要写场景+动作+心理:"温柔宠溺,轻声细语,像哄小孩,尾音上扬"。

L2 情感标签嵌文本

[抽泣] [轻笑] [破涕为笑] [大笑] [叹气] [耳语] —— cosyvoice 原生支持,直接驱动拟声,比指令更硬。

L3 文本口语化

真人不说完整句子:填充词(嗯/呃)、重复("你刚才、你刚才")、半截话、语气词(嘛/啊/哟)。

🧹 去 AI 味四层

AI 味三大来源:太干净、太均匀、频谱有合成感。

层手段参数
节奏每句随机变速atempo 0.94-1.08
停顿间隙随机化0.15-0.65s(不等长)
频谱EQ 削合成感 + 暖度 + 去咝3.5kHz -2.5dB / 180Hz +2dB / 6.8kHz -2dB
质感tanh 软饱和 + 轻压缩 + 粉噪 + 微混响模拟真实录音空间
结尾自然收尾句 + 整体淡出1.5-1.8s fade
[0:a]highpass=f=85,
equalizer=f=180:t=q:w=1.0:g=2.0,
equalizer=f=3500:t=q:w=1.4:g=-2.5,
equalizer=f=6800:t=q:w=1.6:g=-2.0,
asoftclip=type=tanh:param=0.75,
acompressor=threshold=-19dB:ratio=2:attack=12:release=140[main];
anoisesrc=color=pink:amplitude=0.010[n];
[main][n]amix=inputs=2:duration=first,
aecho=0.7:0.35:26:0.10,
afade=t=out:st=<dur-1.8>:d=1.8[out]

👥 多角色分轨

角色A台词 → voice_A + 指令A → 轨1.wav ─┐
角色B台词 → voice_B + 指令B → 轨2.wav ─┼→ concat(随机间隙) → 混音 → 成品
角色A台词 → ...              → 轨3.wav ─┘

一人分饰多角:同一 voice_id + 不同指令分轨。

🗃️ 已复刻音色注册表

人物voice_id参考源
边江cosyvoice-v3.5-plus-bj-a7a41343a86149f5aa8c11dc35a29fcc抖音朗读《春》10s
duan(哄方)cosyvoice-v3.5-plus-duan-9a7c4e281aa24dbda0495fc47e3afa20哄宝宝 36s
role2(撒娇方)cosyvoice-v3.5-plus-role2-b1beb4ce5aab4d9ab361f88c2e41c07a撒娇 57s

⛔ 踩坑清单(实战换的)

  1. qwen3-tts-flash 传 instruction 静默忽略 —— 语气控制必须 instruct 系列
  2. 口音是音色级的,指令改不了
  3. instruct 系列只有普通话音色;方言+情绪指令不可叠加
  4. 克隆音频 <15s 报 AudioShortError(11s 实测被拒)
  5. WebSocket 合成 finish() 非阻塞,不等完成事件 = 0 字节
  6. 百炼 plus 模型只走 WebSocket,HTTP REST 报 url error
  7. ffmpeg asoftclip 是 tanh 不是 tan
  8. 混合滤镜必须 -filter_complex 分链,amix 不能串在 -af 单链
  9. 复刻音频需公网 URL:up.93ie.com 上传路径是 /upload/<filename>