| 句 | 角色 | 情感处理 |
|---|---|---|
| 1 | 老婆(role2) | [抽泣] + 委屈控诉、声音发颤 |
| 2 | 老公(duan) | [轻笑] + 心疼宠溺 |
| 3 | 老婆 | [抽泣] + 哭腔加重、拖长尾音 |
| 4 | 老公 | 低声下气、语速放慢 |
| 5 | 老婆 | [破涕为笑] + 鼻音未消带笑 |
| 6 | 老公 | [大笑] + 豪爽 |
| 7 | 老婆 | 软糯收尾 + 全局 1.8s 淡出 |
| 模型 | 提供方 | 特长 | 短板 | 场景 |
|---|---|---|---|---|
| cosyvoice-v3.5-plus | 百炼(阿里通义) | 声音复刻 + 方言指令 + 情感标签 + 情绪指令,一个模型全包 | 仅云端、付费 | 克隆配音、多角色 |
| qwen3-tts-flash | 百炼 | 方言预置音色(川/粤/津/京),HTTP 一次调用,97ms 首包 | 不支持情绪指令(静默忽略) | 快速方言 |
| qwen3-tts-instruct-flash | 百炼 | 自然语言控情绪(1600 token 指令) | 仅普通话音色 | 情绪配音 |
| qwen3-tts-vc | 百炼 | 克隆 | 基本只保普通话 | 克隆(普通话) |
| Qwen3-TTS 开源版 | fal 托管 | 0.6B/1.7B 开源,3 秒克隆,跨语言 SOTA | 1.7B 需 GPU;fal $0.09/千字符 | 海外/跨语言克隆 |
| VoxCPM2 | 本地(面壁) | 免费、CPU 可跑、9 方言 | RTF ~3x,无指令控制 | 日常语音回复 |
| ElevenLabs | 海外 | 表现力顶流 | 贵、中文一般 | 英文向 |
| 音色 | 口音 | 人设 |
|---|---|---|
Eric | 四川话 | 成都男,跳脱市井 |
Sunny | 四川话 | 川妹子,甜 |
Rocky | 粤语 | 幽默阿强 |
Peter | 天津话 | 相声捧哏 |
Dylan | 北京话 | 北京青年 |
Cherry / Vivian / Serena / Uncle_Fu | 普通话 | 日常主力 |
要什么?
├─ 免费日常回复 → VoxCPM2 本地
├─ 方言(川/粤/津/京…)→ qwen3-tts-flash + 方言音色
├─ 语气/情绪 → qwen3-tts-instruct-flash(⚠️ 仅普通话)
├─ 方言+情绪 → 方言音色 + 文本写口语化(指令不支持叠加)
├─ 克隆任意人 → cosyvoice-v3.5-plus
└─ 克隆+方言+情绪 → 只有 cosyvoice-v3.5-plus 一个选项
铁律:口音是音色级的,指令改不了口音(Cherry 永远不会说四川话);克隆要 15 秒以上干净人声。
不要写"温柔",要写场景+动作+心理:"温柔宠溺,轻声细语,像哄小孩,尾音上扬"。
[抽泣] [轻笑] [破涕为笑] [大笑] [叹气] [耳语] —— cosyvoice 原生支持,直接驱动拟声,比指令更硬。
真人不说完整句子:填充词(嗯/呃)、重复("你刚才、你刚才")、半截话、语气词(嘛/啊/哟)。
AI 味三大来源:太干净、太均匀、频谱有合成感。
| 层 | 手段 | 参数 |
|---|---|---|
| 节奏 | 每句随机变速 | atempo 0.94-1.08 |
| 停顿 | 间隙随机化 | 0.15-0.65s(不等长) |
| 频谱 | EQ 削合成感 + 暖度 + 去咝 | 3.5kHz -2.5dB / 180Hz +2dB / 6.8kHz -2dB |
| 质感 | tanh 软饱和 + 轻压缩 + 粉噪 + 微混响 | 模拟真实录音空间 |
| 结尾 | 自然收尾句 + 整体淡出 | 1.5-1.8s fade |
[0:a]highpass=f=85,
equalizer=f=180:t=q:w=1.0:g=2.0,
equalizer=f=3500:t=q:w=1.4:g=-2.5,
equalizer=f=6800:t=q:w=1.6:g=-2.0,
asoftclip=type=tanh:param=0.75,
acompressor=threshold=-19dB:ratio=2:attack=12:release=140[main];
anoisesrc=color=pink:amplitude=0.010[n];
[main][n]amix=inputs=2:duration=first,
aecho=0.7:0.35:26:0.10,
afade=t=out:st=<dur-1.8>:d=1.8[out]
角色A台词 → voice_A + 指令A → 轨1.wav ─┐
角色B台词 → voice_B + 指令B → 轨2.wav ─┼→ concat(随机间隙) → 混音 → 成品
角色A台词 → ... → 轨3.wav ─┘
一人分饰多角:同一 voice_id + 不同指令分轨。
| 人物 | voice_id | 参考源 |
|---|---|---|
| 边江 | cosyvoice-v3.5-plus-bj-a7a41343a86149f5aa8c11dc35a29fcc | 抖音朗读《春》10s |
| duan(哄方) | cosyvoice-v3.5-plus-duan-9a7c4e281aa24dbda0495fc47e3afa20 | 哄宝宝 36s |
| role2(撒娇方) | cosyvoice-v3.5-plus-role2-b1beb4ce5aab4d9ab361f88c2e41c07a | 撒娇 57s |
AudioShortError(11s 实测被拒)tanh 不是 tan-filter_complex 分链,amix 不能串在 -af 单链/upload/<filename>