Findings¶
跨实验的主张,每条带证据强度与出处。 强 = n≥30 或两条独立口径一致;中 = n≥10 单一口径;弱 = n<10,只作线索不作结论。
全局前提
本项目所有情感强度类结论都依赖 emotion2vec,而该分类器在本任务上已被证明饱和 (见 F5)。凡是「混合成功与否」的判断都受此限制。
F1 · DTW 内容对齐是长度失配的唯一有效解¶
证据强度:中(3 句 × 6 混合配方 = 18 条/臂;效应量级极大 + 有自检臂)
| 臂 | 混合 CER |
|---|---|
| 截断 | 0.662 |
| 条件侧 token 重采样 | 0.430 |
| 条件侧 μ 插值 | 0.447 |
| 状态侧均匀 warp | 0.562 |
| 状态侧 DTW | 0.053 |
低 8–12 倍。自检臂:纯情感配方在六臂逐条完全相同,证明差异只来自混合。
⚠️ 边界:这条只说「字重新听得清了」,不蕴含「混合可用」(见 F7)。
→ M3 调色板六臂
F2 · 混合时长可以成为 α 的连续函数¶
证据强度:机制强(构造保证)/ 音质弱(n=1 句)
\(K^* = \sum_e w_e K_e\) 是凸组合,故时长必落在各分支之间。实测每 0.25 α 恰好 +17 帧:
| α | 0.00 | 0.25 | 0.50 | 0.75 | 1.00 | 1.25 | 1.50 |
|---|---|---|---|---|---|---|---|
| \(K^*\) | 170 | 187 | 204 | 221 | 238 | 255 | 272 |
| CER | 0 | 0 | 0 | 0 | 0 | 0.083 | 0.083 |
前提:必须固定各情感的 LLM 种子,否则 1.288 的采样噪声会淹没这条曲线。
⚠️ 边界:CER 那一行只有 1 句话,属弱证据。
→ M3
F3 · 时长是情感身份的内禀属性,无法通过挑参考剥离¶
证据强度:强(两条独立口径:长度测量 n=300 + 合成音频 CER)
两条互相独立的否决理由:
- 压不到位 —— 数据集里最整齐的参考(真实时长比 1.078)只能把生成离散度压到 1.28, 而逐帧混合需要 ≲1.05。且 LLM 采样噪声单独就有 1.288 (同参考同文本同情感,只换种子重抽 5 次)—— 即使情感完全不影响时长,方案也失败。
- 压到了也没用 —— 整齐参考 vs 不齐参考的混合 CER 几乎相同(0.544 vs 0.529), 尽管生成离散度差了 1.5 倍(1.28 vs 1.91)。
附带:最「时长整齐」的参考,情感表达反而最弱(纯情感得分 0.517 vs 不齐参考 0.697)—— 时长整齐与情感表达充分此消彼长。
→ M2 参考探针
F4 · 「1+3」几何:情感方向沿唤醒度分离,不是效价¶
证据强度:强(三条独立通道一致)
| 通道 | 证据 |
|---|---|
| 方向余弦 | Happy 与 Angry 的 cos = 0.72,尽管效价相反 |
| 时长指纹 | Angry 稳定偏短 / Sad 稳定偏长;Happy 与 Surprise 无稳定指纹 |
| 分类器混淆 | Surprise 被判成 Angry(1.00) 或 Happy(1.00);Happy 被判成 Surprise(0.70) |
三条通道在同一对情感(Happy/Surprise)上同时失稳。
F5 · 现有情感指标结构上无法表达「部分情感」¶
证据强度:强(n=168 条评分,两个模型)
emotion2vec_plus_large 输出饱和的近 one-hot 分布:
| α | 0.00 | 0.25 | 0.50 | 0.75 | 1.00 | 1.25 | 1.50 |
|---|---|---|---|---|---|---|---|
| 中立 | 1.00 | 1.00 | 1.00 | 0.01 | 0.00 | 0.00 | 0.00 |
| 难过 | 0.00 | 0.00 | 0.00 | 0.99 | 1.00 | 1.00 | 1.00 |
全是 0.00 或 1.00,从无 0.6/0.4 的中间态 —— 而同批音频的时长在完美线性变化, 所以音频确实有中间态,是评测器表达不了。
更直接的证据(逐组原始分数):
0001_text00290 Sad : [1.0, 1.0, 1.0, 1.0, 1.0, 1.0, 1.0] ← α=0 的纯中性音频被判 Sad 1.0
0002_text00150 Ang : [0.003, 0.07, 0.003, 4e-7, 5e-9, 0.06, 1e-8] ← delta 为负
全部分数里 83–87% 落在 <0.05 或 >0.95。
推论:混合配方那 0.31–0.39 的情感分读不出结论 —— 成功的 50/50 混合本就不该在任一端点得高分,低分既可能是成功也可能是退化。
这是当前的头号瓶颈。 见 OPEN G1。
F6 · A 低秩、句首集中;主子空间不承载情感身份¶
证据强度:秩与阵发性 中(n=72 次测量)/ 情感专一性 弱(仅 12 组跨句对)
| A | v_neu(对照) | 随机 | |
|---|---|---|---|
| 帧间方向一致性 | +0.367 | +0.450 | 0.000 |
| 有效秩(上限 80) | 27.5 | 39.8 | — |
| 逐帧范数变异 | 0.389 | 0.145 | — |
\(A\) 沿时间变化比 \(v_{\text{neu}}\) 更剧烈(否定了「\(A\) 沿 K 恒定」的直觉), 但显著低秩 —— 「沿时间起伏,只在窄子空间里起伏」。
能量分布(归一化时间 10 段,1.0 = 该句均值):
| 段 | 1 | 2 | 3 | 4 | 5 | 6 | 7 | 8 | 9 | 10 |
|---|---|---|---|---|---|---|---|---|---|---|
| A | 2.04 | 0.88 | 1.08 | 1.14 | 1.03 | 1.00 | 1.09 | 1.10 | 0.83 | 1.02 |
| v_neu | 1.19 | 0.98 | 1.03 | 0.97 | 1.01 | 1.02 | 1.01 | 1.02 | 1.00 | 0.89 |
能量高度集中在句首(2.04× vs v_neu 的 1.19,净超出约 1.7×), 去掉句首后各段基本持平(0.83–1.14),前半/后半比值仅 1.026。
主子空间不区分情感(弱证据):同情感/不同句 0.194 ≈ 同句/不同情感 0.203(随机基线 0.0625)。 若成立,可解释 \(L_{\text{ortho}}\) 为何完全无效 —— 它约束的正是主方向的正交性, 而主方向本就不承载情感身份。
⚠️ 边界:单说话人、6 句、仅 top-5 子空间。情感专一性一条按约定不作结论,只作线索。
F7 · 所有混合方法的音质都不可用¶
证据强度:中(18 条/臂 × 6 臂)
混合配方 UTMOS 1.26–1.44,纯情感 3.29。DTW 版只是矮子里最高的。
准确表述:「让字重新听得清了」,而不是「让混合可用了」。 对齐修好之后仍然低,说明还有别的东西坏了,尚未定位。见 OPEN G2。
F8 · 时间归一化改变了表示,却改变不了读数¶
证据强度:训练侧 强(1074 个日志点)/ 下游 中(n=12 组)
训练侧影响真实:
| v4 | 时间归一化重训 | |
|---|---|---|
cos_A_target |
0.959 | 0.880 |
A_energy_share |
21.8% | 6.8% |
但下游同管线对比测不出差别:受控组数 6/12 vs 6/12 完全相同。
推论:把时长信息从 \(A\) 里拿掉 3.2 倍,emotion2vec 的读数纹丝不动 —— 这更像尺子的问题,不是模型的结论。
F9 · α 可以沿时间精确定位¶
证据强度:强(n=48 条语句,含等能量对照)
把 \(\alpha\) 从标量改成逐帧函数 \(\alpha(k)\) 后:
| 档 | 句首 |Δ能量| | 句身 |Δ能量| | 定位比 |
|---|---|---|---|
full(全句) |
2.42 dB | 3.07 dB | 0.8 |
onset(仅句首) |
2.09 dB | 0.05 dB | 42.3 |
onset_eq(等总能量) |
19.89 dB | 0.20 dB | 100.3 |
half(前 K/2) |
2.42 dB | 0.74 dB | 3.3 |

onset 只抬高第 1 段,其余九段压在 0.05–0.2 dB。
onset_eq排除了 「施加得少所以破坏得少」的假象 —— 等总能量下句首放大到 19.89 dB,句身仍是 0.20 dB。
这是本项目第一个不依赖情感分类器的可控性证据
判据是 F0 / 能量 / 谱倾斜等物理量,完全绕开了 F5 的度量瓶颈。
⚠️ 边界:只证明声学上的定位,不证明感知上的等效 —— 「句首足够传达情感」需要 G1 或人工听测才能回答。
→ M6
F10 · instruct 给得了类别,给不了强度¶
证据强度:强(n=48 条语句,三档强度 × 4 情感)
「稍微 → 无副词 → 非常」的声学变化量不单调:

而且两条通道改的东西不同:
| ΔF0 | Δ能量 | Δ谱倾斜 | Δ时长 | |
|---|---|---|---|---|
| ref(声学通道) | 79.0 Hz | 6.32 dB | 2.18 dB | +0.10 s |
| instruct(文本通道) | ~20 Hz | ~6.3 dB | ~0.85 dB | −0.4 s |
F0 差 4 倍、谱倾斜差 2.6 倍,能量却几乎相同;时长方向还相反 (ref 让悲伤变长,符合真实录音;instruct 反而变短)。
→ 声学通道动音高与音色,文本通道主要动响度。
这条结论不依赖调色板是否成功 —— 即使混合线全线失败, 「\(\alpha\) 提供 instruct 做不到的连续强度」仍然站得住。
→ M8
F11 · α 机制不需要我们的训练¶
证据强度:定性强 / 名次弱(n=12 组/档;三档对照)
把同一套 α 机制原样套到三个模型上:
| 档 | 受控组>0.5 | CER ↓ | 饱和率 |
|---|---|---|---|
| CosyVoice2(他方论文,未训练) | 7/12 | 0.039 | 94% |
| CosyVoice3 基座(未训练) | 6/12 | 0.034 | 93% |
| CosyVoice3 + v4(我们的) | 5/12 | 0.029 | 95% |
未训练的模型受控组数不少反多。 共享状态速度混合是 flow-matching 的 通用性质(与 CFG 同构),不依赖针对性微调。
但训练确有一个可测收益:CER 呈严格单调 0.039 → 0.034 → 0.029 —— 在 α 扫描(含外推)下,微调过的模型输出更清楚。
⚠️ 双重边界: ① 三档饱和率都是 93–95%,所以「情感可控性没差别」只能表述为 「在这把尺子下测不出差异」(见 F5); ② n=12 组,定性结论(未训练也能调)可信,具体名次属噪声。
直接后果:novelty 不能再主张「只有我们能做到」。见 OPEN G7。
→ M9
F12 · α 插值本身不是我们的贡献,控制的层级才是¶
证据强度:中(n=48 条语句,单模型单说话人)
把同一个 α 插值公式搬到 EmotiVoice 的 style embedding(768 维,全句一个向量)上:
| α | Δ时长 /s | |ΔF0| /Hz |
|---|---|---|
| 0.50 | −0.01 | 7.8 |
| 1.00 | 0.04 | 17.3 |
| 1.50 | 0.21 | 30.2 |
它工作得相当好 —— F0 平滑单调、α>1 外推不崩。

但两处差别是实打实的:
| embedding 层 | 速度场层(我们) | |
|---|---|---|
| 时长控制 | +0.135 s/α | +1.36 s/α(10 倍) |
| 时变定位 | ❌ 全局向量,结构上做不到 | ✅ 定位比 42.3(F9) |
推论:与 F11 合起来看,「α 插值」在任何层级、任何模型上都好用 —— 它是通用手法。我们的贡献只能主张把它放到了能时变、且时长控制强一个数量级的层级。
→ M7