跳转至

Findings

跨实验的主张,每条带证据强度与出处。 强 = n≥30 或两条独立口径一致;中 = n≥10 单一口径;弱 = n<10,只作线索不作结论

全局前提

本项目所有情感强度类结论都依赖 emotion2vec,而该分类器在本任务上已被证明饱和 (见 F5)。凡是「混合成功与否」的判断都受此限制。


F1 · DTW 内容对齐是长度失配的唯一有效解

证据强度:中(3 句 × 6 混合配方 = 18 条/臂;效应量级极大 + 有自检臂)

混合 CER
截断 0.662
条件侧 token 重采样 0.430
条件侧 μ 插值 0.447
状态侧均匀 warp 0.562
状态侧 DTW 0.053

低 8–12 倍。自检臂:纯情感配方在六臂逐条完全相同,证明差异只来自混合。

⚠️ 边界:这条只说「字重新听得清了」,不蕴含「混合可用」(见 F7)。

M3 调色板六臂


F2 · 混合时长可以成为 α 的连续函数

证据强度:机制强(构造保证)/ 音质弱(n=1 句)

\(K^* = \sum_e w_e K_e\) 是凸组合,故时长必落在各分支之间。实测每 0.25 α 恰好 +17 帧:

α 0.00 0.25 0.50 0.75 1.00 1.25 1.50
\(K^*\) 170 187 204 221 238 255 272
CER 0 0 0 0 0 0.083 0.083

前提:必须固定各情感的 LLM 种子,否则 1.288 的采样噪声会淹没这条曲线。

⚠️ 边界:CER 那一行只有 1 句话,属证据。

M3


F3 · 时长是情感身份的内禀属性,无法通过挑参考剥离

证据强度:强(两条独立口径:长度测量 n=300 + 合成音频 CER)

两条互相独立的否决理由:

  1. 压不到位 —— 数据集里最整齐的参考(真实时长比 1.078)只能把生成离散度压到 1.28, 而逐帧混合需要 ≲1.05。且 LLM 采样噪声单独就有 1.288 (同参考同文本同情感,只换种子重抽 5 次)—— 即使情感完全不影响时长,方案也失败。
  2. 压到了也没用 —— 整齐参考 vs 不齐参考的混合 CER 几乎相同(0.544 vs 0.529), 尽管生成离散度差了 1.5 倍(1.28 vs 1.91)。

附带:最「时长整齐」的参考,情感表达反而最弱(纯情感得分 0.517 vs 不齐参考 0.697)—— 时长整齐与情感表达充分此消彼长

M2 参考探针


F4 · 「1+3」几何:情感方向沿唤醒度分离,不是效价

证据强度:强(三条独立通道一致)

通道 证据
方向余弦 Happy 与 Angry 的 cos = 0.72,尽管效价相反
时长指纹 Angry 稳定偏短 / Sad 稳定偏长;Happy 与 Surprise 无稳定指纹
分类器混淆 Surprise 被判成 Angry(1.00) 或 Happy(1.00);Happy 被判成 Surprise(0.70)

三条通道在同一对情感(Happy/Surprise)上同时失稳。


F5 · 现有情感指标结构上无法表达「部分情感」

证据强度:强(n=168 条评分,两个模型)

emotion2vec_plus_large 输出饱和的近 one-hot 分布:

α 0.00 0.25 0.50 0.75 1.00 1.25 1.50
中立 1.00 1.00 1.00 0.01 0.00 0.00 0.00
难过 0.00 0.00 0.00 0.99 1.00 1.00 1.00

全是 0.00 或 1.00,从无 0.6/0.4 的中间态 —— 而同批音频的时长在完美线性变化, 所以音频确实有中间态,是评测器表达不了

更直接的证据(逐组原始分数):

0001_text00290 Sad : [1.0, 1.0, 1.0, 1.0, 1.0, 1.0, 1.0]   ← α=0 的纯中性音频被判 Sad 1.0
0002_text00150 Ang : [0.003, 0.07, 0.003, 4e-7, 5e-9, 0.06, 1e-8]  ← delta 为负

全部分数里 83–87% 落在 <0.05 或 >0.95

推论:混合配方那 0.31–0.39 的情感分读不出结论 —— 成功的 50/50 混合本就不该在任一端点得高分,低分既可能是成功也可能是退化。

这是当前的头号瓶颈。OPEN G1


F6 · A 低秩、句首集中;主子空间不承载情感身份

证据强度:秩与阵发性 中(n=72 次测量)/ 情感专一性 弱(仅 12 组跨句对)

A v_neu(对照) 随机
帧间方向一致性 +0.367 +0.450 0.000
有效秩(上限 80) 27.5 39.8
逐帧范数变异 0.389 0.145

\(A\) 沿时间变化比 \(v_{\text{neu}}\) 更剧烈(否定了「\(A\) 沿 K 恒定」的直觉), 但显著低秩 —— 「沿时间起伏,只在窄子空间里起伏」。

能量分布(归一化时间 10 段,1.0 = 该句均值):

1 2 3 4 5 6 7 8 9 10
A 2.04 0.88 1.08 1.14 1.03 1.00 1.09 1.10 0.83 1.02
v_neu 1.19 0.98 1.03 0.97 1.01 1.02 1.01 1.02 1.00 0.89

能量高度集中在句首(2.04× vs v_neu 的 1.19,净超出约 1.7×), 去掉句首后各段基本持平(0.83–1.14),前半/后半比值仅 1.026

主子空间不区分情感(弱证据):同情感/不同句 0.194 ≈ 同句/不同情感 0.203(随机基线 0.0625)。 若成立,可解释 \(L_{\text{ortho}}\) 为何完全无效 —— 它约束的正是主方向的正交性, 而主方向本就不承载情感身份。

⚠️ 边界:单说话人、6 句、仅 top-5 子空间。情感专一性一条按约定不作结论,只作线索。

M5 A 结构探针


F7 · 所有混合方法的音质都不可用

证据强度:中(18 条/臂 × 6 臂)

混合配方 UTMOS 1.26–1.44,纯情感 3.29。DTW 版只是矮子里最高的。

准确表述:「让字重新听得清了」,而不是「让混合可用了」。 对齐修好之后仍然低,说明还有别的东西坏了,尚未定位。见 OPEN G2


F8 · 时间归一化改变了表示,却改变不了读数

证据强度:训练侧 强(1074 个日志点)/ 下游 中(n=12 组)

训练侧影响真实:

v4 时间归一化重训
cos_A_target 0.959 0.880
A_energy_share 21.8% 6.8%

但下游同管线对比测不出差别:受控组数 6/12 vs 6/12 完全相同

推论:把时长信息从 \(A\) 里拿掉 3.2 倍,emotion2vec 的读数纹丝不动 —— 这更像尺子的问题,不是模型的结论。

M4 时间归一化重训


F9 · α 可以沿时间精确定位

证据强度:强(n=48 条语句,含等能量对照)

\(\alpha\) 从标量改成逐帧函数 \(\alpha(k)\) 后:

句首 |Δ能量| 句身 |Δ能量| 定位比
full(全句) 2.42 dB 3.07 dB 0.8
onset(仅句首) 2.09 dB 0.05 dB 42.3
onset_eq(等总能量) 19.89 dB 0.20 dB 100.3
half(前 K/2) 2.42 dB 0.74 dB 3.3

分段 α 的定位效果

onset 只抬高第 1 段,其余九段压在 0.05–0.2 dB。 onset_eq 排除了 「施加得少所以破坏得少」的假象 —— 等总能量下句首放大到 19.89 dB,句身仍是 0.20 dB。

这是本项目第一个不依赖情感分类器的可控性证据

判据是 F0 / 能量 / 谱倾斜等物理量,完全绕开了 F5 的度量瓶颈

⚠️ 边界:只证明声学上的定位,不证明感知上的等效 —— 「句首足够传达情感」需要 G1 或人工听测才能回答。

M6


F10 · instruct 给得了类别,给不了强度

证据强度:强(n=48 条语句,三档强度 × 4 情感)

「稍微 → 无副词 → 非常」的声学变化量不单调:

F0      21.88 → 21.40 → 16.48 Hz   反而递减
能量     6.53 →  5.88 →  6.65 dB   不单调
逐语句单调率 22.9%   随机基线 16.7%

instruct 的强度阶梯

而且两条通道改的东西不同:

ΔF0 Δ能量 Δ谱倾斜 Δ时长
ref(声学通道) 79.0 Hz 6.32 dB 2.18 dB +0.10 s
instruct(文本通道) ~20 Hz ~6.3 dB ~0.85 dB −0.4 s

F0 差 4 倍、谱倾斜差 2.6 倍,能量却几乎相同;时长方向还相反 (ref 让悲伤变长,符合真实录音;instruct 反而变短)。

→ 声学通道动音高与音色,文本通道主要动响度

这条结论不依赖调色板是否成功 —— 即使混合线全线失败, 「\(\alpha\) 提供 instruct 做不到的连续强度」仍然站得住。

M8


F11 · α 机制不需要我们的训练

证据强度:定性强 / 名次弱(n=12 组/档;三档对照)

把同一套 α 机制原样套到三个模型上:

受控组>0.5 CER ↓ 饱和率
CosyVoice2(他方论文,未训练) 7/12 0.039 94%
CosyVoice3 基座(未训练) 6/12 0.034 93%
CosyVoice3 + v4(我们的) 5/12 0.029 95%

未训练的模型受控组数不少反多。 共享状态速度混合是 flow-matching 的 通用性质(与 CFG 同构),不依赖针对性微调。

但训练确有一个可测收益:CER 呈严格单调 0.039 → 0.034 → 0.029 —— 在 α 扫描(含外推)下,微调过的模型输出更清楚。

⚠️ 双重边界: ① 三档饱和率都是 93–95%,所以「情感可控性没差别」只能表述为 「在这把尺子下测不出差异」(见 F5); ② n=12 组,定性结论(未训练也能调)可信,具体名次属噪声

直接后果:novelty 不能再主张「只有我们能做到」。见 OPEN G7

M9