跳转至

M2 · 参考探针:挑「时长整齐」的参考

状态 ⚠️ 作废(证伪)
日期 2026-08-14(探针) / 2026-08-15(音频)
一句话 固定一组各情感时长几乎相同的参考,既压不到逐帧混合所需的整齐度,压到了也无用
上游 M1:截断失败,想绕开长度失配
下游 M3:长度失配不可回避,只能在混合阶段处理

1 动机

M1 表明截断不可行。但 ICL 里参考与目标文本是解耦的 —— prompt_text 是参考的文本,目标文本可以任意替换。 那么只要挑一组各情感时长几乎相同的参考,固定不动,生成长度是否也随之拉齐?

2 假设

\(L_e\) 主要由参考的隐含语速决定。选定 \(\max_e T_e/\min_e T_e \to 1\) 的参考组, 可令生成长度离散度降到逐帧混合可接受的范围(≲1.05)。

若不成立(H2:情感身份先验主导),则说明时长是情感的内禀属性, 无法通过参考剥离 —— 这本身是「源–闸门」结论的有力延伸。

3 设计

阶段 1 探针(只跑 LLM,不合成 —— 便宜且足以判定):

自变量 参考组的时长整齐度
控制量 同一说话人 0006、同目标文本、同种子
对照 ① 最不整齐组(比值 1.580) ② 采样噪声地板(同参考同文本同情感,只换种子重抽 5 次)
判据 整齐组生成离散度中位 <1.10 → 假设成立;>1.30 → 证伪
n 4 组参考 × 15 条 held-out 文本 × 5 情感 = 300;噪声地板 75

阶段 2 音频(用户要求:没有音频无法判断是否真有用): 固定参考 + 截断合并,目标文本与 M3 相同,故 wav 同名可对拍。

4 运行

emo/exp/B0_ref_probe/run.py         探针,单卡 ~9 min
emo/exp/B0_ref_probe/launch_B1.sh   音频,2×33 条
产物:outputs/palette_B0/(数据)、outputs/palette_v2/B_{even,uneven}ref/(音频)

5 结果

定量 —— 生成长度离散度

参考组 真实时长比 生成离散度中位
0006_text00124 1.072 1.554
0006_text00336 1.078 1.541
0006_text00134 1.086 1.513
0006_text00025(对照) 1.580 2.161
采样噪声地板 1.288

参考拉平到 1.07,生成照样散到 ~1.55 —— 而 1.55 正是真实录音 5 情绪离散度的中位数。 参考不整齐会额外叠加(1.58 → 2.16),即参考只能往上加、不能往下压

定量 —— 合成音频(n=18 混合配方/臂)

参考真实比 生成离散度 混合 CER 混合 UTMOS
整齐参考 1.078 1.281 0.544 1.38
不齐参考 1.580 1.909 0.529 1.32
(对比)M3 DTW 0.053 1.44

参考整齐度差 1.5 倍,混合结果的 CER 几乎相同。

定性 —— 只差参考整齐度,听不出区别

同一句、同一配方(mix_Hap.5_Ang.5)、同一种子,只换参考组:

参考真实时长比 1.078(最整齐) 参考真实时长比 1.580(对照)

这两条听起来应当差不多 —— 这正是本方案被证伪的直接证据。 若挑参考有用,左边应当明显更清楚;实测 CER 0.544 vs 0.529,反而右边略低。

定性 —— 选样偏倚

参考 纯情感配方情感分 纯情感 UTMOS
整齐参考(1.078) 0.517 2.86
不齐参考(1.580) 0.697 2.55
参考=目标 0.780 3.29

最「时长整齐」的那组参考,情感表达反而最弱。 体检佐证:0006_text00336 的 Happy 被 emotion2vec 判成「吃惊」0.70 /「开心」0.30。

6 结论

假设证伪,H2 成立。 两条互相独立的否决理由:

  1. 压不到位 —— 最整齐的参考只到 1.28,需要 ≲1.05。且采样噪声单独就有 1.288, 即使情感完全不影响时长,方案照样失败。
  2. 压到了也没用 —— 1.28 与 1.91 的混合质量无差别,说明在这个区间里破坏已经饱和。

边界:这条不否定参考选择在别的用途上有价值(如音色、情感强度); 只否定「靠挑参考实现逐帧对齐」。

→ 升格为 F3

7 坑

  • 探针 CSV 里噪声行的五列实际是同一情感的 5 次抽样,且当初没记是哪个情感 (logging 缺陷)。情感归属只能从日志恢复。已修
  • 我最初只用数值判据就否决了本方案、没出音频。 用户指出「没有音频怎么判断是不是真有用」——补跑后结论不变,但证据强度提升一档。 → 提炼为 方法论准则 §5.2 的同类: 判据推论 ≠ 现象演示

8 引出

M3:既然长度失配不可回避,只能在混合阶段处理。 → 99 Graveyard