M2 · 参考探针:挑「时长整齐」的参考¶
| 状态 | ⚠️ 作废(证伪) |
| 日期 | 2026-08-14(探针) / 2026-08-15(音频) |
| 一句话 | 固定一组各情感时长几乎相同的参考,既压不到逐帧混合所需的整齐度,压到了也无用 |
| 上游 | ← M1:截断失败,想绕开长度失配 |
| 下游 | → M3:长度失配不可回避,只能在混合阶段处理 |
1 动机¶
M1 表明截断不可行。但 ICL 里参考与目标文本是解耦的 ——
prompt_text 是参考的文本,目标文本可以任意替换。
那么只要挑一组各情感时长几乎相同的参考,固定不动,生成长度是否也随之拉齐?
2 假设¶
\(L_e\) 主要由参考的隐含语速决定。选定 \(\max_e T_e/\min_e T_e \to 1\) 的参考组, 可令生成长度离散度降到逐帧混合可接受的范围(≲1.05)。
若不成立(H2:情感身份先验主导),则说明时长是情感的内禀属性, 无法通过参考剥离 —— 这本身是「源–闸门」结论的有力延伸。
3 设计¶
阶段 1 探针(只跑 LLM,不合成 —— 便宜且足以判定):
| 自变量 | 参考组的时长整齐度 |
| 控制量 | 同一说话人 0006、同目标文本、同种子 |
| 对照 | ① 最不整齐组(比值 1.580) ② 采样噪声地板(同参考同文本同情感,只换种子重抽 5 次) |
| 判据 | 整齐组生成离散度中位 <1.10 → 假设成立;>1.30 → 证伪 |
| n | 4 组参考 × 15 条 held-out 文本 × 5 情感 = 300;噪声地板 75 |
阶段 2 音频(用户要求:没有音频无法判断是否真有用): 固定参考 + 截断合并,目标文本与 M3 相同,故 wav 同名可对拍。
4 运行¶
产物:outputs/palette_B0/(数据)、outputs/palette_v2/B_{even,uneven}ref/(音频)
5 结果¶
定量 —— 生成长度离散度¶
| 参考组 | 真实时长比 | 生成离散度中位 |
|---|---|---|
0006_text00124 |
1.072 | 1.554 |
0006_text00336 |
1.078 | 1.541 |
0006_text00134 |
1.086 | 1.513 |
0006_text00025(对照) |
1.580 | 2.161 |
| — | — | 采样噪声地板 1.288 |
参考拉平到 1.07,生成照样散到 ~1.55 —— 而 1.55 正是真实录音 5 情绪离散度的中位数。 参考不整齐会额外叠加(1.58 → 2.16),即参考只能往上加、不能往下压。
定量 —— 合成音频(n=18 混合配方/臂)¶
| 臂 | 参考真实比 | 生成离散度 | 混合 CER | 混合 UTMOS |
|---|---|---|---|---|
| 整齐参考 | 1.078 | 1.281 | 0.544 | 1.38 |
| 不齐参考 | 1.580 | 1.909 | 0.529 | 1.32 |
| (对比)M3 DTW | — | — | 0.053 | 1.44 |
参考整齐度差 1.5 倍,混合结果的 CER 几乎相同。
定性 —— 只差参考整齐度,听不出区别¶
同一句、同一配方(mix_Hap.5_Ang.5)、同一种子,只换参考组:
| 参考真实时长比 1.078(最整齐) | 参考真实时长比 1.580(对照) |
|---|---|
这两条听起来应当差不多 —— 这正是本方案被证伪的直接证据。 若挑参考有用,左边应当明显更清楚;实测 CER 0.544 vs 0.529,反而右边略低。
定性 —— 选样偏倚¶
| 参考 | 纯情感配方情感分 | 纯情感 UTMOS |
|---|---|---|
| 整齐参考(1.078) | 0.517 | 2.86 |
| 不齐参考(1.580) | 0.697 | 2.55 |
| 参考=目标 | 0.780 | 3.29 |
最「时长整齐」的那组参考,情感表达反而最弱。
体检佐证:0006_text00336 的 Happy 被 emotion2vec 判成「吃惊」0.70 /「开心」0.30。
6 结论¶
假设证伪,H2 成立。 两条互相独立的否决理由:
- 压不到位 —— 最整齐的参考只到 1.28,需要 ≲1.05。且采样噪声单独就有 1.288, 即使情感完全不影响时长,方案照样失败。
- 压到了也没用 —— 1.28 与 1.91 的混合质量无差别,说明在这个区间里破坏已经饱和。
边界:这条不否定参考选择在别的用途上有价值(如音色、情感强度); 只否定「靠挑参考实现逐帧对齐」。
→ 升格为 F3。
7 坑¶
- 探针 CSV 里噪声行的五列实际是同一情感的 5 次抽样,且当初没记是哪个情感 (logging 缺陷)。情感归属只能从日志恢复。已修。
- 我最初只用数值判据就否决了本方案、没出音频。 用户指出「没有音频怎么判断是不是真有用」——补跑后结论不变,但证据强度提升一档。 → 提炼为 方法论准则 §5.2 的同类: 判据推论 ≠ 现象演示。
8 引出¶
→ M3:既然长度失配不可回避,只能在混合阶段处理。 → 99 Graveyard。