Graveyard¶
试过、否了、为什么。论文会删掉失败,研究记录必须留着 —— 半年后最常问的是「这个我们试过吗」。不删,即使后来又想做。
G1 · 截断对齐(砍到最短)¶
否于 2026-08-14 · M1
把各分支的生成段截断到 \(\min_e K_e\) 再逐帧混合。 失败原因:截断以丢内容换对齐,导致帧级音素错位 —— 某帧上快分支已到句尾、 慢分支还在句中,逐帧相加得到不同音素的声学平均。11/22 个样本里最狠的分支保留 <75%。
保留作基线:六臂对照里的 C_truncate(混合 CER 0.662,最差)。
G2 · 挑「时长整齐」的参考¶
固定一组各情感时长几乎相同的参考,期望生成长度也随之拉齐。
两条独立的失败原因:
- 数据集里最整齐的参考只能把生成离散度压到 1.28(需要 ≲1.05), 而 LLM 采样噪声单独就有 1.288
- 压到了也没用 —— 1.28 与 1.91 的混合 CER 几乎相同(0.544 vs 0.529)
附带发现:最「时长整齐」的参考,情感表达反而最弱 —— 二者此消彼长。
不要重做
若将来想重试,先回答:采样噪声地板 1.288 怎么办?这一条单独就足以否决。
G3 · \(L_{\text{ortho}}\) 正交约束¶
否于 v4 阶段(λ=0 完整重训对照,53,700 步同种子)
约束 \(A\) 与 \(B\) 的跨通道余弦,期望让情感方向与语义方向解耦。 完全无效 —— 加与不加的结果无差别。
机制解释(2026-08-15,M5 的线索): 该项约束的是主方向的正交性,而 \(A\) 的主子空间本就不承载情感身份 (同情感/不同句 0.194 ≈ 同句/不同情感 0.203)。约束了一个不含目标信息的子空间, 自然没有效果。
参数仍保留 λ=0.01,仅为与 v4 可比。
G4 · 「A 沿 K 近似恒定」的直觉¶
否于 2026-08-17 · M5
假设:\(A\) 分离了语义,故其 80 维 mel 向量在不同帧上应该差不多。
实测反向:\(A\) 的帧间方向一致性 +0.367,比 \(v_{\text{neu}}\) 的 +0.450 更低; 逐帧范数变异 0.389,是 \(v_{\text{neu}}\) 的 2.7 倍。
为什么:「与语义无关」不蕴含「与时间无关」。情感靠 F0 轮廓、重音位置、句尾走向实现, 都绑定在具体时刻。若 \(A\) 沿 \(K\) 恒定,它只能整体改变频谱倾斜 —— 那是均衡器,不是情感。
但保留了一半:\(A\) 确实显著低秩(27.5 vs 39.8)。 正确表述是「沿时间起伏,只在窄子空间里起伏」。
G5 · 「状态侧优于条件侧」的立论¶
原立论:方案 D(只搬状态、条件保持原生)应优于方案 C(改条件), 因为模型只见训练时见过的输入。
实测否定:均匀 warp 时,改状态(CER 0.562)比改条件(0.430)更差。
修正后的理解:改状态本身没有优势,反而更危险(状态就是正在成形的信号, 用错的 warp 搬它比搬条件破坏更大)。全部收益来自内容对齐(DTW),与改哪一侧无关。
方案 D 没有被否决
被否决的是它为什么好的解释。D1-DTW 仍是最优臂(CER 0.053)。
G6 · 「时间归一化会明显变差」的预测¶
否于 2026-08-15 · M4
预测:抹掉时长这一维情感后 Δ_emo 会明显下降,可作为「时长确实携带情感」的消融证据。
未发生:受控组数 6/12 vs 6/12 完全相同。
真正的结论:把时长信息从 \(A\) 里拿掉 3.2 倍(能量占比 21.8%→6.8%), emotion2vec 的读数纹丝不动 —— 这更像尺子的问题(F5), 不是模型的结论。该实验因此既不能当候选方案,也不能当消融证据。
统计口径上的两次自我更正¶
截断比例算错两次:
| 时间 | 数字 | 来源 |
|---|---|---|
| 最初 | 11% | 单条日志,不具代表性 |
| 「更正」 | 17% | 也是错的 —— 把中位比值代进截断公式 |
| 实测 | 中位 12.4%,均值 14.1%,最大 49.6% | 3200 对,逐对算再取中位 |
教训已提炼为方法论 §5.1: 分布跨在 1 两侧时,先逐样本算目标量,再聚合。