Open Questions 待决问题¶
想法、被搁置的实验、存疑的结论。发散用,不要求成熟。 状态:
想法/已排期/进行中/已否决(附理由)/已完成(移入 LOG)被否决的留着不删。
A. 会改变结论的¶
G1 · 怎么度量「部分情感」?¶
状态:想法 · 🔴 最高优先级 —— 挡着所有混合类实验
emotion2vec 输出饱和的近 one-hot 分布,已证明结构上无法表达 「50% 悲伤 + 50% 惊讶」。后果:M3/M4 的混合结果都无法判定成败。
候选方向(均未评估):
| 方向 | 想法 | 风险 |
|---|---|---|
| valence/arousal 回归探针 | 用连续维度替代离散类别 | 需要标注数据;与已发表口径不可比 |
| 声学量(F0 / 能量 / 语速) | 直接测物理量,绕开分类器 | 只能说「变了」,说不了「是哪种情感」 |
| 人工配对比较(MOS-style) | A/B 听测「哪个更像 X+Y 的混合」 | 成本高,但可能是唯一可信的 |
| 分类器的中间层表示 | 用 embedding 距离而非 argmax | 未验证是否比输出层更有分辨率 |
约束:按既定决策,不替换已发表口径,只新增。
G2 · 混合音质为何全线不可用?¶
状态:想法
对齐修好后 CER 从 0.66 降到 0.053,但 UTMOS 仍只有 1.26–1.44(纯情感 3.29)。 说明还有别的东西坏了,尚未定位。 候选:
- 速度场混合本身会缩范数(去相关 → 幅度衰减) → 需查 mel 的能量分布
- HiFT 声码器对「非自然 mel」的鲁棒性
- 混合破坏了 mel 的时频局部一致性(相位重建失败)
G3 · A 的情感身份藏在哪?¶
状态:想法
M5 的线索:主子空间不区分情感(弱证据)。 若成立,情感身份应在能量较低的方向。可做:去掉 top-k 主方向后看残差的情感专一性。
顺带能验证 \(L_{\text{ortho}}\) 无效的机制解释。
B. 已知缺陷,待修¶
B1 · OOD 泛化是最大短板¶
状态:想法
| 维度 | 现状 | 缺口 |
|---|---|---|
| 文本 OOD | ✅ P6 held-out | 同数据集同说话人风格,弱 OOD |
| 说话人 OOD | ⚠️ ESD 内部 | 未系统评测 |
| 数据集 OOD | ❌ 全部结果在 ESD 上 | 最致命 |
| 语种 OOD | ⚠️ 英文缺 3 个说话人 | p6_test_en 缺 511 条 |
IEMOCAP 已申请到手但仍在 sai 未迁移(12.3 GB);
inference_iemocap_transfer.py 已存在。这是最快能补的一块。
B2 · 数据不完整¶
ESD 说话人 0012–0014 完全缺失、0015 不完整(迁移最后 0.9 GB 未传完)。
影响:p6_test_en 1174/1685、esd_parallel 28570/33620。
中文完整(p6_test_zh 1710/1710),训练不受影响(用特征缓存)。
B3 · 分段 α 需要平滑过渡¶
\(\alpha\) 在切换点突变 → 速度场突变 → mel 不连续 → 可能有可听的咔哒声。 实现前必须带 cosine ramp(建议 8 帧 / 160 ms)。
C. 方法上的疑问¶
G4 · 分段 α 怎么切?¶
状态:已排期
M5 的数据表明:「前 K/2 vs 后 K/2」切在了最没结构的轴上 (去掉句首后前半/后半比值仅 1.026)。有结构的是句首 vs 句身(2.04× vs ~1.0)。
三个变体:
| 变体 | 切法 | 依据 |
|---|---|---|
| 句首/句身(推荐) | \(\alpha_{\text{onset}}\)(前 10%)+ \(\alpha_{\text{body}}\) | M5 能量分布 |
| 连续 \(\alpha(k)\) | 自定义曲线 | 最通用 |
| 语言学单元 | 音节/词/短语边界 | 最可解释,需 MFA |
这是唯一能绕开 G1 的想法
若只在句首加 \(\alpha\),则句首的声学量应变、句身不变 —— 可用 F0/能量直接验证,不依赖情感分类器。
G5 · 「直接加权」的基线该怎么做?¶
状态:想法
要论证「可分离的 \(v\)」是必要的,需要四臂:波形加权 / mel 输出加权 / frozen 模型 + 共享状态速度混合 / 我们的。
这个实验有打脸风险
共享状态混合是 flow-matching 的通用性质,不需要微调。 若 frozen + shared-x 就能工作,claim 必须从「只有我们能做到」 改成「这是通用机制,我们的贡献是让它可控」。 正因为审稿人一定会问,才更该自己先做。
G6 · instruction 通道与我们的通道是否正交?¶
状态:想法
代码事实:frontend_instruct2 = frontend_zero_shot + 删掉 llm_prompt_speech_token。
即 instruct 从文本注入情感,我们从声学 token注入 —— 正好是它删掉的那条。
可做:① instruct 能否表达「稍微/非常悲伤」这类强度(最便宜,先做) ② 与 \(\alpha\) 阶梯对比 ③ 组合使用。
混杂提醒:instruct 删掉声学 prompt 后音色只靠 flow 参考,SECS 大概率下降 —— 那是模式的固有代价,不是情感控制能力的差异。
G7 · claim 的重心要不要换?¶
状态:🔴 已成必须 —— M9 推翻了原 claim 的前提
原 claim 的两个支柱都塌了:①「我们做出了情绪调色板」—— 音质不可用、度量读不出; ②「只有我们的可分离 \(v\) 能做到」—— 未训练的模型也能调,受控组数还更多。
建议改成「我们揭示了情绪调色板为什么难,并给出了必要条件」—— F1/F3/F4 都是关于问题结构的发现, 证据强度高、负结果导向,不怕复现。
已决¶
| 决策 | 内容 | 何时可推翻 |
|---|---|---|
| 归一化目标 | 中性录音的时长 | 若改用平均时长 |
| 不设时长旋钮 | \(\alpha\) 单独控制情感 | 若 claim 改为「\(\alpha\) 控音色 + 时长另设旋钮」—— 会让 M4 从消融变回候选 |
| 对齐方法 | DTW,不上 MFA | 若对齐质量成瓶颈 |
| DTW 距离 | 用 mel 不用离散 token | 实测 token 最优对齐下仅 5.61% 相同 |
| 锚点 | 2 分支直连;≥3 分支经 Neutral,允许权重为 0 | — |
| \(K^*\) 夹紧 | \([0.5\min, 2\max]\) | 若 α 永远 ≤1.5 则不触发 |
| 评测口径 | 不自创指标,沿用 eval_suite.py |
找到合适度量后新增,不替换 |
| CER 引擎 | 必须 Paraformer,不用 whisper 顶替 | — |
| 可用 GPU | 卡 7(2026-08-17 起) | — |
已否决(留档)¶
见 99 Graveyard。