跳转至

Open Questions 待决问题

想法、被搁置的实验、存疑的结论。发散用,不要求成熟。 状态:想法 / 已排期 / 进行中 / 已否决(附理由) / 已完成(移入 LOG) 被否决的留着不删


A. 会改变结论的

G1 · 怎么度量「部分情感」?

状态:想法 · 🔴 最高优先级 —— 挡着所有混合类实验

emotion2vec 输出饱和的近 one-hot 分布,已证明结构上无法表达 「50% 悲伤 + 50% 惊讶」。后果:M3/M4 的混合结果都无法判定成败

候选方向(均未评估):

方向 想法 风险
valence/arousal 回归探针 用连续维度替代离散类别 需要标注数据;与已发表口径不可比
声学量(F0 / 能量 / 语速) 直接测物理量,绕开分类器 只能说「变了」,说不了「是哪种情感」
人工配对比较(MOS-style) A/B 听测「哪个更像 X+Y 的混合」 成本高,但可能是唯一可信的
分类器的中间层表示 用 embedding 距离而非 argmax 未验证是否比输出层更有分辨率

约束:按既定决策,不替换已发表口径,只新增

G2 · 混合音质为何全线不可用?

状态:想法

对齐修好后 CER 从 0.66 降到 0.053,但 UTMOS 仍只有 1.26–1.44(纯情感 3.29)。 说明还有别的东西坏了,尚未定位。 候选:

  • 速度场混合本身会缩范数(去相关 → 幅度衰减) → 需查 mel 的能量分布
  • HiFT 声码器对「非自然 mel」的鲁棒性
  • 混合破坏了 mel 的时频局部一致性(相位重建失败)

G3 · A 的情感身份藏在哪?

状态:想法

M5 的线索:主子空间不区分情感(弱证据)。 若成立,情感身份应在能量较低的方向。可做:去掉 top-k 主方向后看残差的情感专一性。

顺带能验证 \(L_{\text{ortho}}\) 无效的机制解释。


B. 已知缺陷,待修

B1 · OOD 泛化是最大短板

状态:想法

维度 现状 缺口
文本 OOD ✅ P6 held-out 同数据集同说话人风格,弱 OOD
说话人 OOD ⚠️ ESD 内部 未系统评测
数据集 OOD 全部结果在 ESD 上 最致命
语种 OOD ⚠️ 英文缺 3 个说话人 p6_test_en 缺 511 条

IEMOCAP 已申请到手但仍在 sai 未迁移(12.3 GB); inference_iemocap_transfer.py 已存在。这是最快能补的一块。

B2 · 数据不完整

ESD 说话人 0012–0014 完全缺失、0015 不完整(迁移最后 0.9 GB 未传完)。 影响:p6_test_en 1174/1685、esd_parallel 28570/33620。 中文完整(p6_test_zh 1710/1710),训练不受影响(用特征缓存)。

B3 · 分段 α 需要平滑过渡

\(\alpha\) 在切换点突变 → 速度场突变 → mel 不连续 → 可能有可听的咔哒声。 实现前必须带 cosine ramp(建议 8 帧 / 160 ms)。


C. 方法上的疑问

G4 · 分段 α 怎么切?

状态:已排期

M5 的数据表明:「前 K/2 vs 后 K/2」切在了最没结构的轴上 (去掉句首后前半/后半比值仅 1.026)。有结构的是句首 vs 句身(2.04× vs ~1.0)。

三个变体:

变体 切法 依据
句首/句身(推荐) \(\alpha_{\text{onset}}\)(前 10%)+ \(\alpha_{\text{body}}\) M5 能量分布
连续 \(\alpha(k)\) 自定义曲线 最通用
语言学单元 音节/词/短语边界 最可解释,需 MFA

这是唯一能绕开 G1 的想法

若只在句首加 \(\alpha\),则句首的声学量应变、句身不变 —— 可用 F0/能量直接验证,不依赖情感分类器。

G5 · 「直接加权」的基线该怎么做?

状态:想法

要论证「可分离的 \(v\)」是必要的,需要四臂:波形加权 / mel 输出加权 / frozen 模型 + 共享状态速度混合 / 我们的。

这个实验有打脸风险

共享状态混合是 flow-matching 的通用性质,不需要微调。 若 frozen + shared-x 就能工作,claim 必须从「只有我们能做到」 改成「这是通用机制,我们的贡献是让它可控」。 正因为审稿人一定会问,才更该自己先做。

G6 · instruction 通道与我们的通道是否正交?

状态:想法

代码事实:frontend_instruct2 = frontend_zero_shot + 删掉 llm_prompt_speech_token。 即 instruct 从文本注入情感,我们从声学 token注入 —— 正好是它删掉的那条。

可做:① instruct 能否表达「稍微/非常悲伤」这类强度(最便宜,先做) ② 与 \(\alpha\) 阶梯对比 ③ 组合使用。

混杂提醒:instruct 删掉声学 prompt 后音色只靠 flow 参考,SECS 大概率下降 —— 那是模式的固有代价,不是情感控制能力的差异。

G7 · claim 的重心要不要换?

状态:🔴 已成必须 —— M9 推翻了原 claim 的前提

原 claim 的两个支柱都塌了:①「我们做出了情绪调色板」—— 音质不可用、度量读不出; ②「只有我们的可分离 \(v\) 能做到」—— 未训练的模型也能调,受控组数还更多

建议改成「我们揭示了情绪调色板为什么难,并给出了必要条件」—— F1/F3/F4 都是关于问题结构的发现, 证据强度高、负结果导向,不怕复现。


已决

决策 内容 何时可推翻
归一化目标 中性录音的时长 若改用平均时长
不设时长旋钮 \(\alpha\) 单独控制情感 若 claim 改为「\(\alpha\) 控音色 + 时长另设旋钮」—— 会让 M4 从消融变回候选
对齐方法 DTW,不上 MFA 若对齐质量成瓶颈
DTW 距离 用 mel 不用离散 token 实测 token 最优对齐下仅 5.61% 相同
锚点 2 分支直连;≥3 分支经 Neutral,允许权重为 0
\(K^*\) 夹紧 \([0.5\min, 2\max]\) 若 α 永远 ≤1.5 则不触发
评测口径 不自创指标,沿用 eval_suite.py 找到合适度量后新增,不替换
CER 引擎 必须 Paraformer,不用 whisper 顶替
可用 GPU 卡 7(2026-08-17 起)

已否决(留档)

99 Graveyard