M5 · A 的结构探针¶
| 状态 | ✅ 部分成立(秩与阵发性)/ 🔵 线索(情感专一性,n 不足) |
| 日期 | 2026-08-15(结构) / 2026-08-17(能量分布) |
| 一句话 | A 沿时间比 v_neu 变化更剧烈、能量集中在句首,但显著低秩;主子空间不承载情感身份 |
| 上游 | ← 用户提问:「A 分离了语义,那它沿 K 应该差不多吧?」 |
| 下游 | → OPEN G3 分层再看;→ 分段 α 的设计依据 |
1 动机¶
M4 改变了 \(A\) 的能量占比 3.2 倍却测不出下游差别, 说明我们对 \(A\) 本身了解太少。用户提出一个具体假设,正好是切入口:
\(A\) 是分离了语义的速度,那它在 \(K\) 维上的不同帧应该差不多。
2 假设¶
H1:\(A\) 沿时间近似恒定(帧间方向一致性接近 1)。 H2:\(A\) 与语义无关 —— 同情感不同句的 \(A\) 应比同句不同情感的更相似。
H1 若不成立,说明「与语义无关」不蕴含「与时间无关」。 H2 若不成立,说明 \(A\) 的主导方向不是情感标签。
3 设计¶
| 自变量 | 无(观测性实验) |
| 控制量 | 同一说话人 0003、同 \(x_t\)、同 gen_token、同 ckpt |
| 对照 | ① \(v_{\text{neu}}\)(语义主导,应当低) ② 随机高斯(应当 ≈0) ③ 随机子空间基线 0.0625 |
| 判据 | 帧间余弦接近 1 → H1 成立;情感专一性 >0.02 → H2 成立 |
| n | 6 句 × 4 情感 × 3 个 \(t\) = 72 次测量;跨句对 12 组 |
4 运行¶
CUDA_VISIBLE_DEVICES=1 python emo/exp/probe_A_structure.py \
--ckpt _incoming/v4_epoch5.pt --label v4_spk0003 --keys <6 句>
outputs/probe_A_structure/*.json
5 结果¶
定量 —— 结构指标(n=72)¶
| 测量 | A | v_neu(对照) | 随机 |
|---|---|---|---|
| ① 帧间方向一致性 | +0.367 | +0.450 | 0.000 |
| ② 有效秩(上限 80) | 27.5 | 39.8 | — |
| ③ 逐帧范数变异 std/mean | 0.389 | 0.145 | — |
| ④ ‖A‖/‖v_emo‖ | 0.105 | — | — |
趋势 —— 能量沿归一化时间(10 段,1.0 = 该句均值)¶
| 段 | 1 | 2 | 3 | 4 | 5 | 6 | 7 | 8 | 9 | 10 |
|---|---|---|---|---|---|---|---|---|---|---|
| A | 2.04 | 0.88 | 1.08 | 1.14 | 1.03 | 1.00 | 1.09 | 1.10 | 0.83 | 1.02 |
| v_neu | 1.19 | 0.98 | 1.03 | 0.97 | 1.01 | 1.02 | 1.01 | 1.02 | 1.00 | 0.89 |

A(蓝)只在第 1 段高高跃起,其余九段与对照(橙)几乎重合。 对照 \(v_{\text{neu}}\) 在同位置只有 1.19,说明这个尖峰是情感特有的而非前缀边界效应。 也正因为第 2–10 段这么平,「前 K/2 vs 后 K/2」的切法才没有意义(比值 1.026)。
A 的能量高度集中在句首(2.04×),四情感一致(2.02–2.12)。 \(v_{\text{neu}}\) 同位置只有 1.19,故这主要是情感特有的(净超出约 1.7×), 不是单纯的前缀边界效应。
去掉句首后各段基本持平(0.83–1.14,max/min 1.38), 前半 1.034 vs 后半 1.008,比值仅 1.026。
定量 —— 跨句一致性(子空间重叠,n=12 组 → 弱)¶
A:同情感 / 不同句 0.194 ← 高 = 与语义无关
A:同句 / 不同情感 0.203 ← 低 = 能区分情感
v_neu:不同句(对照) 0.267
随机基线 0.0625
→ 情感专一性 = -0.009 ≈ 0
6 结论¶
H1 不成立。H2 不成立(但证据弱)。
- 「与语义无关」≠「与时间无关」。 \(A\) 沿时间变化比 \(v_{\text{neu}}\) 更剧烈, 强度起伏是其 2.7 倍。符合物理:情感靠 F0 轮廓、重音位置、句尾走向实现, 都绑定在具体时刻。若 \(A\) 沿 \(K\) 恒定,它只能整体改变频谱倾斜 —— 那是均衡器,不是情感。
- 但 \(A\) 确实低秩(27.5 vs 39.8)。正确表述是 「沿时间起伏,但只在一个窄子空间里起伏」。
- 主子空间不承载情感身份(弱证据)。若成立,可解释 \(L_{\text{ortho}}\) 为何完全无效 —— 它约束的正是主方向的正交性,而主方向本就不承载情感身份。
⚠️ 边界:结论 3 只有 12 组跨句对,按约定 属线索,不作结论。且只测 top-5 子空间、单说话人。 不否定 α 有用(delta 确实工作)—— 情感身份可能藏在能量较低的方向里。
→ 升格为 F6。
7 坑¶
第一版的跨句测量是逐帧算余弦 —— 但第 \(k\) 帧在两句话里是不同音素, 即使 \(A\) 完全情感专一也测不出相关。改为子空间重叠(与时间对齐无关)才有意义。 第一版还混进了说话人变量(3 个 key 里两个来自 0003、一个来自 0006), 复测时改为同说话人 6 句。
→ 提炼进 方法论 §5.3。
8 引出¶
→ 分段 α 的设计依据:能量集中在句首、而前半/后半几乎无差异(1.026), 说明「前 K/2 vs 后 K/2」这条分界线切在了最没有结构的轴上; 有价值的切法是句首 vs 句身。见 OPEN。 → OPEN G3:去掉主方向后看残差,情感身份是否在低能量方向。