跳转至

Experiments

一个实验一页,写完冻结。推进新实验只新增一页 + 下表加一行,不改动已有记录。 概念一律以 Glossary 的锚点为准。

时间线

日期 实验 状态 一句话
08-14 M1 截断调色板 ⚠️ 作废 让各情感贡献自己的 token 骨架,再截断到最短对齐 —— 帧级音素错位,失真明显
08-14/15 M2 参考探针 ⚠️ 证伪 固定一组各情感时长几乎相同的参考,既压不到逐帧混合所需的整齐度,压到了也无用
08-14 M3 调色板六臂 ✅ 成立 DTW 内容对齐使混合 CER 降低 8–12 倍,而「改条件还是改状态」本身无关紧要
08-15 M4 时间归一化重训 ⚠️ 无法判定 训练期把平行对拉到同一时间轴,截断彻底归零、A 能量占比掉 3.2 倍,但下游指标纹丝不动
08-15/17 M5 A 结构探针 ✅ 部分成立 A 沿时间比 v_neu 变化更剧烈、能量集中在句首,但显著低秩;主子空间不承载情感身份
08-17 M6 分段 α ✅ 成立 α 改成沿时间的函数后定位精确(仅句首档的句身残留 0.05 dB),且判据全程不经过情感分类器
08-18 M7 把 α 搬到情感 embedding 上 ✅ 成立 embedding 层的 α 插值同样平滑、外推也不崩,但时长响应只有速度场层的 1/10
08-17 M8 instruction 通道 ✅ 成立 instruct 能给情感类别但给不了强度(程度副词的单调率 22.9%,随机基线 16.7%),且它改的是能量而几乎不动 F0
08-17 M9 不训练能否调 α ⚠️ 假设被推翻 别的论文的模型不训练也能用 α 调情感(受控组数还更多),我们的训练改善的是可懂度而非情感可控性

结果自洽性标准

一个实验必须自己回答自己的动机。 §1 说要探究什么,§5 就得拿出对应证据 —— 缺一半不算做完。 实验脚本在设计时就要产出这些,不能事后补。

要什么
定性 一张图或一段视频,让人直接看见结论成不成立
定量 表格,带单位 / n / 统计量口径 / 验收线
趋势 随某变量变化的量用图不用表
对照 基线或消融 —— 否则绝对数说明不了任何事

实验脚本的产出契约

runs/<实验>/
  metrics.json      汇总(含 n、单位、口径)
  per_scene.json    逐场景明细 + **原始量测轨迹**
  curves.png        趋势
  videos/           定性证据,至少 2 段

轨迹一定要存 —— 事后换判据、重画图都不必再占 GPU 重跑。

Benchmarks & Metrics

目前采用的指标与基线。接入公开 benchmark 时在此登记。

指标 定义 单位 天花板 / 底线 用在哪
情感分 emotion2vec_plus_large 给目标情感的概率 比例 纯情感配方 0.78 全部
CER Paraformer-zh,标点归一化后的字错率 比例 ↓ 纯情感配方 0.017 全部
SECS campplus 说话人嵌入余弦 比例 纯情感配方 0.849 全部
UTMOS UTMOS22 strong MOS 1–5 纯情感配方 3.29;<2.5 视为破音 全部
mono 相邻 α 步中情感分上升的比例 比例 量化到 1/6 格点 α 阶梯
delta α=1 与 α=0 的情感分之差 比例 α 阶梯
长度离散度 max_e K_e / min_e K_e 比值 逐帧混合需 ≲1.05 调色板

依赖关系

flowchart TD
    M0[M0] --> M1[M1]