Experiments¶
一个实验一页,写完冻结。推进新实验只新增一页 + 下表加一行,不改动已有记录。 概念一律以 Glossary 的锚点为准。
时间线¶
| 日期 | 实验 | 状态 | 一句话 |
|---|---|---|---|
| 08-14 | M1 截断调色板 | ⚠️ 作废 | 让各情感贡献自己的 token 骨架,再截断到最短对齐 —— 帧级音素错位,失真明显 |
| 08-14/15 | M2 参考探针 | ⚠️ 证伪 | 固定一组各情感时长几乎相同的参考,既压不到逐帧混合所需的整齐度,压到了也无用 |
| 08-14 | M3 调色板六臂 | ✅ 成立 | DTW 内容对齐使混合 CER 降低 8–12 倍,而「改条件还是改状态」本身无关紧要 |
| 08-15 | M4 时间归一化重训 | ⚠️ 无法判定 | 训练期把平行对拉到同一时间轴,截断彻底归零、A 能量占比掉 3.2 倍,但下游指标纹丝不动 |
| 08-15/17 | M5 A 结构探针 | ✅ 部分成立 | A 沿时间比 v_neu 变化更剧烈、能量集中在句首,但显著低秩;主子空间不承载情感身份 |
| 08-17 | M6 分段 α | ✅ 成立 | α 改成沿时间的函数后定位精确(仅句首档的句身残留 0.05 dB),且判据全程不经过情感分类器 |
| 08-18 | M7 把 α 搬到情感 embedding 上 | 🔵 提案 | 把我们的 α 插值原样搬到「有显式情感 embedding 的未训练模型」上,看它是什么响应 |
| 08-17 | M8 instruction 通道 | ✅ 成立 | instruct 能给情感类别但给不了强度(程度副词的单调率 22.9%,随机基线 16.7%),且它改的是能量而几乎不动 F0 |
| 08-17 | M9 不训练能否调 α | ⚠️ 假设被推翻 | 别的论文的模型不训练也能用 α 调情感(受控组数还更多),我们的训练改善的是可懂度而非情感可控性 |
结果自洽性标准¶
一个实验必须自己回答自己的动机。 §1 说要探究什么,§5 就得拿出对应证据 —— 缺一半不算做完。 实验脚本在设计时就要产出这些,不能事后补。
| 要什么 | |
|---|---|
| 定性 | 一张图或一段视频,让人直接看见结论成不成立 |
| 定量 | 表格,带单位 / n / 统计量口径 / 验收线 |
| 趋势 | 随某变量变化的量用图不用表 |
| 对照 | 基线或消融 —— 否则绝对数说明不了任何事 |
实验脚本的产出契约¶
runs/<实验>/
metrics.json 汇总(含 n、单位、口径)
per_scene.json 逐场景明细 + **原始量测轨迹**
curves.png 趋势
videos/ 定性证据,至少 2 段
轨迹一定要存 —— 事后换判据、重画图都不必再占 GPU 重跑。
Benchmarks & Metrics¶
目前采用的指标与基线。接入公开 benchmark 时在此登记。
| 指标 | 定义 | 单位 | 天花板 / 底线 | 用在哪 |
|---|---|---|---|---|
| 情感分 | emotion2vec_plus_large 给目标情感的概率 | 比例 | 纯情感配方 0.78 | 全部 |
| CER | Paraformer-zh,标点归一化后的字错率 | 比例 ↓ | 纯情感配方 0.017 | 全部 |
| SECS | campplus 说话人嵌入余弦 | 比例 | 纯情感配方 0.849 | 全部 |
| UTMOS | UTMOS22 strong | MOS 1–5 | 纯情感配方 3.29;<2.5 视为破音 | 全部 |
| mono | 相邻 α 步中情感分上升的比例 | 比例 | 量化到 1/6 格点 | α 阶梯 |
| delta | α=1 与 α=0 的情感分之差 | 比例 | — | α 阶梯 |
| 长度离散度 | max_e K_e / min_e K_e | 比值 | 逐帧混合需 ≲1.05 | 调色板 |
依赖关系¶
flowchart TD
M0[M0] --> M1[M1]