aishifu 研究笔记 H3 案例库 关于 联系 EN

标了「对口型」的案例里,45% 从没做过语音检测

Alpha Lay ·

这一篇是我们自己数据里最难看的一块。

我们给案例库跑了一轮语音检测(ASR),用来回答一个很基础的问题:这条视频里到底有没有人说话。有了这个字段,才能把「口播类」和「纯画面类」分开,才能评估口型同步这类能力。

跑完之后我们对了一次账,发现两个本该互相印证的维度,对不上的比例超过一半。

数据是怎么来的

两者是独立产生的,正好可以交叉验证。

发现一:超过一半的案例,这个问题从未被回答

语音检测结果条数占比
not_run_this_round(本轮未执行)70455.3%
no_segments(有音轨无人声)31424.6%
dialogue_detected(检测到对白)25119.7%
suspect_hallucination30.2%
未匹配20.2%

55.3% 的案例没有语音检测结论。 而且缺的分布很不均衡——最高优先级的那一档缺得最厉害:

优先级样本未执行检测
P0(当前短剧)263194(73.8%)
P1(跨题材技法)441261(59.2%)
P2(未来类型)570249(43.7%)

P0 是我们自己定义的「最该先看懂」的一档(以短剧对话为主),结果它有四分之三连「有没有人说话」都不知道。

发现二:打上「对口型」标签的,45% 从没验过

这一条是这篇的重点。我们取全部被标了「配音口型」的案例(313 条),看它们的语音检测结果:

配音口型案例的语音检测结果条数占比
dialogue_detected(确实检测到对白)11938.0%
no_segments(有音轨但无人声)5016.0%
not_run_this_round(从没跑过)14044.7%
suspect_hallucination20.6%
未匹配20.6%

313 条「对口型」案例里,140 条(44.7%)在标注时并没有语音检测数据作为依据。

那这 140 条的口型标签是怎么来的?只能是从画面判断的——看着像是有人在说话。而「看着像」和「音轨里真有人声」是两件事:一个对着镜头张合嘴巴的镜头,音轨可能是纯音乐,也可能根本没有音轨。

发现三:反方向也对不上——检测到对白的,只有 47% 被标了「配音口型」

把交叉表反过来看:

检测到对白的 251 条条数占比
同时标了「配音口型」11947.4%
没标「配音口型」13252.6%

语音检测说「有人说话」的案例里,超过一半没有拿到「配音口型」标签。 其中一部分合理——画外音、旁白、唱歌都可能检测到人声但不涉及口型。但 132 条这个规模,说明还有相当一部分是漏标。

这些数字能拿来干什么

如果你要评估口型同步能力:库里真正可用于这个目的的样本是 119 条(同时有对白检测 + 口型标签),不是 313 条。用 313 条做分母会把评测结论稀释掉。

如果你在选模型做口播内容:先看 P0 档那 73.8% 的缺失——它意味着当前公开案例里,口播类的最佳实践几乎没有被系统整理过。这个空白是机会,不是障碍。

如果你自己在标注数据:这一篇是一个现成的反面教材。不要用「看起来像」代替「测一下」。我们的口型标签有 45% 没有检测依据,这个比例足以让整个字段失效。

方法与局限

数据可查

按语音检测结果筛选,或按「配音口型」技法标签交叉查看:https://cases.aishifu.shop/