标了「对口型」的案例里,45% 从没做过语音检测
这一篇是我们自己数据里最难看的一块。
我们给案例库跑了一轮语音检测(ASR),用来回答一个很基础的问题:这条视频里到底有没有人说话。有了这个字段,才能把「口播类」和「纯画面类」分开,才能评估口型同步这类能力。
跑完之后我们对了一次账,发现两个本该互相印证的维度,对不上的比例超过一半。
数据是怎么来的
- 语音检测字段(
asr):对视频音轨跑分段检测,结果为四类——检测到人声段落(dialogue_detected)、有音轨但无人声段落(no_segments)、疑似识别幻觉(suspect_hallucination)、本轮未执行(not_run_this_round)。 - 「配音口型」技法标签(
tt):人工/半自动标注,含义是「画面里存在与声音对应的口型运动」。
两者是独立产生的,正好可以交叉验证。
发现一:超过一半的案例,这个问题从未被回答
| 语音检测结果 | 条数 | 占比 |
|---|---|---|
| not_run_this_round(本轮未执行) | 704 | 55.3% |
| no_segments(有音轨无人声) | 314 | 24.6% |
| dialogue_detected(检测到对白) | 251 | 19.7% |
| suspect_hallucination | 3 | 0.2% |
| 未匹配 | 2 | 0.2% |
55.3% 的案例没有语音检测结论。 而且缺的分布很不均衡——最高优先级的那一档缺得最厉害:
| 优先级 | 样本 | 未执行检测 |
|---|---|---|
| P0(当前短剧) | 263 | 194(73.8%) |
| P1(跨题材技法) | 441 | 261(59.2%) |
| P2(未来类型) | 570 | 249(43.7%) |
P0 是我们自己定义的「最该先看懂」的一档(以短剧对话为主),结果它有四分之三连「有没有人说话」都不知道。
发现二:打上「对口型」标签的,45% 从没验过
这一条是这篇的重点。我们取全部被标了「配音口型」的案例(313 条),看它们的语音检测结果:
| 配音口型案例的语音检测结果 | 条数 | 占比 |
|---|---|---|
| dialogue_detected(确实检测到对白) | 119 | 38.0% |
| no_segments(有音轨但无人声) | 50 | 16.0% |
| not_run_this_round(从没跑过) | 140 | 44.7% |
| suspect_hallucination | 2 | 0.6% |
| 未匹配 | 2 | 0.6% |
313 条「对口型」案例里,140 条(44.7%)在标注时并没有语音检测数据作为依据。
那这 140 条的口型标签是怎么来的?只能是从画面判断的——看着像是有人在说话。而「看着像」和「音轨里真有人声」是两件事:一个对着镜头张合嘴巴的镜头,音轨可能是纯音乐,也可能根本没有音轨。
发现三:反方向也对不上——检测到对白的,只有 47% 被标了「配音口型」
把交叉表反过来看:
| 检测到对白的 251 条 | 条数 | 占比 |
|---|---|---|
| 同时标了「配音口型」 | 119 | 47.4% |
| 没标「配音口型」 | 132 | 52.6% |
语音检测说「有人说话」的案例里,超过一半没有拿到「配音口型」标签。 其中一部分合理——画外音、旁白、唱歌都可能检测到人声但不涉及口型。但 132 条这个规模,说明还有相当一部分是漏标。
这些数字能拿来干什么
如果你要评估口型同步能力:库里真正可用于这个目的的样本是 119 条(同时有对白检测 + 口型标签),不是 313 条。用 313 条做分母会把评测结论稀释掉。
如果你在选模型做口播内容:先看 P0 档那 73.8% 的缺失——它意味着当前公开案例里,口播类的最佳实践几乎没有被系统整理过。这个空白是机会,不是障碍。
如果你自己在标注数据:这一篇是一个现成的反面教材。不要用「看起来像」代替「测一下」。我们的口型标签有 45% 没有检测依据,这个比例足以让整个字段失效。
方法与局限
- 「检测到对白」的判定门槛会影响结果:人声段落过短、音乐盖过说话、外语口音都可能漏检。我们没有做人工听力复核。
suspect_hallucination只有 3 条,规模太小,不构成对 ASR 准确率的结论。- 不能反推「模型不能做口型」:
no_segments的 50 条可能是标注错误(画面有口型但音轨没声音,属于无声片),也可能是检测漏判,本文不做区分。 - 全部数字基于 1,274 条索引记录(去重后:未执行 374 条、检测到对白 244 条、无人声 301 条,比例基本一致;去重后「配音口型」224 条中未执行 51 条,即 22.8% —— 去重后反而更低,说明重复的镜像主要落在已检测的一批里)。
数据可查
按语音检测结果筛选,或按「配音口型」技法标签交叉查看:https://cases.aishifu.shop/