「224 比 4」这个数字是错的:去掉镜像重复后是 153 比 2
这一篇是对我们自己前面结论的更正。
我们早先写过一句很有说服力的话:「短剧对话 224 条,仙侠武侠只有 4 条」——用它说明公开案例的题材分布严重偏离实际投放需求。写的时候就觉得 4 这个数字太整了,像是有问题,但没深究。
最近做数据卫生检查时,答案出来了:4 条对应的是 2 个原始视频。这个题材在整批样本里的真实样本量是 2。
问题是怎么发现的
起因是另一个题材:动作物理。它的样本数从原始统计看是 70 条,但我们抽查时发现其中几条指向同一个原始发布链接,只是视频文件托管在不同的域名下。
于是按「原始发布链接」(src 字段,指向那条推文或原始页面)做了一次全库去重:
| 指标 | 数值 |
|---|---|
| 索引记录总数 | 1,274 |
| 按原始发布去重后 | 924 |
| 重复条数 | 350(27.5%) |
| 存在重复的原始发布 | 324 组 |
| 涉及案例 | 674 条 |
| 一个源对应 2 个托管方 | 302 组 |
超过四分之一的索引记录是重复的。 而且重复形态很整齐:同一个原始发布,视频文件同时被两个不同的托管域名保存了一份。
发现一:重复不是随机的,垂直题材被镜像得最多
去重前后各题材的变化差别很大:
| 题材 | 原始 | 去重后 | 减少 |
|---|---|---|---|
| 转场编辑 | 43 | 19 | −56% |
| 动作物理 | 70 | 32 | −54% |
| 短剧对话 | 224 | 153 | −32% |
| 产品广告 | 192 | 137 | −29% |
| 景观自然 | 94 | 68 | −28% |
| 动画游戏 | 83 | 61 | −27% |
| 音乐舞蹈 | 121 | 101 | −17% |
| 人物表演 | 149 | 133 | −11% |
| 武打格斗 | 71 | 63 | −11% |
| 多人互动 | 12 | 12 | 0% |
「转场编辑」和「动作物理」的重复率过半。 这两个都是技术演示型题材——它们被镜像得多,很可能是因为这类内容被「工具对比」「能力展示」类文章反复引用,于是被多个站点各自保存了一份。
而「人物表演」「武打格斗」这类内容型题材重复率只有 11%——内容越有「作品感」,越少被工具站镜像。
发现二:仙侠武侠的真实样本是 2,题材鸿沟是 76 倍不是 56 倍
回到最初的问题:
| 版本 | 短剧对话 | 仙侠武侠 | 倍数 |
|---|---|---|---|
| 去重前(我们之前写的) | 224 | 4 | 56 倍 |
| 去重后(真实值) | 153 | 2 | 76.5 倍 |
那 4 条的实际构成:
| 原始发布 | 对应索引记录数 |
|---|---|
| x.com/AIwithAliya/status/2083132770650571041 | 2 条(railway 镜像 + beatapi 镜像) |
| x.com/Stellakjbk/status/2086021869040263455 | 2 条(railway 镜像 + beatapi 镜像) |
所以「仙侠武侠只有 4 条」实际是「仙侠武侠只有 2 条被两个站点各存了一份」。
题材鸿沟比我原来写的更大,而且更绝对。原来那句话(「公开案例的题材分布严重偏离投放需求」)方向是对的,但数字要改:不是 56 倍,是 76.5 倍。
发现三:去重后,托管集中度反而更高了
去重还揭穿了另一件事。原始统计里托管最多的是两个域:
| 托管方 | 去重前 | 去重后 |
|---|---|---|
| h3-field-notes-production.up.railway.app | 648(50.9%) | 625(67.6%) |
| media.beatapi.io | 312(24.5%) | 55(6.0%) |
| video.twimg.com | 155 | 124 |
| raw.githubusercontent.com | 60 | 43 |
| external-cdn.morphic.com | 44 | 44 |
beatapi 的 312 条里,只有 55 条是独有的——其余 257 条都是别处已有内容的镜像。
这改变了「托管集中度」的解读:不是「两个站点各占一半」,而是一个托管方承载了 67.6% 的独有案例。这个数字我们在另一篇里单独展开。
这些数字能拿来干什么
如果你在看任何「AI 视频案例统计」:先问一句去重口径。同一个原始视频被多个镜像站保存、被多个索引项目抓取,是这类统计的系统性偏差源,而且它不随机——垂直题材和高传播内容被重复得更多,会把热门品类进一步放大。
如果你在做自己的索引:去重键要选「原始发布」而不是「文件 URL」。文件 URL 层面去重会失效,因为同一个视频在不同托管方有完全不同的 URL(我们自己就是这么漏掉的)。
如果你关心选题方向:仙侠武侠的真实样本是 2 条,这个题材在公开案例里基本等于没有。想要参考就得自己生成。
方法与局限
- 「同一原始发布」不等于「同一视频」:一条推文里发布多个视频的情况存在,我们的去重会把它折叠成 1 条(
nurls字段显示全库共 1,317 个视频 URL,1231 条案例只对应 1 个,43 条对应 2 个)。这会轻微低估真实案例量。 - 跨源重复抓不到:如果一个视频被两个人分别转发且各自上传,原始发布链接不同,去重无法识别。所以 350 这个数字是下限。
- 去重后的 924 不是「正确答案」:它只是「按原始发布去重的口径」。站点上仍以 1,274 条索引记录检索,因为对使用者而言,多一个可播放的镜像源是有用的——索引数量与统计口径是两件事。
- 本文结论不影响画幅、时长、风格等维度(去重前后比例一致,见各篇「方法与局限」)。
数据可查
案例库仍按 1,274 条索引提供服务(保留镜像对使用者有用);原始发布链接在每条详情里可查,可自行复现去重:https://cases.aishifu.shop/