aishifu 研究笔记 H3 案例库 关于 联系 EN

「224 比 4」这个数字是错的:去掉镜像重复后是 153 比 2

Alpha Lay ·

这一篇是对我们自己前面结论的更正。

我们早先写过一句很有说服力的话:「短剧对话 224 条,仙侠武侠只有 4 条」——用它说明公开案例的题材分布严重偏离实际投放需求。写的时候就觉得 4 这个数字太整了,像是有问题,但没深究。

最近做数据卫生检查时,答案出来了:4 条对应的是 2 个原始视频。这个题材在整批样本里的真实样本量是 2。

问题是怎么发现的

起因是另一个题材:动作物理。它的样本数从原始统计看是 70 条,但我们抽查时发现其中几条指向同一个原始发布链接,只是视频文件托管在不同的域名下。

于是按「原始发布链接」(src 字段,指向那条推文或原始页面)做了一次全库去重:

指标数值
索引记录总数1,274
按原始发布去重后924
重复条数350(27.5%)
存在重复的原始发布324 组
涉及案例674 条
一个源对应 2 个托管方302 组

超过四分之一的索引记录是重复的。 而且重复形态很整齐:同一个原始发布,视频文件同时被两个不同的托管域名保存了一份。

发现一:重复不是随机的,垂直题材被镜像得最多

去重前后各题材的变化差别很大:

题材原始去重后减少
转场编辑4319−56%
动作物理7032−54%
短剧对话224153−32%
产品广告192137−29%
景观自然9468−28%
动画游戏8361−27%
音乐舞蹈121101−17%
人物表演149133−11%
武打格斗7163−11%
多人互动12120%

「转场编辑」和「动作物理」的重复率过半。 这两个都是技术演示型题材——它们被镜像得多,很可能是因为这类内容被「工具对比」「能力展示」类文章反复引用,于是被多个站点各自保存了一份。

而「人物表演」「武打格斗」这类内容型题材重复率只有 11%——内容越有「作品感」,越少被工具站镜像。

发现二:仙侠武侠的真实样本是 2,题材鸿沟是 76 倍不是 56 倍

回到最初的问题:

版本短剧对话仙侠武侠倍数
去重前(我们之前写的)224456 倍
去重后(真实值)153276.5 倍

那 4 条的实际构成:

原始发布对应索引记录数
x.com/AIwithAliya/status/20831327706505710412 条(railway 镜像 + beatapi 镜像)
x.com/Stellakjbk/status/20860218690402634552 条(railway 镜像 + beatapi 镜像)

所以「仙侠武侠只有 4 条」实际是「仙侠武侠只有 2 条被两个站点各存了一份」。

题材鸿沟比我原来写的更大,而且更绝对。原来那句话(「公开案例的题材分布严重偏离投放需求」)方向是对的,但数字要改:不是 56 倍,是 76.5 倍。

发现三:去重后,托管集中度反而更高了

去重还揭穿了另一件事。原始统计里托管最多的是两个域:

托管方去重前去重后
h3-field-notes-production.up.railway.app648(50.9%)625(67.6%)
media.beatapi.io312(24.5%)55(6.0%)
video.twimg.com155124
raw.githubusercontent.com6043
external-cdn.morphic.com4444

beatapi 的 312 条里,只有 55 条是独有的——其余 257 条都是别处已有内容的镜像。

这改变了「托管集中度」的解读:不是「两个站点各占一半」,而是一个托管方承载了 67.6% 的独有案例。这个数字我们在另一篇里单独展开。

这些数字能拿来干什么

如果你在看任何「AI 视频案例统计」:先问一句去重口径。同一个原始视频被多个镜像站保存、被多个索引项目抓取,是这类统计的系统性偏差源,而且它不随机——垂直题材和高传播内容被重复得更多,会把热门品类进一步放大。

如果你在做自己的索引:去重键要选「原始发布」而不是「文件 URL」。文件 URL 层面去重会失效,因为同一个视频在不同托管方有完全不同的 URL(我们自己就是这么漏掉的)。

如果你关心选题方向:仙侠武侠的真实样本是 2 条,这个题材在公开案例里基本等于没有。想要参考就得自己生成。

方法与局限

数据可查

案例库仍按 1,274 条索引提供服务(保留镜像对使用者有用);原始发布链接在每条详情里可查,可自行复现去重:https://cases.aishifu.shop/