aishifu 研究笔记 H3 案例库 关于 联系 EN

88% 的分类依据不是画面:我们是怎么给这 1,274 条打标签的

Alpha Lay ·

前面有一篇写了我们 95% 的记录处于「待语义复核」状态。那一篇讲的是复核没做;这一篇讲得更根本——即使做了分类,依据也不是画面。

数据是怎么来的

每条案例的 basis 字段记录这条记录的分类依据来自哪里。取值有 6 种:

basis含义条数占比
title依据案例标题57545.1%
metadata_only只有元数据,没有内容依据54042.4%
prompt_only依据提示词文本1028.0%
none无依据221.7%
synthetic_title标题本身是生成的201.6%
case_id_slug依据 ID 中的标识串151.2%

发现一:87.5% 的分类依据不是内容

把前两类加起来:575 + 540 = 1,115 条(87.5%)。

真正读过提示词(prompt_only)的只有 102 条(8.0%)。

也就是说,这个库里约 92% 的题材/技法分类,不是基于对视频内容的观察。

发现二:标题本身还有一部分是生成的

那 575 条依据标题的记录里,有 20 条的标题是我们自己生成的(synthetic_title)。

这就是一个自指的循环:因为拿不到原始信息,我们生成了一个标题,再用这个标题去分类。这类记录的分类依据严格说是零——但它们在统计表和前面的每一篇文章里,与有真实依据的记录等权重。

必须说得更直白一点:这是一个方法论缺陷,不是数据规模问题。 加更多记录不会修复它。

发现三:标题平均只有 36 个字符

1,146 条案例有标题(90.0%),平均长度 36 个字符。

36 个字符能承载多少信息?看一下最高频的词:

词出现次数
minimax61
anime49
video46
character39
commercial32
film30
study30
motion29
fashion29
cinematic28
luxury21
storyboard21

这些是体裁标签式的词(commercial、fashion、anime、film),不是对画面的描述。用「fashion」这个词判定一条视频属于「时尚美妆」题材,准确率会有多高?我们不知道——因为我们没有做过抽样人工核验。

这恰恰是问题所在:一个 36 字符的标题,加上没有核验,不构成可靠的分类依据。

发现四:只有 11 条带「verified」标记

我们顺手查了标题里的可信度词:

关键词条数
含 "verified"11
含 "official"3

1,146 条标题里,只有 11 条声明自己经过验证。 也就是说,这批数据几乎不存在「这条案例已被确认」的标记——包括我们自己的记录在内。

这些数字能拿来干什么

如果你在引用我们前面的任何一篇:请把这一篇当作前置声明。涉及客观测量的结论(画幅、时长、分辨率、发布时间)是可靠的;涉及分类的结论(题材分布、技法排行、风格收敛)都建立在一个 87.5% 非内容依据的基础上。方向可能对,精度不可信。

如果你在做自己的标注:这是最该抄走的一条教训——「依据来源」必须是一个一等字段,而且在报表里要显示出来。 我们把它记了下来(basis),却没有在任何分析里按它分层。如果我们早点按 basis 过滤,就会立刻发现 87.5% 这个数字。

如果你在看任何一个自动标注数据集:问一句「标签的依据是什么」比问「有多少条」有用得多。一个 10 万条但依据是标题的库,价值可能低于一个 1,000 条逐条看过画面的库。

方法与局限

数据可查

每条案例的分类依据在详情里可见:https://cases.aishifu.shop/