88% 的分类依据不是画面:我们是怎么给这 1,274 条打标签的
前面有一篇写了我们 95% 的记录处于「待语义复核」状态。那一篇讲的是复核没做;这一篇讲得更根本——即使做了分类,依据也不是画面。
数据是怎么来的
每条案例的 basis 字段记录这条记录的分类依据来自哪里。取值有 6 种:
| basis | 含义 | 条数 | 占比 |
|---|---|---|---|
| title | 依据案例标题 | 575 | 45.1% |
| metadata_only | 只有元数据,没有内容依据 | 540 | 42.4% |
| prompt_only | 依据提示词文本 | 102 | 8.0% |
| none | 无依据 | 22 | 1.7% |
| synthetic_title | 标题本身是生成的 | 20 | 1.6% |
| case_id_slug | 依据 ID 中的标识串 | 15 | 1.2% |
发现一:87.5% 的分类依据不是内容
把前两类加起来:575 + 540 = 1,115 条(87.5%)。
title意味着:我们读了一句标题,然后据此判定这条视频的题材和技法。metadata_only更直接:连标题都没有,只有分辨率、时长、托管方这些技术元数据。
真正读过提示词(prompt_only)的只有 102 条(8.0%)。
也就是说,这个库里约 92% 的题材/技法分类,不是基于对视频内容的观察。
发现二:标题本身还有一部分是生成的
那 575 条依据标题的记录里,有 20 条的标题是我们自己生成的(synthetic_title)。
这就是一个自指的循环:因为拿不到原始信息,我们生成了一个标题,再用这个标题去分类。这类记录的分类依据严格说是零——但它们在统计表和前面的每一篇文章里,与有真实依据的记录等权重。
必须说得更直白一点:这是一个方法论缺陷,不是数据规模问题。 加更多记录不会修复它。
发现三:标题平均只有 36 个字符
1,146 条案例有标题(90.0%),平均长度 36 个字符。
36 个字符能承载多少信息?看一下最高频的词:
| 词 | 出现次数 |
|---|---|
| minimax | 61 |
| anime | 49 |
| video | 46 |
| character | 39 |
| commercial | 32 |
| film | 30 |
| study | 30 |
| motion | 29 |
| fashion | 29 |
| cinematic | 28 |
| luxury | 21 |
| storyboard | 21 |
这些是体裁标签式的词(commercial、fashion、anime、film),不是对画面的描述。用「fashion」这个词判定一条视频属于「时尚美妆」题材,准确率会有多高?我们不知道——因为我们没有做过抽样人工核验。
这恰恰是问题所在:一个 36 字符的标题,加上没有核验,不构成可靠的分类依据。
发现四:只有 11 条带「verified」标记
我们顺手查了标题里的可信度词:
| 关键词 | 条数 |
|---|---|
| 含 "verified" | 11 |
| 含 "official" | 3 |
1,146 条标题里,只有 11 条声明自己经过验证。 也就是说,这批数据几乎不存在「这条案例已被确认」的标记——包括我们自己的记录在内。
这些数字能拿来干什么
如果你在引用我们前面的任何一篇:请把这一篇当作前置声明。涉及客观测量的结论(画幅、时长、分辨率、发布时间)是可靠的;涉及分类的结论(题材分布、技法排行、风格收敛)都建立在一个 87.5% 非内容依据的基础上。方向可能对,精度不可信。
如果你在做自己的标注:这是最该抄走的一条教训——「依据来源」必须是一个一等字段,而且在报表里要显示出来。 我们把它记了下来(basis),却没有在任何分析里按它分层。如果我们早点按 basis 过滤,就会立刻发现 87.5% 这个数字。
如果你在看任何一个自动标注数据集:问一句「标签的依据是什么」比问「有多少条」有用得多。一个 10 万条但依据是标题的库,价值可能低于一个 1,000 条逐条看过画面的库。
方法与局限
basis是我们自己写的字段,它的准确性同样没有经过外部核验。本文的自我批评建立在我们自己的自述之上。title不等于「不可靠」:有些标题信息量很高(包含镜头、动作、风格描述)。本文只指出标题作为分类依据在样本层面不构成依据,不是说每条都错。metadata_only不一定零信息:分辨率、时长、画幅本身是客观测量,可以支撑一部分结论(例如「这是一条横屏 15 秒的片子」);问题在于它们无法支撑题材与技法分类。- 无法估计错误率:我们没有抽样人工复核,所以不知道这 575 条(或 1,115 条)的分类错了多少。这是本文最大的空白,也是我们欠的下一笔账。
- 全部数字基于 1,274 条索引记录。
数据可查
每条案例的分类依据在详情里可见:https://cases.aishifu.shop/