930 条 AI 视频说不出自己是怎么生成的——问题不在创作者,在来源
做标签体系时我们设了一个基础字段:这条视频是怎么生成的——文生、图生、参考生、首尾帧生?
这是提示词写作的前提。你要学一条案例的写法,第一件要知道的事就是它有没有参考图、有没有给定首尾帧,因为这三类提示词的写法完全不同。但填完 1,274 条之后,七成以上是空的。
数据是怎么来的
「生成模式」字段由三路信息来源判定:原始发布页正文里的显式说明、提示词文本本身的结构特征(例如是否声明了 first frame)、以及来源站点的官方标注。三者都拿不到时,记为「模式未核实」,而不是猜一个。
| 生成模式 | 条数 | 占比 |
|---|---|---|
| 模式未核实 | 930 | 73.0% |
| 文生视频 | 164 | 12.9% |
| 参考生视频 | 128 | 10.0% |
| 首尾帧生视频 | 49 | 3.8% |
| 图生视频-未细分 | 3 | 0.2% |
一开始我们的假设是「创作者懒得写」。按题材切了一遍,看起来也支持这个假设——最高和最低差了近 50 个百分点:
| 题材 | 未核实率 | 样本 |
|---|---|---|
| 动作物理 | 94.3% | 70 |
| 转场编辑 | 86.0% | 43 |
| 短剧对话 | 79.0% | 224 |
| … | ||
| 科幻 | 53.6% | 56 |
| 武打格斗 | 45.1% | 71 |
看上去像是「不同圈子的创作者习惯不同」。但真正的原因是另一件事。
发现一:缺失率几乎是来源渠道的镜像
我们按「这条案例是从哪来的」(prov 字段,即来源类型)重新切了一次:
| 来源类型 | 样本 | 未核实率 |
|---|---|---|
| official(官方) | 6 | 0.0% |
| source_page_public_prompt(来源页公开提示词) | 64 | 68.8% |
| creator-verbatim(原发布者原文照录) | 645 | 52.4% |
| beatapi_indexed_prompt_with_webm | 312 | 100.0% |
| indexed_from_awesome_minimax_h3_prompts | 74 | 100.0% |
| apimodels_original_or_indexed | 63 | 100.0% |
| official_or_official_index_prompt | 37 | 100.0% |
| static.minimax-h3.io 转载 | 20 | 100.0% |
规律非常干净:凡是官方原始渠道,模式标注率 100%;凡是第三方聚合镜像站,未核实率 100%。
这个结论比题材切法有力得多。它说明「模式未核实」不是创作者的属性,而是信息在传播过程中被剥掉了——原帖里常常写了,被聚合站抓走之后那一行没了,之后的索引者就再也无从得知。
发现二:唯一标注完整的两个来源,都不是社区主渠道
我们把托管方和未核实率对齐看,规律更极端:
| 视频托管方 | 样本 | 未核实率 |
|---|---|---|
| pub-…r2.dev(官方转载渠道) | 20 | 0.0% |
| h3-field-notes-production.up.railway.app | 648 | 52.2% |
| video.twimg.com(X 原生视频) | 155 | 92.9% |
| media.beatapi.io | 312 | 100.0% |
| raw.githubusercontent.com | 60 | 100.0% |
| external-cdn.morphic.com | 44 | 100.0% |
| static.minimax-h3.io | 20 | 100.0% |
而全库 87.4% 的案例来源都在 X(Twitter)——那里恰好是最不容易带上结构化元数据的地方。
发现三:已核实的 344 条里,短剧的占比低于预期
如果只统计能核实模式的 344 条,题材构成和全体并不一样:
| 题材 | 已核实条数 |
|---|---|
| 产品广告 | 57 |
| 人物表演 | 51 |
| 短剧对话 | 47 |
| 武打格斗 | 39 |
| 城市建筑 | 34 |
短剧对话在全体里是样本最多的题材(224 条,17.6%),但在「能说清怎么生成的」这一子集里只排第三(47 条,13.7%)。越是依赖具体参考素材的题材,它的生成方式越容易在传播中丢失。
这些数字能拿来干什么
如果你在照着公开案例学提示词写法:先确认这条案例的生成模式,确认不了就别照抄。同一句「镜头缓缓推近」,在文生和参考生里的写法差别很大,抄错层会白折腾半天。我们的建议是只学模式明确的案例——本库里这类一共 344 条。
如果你在做数据集或索引:这条发现值得单独记一下:从聚合站抓数据会系统性地丢掉结构化字段,而且丢得不是随机的——聚合越彻底,字段越干净。想保住这类信息,必须在链条上游拿。
如果你在发布自己的作品:在正文里写清生成模式(哪怕只是一句「参考图生视频」),能让你的案例被后续索引者正确归类——这是一个几乎零成本、但显著提高被引用率的动作。
方法与局限
- 「模式未核实」不等于「不知道」。 它只表示我们这三路信息来源都没取到。视频本身当然有确定的生成方式,只是没有被记录下来。
- 判据本身有误差。 提示词文本特征识别(如检测
first frame字样)可能误判;这类样本我们加了弱分类依据标记,共 26 条。 - 相关性说明:本文陈述的是「来源渠道」与「字段缺失」的强相关,不主张单一因果——也存在「某些渠道恰好偏好收录某些题材」的可能。
- 全部数字基于 1,274 条索引记录,未按原始发布去重(去重口径见另一篇)。
数据可查
按「生成模式」筛选,或按来源站点分组查看:https://cases.aishifu.shop/