aishifu 研究笔记 H3 案例库 关于 联系 EN

930 条 AI 视频说不出自己是怎么生成的——问题不在创作者,在来源

Alpha Lay ·

做标签体系时我们设了一个基础字段:这条视频是怎么生成的——文生、图生、参考生、首尾帧生?

这是提示词写作的前提。你要学一条案例的写法,第一件要知道的事就是它有没有参考图、有没有给定首尾帧,因为这三类提示词的写法完全不同。但填完 1,274 条之后,七成以上是空的。

数据是怎么来的

「生成模式」字段由三路信息来源判定:原始发布页正文里的显式说明、提示词文本本身的结构特征(例如是否声明了 first frame)、以及来源站点的官方标注。三者都拿不到时,记为「模式未核实」,而不是猜一个。

生成模式条数占比
模式未核实93073.0%
文生视频16412.9%
参考生视频12810.0%
首尾帧生视频493.8%
图生视频-未细分30.2%

一开始我们的假设是「创作者懒得写」。按题材切了一遍,看起来也支持这个假设——最高和最低差了近 50 个百分点:

题材未核实率样本
动作物理94.3%70
转场编辑86.0%43
短剧对话79.0%224
…
科幻53.6%56
武打格斗45.1%71

看上去像是「不同圈子的创作者习惯不同」。但真正的原因是另一件事。

发现一:缺失率几乎是来源渠道的镜像

我们按「这条案例是从哪来的」(prov 字段,即来源类型)重新切了一次:

来源类型样本未核实率
official(官方)60.0%
source_page_public_prompt(来源页公开提示词)6468.8%
creator-verbatim(原发布者原文照录)64552.4%
beatapi_indexed_prompt_with_webm312100.0%
indexed_from_awesome_minimax_h3_prompts74100.0%
apimodels_original_or_indexed63100.0%
official_or_official_index_prompt37100.0%
static.minimax-h3.io 转载20100.0%

规律非常干净:凡是官方原始渠道,模式标注率 100%;凡是第三方聚合镜像站,未核实率 100%。

这个结论比题材切法有力得多。它说明「模式未核实」不是创作者的属性,而是信息在传播过程中被剥掉了——原帖里常常写了,被聚合站抓走之后那一行没了,之后的索引者就再也无从得知。

发现二:唯一标注完整的两个来源,都不是社区主渠道

我们把托管方和未核实率对齐看,规律更极端:

视频托管方样本未核实率
pub-…r2.dev(官方转载渠道)200.0%
h3-field-notes-production.up.railway.app64852.2%
video.twimg.com(X 原生视频)15592.9%
media.beatapi.io312100.0%
raw.githubusercontent.com60100.0%
external-cdn.morphic.com44100.0%
static.minimax-h3.io20100.0%

而全库 87.4% 的案例来源都在 X(Twitter)——那里恰好是最不容易带上结构化元数据的地方。

发现三:已核实的 344 条里,短剧的占比低于预期

如果只统计能核实模式的 344 条,题材构成和全体并不一样:

题材已核实条数
产品广告57
人物表演51
短剧对话47
武打格斗39
城市建筑34

短剧对话在全体里是样本最多的题材(224 条,17.6%),但在「能说清怎么生成的」这一子集里只排第三(47 条,13.7%)。越是依赖具体参考素材的题材,它的生成方式越容易在传播中丢失。

这些数字能拿来干什么

如果你在照着公开案例学提示词写法:先确认这条案例的生成模式,确认不了就别照抄。同一句「镜头缓缓推近」,在文生和参考生里的写法差别很大,抄错层会白折腾半天。我们的建议是只学模式明确的案例——本库里这类一共 344 条。

如果你在做数据集或索引:这条发现值得单独记一下:从聚合站抓数据会系统性地丢掉结构化字段,而且丢得不是随机的——聚合越彻底,字段越干净。想保住这类信息,必须在链条上游拿。

如果你在发布自己的作品:在正文里写清生成模式(哪怕只是一句「参考图生视频」),能让你的案例被后续索引者正确归类——这是一个几乎零成本、但显著提高被引用率的动作。

方法与局限

数据可查

按「生成模式」筛选,或按来源站点分组查看:https://cases.aishifu.shop/