aishifu 研究笔记 H3 案例库 关于 联系 EN

74% 的 AI 视频卡在 14 到 16 秒:这不是选择,是默认值

Alpha Lay ·

我们之前写过一句结论:「86% 的 AI 视频时长在 8 到 16 秒之间。」

写完觉得这个说法太宽了。8 秒和 16 秒差一倍,把它们算作一类,等于什么也没说。于是我们把 1,274 条按 2 秒重新分了桶。

结果比原来那句话极端得多。

数据是怎么来的

时长读自视频文件本身的容器元数据,不是从发布页描述里取的——所以它属于客观测量。分桶方式:每 2 秒一档。

时长区间条数占比
8–10 秒342.7%
10–12 秒947.4%
12–14 秒282.2%
14–16 秒94574.2%

如果按整数区间统计,形状更清楚:

条件条数占比
[14.0, 16.0) 秒94574.2%
[14.5, 16.0) 秒91571.8%
≥ 15.0 秒98477.2%
落在 15.0 – 15.2 秒之间83265.3%

832 条正好落在 15.0 到 15.2 秒这个宽度只有 0.2 秒的窗口里。

发现一:这不是人在选时长,是模型的输出默认值

人不会集体选择「15.1 秒」这个数字。

如果时长是创作者按内容需要定的,分布应该随题材散开——喜剧需要铺陈、广告需要短平快、舞蹈要跟完整段音乐。但实际分布是一根针:65% 的样本落在 0.2 秒宽的区间里。

结论只能是:模型的单次生成时长有一个固定的默认输出长度,绝大多数人没有改它。 那 74% 的「14–16 秒」并不是一个创作上的选择区间,而是同一个出厂设置被记了 945 次。

这解释了另外两件事:

  1. 为什么「8–16 秒」这个口语说法会流传——它是对一根针的粗略描述。
  2. 为什么 8–12 秒的样本只有 130 条(10.2%)——想做出 8 秒的片子,你得主动去截,这比默认输出麻烦,所以很少有人做。

发现二:短剧的均值被长尾拉高了 4 秒

题材中位数均值样本
短剧对话15.2 秒16.2 秒224
全体15.2 秒15.4 秒1,274

短剧的中位数和全体一样(15.2 秒),但均值高出近 1 秒,而且它的最长案例是 160.7 秒——超过中位数的十倍。

这是典型的「针 + 长尾」结构:绝大多数是默认的 15 秒,少数是拼接出来的长片。报均值会掩盖掉这个结构,报中位数才能看出真相。

发现三:长的那 81 条,几乎都是拼的

16 秒以上一共 81 条,它们的画像和主体完全不同:

指标16 秒以上(81 条)
时长中位数28.7 秒
时长均值38.7 秒
最长186.8 秒
超过 60 秒的11 条
横屏占比85.2%(69 / 81)

最长的一条是音乐舞蹈类,186.8 秒。这个长度不可能是单次生成——远超模型的输出上限。

>

这些数字能拿来干什么

如果你在规划一条 30 秒以上的片子:不要指望靠提示词拉长。按数据,你得先按 15 秒的节拍把内容切成 2–3 段,每段按默认长度出,再拼。这也是为什么「多镜切换」和「切镜时间」这两个技法在库里各有 200 条以上——它们是长片的基础设施。

如果你在评估模型:15 秒这个默认值是一个硬约束,值得在选型时单独立项测。要关注的问题不是「能不能生出 30 秒」,而是「超出默认长度后画面一致性和运动连续性掉多少」。

如果你在做广告投放:0–8 秒的样本只有 92 条,其中产品广告 11 条。也就是说,公开案例里几乎没有可直接参考的超短广告。这个区间目前是空的,你得自己试。

方法与局限

数据可查

按「时长」筛选器可以逐条核对,也可以自己重新分桶:https://cases.aishifu.shop/