返回博客
视频模型AI 创作

放一张参考图,视频被拒的概率变成 13 倍

在思畅生成视频,你有四种起手式:只给文字(文生视频)、给一张图(图生视频)、给若干张参考图(参考图生视频)、给一段已有的视频往后接(视频续写)。

近 60 天这四条链路一共跑了 3,945 个任务。把它们的内容拦截率摆在一起,差距大到不像是同一个产品:

链路任务数内容拦截率
图生视频2,2122.4%
视频续写1,0343.1%
文生视频826.1% (样本不足,仅作背景)
参考图生视频60931.9%

31.9% 对 2.4%——13 倍。

用参考图做视频,三次里有一次会被上游直接拒掉。而同样的内容改用图生视频,这个概率是四十分之一。

先排除一个可能:这不是我们自己的锅

看到这种数字,第一反应应该是怀疑统计口径。所以先把口径讲透。

视频任务失败有三类成因,混在一起统计就是一笔糊涂账:

  1. 内容拦截——上游看了你的提示词或参考图,拒绝执行;
  2. 上游故障——上游超时、限流、自己挂了;
  3. 我们自己的链路故障——我们的轮询或队列出了问题(说实话,这一类的量并不小)。

上面那张表只统计第一类

如果你担心是我们把自己的 bug 算到了参考图头上,可以看剔除第三类之后的总失败率:参考图生视频 41.4%,图生视频 8.6%。差距依然在,而且依然悬殊。

另外,思畅自己的安全审核(只针对涉未成年人性化内容那一条红线)在链路更早的位置就返回了,不会写进这张表。所以每一次拦截都是上游的判断。

为什么参考图这么招审核

数据只说差了 13 倍,不说为什么。下面是我们认为最站得住的解释,但它是假说

参考图上通常有一张清晰的、可辨认的真人脸。

对上游的审核系统来说,「一段越界的描述」和「一段越界的描述 + 一个具体的真实人物」是两个风险等级完全不同的东西。后者直接指向肖像滥用这类最敏感的场景,阈值收得比什么都紧。

图生视频虽然也传图,但它传的通常是已经生成好的图——风格化的、AI 产物的、审核系统见得多的那一类。参考图这条链路的典型用法恰恰相反:用户传的是真人照片,目的就是让视频里的人长得像那个人。

换句话说,被拦的不是你的提示词,是你的意图在审核眼里的样子

怎么绕开

三条,按有效性排序:

一、能用图生视频就别用参考图。 如果你的目标只是「让这张图动起来」,那本来就该走图生视频——它便宜、快、拦截率四十分之一。参考图链路是为「让视频里的角色长得像这几张图里的人」准备的,不是通用入口。

二、参考图先过一道生成。 与其直接传真人照片,不如先在图片生成里把它转成风格化的图,再拿转出来的结果去做视频。多一步,但拦截率的档位完全不一样。

三、撞墙了就换链路,别反复重试同一条。 上游的判定对同一组输入是相当稳定的——同样的图和词再交一次,大概率还是拒。换个起手式比换个说法有用得多。

最后

把 31.9% 这个数字公开出来,我们内部讨论过会不会吓退人。结论是不会——因为你撞上的这三分之一,一个积分都不会扣(这一点的具体口径见文末)。

真正劝退的从来不是失败率,是不知道自己为什么失败、也不知道该怎么办。

延伸阅读