放一张参考图,视频被拒的概率变成 13 倍
在思畅生成视频,你有四种起手式:只给文字(文生视频)、给一张图(图生视频)、给若干张参考图(参考图生视频)、给一段已有的视频往后接(视频续写)。
近 60 天这四条链路一共跑了 3,945 个任务。把它们的内容拦截率摆在一起,差距大到不像是同一个产品:
| 链路 | 任务数 | 内容拦截率 |
|---|---|---|
| 图生视频 | 2,212 | 2.4% |
| 视频续写 | 1,034 | 3.1% |
| 文生视频 | 82 | 6.1% (样本不足,仅作背景) |
| 参考图生视频 | 609 | 31.9% |
31.9% 对 2.4%——13 倍。
用参考图做视频,三次里有一次会被上游直接拒掉。而同样的内容改用图生视频,这个概率是四十分之一。
先排除一个可能:这不是我们自己的锅
看到这种数字,第一反应应该是怀疑统计口径。所以先把口径讲透。
视频任务失败有三类成因,混在一起统计就是一笔糊涂账:
- 内容拦截——上游看了你的提示词或参考图,拒绝执行;
- 上游故障——上游超时、限流、自己挂了;
- 我们自己的链路故障——我们的轮询或队列出了问题(说实话,这一类的量并不小)。
上面那张表只统计第一类。
如果你担心是我们把自己的 bug 算到了参考图头上,可以看剔除第三类之后的总失败率:参考图生视频 41.4%,图生视频 8.6%。差距依然在,而且依然悬殊。
另外,思畅自己的安全审核(只针对涉未成年人性化内容那一条红线)在链路更早的位置就返回了,不会写进这张表。所以每一次拦截都是上游的判断。
为什么参考图这么招审核
数据只说差了 13 倍,不说为什么。下面是我们认为最站得住的解释,但它是假说:
参考图上通常有一张清晰的、可辨认的真人脸。
对上游的审核系统来说,「一段越界的描述」和「一段越界的描述 + 一个具体的真实人物」是两个风险等级完全不同的东西。后者直接指向肖像滥用这类最敏感的场景,阈值收得比什么都紧。
图生视频虽然也传图,但它传的通常是已经生成好的图——风格化的、AI 产物的、审核系统见得多的那一类。参考图这条链路的典型用法恰恰相反:用户传的是真人照片,目的就是让视频里的人长得像那个人。
换句话说,被拦的不是你的提示词,是你的意图在审核眼里的样子。
怎么绕开
三条,按有效性排序:
一、能用图生视频就别用参考图。 如果你的目标只是「让这张图动起来」,那本来就该走图生视频——它便宜、快、拦截率四十分之一。参考图链路是为「让视频里的角色长得像这几张图里的人」准备的,不是通用入口。
二、参考图先过一道生成。 与其直接传真人照片,不如先在图片生成里把它转成风格化的图,再拿转出来的结果去做视频。多一步,但拦截率的档位完全不一样。
三、撞墙了就换链路,别反复重试同一条。 上游的判定对同一组输入是相当稳定的——同样的图和词再交一次,大概率还是拒。换个起手式比换个说法有用得多。
最后
把 31.9% 这个数字公开出来,我们内部讨论过会不会吓退人。结论是不会——因为你撞上的这三分之一,一个积分都不会扣(这一点的具体口径见文末)。
真正劝退的从来不是失败率,是不知道自己为什么失败、也不知道该怎么办。
延伸阅读
- 名字里写着 uncensored 的那个模型,反而是拦得最狠的——为什么不能靠名字选模型
- 「改图」比「出图」更容易被拒——图片侧的同一个规律