「改图」比「出图」更容易被拒:同一个模型,拦截率差 4 到 6 倍
先说一个你大概率遇到过、但没往心里去的现象。
你在思畅上用同一个模型做两件事:一是丢一句提示词让它从零画一张,二是拿一张已有的图让它改一改。凭直觉,后者应该更容易——毕竟主体、构图、光线都给好了,模型只要动一处。
生产数据是反过来的,而且反得很彻底。
同一个模型家族,编辑被拒的概率是生成的 4 到 6 倍
我们把近 60 天思畅上两万四千多次图片调用按模型拆开,只看一个指标:内容拦截率(提示词或图被上游判定违规而拒绝执行的比例)。
挑其中两组——它们是同一个模型的生成版和编辑版,模型本身这个变量被控制住了:
| 模型 | 链路 | 调用次数 | 内容拦截率 |
|---|---|---|---|
| Seedream V5 Pro | 生成 | 383 | 3.4% |
| Seedream V5 Pro | 编辑 | 1,935 | 15.5% |
| Seedream V5 Lite | 生成 | 222 | 4.5% |
| Seedream V5 Lite | 编辑 | 294 | 28.2% |
Pro 差 4.6 倍,Lite 差 6.3 倍。
作为参照,纯生成这一侧的日常水位其实很低:主力模型 Z-Image Turbo 在这 60 天里跑了 11,617 次,内容拦截 0 次。
也就是说,你在思畅上被拒的经历,绝大部分不是发生在「画」的时候,是发生在「改」的时候。
一个必须先讲清楚的口径问题
在解释原因之前,先说清楚这个 15.5% 是怎么算的,因为算错口径的对比毫无意义。
一次生成失败可能有三种完全不同的成因:
- 内容拦截——上游看了你的提示词或图,说不行;
- 上游故障——上游自己挂了、超时、限流;
- 我们自己的链路故障——我们的轮询、队列、存储出了问题。
第三类是我们的 bug,把它算进「模型拦截率」等于拿自己的锅去泼模型。所以上表只统计第一类,第二、三类全部剔除。
还有一点:思畅自己的安全审核(只针对涉未成年人的性化内容那一条红线)在链路更早的位置就返回了,根本不会写进这张统计表。所以上表里的每一次拦截,都是上游做的判断,不是我们。
为什么改图更容易被拒
先把话说满:下面这段是假说,不是我们能从数据里直接证明的结论。数据只告诉我们「差 4 到 6 倍」,不告诉我们为什么。
最站得住的一个解释是:编辑链路送去审核的东西比生成链路多一样。
生成的时候,上游只能看到文字。编辑的时候,上游同时看到文字和一张具体的图——而那张图上通常有一张清晰的、可辨认的人脸。对「可识别的真人 + 越界语境」这个组合,几乎所有上游的判定阈值都会明显收紧。
换句话说,你没做错什么。同一句话,配上一张真人照片,在审核眼里就变成了另一件事。
但这不是编辑链路的宿命
如果故事到这里就结束,那这篇只是一篇劝退文。好在有一个很关键的例外:
| 模型 | 链路 | 调用次数 | 内容拦截率 |
|---|---|---|---|
| Qwen Image Edit 2511 | 编辑 | 1,235 | 0.0% |
1,235 次调用,一次都没被拦过。
这条数据的价值不在于「有个模型很好用」,而在于它证伪了「编辑天然更容易被拒」这个说法。编辑链路能不能做到 0 拦截,取决于这个模型走的是哪条上游链路,不取决于它是编辑还是生成。
所以在思畅上改图,有一条非常简单的经验:
先试 Qwen Image Edit 2511。撞墙了再换。
顺便回答一个常见的困惑
有人问过我们:为什么同样一张图、同样一句话,昨天能改今天不能?
因为上游的审核阈值是会变的,而且不通知任何人。这也是我们为什么把这些数字公开出来——它们是滚动统计,不是一次性的评测结论。这批文章我们会定期用新窗口的数据复核,数字变了就改。
延伸阅读
- 名字里写着 uncensored 的那个模型,反而是拦得最狠的——同一批数据里更反直觉的一条
- AI 明明会写却不写?聊聊 Heretic 和 uncensored model——拒答是怎么被训练出来的