名字里写着 uncensored 的那个模型,反而是拦得最狠的
如果你在挑一个「无审查」的 AI 绘画模型,最自然的做法是看名字里有没有 uncensored。
我们手上有一组数据,说明这个做法为什么会失灵。
三个同门师兄弟
近 60 天,思畅上跑了三个同属 Qwen 家族的图片编辑模型。同一个家族、同一类任务,唯一的区别是走的链路不同:
| 模型 | 调用次数 | 内容拦截次数 | 内容拦截率 |
|---|---|---|---|
| Qwen Edit Uncensored | 2,069 | 431 | 20.8% |
| Qwen Image Edit 2511 | 1,235 | 0 | 0.0% |
| Qwen Image Edit Plus | 428 | 0 | 0.0% |
名字里写着 uncensored 的那个,五次里拦你一次。
不带这个词的两个,加起来 1,663 次调用,一次都没拦过。
这不是小样本的巧合。三行的样本量都在四百次以上,差距是 20.8% 对 0。
「无审查」描述的不是拦你的那一层
要理解这个反差,得先接受一件事:你从提交到拿图,中间要过两道关,而它们是完全独立的两拨人在把守。
第一道关在模型内部。 一个模型愿不愿意画某类东西,是训练阶段决定的。大厂在最后一步「安全对齐」里教会模型在边界模糊时倾向拒绝——这就是为什么很多模型明明有能力,却会给你一段「我理解你在做创作,但是……」。而 uncensored、abliterated 这类标签,说的正是有人把这一步的刹车拆掉了。这个过程怎么运作,我们之前专门写过一篇:AI 明明会写却不写?聊聊 Heretic 和 uncensored model。
第二道关在模型外面。 你的请求要经过一个上游服务商,图从模型出来之后还要经过它的输出侧安全检查。这一层跟模型权重毫无关系——模型愿不愿意画是一回事,链路让不让这张图出去是另一回事。
于是就有了那张表里的荒谬场景:
一个刹车被拆掉的模型,装在一辆刹车更灵的车上。
uncensored 这个词是真的,它准确描述了第一道关。它只是没告诉你第二道关在哪儿、有多严——而绝大多数时候,拦你的是第二道关。
所以选模型该看什么
看实际拦截率,不看名字。而实际拦截率没法从模型卡、参数量、或者任何公开文档里读出来——它只能靠真的把请求打过去,一次一次数。
这也是我们决定把这些数字公开的原因。一个平台如果同时接了很多条上游链路,它是唯一有条件数这个数的角色:单个用户撞上几次拒绝,分不清是自己提示词的问题还是链路的问题;而我们手上有几万次调用。
顺带交代一个结果:上表里那个 20.8% 的模型,我们已经把它下线了。 下线的理由就是这张表——它的名字承诺了一件它交付不了的事,留在目录里只会让人按名字选,然后在五分之一的时候撞墙。
现在思畅的图片编辑目录里,Qwen Image Edit 2511 是默认推荐的那一个。它的名字里没有 uncensored。
一句话总结
uncensored是一个关于训练的形容词,不是一个关于结果的承诺。
挑模型的时候,把它当成一条线索,别当成结论。
延伸阅读
- 「改图」比「出图」更容易被拒:同一个模型,拦截率差 4 到 6 倍——同一批数据里的另一条
- AI 明明会写却不写?聊聊 Heretic 和 uncensored model——第一道关是怎么被拆掉的