三个同门的图片编辑模型,名字带 uncensored 的那个内容拦截率 20.8%,不带的两个各跑了上千次、一次都没拦过。这不是巧合——它说明「无审查」这个标签描述的根本不是拦你的那一层。
拒答不是能力问题,而是被训练出来的行为。从 Heretic 的 abliteration 原理,到本地模型怎么跑、有哪些现成选择,一篇讲清 uncensored model 到底解决了什么。