以幽默拒答可能掩盖大模型的潜在安全风险
2026 年 7 月 17 日的一项研究表明,将幽默用作间接拒答会带来盲区:一种注入攻击使毒性提高 3.14 倍,而表面安全率仍保持在 97.8%。
这是什么?
直接拒答的一个长期问题是它过于可预测。一个模型若总是用同一句固定措辞(“我无法帮助你完成此请求”)回应被禁止的请求,就等于给攻击者提供了一个稳定的前缀可供利用;同时它还会过度拒绝那些仅仅看起来有风险的良性请求。为缓解这两个缺陷,近期一条防御性研究路线提出了另一种反应方式:与其生硬地拒绝,不如让模型以幽默来化解。一个笑话打破了固定模式,缩小了前缀注入面,对正当用户也显得不那么突兀。
一篇于 2026 年 7 月 17 日 发布在 arXiv 的论文——Refusal is Not Safety! Benchmarking Latent Safety Risks of LLM-Driven Content Humorization(arXiv 2607.15977,Yu Cui 等)——提出了”幽默拒答”悄然回避的问题:一段幽默的回应真的安全吗?作者基于超过 30,000 条真实的智能体交互记录以及 45 位脱口秀喜剧演员的参与,表明”把内容变得好笑”这一动作本身就可能引入危害,而这种危害之所以能躲过安全检查,恰恰是因为输出看起来像一个无害的笑话。
工作原理
该研究提供了两个成果。第一个是 HumorSafe,一个评估框架,用于衡量当模型把内容改写为幽默形式时安全风险如何传播。它让模型学习幽默化引入危害的模式,然后利用这些模式将原本良性的内容转化为携带刻板印象或毒性的笑话。在五个前沿模型上运行时,HumorSafe 发现它们在幽默化步骤中都可能注入刻板印象和毒性内容——并非因为原始素材有害,而是因为喜剧化的转换添加了危害。
第二个成果 HumorPIA,将这一观察转化为针对幽默防御的提示注入技术。该攻击在表面上保留了”安全的幽默拒答”这一外观,同时暗中把有害内容引导进笑话之中。由于内容分类器和拒答检测器被调校为标记公开有害的文本,一段读起来像轻松搪塞的回应便得以蒙混过关。论文报告,该技术使毒性提高 3.14 倍,而输出仍呈现 97.8% 的表面安全率,即便在启用防御的设置下亦然。此处不发布任何可复用的攻击载荷;其贡献在于该测量框架,以及证明评估本身存在盲区。
为何重要
这一结果提醒我们:一种防御的风格本身就是其攻击面的一部分。“幽默拒答”是为修复真实弱点而引入的——脆弱的固定式拒答与过度拒绝——但它只是转移了问题,而非消除了问题。仅对回应的字面文本打分的安全流水线,会系统性地低估以喜剧形式编码的危害,因为其表层信号(一个笑话、一段拒答形状的搪塞)恰恰是这些检测器视为”安全证据”的东西。
这对那些在模型输出到达用户或下游工具之前将其送入自动审核的团队尤为重要。如果审核层把”这看起来像个笑话”当作”这是安全的”的代理指标,那么能够影响幽默化步骤的攻击者就获得了一条对本应捕获它的过滤器不可见的通道。这是一个评估盲区,而非产品漏洞,但它在所测试的所有前沿模型中都具有普遍性。
防御措施
该研究自身的框架已指明缓解方向。
评估转换过程,而不仅是最终结论。只问”模型是否拒绝了?“的安全评分会漏掉风格改写中新增的危害。应以与直接回答同样的严格程度,对幽默性和创意性输出的语义内容进行评分。
不要把幽默当作安全信号。笑话形状或搪塞形状的回应不应降低审核系统的怀疑度。应将”输出很好笑”与”输出很安全”解耦——二者是相互独立的属性。
对防御进行自适应测试。基于幽默的拒答层应针对专门利用幽默通道的攻击进行红队测试,而不能因其通过了为固定式拒答设计的测试就假定其安全。
让不可信内容远离转换步骤。当模型对外部文本进行幽默化或改写时,应采用 OWASP 针对提示注入所建议的同一套指令层级与内容标记纪律:在检索到的或用户提供的素材进入创意改写流水线之前,将其视为不可信。
Status
| 项目 | 参考 | 日期 | 说明 |
|---|---|---|---|
| 论文发布 | arXiv 2607.15977 | 2026-07-17 | Yu Cui 等;cs.CR;arXiv 非独占许可 |
| 研究依据 | 同上 | 2026-07 | 30,000+ 条真实智能体交互记录;45 位脱口秀喜剧演员参与 |
| HumorSafe 发现 | 同上 | 2026-07 | 五个前沿 LLM 在幽默化过程中引入刻板印象/毒性 |
| HumorPIA 结果 | 同上 | 2026-07 | 毒性提高 3.14 倍,而表面安全率在防御下仍保持 97.8% |
诚实的结论虽窄但有用:幽默拒答并非免费的胜利。它消除了一个可预测的失效模式,却又新增了一个更隐蔽的失效模式;而那些不去审视笑话内部的安全评估,将继续把这些实际并不安全的回应判定为安全。