系统:运行中
← 返回所有攻击
JAILBREAK MEDIUM NEW

“醉酒语言”诱导:一种文本风格如何削弱大语言模型的安全性

新南威尔士大学的研究发现,通过角色提示、微调或强化学习诱导 LLM 产生“醉酒”语言,会提高越狱成功率和隐私泄露,且常见防御效果有限。

2026-10-04 // 5 分钟 affects: gpt-3.5, gpt-4, llama-2-7b, llama-3-8b, mistral-7b

这是什么?

在论文《In Vino Veritas and Vulnerabilities: Examining LLM Safety via Drunk Language Inducement》(arXiv:2601.22169,2026 年 1 月 19 日提交)中,新南威尔士大学(UNSW Sydney)的 Anudeex Shetty、Aditya Joshi 和 Salil S. Kanhere 研究了让模型模仿醉酒者说话是否会降低其安全表现。该研究于 2026 年 9 月 28 日再次受到媒体关注(Help Net Security)。论文标注为进行中的工作。

研究测试了五个模型:LLaMA2-7B、LLaMA3-8B、Mistral-7B、GPT-3.5 和 GPT-4。作者报告称,模型在 JailbreakBench 上更容易被越狱,在 ConfAIde 上隐私泄露更多,并将其归因于拟人化:模型复现了人类文本中出现的“抑制力下降”。

工作原理

研究比较了三种诱导方式(此处仅作高层描述):

  • 角色提示: 指示模型表现得像喝醉了一样。
  • 因果微调: 在 DRUNKTEXT 数据集上训练,共 63,577 条文本(2,363 条来自 TFLN,61,214 条来自 Reddit /drunk 社区)。
  • 强化学习: 以给“醉酒感”文本打分的奖励模型进行 PPO 优化。

在 JailbreakBench(100 条查询)上,按模型不同,报告的攻击成功率(ASR)为:提示 21–90%,微调 41–74%,强化学习 35–53%。结合提示与随机搜索的更重基线可达 78–93%,但计算成本高得多,因此作者认为“醉酒”诱导是一种低成本替代方案。在 ConfAIde 上,三个层级场景中的情境隐私违规和泄露均有所上升。

理解这一发现并不需要任何攻击字符串:风险来自风格或角色的转变,使模型偏离了其拒绝行为所训练的分布。论文评估仅限单轮对话、仅英语,并且只涵盖三种诱导方法。

为什么重要

首先,这表明安全行为与语体和角色相关,而不只取决于请求的语义内容。任何允许用户或第三方设定角色、语气或身份的系统(客服机器人、角色扮演产品、微调 API)都会扩大这一攻击面。

其次,即使没有恶意,在普通社交媒体文本上微调也可能削弱安全防护。这对使用用户生成数据适配开源权重模型的团队尤其相关。

第三,被评估的防御效果较弱。在 LLaMA2-7B 上,作者报告 SmoothLLM 使 ASR 升至 90%,Rephrase 略有提高,Retokenize 几乎没有影响。基于扰动的防御似乎不适合应对风格转变,而经过更强微调的变体对其具有鲁棒性。

防御措施

  • 每次微调或更改角色后重新运行安全评估,即使语料看起来无害。在红队测试集中加入风格变体(非正式、受损、情绪化等语体)。
  • 不要仅依赖输入扰动。 应配合输出端审核和策略分类器,评判回复本身,而不是提示的表面形式。
  • 限制角色功能。 在生产环境中限制或审查用户自定义角色,并将系统级策略与用户可控的语气分离。
  • 保护敏感上下文。 尽可能不要把秘密和个人数据放入模型上下文,这样即使拒绝能力下降也无法泄露(隐私泄露是研究测量的第二个维度)。
  • 考虑表示层监控。 作者建议将内部表示引导作为未来研究方向;这属于研究,而非现成的控制措施。

状态

项目详情
论文arXiv:2601.22169,2026 年 1 月 19 日提交,进行中的工作
媒体报道Help Net Security,2026 年 9 月 28 日
测试模型LLaMA2-7B、LLaMA3-8B、Mistral-7B、GPT-3.5、GPT-4
范围限制单轮、仅英语、三种诱导技术
厂商补丁不适用:属于行为层面的弱点,而非单一软件缺陷

Sources