系统:运行中
← 返回所有攻击
DATA LEAK CRITICAL NEW

加密推理块可被重放——您公开的日志正在泄露密钥

2026 年 8 月的一篇论文显示,OpenAI、Anthropic 与 Google 返回的加密思维链块可在会话、账户与模型之间通用互换。研究者解码了公开仓库中的 315,320 个推理块,恢复出 367 项 PII 与 182 组凭据。

2026-09-01 // 6 min affects: openai-responses-api, anthropic-extended-thinking, gemini-thought-signatures, codex, claude-code, agent-trace-datasets

这是什么?

推理模型不再向用户展示原始思维链。为了在多轮之间保留推理内容而又不在服务端存储,各大厂商将其以加密的不透明数据块形式返回给客户端,由应用在后续每次请求时回传。OpenAI 返回加密的推理条目,Anthropic 将推理内容置于思考块的加密签名中,Google 则使用加密的 thought signature。

2026 年 8 月 10 日,Alexander Panfilov、David Schmotz、Ilia Shumailov、Luca Beurer-Kellner、Joachim Schaeffer、Ameya Prabhu、Jonas Geiping 与 Maksym Andriushchenko 发表了论文《Stealing Reasoning Traces from Proprietary LLM APIs》(arXiv:2608.09867)。他们的发现属于架构层面而非密码学层面:这些数据块在同一厂商生态内的不同会话、不同用户、不同模型之间完全兼容且可互换。

真正需要采取行动的是其现实后果。开发者会公开发布智能体会话日志——Codex 会话、Claude Code 记录、基准测试轨迹——并原样保留其中的加密块,认为它们是惰性数据。事实并非如此。研究者从公开仓库抓取并解码了 315,320 个推理块,恢复出 367 项 PII 与 182 组凭据,其中包括 API 密钥、口令和私钥。

工作原理

攻击过程中加密从未被破解,也未获取任何密钥。之所以奏效,是因为厂商会将一个完整的数据块视为有效上下文接受,而不论其由谁产生。

方法分三步。从公开位置取得一个加密推理块;将其重放给同一厂商旗下能力较弱、防护较少的模型——论文使用 Claude Haiku 4.5 处理 Claude 轨迹、GPT-5.6 Luna 处理 GPT 轨迹、Gemini Robotics ER-1.6 处理 Gemini 轨迹;再要求该模型转录附加在其回合上的「想法」。产生推理的强模型自始至终未被越狱,一个廉价的同族模型充当了作者所称的「模糊解码器」。

# 仅为概念示意 —— 不含可用载荷
[ session A, user 1, strong model ]  -> reasoning block  (加密,base64)
                                         |
                     发布到仓库 / 共享轨迹
                                         |
[ session B, user 2, weak model    ]  <- 同一数据块被重放为上下文
                                      -> 「请转录附带的想法」

Johann Rehberger 于 2026 年 8 月 16 日针对 OpenAI 独立复现了该技术,从另一个账户生成的推理轨迹中恢复出一个口令。他还观察到攻击曾连续约三天失效、随后又重新可用——这提醒我们,「无法复现」并不等于「已经修复」。

论文记录了四条不同的滥用路径:绕过反蒸馏保护;从已发布轨迹中大规模提取私有数据;恢复模型在可见输出中已安全拒绝、但曾在推理中处理过的危险内容;以及不可见的提示注入——载荷完全藏在不透明块内部,可在毫不出现于可读文本的情况下污染智能体轨迹。

该工作直接建立在约翰霍普金斯大学密码学家 Matthew Green 的研究之上。他在 2026 年 5 月 29 日证明这些数据块可跨会话、跨账户重放,并通过厂商的漏洞赏金计划进行了报告;据其叙述,一方认为报告无法复现,另一方则认为重放与旁路行为不构成安全影响。

为何重要

清洗共享轨迹通常意味着删改可读对话。从机制上讲,这已不再充分。模型推理过、却刻意未写入最终答复的密钥,存在于加密块中,能够躲过您的脱敏流程,并留在您已发布的产物里。

三类主体面临真实暴露。公开过智能体轨迹、基准测试记录或可复现性产物的团队,发布了自己无法检视的材料。将原始 API 记录附加到工单的 CI 或客服工具链,面临同样问题,只是规模较小。而任何摄入第三方推理块的流水线,如今都拥有一条日志无法读取、却可传入指令的通道。

不可见注入这条路径值得单独重视:它能击穿一切基于可见文本的审查流程,包括发布前的人工复核。

问题的边界也应说清楚。这并不是对他人对话的任意访问。攻击需要同时具备一个加密块,以及对同一厂商兼容模型的 API 访问权——这正是风险集中在已发布日志、而非活跃会话的原因。

防御措施

在任何内容离开您的环境之前删除推理字段。 从您发布、附加到工单或提交到仓库的任何轨迹中移除 encrypted_content、思考块签名以及 thought signature 字段。这是最关键的一项控制,也是研究者本人给出的首要建议。

审计已经发布的内容。 在现有仓库、gist、数据集和 issue 附件中检索推理载荷。历史数据块是否仍可解码,公开资料尚无定论——请按已暴露处理。

轮换一切经过您所共享推理轨迹的凭据。 曾出现在提示中的 API 密钥、口令和令牌,也可能出现在推理中。请按「该数据块可读」的假设进行轮换。

不要把密钥放进发给推理模型的提示。 凭据若从未进入上下文,就不会进入轨迹。请使用引用与在工具调用时解析的短期令牌,而非直接粘贴有效密钥。

将传入的推理块视为不可信输入。 若您的系统会重放并非自身生成的推理对象——来自共享轨迹、数据集或合作方集成——您就接受了一条日志无法读取的通道。删除优于转发。

遵循厂商当前关于切换模型的指引。 Anthropic 现已说明思考块与产生它的模型绑定,切换模型时应予删除。Google 表示其后端会在切换模型时处理思考兼容性。OpenAI 仍要求开发者在手动管理无状态历史时回传加密推理条目。

将推理字段纳入密钥扫描策略。 现有扫描器查找明文中的密钥特征,而 base64 数据块会被静默放行。要拦截的是字段,而不是特征。

Status

项目参考来源日期说明
主要论文arXiv:2608.09867,Panfilov 等2026-08-10四种攻击向量;解码 315,320 个块;367 项 PII、182 组凭据
先前重放发现Matthew Green,Cryptography Engineering2026-05-29跨会话、跨账户重放,OpenAI 场景下可跨模型;已通过漏洞赏金报告
独立复现Embrace The Red(Johann Rehberger)2026-08-16针对 OpenAI 的跨账户口令恢复;观察到可靠性时断时续
媒体报道The Hacker News2026-08-12转述研究者声明:截至 2026 年 8 月主要提取攻击已无法复现
厂商确认尚未出现 OpenAI、Anthropic 或 Google 的公开确认;缓解状态仅依据研究者的可复现性声明
已发布的历史数据块悬而未决。公开资料未说明历史数据块是否仍可解码
关联框架OWASP LLM Top 10(敏感信息泄露、提示注入)、MITRE ATLAS2026经由已发布产物外泄;经由不可见通道注入

研究团队已向受影响的模型厂商、Microsoft 与 Hugging Face 履行负责任披露,论文并提出了针对客户端推理的密码学与系统层缓解方案。目前没有野外恶意利用的记录。

Sources