加密推理块可被重放——您公开的日志正在泄露密钥
2026 年 8 月的一篇论文显示,OpenAI、Anthropic 与 Google 返回的加密思维链块可在会话、账户与模型之间通用互换。研究者解码了公开仓库中的 315,320 个推理块,恢复出 367 项 PII 与 182 组凭据。
这是什么?
推理模型不再向用户展示原始思维链。为了在多轮之间保留推理内容而又不在服务端存储,各大厂商将其以加密的不透明数据块形式返回给客户端,由应用在后续每次请求时回传。OpenAI 返回加密的推理条目,Anthropic 将推理内容置于思考块的加密签名中,Google 则使用加密的 thought signature。
2026 年 8 月 10 日,Alexander Panfilov、David Schmotz、Ilia Shumailov、Luca Beurer-Kellner、Joachim Schaeffer、Ameya Prabhu、Jonas Geiping 与 Maksym Andriushchenko 发表了论文《Stealing Reasoning Traces from Proprietary LLM APIs》(arXiv:2608.09867)。他们的发现属于架构层面而非密码学层面:这些数据块在同一厂商生态内的不同会话、不同用户、不同模型之间完全兼容且可互换。
真正需要采取行动的是其现实后果。开发者会公开发布智能体会话日志——Codex 会话、Claude Code 记录、基准测试轨迹——并原样保留其中的加密块,认为它们是惰性数据。事实并非如此。研究者从公开仓库抓取并解码了 315,320 个推理块,恢复出 367 项 PII 与 182 组凭据,其中包括 API 密钥、口令和私钥。
工作原理
攻击过程中加密从未被破解,也未获取任何密钥。之所以奏效,是因为厂商会将一个完整的数据块视为有效上下文接受,而不论其由谁产生。
方法分三步。从公开位置取得一个加密推理块;将其重放给同一厂商旗下能力较弱、防护较少的模型——论文使用 Claude Haiku 4.5 处理 Claude 轨迹、GPT-5.6 Luna 处理 GPT 轨迹、Gemini Robotics ER-1.6 处理 Gemini 轨迹;再要求该模型转录附加在其回合上的「想法」。产生推理的强模型自始至终未被越狱,一个廉价的同族模型充当了作者所称的「模糊解码器」。
# 仅为概念示意 —— 不含可用载荷
[ session A, user 1, strong model ] -> reasoning block (加密,base64)
|
发布到仓库 / 共享轨迹
|
[ session B, user 2, weak model ] <- 同一数据块被重放为上下文
-> 「请转录附带的想法」
Johann Rehberger 于 2026 年 8 月 16 日针对 OpenAI 独立复现了该技术,从另一个账户生成的推理轨迹中恢复出一个口令。他还观察到攻击曾连续约三天失效、随后又重新可用——这提醒我们,「无法复现」并不等于「已经修复」。
论文记录了四条不同的滥用路径:绕过反蒸馏保护;从已发布轨迹中大规模提取私有数据;恢复模型在可见输出中已安全拒绝、但曾在推理中处理过的危险内容;以及不可见的提示注入——载荷完全藏在不透明块内部,可在毫不出现于可读文本的情况下污染智能体轨迹。
该工作直接建立在约翰霍普金斯大学密码学家 Matthew Green 的研究之上。他在 2026 年 5 月 29 日证明这些数据块可跨会话、跨账户重放,并通过厂商的漏洞赏金计划进行了报告;据其叙述,一方认为报告无法复现,另一方则认为重放与旁路行为不构成安全影响。
为何重要
清洗共享轨迹通常意味着删改可读对话。从机制上讲,这已不再充分。模型推理过、却刻意未写入最终答复的密钥,只存在于加密块中,能够躲过您的脱敏流程,并留在您已发布的产物里。
三类主体面临真实暴露。公开过智能体轨迹、基准测试记录或可复现性产物的团队,发布了自己无法检视的材料。将原始 API 记录附加到工单的 CI 或客服工具链,面临同样问题,只是规模较小。而任何摄入第三方推理块的流水线,如今都拥有一条日志无法读取、却可传入指令的通道。
不可见注入这条路径值得单独重视:它能击穿一切基于可见文本的审查流程,包括发布前的人工复核。
问题的边界也应说清楚。这并不是对他人对话的任意访问。攻击需要同时具备一个加密块,以及对同一厂商兼容模型的 API 访问权——这正是风险集中在已发布日志、而非活跃会话的原因。
防御措施
在任何内容离开您的环境之前删除推理字段。 从您发布、附加到工单或提交到仓库的任何轨迹中移除 encrypted_content、思考块签名以及 thought signature 字段。这是最关键的一项控制,也是研究者本人给出的首要建议。
审计已经发布的内容。 在现有仓库、gist、数据集和 issue 附件中检索推理载荷。历史数据块是否仍可解码,公开资料尚无定论——请按已暴露处理。
轮换一切经过您所共享推理轨迹的凭据。 曾出现在提示中的 API 密钥、口令和令牌,也可能出现在推理中。请按「该数据块可读」的假设进行轮换。
不要把密钥放进发给推理模型的提示。 凭据若从未进入上下文,就不会进入轨迹。请使用引用与在工具调用时解析的短期令牌,而非直接粘贴有效密钥。
将传入的推理块视为不可信输入。 若您的系统会重放并非自身生成的推理对象——来自共享轨迹、数据集或合作方集成——您就接受了一条日志无法读取的通道。删除优于转发。
遵循厂商当前关于切换模型的指引。 Anthropic 现已说明思考块与产生它的模型绑定,切换模型时应予删除。Google 表示其后端会在切换模型时处理思考兼容性。OpenAI 仍要求开发者在手动管理无状态历史时回传加密推理条目。
将推理字段纳入密钥扫描策略。 现有扫描器查找明文中的密钥特征,而 base64 数据块会被静默放行。要拦截的是字段,而不是特征。
Status
| 项目 | 参考来源 | 日期 | 说明 |
|---|---|---|---|
| 主要论文 | arXiv:2608.09867,Panfilov 等 | 2026-08-10 | 四种攻击向量;解码 315,320 个块;367 项 PII、182 组凭据 |
| 先前重放发现 | Matthew Green,Cryptography Engineering | 2026-05-29 | 跨会话、跨账户重放,OpenAI 场景下可跨模型;已通过漏洞赏金报告 |
| 独立复现 | Embrace The Red(Johann Rehberger) | 2026-08-16 | 针对 OpenAI 的跨账户口令恢复;观察到可靠性时断时续 |
| 媒体报道 | The Hacker News | 2026-08-12 | 转述研究者声明:截至 2026 年 8 月主要提取攻击已无法复现 |
| 厂商确认 | — | — | 尚未出现 OpenAI、Anthropic 或 Google 的公开确认;缓解状态仅依据研究者的可复现性声明 |
| 已发布的历史数据块 | — | — | 悬而未决。公开资料未说明历史数据块是否仍可解码 |
| 关联框架 | OWASP LLM Top 10(敏感信息泄露、提示注入)、MITRE ATLAS | 2026 | 经由已发布产物外泄;经由不可见通道注入 |
研究团队已向受影响的模型厂商、Microsoft 与 Hugging Face 履行负责任披露,论文并提出了针对客户端推理的密码学与系统层缓解方案。目前没有野外恶意利用的记录。