
Stolen Thoughts:研究人员成功解码闭源 LLM 的加密推理链
来自多个研究机构的安全团队开发出解码管线,能从 OpenAI、Anthropic、Google 的 API 响应中还原被加密的推理块,并在公开的 agent 轨迹中发现了 700 多个真实密钥与隐私信息。
原文来源:Stolen Thoughts — 闭源 LLM 的"隐藏思考"并不安全:研究团队解码了加密推理块,并从公开 agent 轨迹中挖出 700 多个真实密钥和隐私信息。
主流闭源大模型在回答复杂问题时,内部会先进行一段"隐藏思考"——这段推理过程不会完整展示给用户,部分模型(OpenAI、Anthropic、Google 的推理模型)甚至会用加密块的形式在 API 响应中返回。官方说法是保护模型内部推理不被复制,顺带避免把原始思考过程暴露给用户。但一项新研究证明:这套加密形同虚设。
由多家机构的安全研究人员组成的团队(包括 Maksym Andriushchenko、Jonas Geiping、Ilia Shumailov 等对抗机器学习领域的知名研究者)发布了一篇名为《Stealing Reasoning Traces from Proprietary LLM APIs》的论文,展示了一条完整的解码管线,能把 API 返回的加密推理块还原成明文。更严重的是,他们用这套管线扫描了 GitHub 和 Hugging Face 上公开的 6708 条 agent 轨迹,重建出 31 万个推理块,其中藏着 704 个真实隐私工件——包括 62 个 API 密钥、33 个密码、24 个访问令牌和 30 个个人邮箱。
推理链是怎么"偷"出来的
先解释一下背景。现在的推理模型(比如 OpenAI 的 o 系列、Anthropic 的 Opus 系列、Google 的 Gemini 系列)在生成最终答案前会先产生一段内部推理。API 层面,这段推理以加密块(encrypted reasoning block)的形式随响应返回,客户端拿到的是密文,只能看到 API 另行提供的"推理摘要"(reasoning summary)。
研究团队的核心思路并不复杂:既然模型生成推理链的过程发生在服务端,而加密块本身是模型输出的一部分,那么可以通过构造特定输入,让模型在推理过程中"泄露"自己的思考内容。具体来说,他们利用了模型输出分布的可控性——让模型以"转述/摘要"等看似无害的任务形式,把隐藏在加密块中的推理内容重新输出成明文。
论文中用 120 道 Codeforces 编程题做了验证:把解码出的推理文本作为输入重新喂给模型,其 token 数与 API 报告的隐藏思考 token 数高度吻合(所有模型都紧贴 y=x 对角线,直到 12000 token 的生成上限)。这说明解码结果与真实推理链高度一致,不是模型自己编的。
—— 广告 ——
公开轨迹里的真实事故
最触目惊心的部分是真实数据。研究者从 GitHub 和 Hugging Face 收集了 6708 条公开的 agent 轨迹——这些是 Claude、GPT、Gemini 等模型在真实任务中留下的操作记录,很多是用户主动发布的技术博客、演示视频配套资料或开源项目文档。由于加密块是模型输出的一部分,这些轨迹里仍然带着完整的密文。
用解码管线处理后,他们从这些轨迹中重建出 315320 个推理块,其中属于真实用户会话(排除 benchmark 和人工构造样本)的部分里,找到了 704 个隐私工件:62 个 API 密钥、33 个密码、24 个访问令牌、30 个个人邮箱,外加姓名、邮政地址、内部 URL 等各类技术标识。
最值得警惕的细节是:这 704 个工件中有 64 个只出现在推理块里,在可见会话中完全找不到。也就是说,即使你检查了 agent 的全部可见输出,也发现不了这些密钥已经泄露。举个例子:论文展示了一个 GPT-5.2 Codex 执行"清理仓库中的 API 密钥"任务的轨迹。从可见输出看,它尽职尽责地搜索并替换了各类密钥;但解码后的推理块显示,它在思考过程中完整"复述"了这些密钥——AWS access key、GitHub token、Hugging Face token 一字不差地出现在推理文本里。清理任务本身成了二次泄露。
攻击面不止密钥
除了密钥泄露,论文还展示了两个更隐蔽的问题。
一是"恶意推理链"攻击(misuse uplift)。攻击者可以让模型在隐藏推理中处理有害内容,同时保持可见回答完全正常。由于推理块被加密,服务端的内容审核看不到思考过程,而攻击者事后可以解码出这些有害推理。论文演示了一个案例:模型在推理中详细分析了车辆盗窃的漏洞利用方式,可见回答却是无害的安全建议。这类攻击让"隐藏思考"成为绕过安全对齐的通道。
二是推理摘要的不忠实。API 返回的"推理摘要"并不总是反映真实推理过程。论文发现,Opus 4.8 在解 AIME 数学题时,有时会先在推理里直接写出答案、再补推导过程,而 API 生成的摘要会把这段过程整理得像一条干净的推导链。这意味着用户基于摘要来判断模型"想得对不对"是不可靠的——摘要可以隐藏模型真实的推理路径,包括它是否真的用了正确的方法。
为什么这件事值得关注
对普通用户来说,这篇论文的直接含义是:不要假设"隐藏思考"能保护任何敏感信息。如果你在用 agent 处理包含密钥、密码、个人数据的任务,这些内容一旦进入模型推理链,就存在被解码还原的可能——哪怕 API 声称加密。对团队而言,发布 agent 轨迹(技术博客、演示、课程)等于公开了完整的加密推理块,等于把钥匙递给了能解码的人。
论文也把矛头指向 API 提供商:加密推理块给用户一种"思考过程受保护"的安全错觉,但实际上解码门槛并不高。研究团队呼吁,提供推理模型的厂商要么重新设计推理链的返回机制,要么至少在文档中明确告知用户加密的实际保护力度。至少目前,把敏感信息放进 prompt 让模型"想一想",比很多人以为的要危险得多。
这项研究也间接回答了 HN 上长期争论的一个问题:推理链到底算不算模型输出的隐私?从技术角度,只要它随 API 返回,就只是"加了壳的输出",而壳是可以拆的。对 AI 安全领域来说,这篇论文的意义在于把"隐藏推理"从产品特性重新定义成了攻击面——而且是一个已经出现真实泄露案例的攻击面。
© 2026 四月
原文链接:https://www.aprilzz.com/ai/stolen-thoughts-reasoning-traces
相关文章
Qwen3.8-Max 发布:2.4T 参数,Max 级模型首次开源,10 天自主编程跑出 265 个提交
通义千问发布史上最强 Qwen3.8-Max:2.4T 参数(95B 激活),首次开源 Max 级模型权重,三个自主实验证明它能独立完成十天级编程、论文复现与竞赛夺冠。
Flint:让 AI Agent 稳定画出好图表的可视化中间语言
微软研究院开源的 Flint 用语义类型 + 编译器自动推导,把 AI 生成图表从'碰运气'变成'一次成功'——50 种图表类型、5 个渲染后端、一个统一接口
DeepSeek-V4-Flash 正式版发布:Agent 能力反超自家 Pro 预览版,输出只要 2 元/百万 token
2026年7月31日,DeepSeek-V4-Flash 正式版 API 上线公测:9 项 Agent 基准全面反超 V4-Pro-Preview,原生支持 Responses API 并适配 Codex,输出价格仅 2 元/百万 token。