随笔·阅读约 1 分钟·
AI 不是比数学家更会思考,只是更'记得住'

AI 不是比数学家更会思考,只是更'记得住'

一篇论文级随笔:AI 解数学题的优势可能根本不在推理,而在于它拥有近乎无限的符号工作记忆——上下文窗口就是它随身携带的巨大笔记本。

原文来源:PifferPilfer (Substack) — AI 解决数学难题的关键优势可能不是更强的推理,而是几乎无限的符号工作记忆。

当 AI 系统解出一道困难的数学题时,最常见的解释是:它变聪明了。吸收了海量数学例题,强化学习教会了它更好的推理策略,甚至开始发展出某种"数学直觉"。

这些解释可能都有道理。但 Davide Piffer 在这篇文章里提出了一个更简单的可能性:AI 拥有比人脑大得多的有效工作记忆。或者说,它拥有一个巨大的外部符号工作区,承担了人类工作记忆的大部分职能——而这个差别在数学上尤其致命。

人类数学能力的天花板是记忆

工作记忆是我们短暂保持和操作信息的心智系统。解方程时,你要记住每个变量代表什么、已经做了哪些运算、当前目标是什么;做证明时,要同时跟踪假设、中间引理、例外情况和多个可能分支。

人类工作记忆的容量小得惊人。试试心算两个三位数的乘法:底层运算很简单,难的是在算的同时保住中间结果。把数字写下来,问题立刻变样——纸不会让你更聪明,它扩展了你的有效工作记忆。

数学家的草稿纸、符号记号、图表,本质上都是在做同一件事:把推理"外置"到物理介质上,绕开生物工作记忆的瓶颈。专家靠"组块化"(chunking)压缩信息——新手看到一长串符号,专家认出熟悉的结构,当成一个整体概念处理。但组块只是压缩,没有消除限制。

—— 广告 ——

工作记忆独立于 IQ 预测数学能力

这不是纯理论。心理学研究发现,工作记忆对数学表现的预测力独立于智商。

Alloway 和 Passolunghi(2011)发现工作记忆测量对儿童数学表现有独立贡献;Alloway 和 Alloway(2010)的六年追踪研究更惊人:五岁时的工作记忆表现能预测六年后(包含智商之后)的读写和算术成绩,而且工作记忆比智商测试更好地预测了学业结果。Blankenship 等人(2015)在统计控制智商和年龄后,工作记忆仍解释了数学流畅性和计算的独特变异。

这些发现不该被夸大——工作记忆和智力量重叠很大,统计控制无法完美分离。但窄结论依然成立:在智商相近的孩子中,保持、更新和操作信息的能力差异仍能预测数学表现差异。

如果人类数学表现部分被工作记忆瓶颈封顶,那么给机器一个巨大的符号工作区,比赛的性质就变了:机器看起来更"数学聪明",部分原因是它根本不受那个压制人类表现的认知限制。

上下文窗口就是一本巨型笔记本

现代语言模型能一次性处理海量 token:原始问题、定义、例子、中间计算、自己之前的推理,全都在上下文里。

但上下文窗口不等于人类工作记忆。更准确地说,它是一本巨型外部笔记本,加上一个不完美的检索系统

区别在于:人类有主动的内部记忆——可以默记一个数,在脑中变换它,无需写下来。标准语言模型维持这种私密、持续更新的心智状态的能力弱得多,它们最稳定的记忆形式是"已经生成的 token 序列"。如果模型写下 x=6,后来又写 x+3=9,这些语句留在上下文里,生成下一步时可以重新注意它们。

所以 AI 的推理常常是外化的:文本不只是完成思考的报告,文本本身就是思考发生机制的一部分。人类在草稿纸上也这么做,区别只在规模——一个普通人很难同时保持五个不熟悉的约束条件,AI 能显式保存几十上百个。

当然,长上下文不等于完美检索:模型会忽略相关信息、分心、丢失细节。广告的上下文长度不是可用的记忆。但潜在容量的差距是巨大的。

为什么数学特别适合 AI

上下文窗口的优势并非对所有推理都同等有用,它尤其适合数学——因为数学推理几乎可以完美地翻译成显式符号。

假设、定义、已知方程、当前目标、已证结论、已排除的情况、每步成立的条件,几乎每个相关元素都能写下来,而且写下来后保持稳定:证明开头定义 x 为整数,它就一直是整数;严格不等式不会因为情绪、语境或解释变化变成非严格不等式。数学符号天生为消歧设计。

这就是为什么数学几乎是"通过大型文本工作区运作的智能"的完美舞台。一个需要记住"n 是奇数、p 是素数、x≠0、某个分支已产生矛盾"的问题,人类可能理解基本策略,却在证明 x≠0 之前就除以 x——这不是智力问题,是簿记失误。AI 可以在每个阶段复述活动约束:我们正基于 n 为奇数、p 为素数、x≠0 的假设工作。上下文变成了推理状态的账本。

很多困难数学问题的深刻洞见在开头,但之后是大量不显眼的工作:展开表达式、检查情况、把条件穿过变换、确保最终结论与每个早期假设兼容。机器在这里不需要比人类更深的理解,它只是更擅长在完成长序列运算时保持问题的完整状态。

长推理链:100 步论证的全局结构

数学高度组合化:证明常常是 A→B→C→D 的链。只要每步有效且链被准确保存,结论就成立。大工作区让模型能构建更长的链而不丢线索——因为问题的难度不仅取决于每步的难度,还取决于要协调多少步。

一个人可能完全理解 100 步论证中的每个局部推理,却无法独立生成整个论证:问题超出了他维持全局结构的能力。AI 靠把几乎所有东西写下来来弥补。这也解释了为什么"更多思考时间"常能提升模型表现——更多计算让系统产生更多中间状态、检查更多分支、保存更多部分结论。看起来像更深的思考,有时只是在更大的笔记本里做更广的搜索。

反过来看:非正式推理不买账

把同样的分析用到社交问题上就失效了:"Maria 为什么突然不回复我?"更大的上下文窗口可以让 AI 检查多年的通信记录、识别语气和用词变化——但决定性信息可能根本缺失。Maria 也许在生气、在忙、生病了、丢了手机、在回避一个无关问题。再多的记忆也检索不到从未被观察到的事实。

非正式推理还依赖含义不稳定的概念:"公平""成功""负责任""有害""聪明"不像数学变量那样精确,其意义取决于文化、目标和语境。模型能记住讨论中的每个句子,却仍误解参与者想表达什么。政治分析、历史诠释、商业策略、心理判断都是如此——核心问题往往不是工作记忆容量,而是在证据不完整、模糊时识别正确的因果模型。

一个更冷静的看待 AI 的方式

这篇文章真正锋利的地方在于它的归因:当 AI 解出数学难题,我们习惯归功于"推理能力提升",但它可能只是解除了人类推理最根本的生物限制之一

这不算贬低 AI——能在 10 秒内读完并保持 100 个中间步骤,本身就是革命性的能力。但它改变了我们理解 AI 数学表现的方式:AI 不是"更聪明的爱因斯坦",更像"机器放大的冯·诺依曼"——巨大的速度、广度和符号记忆。数学成绩的含金量需要重新审视:如果大部分优势来自不遗忘而非更会想,那么"AI 会做数学"与"AI 会思考"之间,还隔着一段需要诚实面对的距离。

对正在用 AI 做研究的开发者来说,这个视角也实用:把 AI 当"不会遗忘的笔记本"用(让它在长任务中显式记录状态、复述约束),往往比指望它灵光一现更可靠。

分享到
微博Twitter

© 2026 四月

原文链接:https://www.aprilzz.com/ramble/ai-outremembering-mathematicians