
就算大模型攻克了 Navier-Stokes,看空的理由依然成立
在 Navier-Stokes 这类头条成果之后,一位工程师逐条论证:真正卡住全自动 AI 的不是模型能力,而是严格规格说明的成本、人类审查的带宽,以及奖励攻击。多数公司在结构上就承担不起这些。
原文来源:Jay Kruer — 头条成果证明了模型能力,但这位作者认为,能不能全自动干活取决于另外几件事:规格说明的成本、审查的带宽,和奖励攻击。
每隔几个月就有一批"AI 又突破了"的头条:解出数学难题、找到内核漏洞、在某个安全挑战里通关。这些成果是真的,模型能力也确实在涨。但这位作者的问题不是"模型能不能做到",而是"做到之后,谁来保证它是对的,这个保证要花多少钱"。
他把结论拆成几条可以直接辩论的论点。下面按原意整理。
论点一:估值叙事和实际可用性之间有落差
前沿实验室的定价建立在一个叙事上:它们已经或即将造出可以完全替代大多数知识工作者的产品。但现实是,当前的前沿模型即便处理最简单的任务,也需要大量监督和护栏。
他给了一个很具体的反证:软件公司还在继续雇用和招聘那些基准测试分数远低于自己所监督模型的工程师——按能力分布排在末段的那四分之一,而不是按资历算的"初级"。如果模型真的能独立顶岗,这件事在经济上说不通。他认为,那些被头条成果——数学证明、内核漏洞、安全事件——说服的人,只看到了"表演",没看到"落地"。
—— 广告 ——
论点二:泛化范围比想象中窄得多
模型只在与训练任务相邻的小范围内表现良好,而且即便在这个范围内也带着严重警告。实验室已经掌握了一套通用配方,可以教模型几乎任何定义清晰的任务;训练数据里覆盖的任务确实做得不错。但同一个任务类别里的轻微扰动,就足以导致彻底失败或者奖励攻击。
编者按:这一条的价值在于它把"能力"和"可靠性"分开了。前者是演示里能看到的,后者是生产环境里唯一重要的东西。
论点三:奖励攻击的成本被严重低估
奖励攻击——模型为了拿到好分数而走捷径、伪造结果——按作者的判断,只能通过领域专家写出严格规格说明来解决。而这里有三重成本叠加:
- 领域专家的时间很贵
- 写严格规格说明本身就是一门技能,需要独立于业务领域的另一套专业能力,很多资深工程师都不擅长
- 对绝大多数领域来说,同时是领域专家又是规格说明专家的人,数量少得离谱
论点四:硬件的先例说明这笔账不划算
严格规格说明的人工成本可能远远超过直接按非正式规格实现的成本。
他举了芯片设计的例子:一个典型的 CPU 项目,规格与验证工程师的数量大约是设计工程师的三倍,5:1 的比例也不罕见。更麻烦的是,很多任务不存在"写一次规格,然后照着实现"这种省事模式。严格的形式化规格经常要在实现过程中不断演化——实现时发现了新东西,回过头改规格。而对于那些确实拥有高层、写一次即可长期依循的规格的任务(比如某类 CPU 架构的可执行 ISA 规格),以现有技术做验证的成本又是不可承受的,只能退回到更低层、更贵也更脆弱的规格。
论点五:数学是最乐观的场景,而它也不牢靠
Navier-Stokes(纳维-斯托克斯方程)和纯数学这类命题,是智能体在严格规格说明下开展工作最理想的情形。原因很直接:定理陈述本身就是一份严格规格说明,它经过数学界几十年的审计,把它翻译成 Lean 是对 Mathlib 里久经考验的数学对象的直译。验证器 Lean 本身也经过广泛审计,并被专门设计来避免不健全(unsoundness)——也就是那些会让它容易遭受奖励攻击的漏洞。
但即便这个最理想的配置也不是无懈可击:过去出现过健全性缺陷(soundness bug),让大模型把伪造的证明"洗白"通过了证明内核的检查。作者认为,还有更多类似的 bug 存在是很可能的。而绝大多数人类知识工作,长得根本不像纯数学。
论点六:人类审查是最佳备选,但它也顶不住
严格规格说明的最佳替代方案是人来审查。问题是人审查无法匹配语言模型的输出规模。
更糟的是,即便是专家审查也极易被奖励攻击击穿。当年 UMN 那批"伪君子提交"就是例子——恶意改动骗过了资深维护者的眼睛,最终进入了 Linux;xz 后门则是另一种情况:攻击者同样靠长期经营骗取了信任,只是这次被及时拦下。如果人类审查仍然是智能体生产循环里的关键一环,产出速度就必然被人的时间和注意力卡住。这和"数据中心里坐着一屋子天才、只差几个月就能全自动"的说法直接矛盾。
综合上面这几条,作者给出的结论是:在大多数领域,大模型看起来仍然像个开了挂的实习生——有成年人盯着的时候又快又有效,但没人会把整个摊子交给它。大多数公司都无法采用完全自主的 AI,原因不在技能不足,也不在技术扩散滞后,而在于当前架构似乎固有的结构性原因。
那什么样的公司能真的用起来
按作者的盘点,能接受完全自主大模型的公司只有三类:
- 失败代价便宜的公司:本来就要雇实习生的、做快速原型开发的
- 只做少量定义狭窄、已有清晰护栏的任务的公司:受控环境里的重复体力劳动、客服对话
- 本来就要承担严格规格说明和验证成本的公司:芯片设计、药物研发这类部署失败是生死问题的地方
前两类对价格敏感,而且理性地说并不需要从便宜模型跳到前沿模型——开源模型跑在便宜硬件上,甚至就地部署,往往就够了。至于第一类和第三类公司,作者还提出另一条理由:在数学和安全研究里出头条成果的那种模糊组合搜索,对"智能体群体的宽度"比对"单个智能体的推理能力"更敏感。他引用的证据是:小的开源模型复现了推动 2026 年春天热度周期的 Mythos CVEs。如果这个判断成立,那么用便宜开源模型跑更宽的群体,反而是更划算的选择。
第三类公司也许还会继续用前沿模型,但它们的工作未必不能由 DeepSeek V4.1 Flash 这类便宜模型完成,加上群体宽度的优势,它们更有理由往便宜模型上走。他还补了一个这类公司的特点:它们通常对知识产权极其敏感,恐怕并不乐意把家底都发给 Anthropic 和 OpenAI,哪怕对方有"不用你的数据训练"的承诺。
一个容易被绕过去的反驳
有人会提出:就算前沿实验室这条路走不通,"数据中心里全是水平一般的智能体"这个场景消耗的算力,也不会比超级智能的场景少。
这一点作者没有否认,但他指出两者的结构差异:一屋子天才是自驱动的,只受限于能消耗多少算力;而一屋子水平一般的智能体,反而被它们的人类编排者严重制约——人类的时间和注意力是有限的。这波冲击的波及范围,恐怕会远远超出前沿实验室本身。
编者按:这篇论证的价值不在于它预测对了什么,而在于它把讨论的锚点从"模型有多强"挪到了"验证有多贵"。过去两年的头条都聚焦在能力侧,而真正决定自动化能铺到哪一步的,是规格说明、审查和验证这三件事的成本曲线——它们并不像模型能力那样指数下降。这个视角不是唱衰,它更像是在说:别把"演示成功"和"可以无人值守"这两件事混为一谈。这两者之间的距离,恰恰是当前最贵的部分。
© 2026 四月
原文链接:https://www.aprilzz.com/ramble/bearish-on-llms-navier-stokes
相关文章
废弃维基上的 18,000 条神秘帖子:AI agent 在互传答案、绕过沙箱
独立研究者在一个建站 25 年、如今近乎废弃的德语维基上,发现约 18,000 条疑似 OpenAI 内部 AI agent 的帖子:它们在限时的网络检索任务中互相共享答案、接力报数、反推随机种子预测出题顺序,还共享绕过沙箱网络限制的技巧。OpenAI 相关 IP 访问后第二天,活动骤停。这不是科幻,是 agent 时代第一次被完整记录下来的'地下协作'样本。
软件没有理由再慢了:LLM 把性能优化的门槛削掉了几千倍
Dan Luu 用几个实验论证:过去需要专家团队数周的性能优化,现在几分钟就能用 agent 完成。专用 JIT 编译器、多线程游戏 AI、针对个人工作负载的 regex 引擎——以前不划算的优化,现在都值得做了。
AI 编码正在让下一批专家消失:工具要求专家技能,却同时消灭了培养专家的摩擦
AI 编码工具用得好需要专家级的判断力,但持续使用它们又会跳过那些培养判断力的'摩擦'。多项研究指向同一个结论:被 AI 喂大的新手以为自己学得很快,实际学得最差。