AI 前沿·阅读约 2 分钟·
别拿生成式大模型做简单判断:Laya 用 33 毫秒给出一组校准过的概率

别拿生成式大模型做简单判断:Laya 用 33 毫秒给出一组校准过的概率

作者一年多前就做过非自回归的决策模型,今年同类方案被重新包装成突破发布。他把经验整理成开源的 Laya:单次前向传播回答结构化问题,并公布了英语模型在非拉丁文字上的失效数据。

原文来源:Laya — 作者把自己做了一年多的非自回归决策模型整理成开源模型族 Laya:单次前向传播回答结构化问题,33 毫秒返回校准概率,同时公布英语模型在非拉丁文字上彻底失效的实测数据。

现在做 AI 的人都在聊一种新模型:非自回归、不生成文本、对结构化 schema 给出极快的概率预测。作者看到这波热度时的心情是「既被验证,又非常沮丧」——因为这套东西他 2025 年 3 月就在做。

当时他花了好几个月,发了一篇 arXiv 论文,在 Hugging Face 上放出模型权重和开放数据集,做了 PyPI 包,还在 Reddit 上写完了整套思路;2025 年 9 月他又发了第二篇论文,把「用强化学习引导基于 schema 的决策」这件事形式化。他的系统里真正做主的是强化学习,不是一个 embedding 模型或者自回归 LLM。

然后到了 2026 年 9 月,一家资金充裕的前沿实验室 TypeSafe AI(创始人 Diogo Almeida 是 ChatGPT 的共同发明人之一)发布了 Jev,提出了完全相同的非自回归决策概念,像是在宣布一项全新的科学突破——只是没有技术论文、没有开放权重,也没有开放训练数据集。

作者的处理方式不是说气话,而是把学到的东西重新做一遍,修掉旧方案的每一处架构限制,做成一个完全开放的、横向的 System 1 决策模型族,叫 Laya。他说,因为这次是正经建在双向编码器上,模型在单张 GPU 上跑 32.8 毫秒(批处理摊到每个问题 7.2 毫秒),比 Jev 快六到八倍,支持 100 多种语言,没有 API 订阅成本,权重是 Apache 2.0 完全开源。

问题:用生成式大模型做反射式决策

每一条现代 AI 流水线都有同一个瓶颈:用生成式 LLM 去处理本该是条件反射的简单判断。

客服工单进来、邮件进收件箱、用户往你的 API 提交提示词时,你实际需要的往往只是回答几个结构化的问题:这张工单该转给哪个部门?这封邮件是钓鱼还是垃圾邮件?这个 prompt 是不是在试图越狱或注入指令?这个问题的紧急程度在 0 到 3 的量表上是几级?这个查询需要执行代码还是普通事实回答?

为这些调用一个 8B、70B 甚至前沿 LLM,是彻底的杀鸡用牛刀。你要等 500 到 2000 毫秒让 token 一个个流出来,要为推理真金白银地付钱,最后还得写正则或 JSON 解析器,从自由文本里抠出一个干净的标签。

最糟的是,LLM 很喜欢给出自己编的置信度。当它输出 confidence: 0.95 时,它只是在预测「听起来很自信」的 token 而已,背后没有任何数学校准。作者要的是一个像人脑 System 1 那样工作的模型:瞬间做出反射式判断,给出诚实的、校准过的概率,在普通商用硬件上只花 30 到 35 毫秒。

—— 广告 ——

三个决策原语

Laya 在单次前向传播里,对任意状态(原始文本、邮件、工单或 JSON 文档)评估带类型的问题。它只有三个原语:

choice:从一组选项里挑一个。返回选中的键、所有选项上的概率分布,以及一个校准过的置信度。

score:把状态放到一个有序量表上(0、1、2……)。返回期望等级、各等级的分布和置信度。

noul:一个直接的布尔问题,返回校准过的 P(true),取值 0.0 到 1.0;由构造保证 P(false) = 1 − P(true)。

关键在于输出空间完全由概率和数字组成,所以模型永远不生成文本,也就不可能产生幻觉,schema 违规或者格式错误的 JSON 根本不可能出现。

模型族里有三个专门化的 checkpoint,现在合并到一个 Hugging Face 仓库下:laya 用 ModernBERT-large(421M 参数,512 上下文),主打英文文本分类、护栏和邮件分流;laya-multilingual 用 mmBERT-base(32.2 万词表,322M 参数,1024 上下文,最高 8k),覆盖 100 多种语言,速度还快 2.2 倍;laya-typed-decisions 用 ModernBERT-large 加 1024 上下文,面向 agent 可观测性、客服、发票处理和安全告警,准确率 0.766。

主仓库把三个都捆在一起,但用 Hugging Face 的 allow_patterns,SDK 只会下载你点名的那一个子目录——要英文模型就下约 808MB,要多语言就只下那 647MB,而不是把 2.5GB 全拖下来。

最有价值的一段:置信度救不了你

作者做了 51 种语言在 MASSIVE 基准上的扫描,每个问题 20 个选项,随机基线是 0.050。结果很难看,而且难看的方式很特别。

ModernBERT-large 那套 5 万 token 的英文 BPE 词表,会把非拉丁字母切得粉碎:

高棉语:准确率 0.000,平均置信度 0.952。一百道题里一道都没对,同时报告着大约 95% 的置信度。

亚美尼亚语:准确率 0.050,正好等于掷硬币,置信度 0.885。

希伯来语:0.060 准确率,0.964 置信度。

孟加拉语:0.080 准确率,0.945 置信度。

印地语:0.100 准确率,0.941 置信度。

他从中得出的结论是整篇文章里最该记住的一条:当模型读不懂输入文字时,它自己的置信度不会给出任何警告。在 51 种语言上,英文 checkpoint 的平均置信度从没掉到 0.885 以下,无论准确率是 82% 还是 0%。

也就是说,置信度门控保护不了你。用哪个模型这件事,必须在前向传播之前就定下来。

Laya 内置了一个 Router 来处理这件事:它检查输入文本的 Unicode 脚本(覆盖天城文、CJK 汉字、西里尔、阿拉伯、希伯来、泰米尔、泰文等 22 种字母表),再分析拉丁停用词的分布。开销是纯 Python 的亚毫秒级:标准英文文本 0.09 毫秒,天城文和印度语系 0.54 毫秒,200 行嵌套 JSON 文档 0.73 毫秒。相对 33 毫秒的前向传播,这点路由开销可以忽略(不到 2%)。用 Router(preload=True) 还能把所有需要的模型常驻显存/内存,避免流量在语言之间来回切换时那种 7 到 10 秒的冷切换惩罚。

和 Jev 的正面对比

作者拿 Laya 和 TypeSafe Jev 做了一组对比。需要说明的是,Laya 的每个数字都是他自己实测的,Jev 的数字来自第三方独立研究(AbdelStark、nibzard)和 TypeSafe 官方公布。

在 2,000 条决策的 typed-decisions 基准上,0.766 对 0.727,还超过了 0.735 的教师模型上限;AG News 四分类 0.950 对 0.910;DAIR 情感六分类 0.595 对 0.480,作者特别点出 Jev 在这项上有 16% 的零概率;校准误差 ECE 是 0.081 对 0.246,好了三倍。

延迟的差距更大:单问题 P50 是 32.8 毫秒对 236 到 276 毫秒,快 7.8 倍;十个问题批量调用是 72.3 毫秒(摊到每个问题 7.2 毫秒)对约 1,500 毫秒的串行执行,快 20 倍。语言覆盖上,Jev 没有公布基准,Laya 是 51 种语言里 45 种可用(超过随机基线三倍以上)。成本则是自托管免费对每百万输入 token 收费 0.042 美元。

在九个企业级工作流上,它给出的成绩是这样:Enron 垃圾邮件过滤 0.993 准确率、0.013 的 ECE;钓鱼邮件检测 0.980 准确率、0.012 ECE;基于 ToxicChat 的越狱护栏 0.755 到 0.762,在 50% 选择性覆盖率下准确率能到 0.931;RAG 段落相关性过滤单次前向 0.657;十路工单队列路由 0.522。

它自己承认的天花板

作者专门写了一节「哪里不行」,这在一份模型发布说明里不算常见。

选项太多会退化。在 Banking77 的 77 个标签压力测试里,Laya 拿到 0.425,而 Jev 是 0.870。原因是架构预算约束:所有选项共享 192 到 256 token 的 head_max_len,77 个候选摊下来每个只剩三到四个 token。他的建议是把 choice 的选项控制在 20 个以内,或者做粗到细的两级判断。

零样本不等于好用。开箱的基座模型在 typed-decisions 基准上只有约 0.35,接近随机;0.766 是在该基准训练集上微调之后的结果。所以要把它当成一个可以特化的快速基座,而不是无所不知的零样本先知。

温度需要自己校准。基座权重带的是原始温度 logits,只要在你的领域分布上按问题类型拟合一个标量温度,就能把期望校准误差从 0.466 降到 0.081。

为什么这件事值得关注

把「用不用模型」和「用多大的模型」拆成两个独立决策,是这条流水线上最容易被忽略的省钱点。大量所谓 AI 功能,真正需要的只是一个能在 30 毫秒内给出带校准概率标签的分类器;把它交给生成式 LLM 处理,等于每次都在为不需要的自由度付费,还额外背上了幻觉和解析器的风险。

而 51 种语言那组数据说明,模型自报的置信度在跨语言场景里基本等于噪声。任何做多语言产品的团队,都该像对待 p99 延迟那样对待这件事——不是靠事后门控兜底,而是在请求进来之前就把模型选对。

对隐私敏感的场景,自托管加 Apache 2.0 权重意味着可以完全断网跑在内部机器上,这一点是那些按 token 计费的托管 API 给不了的。

分享到
微博Twitter

© 2026 四月

原文链接:https://www.aprilzz.com/ai/laya-system1-decision-model