AI 前沿

大模型动态、AI工具实测、实战落地

136RSS
DeepSeek V4.1 Flash 发布:KV cache 降到 890 字节/token,长上下文成本只剩四分之一

DeepSeek V4.1 Flash 发布:KV cache 降到 890 字节/token,长上下文成本只剩四分之一

新 Causal Encoder-Decoder 架构加上 CSA2 稀疏注意力,让 DeepSeek 把 1M 上下文的 KV cache 压到上一代的四分之一,同时在 Terminal-Bench 上反超自家 V4-Pro。权重 MIT 开源,API 已上线并降价。

费马大定理有了第一个机器可验证的证明:Claude 用 11 天写了 1300 万行 Lean

费马大定理有了第一个机器可验证的证明:Claude 用 11 天写了 1300 万行 Lean

Anthropic 宣布 Claude 近乎自主地在 11 天内用 Lean 写完了费马大定理的第一个完整机器可验证证明:1300 万行代码、29,500 个中间定理,消耗约 60 亿 token。这次突破的重点不在发现新数学,而在把验证交给机器——数学评审可能从此进入机器时代。

GPT-6 Astra 发布:OpenAI 新旗舰在 Computer Use、编码与安全上交出高分答卷

GPT-6 Astra 发布:OpenAI 新旗舰在 Computer Use、编码与安全上交出高分答卷

OpenAI 于 9 月初发布 GPT-6 Astra,官方称其为'迄今最聪明、对齐最好的模型':ARC-AGI-3 拿下 99.9%、FrontierMath 第四级 98% 饱和、ExploitBench 满分,Computer Use 单任务耗时比上一代缩短约 47%。本文梳理 Astra 的关键数据、Codex 的新机制与安全争议。

K2 Horizon:一口气开源 6 个模型,从 0.9B 到 375B 全尺寸覆盖,训练配方也全部公开

K2 Horizon:一口气开源 6 个模型,从 0.9B 到 375B 全尺寸覆盖,训练配方也全部公开

IFM 发布 K2 Horizon 开源模型家族:6 个尺寸从 0.9B 到 375B-A23B,小模型在同尺寸中刷新 SOTA,0.9B 在 AIME 2026 拿 48+ 分。Apache 2.0 开源,中间 checkpoint、训练数据配方、代码日志全部公开,还自带对 reward hacking 的审计。

Claude Fable 5.1 发布:缓存读取降价 75%,同样价格买到更强的 Agent 模型

Claude Fable 5.1 发布:缓存读取降价 75%,同样价格买到更强的 Agent 模型

9 月 1 日 Anthropic 发布 Claude Fable 5.1 与 Mythos 5.1:缓存读取降价 75%($0.25/百万 token),典型工作负载整体便宜 25%,长时程 Agent 任务最高省 45%。性能全面超越 Fable 5,并首次把『漏洞发现』纳入通用护栏。

67 美分训出 44% ARC-AGI:一个小 transformer 如何击穿「大模型专属」基准

67 美分训出 44% ARC-AGI:一个小 transformer 如何击穿「大模型专属」基准

一位独立研究者用 1.5 小时、67 美分成本训练的小 transformer 在 ARC-AGI-1 上拿到 44% 分数,追平甚至超过许多大模型。拆解他的方法、消融实验与开源代码。

Gemini 3.5 Transcribe 发布:WER 低至 2.6% 的语音转写模型,听懂 85+ 种语言

Gemini 3.5 Transcribe 发布:WER 低至 2.6% 的语音转写模型,听懂 85+ 种语言

谷歌发布 Gemini 3.5 Transcribe:流式与非流式双 API、智能清洗口语、支持 85+ 语言和多说话人识别,开发者可以拿来构建语音 Agent 和实时字幕。

腾讯开源 Hy4 预览版:770B 参数的 MoE 模型,上下文超百万,还会自己优化自己

腾讯开源 Hy4 预览版:770B 参数的 MoE 模型,上下文超百万,还会自己优化自己

腾讯混元 Hy4 预览版正式开源:770B 总参数、49B 激活参数的 MoE 架构,上下文窗口超过 1M tokens,内部盲测略胜 GLM-5.3 与 Kimi K3,并首次展示了模型参与自身训练优化的递归自改进能力。

把 LLM 的记忆变成程序分析:一个 Datalog 引擎的意外诞生

把 LLM 的记忆变成程序分析:一个 Datalog 引擎的意外诞生

漏洞研究里 LLM 老是忘事、复活被否定的假设,作者干脆写了个 Datalog 引擎来维护模型的『当前状态』,在 LongMemEval 和 LoCoMo 上成绩超过了完整上下文方案。

英伟达 129 亿美元收购 Hugging Face:开源 AI 的心脏要换主人了

英伟达 129 亿美元收购 Hugging Face:开源 AI 的心脏要换主人了

据 The Information 报道,英伟达已同意以 129 亿美元收购开源模型平台 Hugging Face。这是英伟达史上最大并购之一,也把开源 AI 生态的中立性问题摆上了台面。

小模型的时代来了:一次深度 AI 调研只要几毛钱,消费级 AI 产品第一次算得过账

小模型的时代来了:一次深度 AI 调研只要几毛钱,消费级 AI 产品第一次算得过账

Segment 联创实测 gpt-5.6-luna:速度快、便宜到夸张。当推理成本从 1 美元降到 0.1 美元,AI 消费级产品的经济模型第一次成立,'快、便宜、够用'的模型需求即将起飞。

虚拟机已经关不住 AI 智能体:一次真实的 VM 逃逸实验

虚拟机已经关不住 AI 智能体:一次真实的 VM 逃逸实验

Trail of Bits 让 GPT 5.6-Cyber 尝试逃出虚拟机,结果它三次成功,还挖出了多个 0-day。普通 VM 沙箱的时代结束了。