AI 前沿·阅读约 2 分钟·
Qwen3.8-Max 发布:2.4T 参数,Max 级模型首次开源,10 天自主编程跑出 265 个提交

Qwen3.8-Max 发布:2.4T 参数,Max 级模型首次开源,10 天自主编程跑出 265 个提交

通义千问发布史上最强 Qwen3.8-Max:2.4T 参数(95B 激活),首次开源 Max 级模型权重,三个自主实验证明它能独立完成十天级编程、论文复现与竞赛夺冠。

原文来源:Qwen 官方博客 — Qwen3.8-Max 发布:2.4T 参数、首次开源 Max 级权重,通过三个自主实验展示了从代码到研究的端到端任务能力。

8 月 2 日,阿里通义千问团队正式发布 Qwen3.8-Max,这是 Qwen 家族迄今能力最强的模型,也是 Qwen 第一次把 Max 级别的权重开源——开放权重将在下周放出。消息一出就冲上 Hacker News 热榜第一,一天内拿到近千点赞,足以说明社区对它的期待。

核心规格:2.4T 参数,95B 激活

Qwen3.8-Max 建立在 Qwen 3.5 的架构基础上,规模扩展到 2.4 万亿参数,但采用 MoE 架构,推理时只激活 95B 参数。这个「总参数大、激活参数小」的路线和 DeepSeek 等主流开源模型的思路一致,目的就是在能力上限和推理成本之间找到平衡。

按照官方说法,它在编程、办公协作、研究、长周期任务等维度都有全面提升,不仅能回答更难的问题,还能端到端地完成复杂任务、产出可直接交付的结果。API 已经上线 QwenCloud,开发者现在就能调用。

对独立开发者和技术团队来说,最值得关注的信号是:开源权重下周发布。这意味着 Qwen 家族第一次把旗舰级(Max 级)模型交到社区手里,本地部署、微调、二次开发都成为可能——过去 Max 级模型只以 API 形式存在,开源版本通常滞后且是缩水版。

—— 广告 ——

实验一:10 天自主编程,跑出一个自进化的项目

为了证明「编程」不是写几个函数那么简单,官方给了 Qwen3.8-Max 一个真正的长期任务:从零创建 oh-my-cli 项目,并让它自主运行 10 天以上,构建一个能自我进化的工程闭环。

这个闭环把用户反馈、社区实践、模型自测结果全部纳入一个工程循环:需求被规范化成 issue,由 agent 自动认领和执行,通过代码、测试、预览、日志持续迭代。整个项目轨迹公开在 GitHub 的 qwen-code-dev-bot/oh-my-cli 仓库。

关键工程细节很有看头:

  • 循环工程:issue 状态机 + 调度器 + 监控 + watchdog 组成执行循环,需求进入 GitHub Issues 后由 agent 认领,状态按 ready → leased → active 流转,实现完成后触发 E2E 测试和 CI 检查,通过后合并 PR。
  • 自测自维护:每次更新后自动触发构建、单元测试、E2E、桌面生命周期验证,异常状态自动路由回对应 issue/PR 修复。
  • 多源进化:把社区经验和用户反馈转化为可执行任务,持续迭代 /goal/resume、动态工作流、会话回放、桌面端等能力。

截至 7 月 30 日,这个完全自主运行的仓库已经积累了 265 个提交、127 个 PR、151 个 issue。也就是说,Qwen3.8-Max 不是照着固定计划执行,而是在反馈循环中不断自我进化——这正是「自主编程」和「自动化脚本」的本质区别。

实验二:复现一篇论文,然后超过它

第二个实验更惊人:官方把一篇 2026 年的研究论文(《Unified Data Selection for LLM Reasoning》,关于 LLM 训练数据选择的实用问题)丢给 Qwen3.8-Max,要求它只凭论文和 GPU,从零复现实验,然后尝试做得更好

没有起始代码,没有现成管线。数据处理脚本、训练代码、评估环境全部从零设计。模型完全自主工作了大约 5 天(约 125 小时连续运转),写了约 7600 行代码,执行了 1100+ 次动作,跑了 33 轮 GPU 训练

过程分两阶段:

  • 复现阶段(约 37 小时):从零重建论文完整管线,复现了它的六项核心结论——比如论文的数据选择方法在 AIME24 上比随机选数据高 +7.7%
  • 改进阶段(约 88 小时):进入自我改进循环——提出假设 → 写代码 → GPU 上跑 → 分析 → 再试。自主设计了 18 个改进想法,分四轮迭代,每轮结果喂给下一轮假设。最终进化出一个新方法,在竞赛级数学基准 AIME24 上超过论文原方法 +2.7 分

这个实验的价值在于:论文复现通常被认为是「需要人类研究者数天工作的专业任务」,而模型现在可以端到端完成,并且能在此基础上做研究性的探索。当然,这背后是真实的 GPU 训练成本,不是模拟演示。

实验三:24 小时参赛,超过 87% 的人类队伍

第三个实验是实战检验:官方把 Qwen3.8-Max 送进阿里巴巴天池平台的 WWW2025 多模态对话意图识别挑战赛,同场竞技的有 526 支人类队伍。任务是从客服聊天记录(文字+截图)中正确推断客户意图。

在严格的 24 小时时限内,Qwen3.8-Max 读完比赛规则并构建了完整方案:文本侧微调并集成了多个中文模型(BERT、MacBERT、RoBERTa),截图侧微调了视觉语言模型 Qwen2.5-VL-7B,配合 Chinese-CLIP 做图像兜底,最后融合成加权投票系统,通过交叉验证校准每个模型的权重。

经过 45 次提交(每轮反馈都驱动下一轮微调和重新加权),准确率从 0.60 稳步爬到 0.853,最终击败 526 支队伍中的 458 支(87%)。官方对比图里,它和 Claude Fable 5、GPT-5.6 Sol 等闭源旗舰放在同一坐标系,成绩处于第一梯队。

长周期决策:FinBench 里 4.16 倍回报

除了编程,官方还测了金融交易场景的 long-horizon 决策能力。在 FinBench 模拟中,Qwen3.8-Max 最终账户余额达到 ¥416,252(4.16 倍回报),比第二名 GLM 5.2 高出 38%,比自家上一代旗舰 Qwen3.7-Max 提升 152%。

更值得注意的不是收益数字,而是它展现的自适应学习:在 2000+ 轮交互中持续迭代策略,而不是死守早期学到的策略。这种「从交易反馈中不断进化」的能力,对任何需要长周期决策的 agent 场景都有参考价值。

多模态与视觉反馈闭环

Qwen3.8-Max 的多模态能力也贯穿任务全生命周期:

  • 超长输入:能处理 200 页以上的财务报告和复杂 PDF,理解跨页的文本、图表和版式;能处理 100 小时以上的视频,把人物、事件、时间戳、场景组织成「视频记忆图」。
  • 视觉反馈循环:执行过程中持续观察和评估自己的中间结果——检查页面布局、物体朝向、动画质量,发现问题就自主修正。视觉不再只是输入端的一种模态,而是规划、执行、验证、迭代的原生反馈通道。
  • Hybrid Agent:编程 + GUI 操作双通道协同。官方为此引入了 RecreationBench 基准(覆盖桌面、移动端、Web 五个平台),模型只能把运行中的应用当黑盒观察,然后从零重建整个应用。
  • Qwen-MM-Plugins:面向多模态 agent 的扩展库,提供图像/视频处理、多模态记忆、动态分辨率、视觉工具调用等能力,任何现有 agent harness 都能借此扩展成多模态原生系统。

Benchmark 亮点

在官方完整基准表中,Qwen3.8-Max 和 Claude Opus 4.8、Claude Fable 5、GPT-5.6 Sol 等闭源旗舰同台对比,几个值得注意的成绩:

  • PaperBench 93.0:超过 GPT-5.6 Sol 的 90.5,是所有对比模型中最高的——和实验二「论文复现」的能力互相印证。
  • Terminal Bench 2.1 86.6:终端编程任务,接近 GPT-5.6 Sol 的 88.8。
  • IFBench 82.8:指令跟随能力反超所有闭源对手(Opus 4.8 是 62.2,GPT-5.6 Sol 是 72.7)。
  • HealthBench 60.2、PLawBench 73.2、PRBench-Finance 58.3:医疗、法律、金融等专业领域均处于第一梯队。
  • 多模态侧:MathVision 95.2/97.7、LogicVista 91.9、HiPhO 90.0 等多项视觉推理指标领先。
  • Dense200 87.0:远超其他模型(Opus 4.8 为 20.8),长上下文密集理解优势明显。

当然,自家模型自己测,benchmark 只能作为参考,最终判断还是要看真实场景使用和社区的独立复测。不过 PaperBench 和 IFBench 这两个成绩和其他来源交叉印证的可能性较高,可信度不错。

对开发者意味着什么

Qwen3.8-Max 发布的信号很明确:

  1. 开源旗舰时代到来:下周放出的开源权重意味着本地部署 2.4T 级 MoE 模型成为可能(激活参数 95B,配合量化,消费级硬件有一定机会跑起来),自托管、私有化、微调不再是闭源旗舰的禁区。
  2. 长周期 agent 是主战场:三个实验全部围绕「多天自主运行」展开,说明模型厂商的竞争焦点已经从单轮问答转向端到端任务可靠性。这对所有做 agent 产品的团队都是方向性参考。
  3. 编程工具生态已就位:官方同时提供了 Codex、Qoder、Qwen Code、OpenClaw 等工具的接入配置,模型发布即生态配套,落地路径清晰。

对于独立开发者,最实际的建议是:先去 QwenCloud 申请 API 试跑自己的真实任务——编程、文档处理、长视频分析都可以测,1M 上下文窗口对大型代码库和长文档场景是实打实的优势。等下周权重开源,本地部署的玩法就更多了。

分享到
微博Twitter

© 2026 四月

原文链接:https://www.aprilzz.com/ai/qwen3-8-max-open-weights-coding