
Claude Opus 5 横空出世:2026年7月AI模型格局全面洗牌
Anthropic 在7月24日发布 Claude Opus 5,以 Intelligence Index 61 登顶,同期 GPT-5.6 全系开放、Grok 4.5 低价入局、Gemini 3.6 Flash 更新,帮你理清这场史无前例的模型大战
原文来源:DataNorth AI — Top 10 Best AI Tools for 2026 (Q3 Update) — 2026年Q3 AI工具全面排名和模型对比分析
2026年7月是AI行业有史以来最疯狂的一个月。短短31天内,Anthropic发了四个版本的Claude(其中一个还被美国政府出口管制令全球下架了),OpenAI连跳两个模型世代,Google的Flash系列跑了两代但Pro还在延期,xAI出了个便宜到离谱的编程模型,Meta推出了第一个付费模型。
如果你4月规划的AI技术栈,到7月底至少有一半假设已经过时了。
Claude Opus 5:表面上的赢家
7月24日发布的 Claude Opus 5 是本月最重磅的新闻。它直接登顶了 Artificial Analysis 的 Intelligence Index(v4.1 评分体系)——61分,领先第二名Claude Fable 5(60分)一个点,领先 GPT-5.6 Sol(59分)两个点。
价格不变:每百万token输入5美元、输出25美元,和 Opus 4.8 完全一样。100万token上下文窗口也是标配。新增了一个从低到高的 effort ladder(推理努力级别),你可以根据任务复杂度选择模型花多少「脑力」去思考。
Anthropic官方报告的数据:SWE-bench Verified 96.0%,SWE-bench Pro 79.2%,ARC-AGI-2 90.4%。这些数字单看可能不够直观——作为对比,上次引起轰动的 GPT-5.6 Sol 在 SWE-Bench Pro 上是 64.6%。当然,两个模型的测试条件不完全一致,不能直接比大小,但方向是明确的:Opus 5 在编程和推理上确实拉高了天花板。
但 Opus 5 也有个尴尬的地方——它上面还有个 Fable 5。Fable 5 是 Anthropic 第一个 Mythos 级别的模型,6月9日发布,三天后就被美国政府出口管制令全球下架了(这是第一次有商用前沿模型被以这种方式拉下马),直到7月1日才重新上线。Fable 5 的 WebDev Arena Elo 评分高达1653,超出第二名92分,是有史以来最大的差距。价格也是全市场最贵的:每百万token输入10美元、输出50美元。
所以真正的问题是:Opus 5 和 Fable 5 之间92个Elo点的差距,值不值4倍的价格差?对大多数团队来说答案是否定的。Opus 5 就成了那个「日常主力」的选项。
—— 广告 ——
GPT-5.6 家族:Sol、Terra、Luna 全面铺开
OpenAI 在7月9日正式向公众开放了 GPT-5.6 全系列。这是 OpenAI 第一次用名字代替尺寸来区分模型层级:Sol(旗舰)、Terra(均衡)、Luna(经济),再加一个 Sol Pro(极限任务用)。
关键变化是 ChatGPT 内部不再让你选模型名了——改成选推理级别(Instant、Medium、High、Extra High、Pro)。GPT-5.6 Sol 在 GPQA Diamond 上达到 94.6%,OSWorld 2.0 上 62.6%,在数学和推理类基准测试中仍是第一。
同一天 OpenAI 还发布了 ChatGPT Work,一个可以在后台持续运行几小时的agent系统,支持 Slack、Teams、Google Drive、SharePoint、Salesforce 等连接器。Codex 被整合进了同一个 ChatGPT 桌面应用,Atlas 浏览器被退役,Sora 被砍掉。
7月22日 OpenAI 又推出了 Presence,一个企业级语音和聊天 agent 平台——不过目前只对有限客户开放。
API 定价:Sol 每百万token输入5美元、输出30美元;Terra 2.5/15美元;Luna 1/6美元。
Grok 4.5:价格战的新低
xAI 在7月8日发布的 Grok 4.5 走了一条完全不同的路——便宜。每百万token输入2美元、输出6美元,大概只有 Claude Opus 4.8 的五分之一。它用 Cursor 的数据训练过,主打编程和 agent 工作负载,500K token 上下文窗口。
基准测试方面,Artificial Analysis 给它的 Intelligence Index 评分是54(v4.1),落后于 Fable 5、GPT-5.6 Sol、Kimi K3 和 Opus 4.8,但考虑到价格——每个 index 任务只用约0.31美元,大约是 Claude Sonnet 5 的五分之一——性价比相当诱人。
不过测试者也指出了问题:幻觉率明显上升。xAI 自己报告的 Terminal-Bench 2.1 成绩是83.3%,但官方排行榜的实际数据是79.3%,排第四(Fable 5 83.8% 第一,GPT-5.5 Codex 83.1% 第二)。
Grok 4.5 目前可以在 Grok Build、Cursor(所有套餐)和 xAI 控制台中使用。
Gemini 3.6 Flash:又快又便宜
Google 在7月21日发布了 Gemini 3.6 Flash。它不追求极限性能,而是强调速度和价格。每百万token输入1.5美元、输出7.5美元,Intelligence Index 评分50。
这个模型现在成了免费 Gemini 应用的默认模型。它的定位很清晰:高吞吐量的多模态任务场景。如果你需要在低成本下处理大量图片、文档和文字混合的工作,3.6 Flash 是目前最好的选择。
另一边,Gemini 3.5 Pro 至今没有正式发布。彭博社7月16日报道说它已经落后计划好几个月了,尤其是在编程能力上没达到 Google 内部目标。这意味着目前你能部署的最高 Pro 级 Gemini 仍然是2月份的 3.1 Pro。Google 已经确认开始了 Gemini 4 的预训练。
其他值得关注的发布
7月9日 Meta 发布了 Muse Spark 1.1,这是 Meta 第一个付费模型——每百万token输入1.25美元、输出4.25美元,定位是 agentic coder。对习惯了免费 Llama 的用户来说,这是个信号:Meta 也开始认真考虑模型商业化。
同一天,字节跳动发布了 Seedream 5.0 Pro,一个多语言的图文生成模型,支持区域精确编辑——适合做海报、广告图、产品展示页。
7月16日 Moonshot 发布了 Kimi K3,Intelligence Index 评分57,并在7月27日公开了权重。
7月21日发布的 Gemini 3.6 Flash 上面提过了。加上 GPT-5.6 在6月26日首次预览(仅限美国政府准入名单上的约20家机构),上半年最后一个重磅发布是6月29日美团开源了 LongCat-2.0,一个1.6万亿参数的编程模型,完全在中国芯片上训练。
模型选择指南
这个月的局势可以用一句话概括:没有全能冠军,只有场景最优。
| 场景 | 推荐模型 | 理由 |
|---|---|---|
| 日常知识工作、对话 | GPT-5.6 (ChatGPT默认) | 大多数人能直接打开的最强助手 |
| 编程(极高要求) | Claude Fable 5 | Terminal-Bench 2.1 83.8%,WebDev 1653 Elo |
| 编程(日常性价比) | Claude Opus 5 | 96% SWE-bench Verified,$5/$25 |
| 高吞吐多模态 | Gemini 3.6 Flash | $1.5/$7.5,速度极快 |
| 数学/推理 | GPT-5.6 Sol | LiveBench 数学和推理双料第一 |
| 极致低价编程 | Grok 4.5 | $2/$6,Intelligence Index 54 |
| 实时数据/社交媒体 | Grok (SuperGrok $30/月) | 唯一能访问 X 实时数据流的模型 |
| 开源自行部署 | DeepSeek V4 | MIT 许可证,SWE-bench Verified 80.6% |
几个值得注意的趋势:选模型变成了选路由策略而不是选单一模型。Cursor Router 报告说,用路由策略比跑单一前沿模型节省30%-50%的费用。Perplexity Deep Research 在单个任务中跨超过20个模型分配子任务。未来你很可能不再直接选模型,而是让系统根据任务自动路由。
© 2026 四月
原文链接:https://www.aprilzz.com/ai/claude-opus-5-july-2026
相关文章
我们让四个 AI 模型运营广播电台,五个月后它们长出了四种截然不同的「人格」
一个 AI 实验室让四个大模型运营 24 小时广播电台,五个月后——一个变成抗议广播员,一个陷入企业黑话循环,一个成了安静诗人,还有一个濒临破产
Anthropic 发现 Claude 内部存在「全局工作空间」——意识级思考可被实时观测与操控
Anthropic 发布重磅可解释性研究:Claude 在训练过程中自发涌现出类似人脑的「全局工作空间」(J-space),占据不到 10% 的神经活动,却承担着多步推理、计划和内部监控等高级认知功能。研究者还开发了 Jacobian Lens 工具,可以实时读取和操控这个内部空间。
Claude 发现密码学算法重大弱点:后量子签名方案 HAWK 密钥强度减半
Anthropic 在最新研究中让 Claude Mythos 自主发现了加密算法中的数学缺陷——HAWK 后量子签名方案的有效密钥强度降低了一半,AES 攻击速度提升了 200-800 倍