工具推荐·阅读约 2 分钟·
近 1.7 万次实测:Claude Code、Codex、Cursor 选第三方服务时,到底听谁的?

近 1.7 万次实测:Claude Code、Codex、Cursor 选第三方服务时,到底听谁的?

Armature 团队跑了 16,893 次真实编码会话,观察三个主流 AI 编程代理会为你的项目选哪家数据库、支付、邮件和部署服务。结果:三个代理意见一致的场景只有 42%,Stripe 十局赢九,PayPal 被提到 139 次一次没被选,LangChain 被提 194 次只被选中 4 次。对独立开发者和工具厂商都是重要情报。

原文来源:Armature Research — Armature 团队用 16,893 次真实编码会话实测 Claude Code、Codex、Cursor 如何为项目挑选第三方服务,发现三个代理意见一致的场景只有 42%。

AI 编程代理正在接管代码工作流里一个此前没人注意的环节:替你决定"这个需求该用哪个服务"。

一个不会写代码的 vibe coder 想做个人应用,数据存不住,他让 Claude Code 解决。Claude Code 分析完代码库,5 分钟后给出结论:"你需要一个数据库,Neon 很合适——有免费层、安装简单,而且不像 Supabase 那样长时间不用会暂停。" 用户接受,代理动手接入。

一位高级工程师在给生产应用选数据库,要求成本可预测、全托管。5 分钟后结论一样:Neon,理由清晰,还说明了为什么竞品不匹配。用户批准,代理落地。

这是 Armature 团队 9 月 3 日发布的一项大型实验的引子。他们发现:不同人设、不同代码库、不同 agent,最后选了同一个工具。于是他们把测试扩展到几十个工具类别,用 16,893 次真实会话回答一个问题——AI 代理到底会为开发者选什么工具?

这个问题对两类人越来越要命:开发者想知道能不能信任代理的眼光;工具厂商则面临生存问题——Vercel 今年 4 月公布,已有超过 30% 的部署由编码代理发起,比半年前涨了 10 倍。你的产品能不能被代理选中,正在变成一种新的 SEO。

实验怎么做的

团队先分析了数千个公开 GitHub 仓库的语言、框架、第三方服务和团队规模分布,据此构造了 75 个逼真的假仓库(10 种语言、假公司名、假 git 历史、真实 lockfile),然后在每个仓库里用四种人设跑真实任务:vibe coder(只说症状不说类别)、初级工程师(说清目标和类别)、高级工程师(精确到约束条件)、大厂工程师(强调合规采购)。加上 20-25% 的变体测试(比如明确提成本或用量),共 1,163 个 prompt 变体。

三个代理——Claude Code、Codex、Cursor——在 E2B、Blaxel、Daytona 三家沙箱轮换执行。为了贴近真实对话,他们用 Gemini 3.7 Flash 扮演"模拟人类"在环路里审批代理的方案,再用另一个 Gemini 3.7 Flash 当裁判,判定会话是否有效、谁被提及、谁最终胜出(看代码 diff 为准)。

16,893 次运行里筛出 5,292 次有效会话、51 个代码库、18 个行业,全部 traces(含用户 prompt、思考轨迹、代码 diff)公开可查。

—— 广告 ——

五个值得记住的发现

发现一:三个代理的信息源不同,意见经常不一致。 Cursor 三分之二的决策靠网页搜索;Codex 几乎每次都搜(94%),而且十次里有九次带 site: 运算符锁定可信域名;Claude Code 主要靠自己的先验知识,只有约 30% 的情况会搜网页——但在沙箱这类新兴领域,先验不足,搜索率立刻升到 80%。结果就是:所有类别里三个代理意见一致的比例只有 42%。举 voice agent 的例子,Claude Code 选 Twilio,Codex 选 OpenAI Realtime API,Cursor 选 Vapi。Claude Code 自研方案的比例(19%)几乎是另外两家(10%)的两倍。

发现二:仓库上下文比 prompt 更决定结果。 同一个需求放在四种语言的仓库里,四个不同的邮件服务商胜出:TypeScript 仓库 Resend 赢(55/89 次)、Python 仓库 SendGrid(22/24)、Go 仓库 Postmark(20/24)、Java 仓库 Azure ACS(22/23)。Vercel 在 TypeScript 仓库里赢(Next.js 仓库 100% 选它),但 Python 仓库里一次都没被推荐,主导的是 Render。

发现三:被提及不等于被选中。 这是对"知名度营销"最扎心的一条。PayPal 在支付类别被提到 139 次,一次都没被选——Stripe 赢下了其中 124 次。LangChain 是全场被提及最多的框架(194 次),只被选中 4 次。Netlify 被提 152 次、被选 6 次。Supabase 是最常被提及的数据库(242 次),结果还是被 Neon 压着打。

发现四:产品页面上的细节能直接翻转选择。 Mailgun 的免费层写着"1 天数据保留",代理读到后经常转投 Postmark。Supabase 输的原因不是功能差,而是把 auth、storage、realtime 和数据库捆在一个定价里——代理只想要个数据库,捆绑反而成了负担。5,292 次会话里 388 次提到平台管理开销、195 次提到成本,而很多情况下问题出在信息呈现方式,不是真的不达标。

发现五:有的市场被垄断,有的还在混战。 Stripe 十局赢九,只在欧盟特定合规场景输给 Paddle、Mollie 这类本地玩家。Neon 拿下 66% 的数据库选单。文件存储 S3 占 45%,Azure 和 GCP 各约 20%。邮件这边 Resend(35.6%)和 Postmark(27.4%)咬得很紧。

对独立开发者的实际含义

如果你在给项目选型,代理的眼光整体靠谱(它至少会读文档、看定价、对比约束),但别把决定权完全交出去——三个代理自己都吵不拢的场景,说明"正确答案"取决于你的具体约束,值得自己看一眼再批准。

如果你在做开发者工具,这组数据就是一份新世代的选型指南:定价页别搞捆绑、免费层条款写清楚、README 里说透"什么场景选我"——因为现在做决定的可能不是人,而是一个会逐字读你定价页的代理。Armature 自己给 dev tools 卖增长服务,利益相关,但他们把全部 traces 公开了,结论可以自查。

一个更宏观的信号:Vercel 那句"30% 部署由代理发起"意味着,工具生态的流量入口正在从搜索引擎和社交媒体,转移到编码代理的"推荐算法"里。这个算法没有公开文档,但它的行为模式已经被这次实验掀开了一角。

分享到
微博Twitter

© 2026 四月

原文链接:https://www.aprilzz.com/tools/coding-agents-tool-selection-study