
Ordewell:把一个目标拆成一张编码 agent 任务图,每个任务都能单独指定模型
多数编码 agent 是「一个模型一路干到底」。Ordewell 把目标先变成一张任务图,每个任务单独指定 runner、模型和思考强度,完成的判定不看模型自我评价,只看会话输出里有没有出现约定的完成标记。
原文来源:GitHub — 一个把「一个目标」拆成有序任务图、并让每个任务独立挑选编码 agent 与模型的开源编排工具。
用 Claude Code 或 Codex 干活的人大概都遇到过同一个别扭:一个任务从头到尾绑定同一个模型,哪怕中间有一段只是改 README,也要用最贵的模型跑;而这个模型一旦判自己「做完了」,你也只能选择相信它。
Ordewell 想解决的就是这两个问题——任务粒度的模型选择,和不靠模型自我评价的验收。
核心思路:先出图,再执行
给它一个目标,它不会立刻开干,而是先产出一份计划——一张编码 agent 任务组成的图:
- 能并行的部分并行,有依赖的部分排序;
- 每个任务带自己的 runner、模型、思考强度和模式;
- 计划本身是一个文件,在真正执行前你可以随便改:换 runner、加删任务、重新连依赖,已完成的工作会保留,在你按下执行前什么都不会跑。
这点和「直接让 agent 一路跑下去」差别很大。Ordewell 的思路是把计划和执行彻底分开:规划阶段只读、可反复调整,确认之后才进入执行。
—— 广告 ——
验收不靠模型自夸
第二个设计是它的完成判定方式:一个任务只有在 runner 的输出里出现了约定的完成标记,才算完成。退出码只作为诊断证据保留,不作为通过依据。
README 里的原话是——「没有任何模型给自己的作业打分」,一个没打出标记就结束的任务会响亮地失败,而不是悄悄通过。对多 agent 流水线来说,这是很实用的一条:模型「感觉做完了」和「实际做完了」之间的差距,往往就是流水线里最难发现的那类问题。
一个任务一个模型
Ordewell 的设计里,模型是按任务分配的。它的理由很直白:一次安全重构和一次 README 更新,不该用同一个模型。规划器会给出整份计划里每个任务的模型分配,并在执行前全部展示给你看。
runner 也是按任务选的,而且可以混用:Claude Code、Codex、OpenCode 都内置,同一个计划里可以混着来。其他工具(Aider、你自己的 CLI)通过一份插件清单接入,不需要改代码。
规划器(planner)本身是只读的:它会去研究仓库,目标含糊时会主动问你,最终输出的消息就是这份计划。读取操作并行执行,任何越出工作区的操作都会先问一次,会写入的命令直接被拒绝。
还有一个务实的点:不需要额外的 API key。Claude Code、Codex、OpenCode 可以直接复用你已经持有的订阅来当规划器和 runner。如果你偏好 API key,25 家提供商都可以通过各自的 *_API_KEY 环境变量接入(OpenRouter、Anthropic、OpenAI、Gemini、xAI、Groq、DeepSeek、Mistral、Cerebras、硅基流动等),或者用 OPENAI_COMPATIBLE_BASE_URL 指向任何兼容端点,包括本地模型服务器。
怎么跑起来
要求 Node.js ≥ 20,macOS、Linux、Windows 都支持;终端 UI 额外需要 tmux。
npm install -g ordewell
ordewell第一次运行会让你选规划器和 runner,在界面里用 /planner、/runners、/key 设置,不用重启,也不用提前准备 API key。
不想装全局的话 npx ordewell 一样能用。用 VS Code 的话有对应扩展,自带核心,不用再从 npm 装东西。
无界面 / 脚本化:每个斜杠命令都有对应的子命令,用环境变量指定规划器和 runner 就能完全跳过 TUI:
export AI_PROVIDER="claude-code" # 或 codex、opencode
ordewell plan --goal "给公开 API 加上限流" && ordewell run它提供了三个界面共用一套核心:VS Code 扩展(流式时间线、任务卡片可展开看 runner 原始输出)、终端 UI(支持 SSH,单键操作)、以及 CLI。
和「让一个 agent 一路跑到底」差在哪
把计划抽出来单独做一个阶段,带来的不只是可控性,还有一个容易被忽略的好处:你能在花掉算力之前,先看到 agent 打算怎么干。
单 agent 模式下,一次误判的代价是整条链路跑歪——它读错了一个文件、用错了模型、或者在一段无关代码上反复折腾,你要等到最后才发现。Ordewell 把「想」和「做」拆开之后,规划器的产出是一份可读、可改的清单:哪个任务、用哪个 runner、什么模型、依赖谁。你可以先改模型再执行,也可以删掉明显多余的任务。已完成的工作不会因为重新规划而丢失。
它的设计文档里也能看出这种取向:规划器只读、写入命令直接拒绝、每个决策都留了 ADR(架构决策记录)编号。对一个要长期跑无人值守流水线的工具来说,这些约束比「能力多强」更值得关注——它把可预测性放在了第一位。
适合谁
如果你已经在用 Claude Code / Codex 做多步骤的工程任务,并且遇到过「模型自评通过但实际没做完」或者「小任务烧了大模型的额度」这两类问题,Ordewell 的按任务分配 + 标记验收值得试。
反过来,如果你只是想让 agent 一次跑完一个简单脚本,它的计划/执行两段式和图结构会显得偏重。另外要注意它仍在活跃开发中,规划器只读、命令写入被拒这些约束在多步骤改造类任务里可能需要你先适应——它把一部分自由度换成了可预测性。
© 2026 四月
原文链接:https://www.aprilzz.com/tools/ordewell-coding-agent-orchestration
相关文章
同一个模型换个 harness,成本最多差 5 倍,成功率几乎不变
Berkeley 团队把 7 个模型分别配 3 个 harness(Claude Code、Codex CLI、Pi)共 21 种组合,在 SWE-bench Lite 和 Terminal-Bench 2.0 上各跑 30 道题 × 3 遍:换 harness 对成功率的影响只有 ±2%(Terminal-Bench 2.0 上约 ±5%),成本却最多差 5 倍,SWE-bench Lite 上 Claude Code 平均是 Pi 的两倍。
shadcn/improve — 让最强的 AI 模型规划,让便宜的模型执行
shadcn 的新开源项目 improve 定义了一种全新的 AI 编码工作流:用你最强的模型(如 Claude Opus 4.6)审计代码库并制定详细执行计划,然后交给便宜的模型去执行。一个优雅的成本优化策略。
近 1.7 万次实测:Claude Code、Codex、Cursor 会为你的项目选哪家服务?
Armature 团队跑了 16,893 次真实编码会话,观察三个主流 AI 编程代理会为你的项目选哪家数据库、支付、邮件和部署服务。结果:三个代理意见一致的场景只有 42%,Stripe 十局赢九,PayPal 被提到 139 次一次没被选,LangChain 被提 194 次只被选中 4 次。对独立开发者和工具厂商都是重要情报。