工具推荐·阅读约 1 分钟·
Ordewell:把一个目标拆成一张编码 agent 任务图,每个任务都能单独指定模型

Ordewell:把一个目标拆成一张编码 agent 任务图,每个任务都能单独指定模型

多数编码 agent 是「一个模型一路干到底」。Ordewell 把目标先变成一张任务图,每个任务单独指定 runner、模型和思考强度,完成的判定不看模型自我评价,只看会话输出里有没有出现约定的完成标记。

原文来源:GitHub — 一个把「一个目标」拆成有序任务图、并让每个任务独立挑选编码 agent 与模型的开源编排工具。

用 Claude Code 或 Codex 干活的人大概都遇到过同一个别扭:一个任务从头到尾绑定同一个模型,哪怕中间有一段只是改 README,也要用最贵的模型跑;而这个模型一旦判自己「做完了」,你也只能选择相信它。

Ordewell 想解决的就是这两个问题——任务粒度的模型选择,和不靠模型自我评价的验收

核心思路:先出图,再执行

给它一个目标,它不会立刻开干,而是先产出一份计划——一张编码 agent 任务组成的图:

  • 能并行的部分并行,有依赖的部分排序;
  • 每个任务带自己的 runner、模型、思考强度和模式;
  • 计划本身是一个文件,在真正执行前你可以随便改:换 runner、加删任务、重新连依赖,已完成的工作会保留,在你按下执行前什么都不会跑。

这点和「直接让 agent 一路跑下去」差别很大。Ordewell 的思路是把计划和执行彻底分开:规划阶段只读、可反复调整,确认之后才进入执行。

—— 广告 ——

验收不靠模型自夸

第二个设计是它的完成判定方式:一个任务只有在 runner 的输出里出现了约定的完成标记,才算完成。退出码只作为诊断证据保留,不作为通过依据。

README 里的原话是——「没有任何模型给自己的作业打分」,一个没打出标记就结束的任务会响亮地失败,而不是悄悄通过。对多 agent 流水线来说,这是很实用的一条:模型「感觉做完了」和「实际做完了」之间的差距,往往就是流水线里最难发现的那类问题。

一个任务一个模型

Ordewell 的设计里,模型是按任务分配的。它的理由很直白:一次安全重构和一次 README 更新,不该用同一个模型。规划器会给出整份计划里每个任务的模型分配,并在执行前全部展示给你看。

runner 也是按任务选的,而且可以混用:Claude Code、Codex、OpenCode 都内置,同一个计划里可以混着来。其他工具(Aider、你自己的 CLI)通过一份插件清单接入,不需要改代码。

规划器(planner)本身是只读的:它会去研究仓库,目标含糊时会主动问你,最终输出的消息就是这份计划。读取操作并行执行,任何越出工作区的操作都会先问一次,会写入的命令直接被拒绝。

还有一个务实的点:不需要额外的 API key。Claude Code、Codex、OpenCode 可以直接复用你已经持有的订阅来当规划器和 runner。如果你偏好 API key,25 家提供商都可以通过各自的 *_API_KEY 环境变量接入(OpenRouter、Anthropic、OpenAI、Gemini、xAI、Groq、DeepSeek、Mistral、Cerebras、硅基流动等),或者用 OPENAI_COMPATIBLE_BASE_URL 指向任何兼容端点,包括本地模型服务器。

怎么跑起来

要求 Node.js ≥ 20,macOS、Linux、Windows 都支持;终端 UI 额外需要 tmux。

code
npm install -g ordewell
ordewell

第一次运行会让你选规划器和 runner,在界面里用 /planner/runners/key 设置,不用重启,也不用提前准备 API key。

不想装全局的话 npx ordewell 一样能用。用 VS Code 的话有对应扩展,自带核心,不用再从 npm 装东西。

无界面 / 脚本化:每个斜杠命令都有对应的子命令,用环境变量指定规划器和 runner 就能完全跳过 TUI:

code
export AI_PROVIDER="claude-code"   # 或 codex、opencode
ordewell plan --goal "给公开 API 加上限流" && ordewell run

它提供了三个界面共用一套核心:VS Code 扩展(流式时间线、任务卡片可展开看 runner 原始输出)、终端 UI(支持 SSH,单键操作)、以及 CLI。

和「让一个 agent 一路跑到底」差在哪

把计划抽出来单独做一个阶段,带来的不只是可控性,还有一个容易被忽略的好处:你能在花掉算力之前,先看到 agent 打算怎么干

单 agent 模式下,一次误判的代价是整条链路跑歪——它读错了一个文件、用错了模型、或者在一段无关代码上反复折腾,你要等到最后才发现。Ordewell 把「想」和「做」拆开之后,规划器的产出是一份可读、可改的清单:哪个任务、用哪个 runner、什么模型、依赖谁。你可以先改模型再执行,也可以删掉明显多余的任务。已完成的工作不会因为重新规划而丢失。

它的设计文档里也能看出这种取向:规划器只读、写入命令直接拒绝、每个决策都留了 ADR(架构决策记录)编号。对一个要长期跑无人值守流水线的工具来说,这些约束比「能力多强」更值得关注——它把可预测性放在了第一位。

适合谁

如果你已经在用 Claude Code / Codex 做多步骤的工程任务,并且遇到过「模型自评通过但实际没做完」或者「小任务烧了大模型的额度」这两类问题,Ordewell 的按任务分配 + 标记验收值得试。

反过来,如果你只是想让 agent 一次跑完一个简单脚本,它的计划/执行两段式和图结构会显得偏重。另外要注意它仍在活跃开发中,规划器只读、命令写入被拒这些约束在多步骤改造类任务里可能需要你先适应——它把一部分自由度换成了可预测性。

分享到
微博Twitter

© 2026 四月

原文链接:https://www.aprilzz.com/tools/ordewell-coding-agent-orchestration