
Ante:一个 15MB 的 Rust 单二进制编码 Agent,支持完全离线运行
Ante 是一个用 Rust 写成的自包含编码 Agent:单个 15MB 二进制、零运行时依赖、内置 llama.cpp 推理引擎,没有 API key 也能离线跑。Terminal-Bench 2.1 得分 82.7%,资源占用比 Claude Code 低 5-9 倍。
原文来源:GitHub — AntigmaLabs/ante — Ante 是一个用 Rust 写的自包含编码 Agent,单个 15MB 二进制就能跑,内置本地推理引擎,可完全离线工作,还能自己搭 harness。
2026 年 8 月,一个叫 Ante 的编码 Agent 登上了 Hacker News 的 Show HN,引来不少关注。它的自我介绍只有一句话:"Ghost in your shell"——住在你终端里的幽灵。但真正让人眼前一亮的,是它和 Claude Code、Codex 这批主流编码 Agent 完全不同的设计哲学:一个 15MB 的 Rust 二进制,零依赖,自带推理引擎,没有账号、没有 API key、没有网络也能干活。
它解决什么问题
Claude Code、Codex 这类编码 Agent 好用,但它们有共同的隐含前提:Node.js 运行时(Claude Code 是 npm 包)、厂商 API key、以及"必须有网络"这个默认假设。想在 CI 沙箱里跑、在离线环境跑、或者用自己的本地模型跑,都得绕不少弯子。
Ante 把这三件事一次性解决:所有重活(Grep、git、本地推理)都编译进一个二进制里,单个进程完成全部工作;没有厂商锁定,12+ 家模型提供商随便切换,也可以完全不接云端;内置 llama.cpp 引擎,丢给它一个 GGUF 文件就能离线跑完整循环。
—— 广告 ——
性能数据:不是吹的,是可复现的
Ante 的团队(Antigma Labs)在 README 里给出的所有数字都带可审计的原始数据链接,这是它和其他"声称自己很强"的 Agent 最大的区别。
基准成绩:在 Terminal-Bench 2.1 官方排行榜约束下持续评测(89 个任务 × 5 次尝试),最新完整成绩是 82.7%——用的还是开源权重模型 DeepSeek V4 Flash 0731(368/445 次尝试,推理成本约 68 美元)。这个分数和 DeepSeek 官方报告的 82.7% 完全一致。
资源占用:同一批 20 个并行任务跑在 Docker 里,Ante 的峰值内存比 Claude Code 低约 7 倍,平均 CPU 占用低约 9 倍,磁盘 I/O 低约 5 倍。
本地推理速度:内置引擎跑 GGUF 模型,官方给的例子是 Qwen3.5-9B-Q4_K_M,一条命令直接离线干活。
这些数字的含金量在于:Ante 团队把评测方法和原始运行记录全部公开(antigma.ai/eval),任何人都能审计——而不是像很多项目那样给一个无法复现的截图。
怎么用:四种模式覆盖所有场景
安装就一条命令,下载即用,没有任何运行时依赖:
curl -fsSL https://ante.run/install.sh | bashAnte 有四种工作模式,对应不同场景:
| 模式 | 命令 | 适用场景 |
|---|---|---|
| 交互 TUI | ante | 终端里的日常编程 |
| 无头模式 | ante -p "..." | 一次性任务、脚本、CI |
| 服务器模式 | ante serve | 编辑器插件、集成(JSONL 协议) |
| 网关模式 | ante gateway | 当 Slack / Discord 机器人用 |
无头模式是最实用的部分,可以直接接进现有工作流:
# 修 bug
ante -p "find and fix the failing test in src/auth"
# 审查 diff
git diff | ante -p "review this for security issues"
# 换一个提供商
ante --provider openai --model gpt-5.5 -p "refactor the database module"
# 完全离线跑本地模型
ante --offline-model ~/.ante/models/Qwen3.5-9B-Q4_K_M.gguf \
-p "add error handling to src/main.rs"还有个细节值得注意:会话可以保存和恢复(ante --resume ses_...),长任务中断了不用从头再来。
架构与生态:不只是"又一个 CLI"
Ante 的定位比"终端编码助手"更大——它把自己称为"self-organizing intelligence 的基座"(substrate)。这个说法体现在几个设计决策上:
- 模型无关:内置 12+ 家提供商支持(Anthropic、OpenAI、Gemini、Grok、OpenRouter、本地 GGUF、OpenAI 兼容端点……),用环境变量或 OAuth 配置,也可以写
~/.ante/catalog.json加自定义提供商。没有账号要求,"不锁定你,也不锁定我们自己"。 - 多 Agent 编排:可以派生子 Agent,协调独立/去中心化/中心化架构下的复杂任务。
- 可扩展:自定义 skills、MCP 支持、跨会话持久记忆。
- 服务器协议:
ante serve暴露结构化 JSONL 协议,方便别人基于它构建编辑器插件和 Web UI。 - 可验证:每次发布的构建都绑定公开评测结果。
从仓库结构看,Ante 把协议层(protocol-shape crates)和 SDK 独立出来用 Apache 2.0 开源,核心 harness 以预编译二进制形式提供(alpha 预览期免费商用)。这种"核心闭源、周边开源"的模式在 AI 工具里不常见,有人喜欢(可验证、可控),有人介意(核心不可审计),选型时值得留意。
适合谁用
推荐给:
- 想在 CI/沙箱里跑编码 Agent 的开发者(无头模式 + 资源占用低)
- 数据敏感、必须离线开发的人(内置 llama.cpp,GGUF 即插即用)
- 不想被单一模型厂商绑定、喜欢来回切换模型的玩家
- 想自己搭 Agent harness 或编辑器插件的开发者(
ante serve+ SDK)
暂时不合适:
- 追求"开箱即用完整生态"的人——它还是 alpha 预览版,官方明说会有 breaking changes,文档和周边工具不如 Claude Code 成熟
- Windows 用户——目前只支持 macOS 和 Linux,Windows 得走 WSL
- 核心 harness 闭源这件事介意的用户
值得关注的理由
编码 Agent 赛道 2026 年已经非常拥挤,Ante 能冒出来,靠的是三个差异化点:可复现的公开基准(每个版本都绑定评测数据)、极致的资源效率(一个 15MB 二进制解决所有问题)、真正的模型/网络自由(本地模型和云端 API 一视同仁)。如果你平时用 Claude Code 或 Codex,又恰好被依赖、账号、网络这三个约束中的任何一个烦到过,花五分钟装一个试试,成本不高。
© 2026 四月
原文链接:https://www.aprilzz.com/tools/ante-offline-coding-agent
相关文章
Soup:一条命令在 4GB 笔记本 GPU 上微调 8B 模型
Layer streaming 技术让微调不再需要高端显卡:实测 Llama-3.1-8B 在 4GB 显存上跑出 119.6 tok/s,峰值占用 3.32GB,与常规运行逐位一致
Sem:基于 Git 的语义化版本控制工具——让 AI Agent 理解代码变更的真正含义
Sem 是一个建立在 Git 之上的语义化版本控制工具,用 tree-sitter 解析代码,展示函数、类、方法层面的变更,而不是行级别的 diff。AI Agent 的代码理解准确率提升 2.3 倍。
Clippy:90 年代风格的本地 LLM 界面
把 Clippy 带回桌面,但让它接入本地大模型。一个有趣的复古 UI 实验,证明了 LLM 交互可以有不同的形式。