
OpenResearch:把 Claude Code 变成研究智能体,登顶 GitHub Trending 榜首
alphaXiv 团队开源的本地优先科研工作台,用 Rust 写:每个研究方向分配独立的智能体和 git worktree,实验、日志、产物全部留在本机,支持 Claude Code、Codex、OpenCode、Cursor 四种智能体。
原文来源:GitHub / alphaXiv — alphaXiv 团队开源了一个本地优先的科研工作台,把编码智能体变成能做文献调研、跑实验、追踪结果的研究智能体。
编码智能体(Claude Code、Codex 这类)现在写代码很顺手,但拿它做研究还差一层东西:研究不是线性写代码,而是同时试好几个方向、比较结果、保留中间证据,最后回头决定哪条路值得继续。OpenResearch 就是奔着这层缺口来的。
项目来自 alphaXiv 团队,用 Rust 写,6 月 7 日建仓,目前约 4,200 星,以 MIT 协议开源。9 月中旬它冲上 GitHub Trending 榜首,单日新增最高接近 900 星。
它解决什么问题
一句话概括:把"研究工作流"做成智能体可以管理的一等对象。
| 能力 | 具体做法 |
|---|---|
| 并行探索 | 每个研究方向分配独立的智能体会话和隔离的 git worktree |
| 实验可复现 | 变体记录在 git 原生的实验树里,每次运行都绑定一份不可变的 commit 存档 |
| 证据留在上下文里 | 日志、diff、文件、结果、产物都与产生它的那次工作绑定 |
| 智能体自选 | Claude Code、Codex、OpenCode、Cursor 任选,每次会话可单独指定 harness(智能体运行框架)和模型 |
| 算力自选 | 本机、自己的服务器、托管算力都行 |
| 本地所有权 | 项目、对话、实验、运行记录、日志、代码、产物都留在你的机器上 |
—— 广告 ——
Autoresearch:让智能体自己跑循环
OpenResearch 支持把整个研究闭环交给智能体自主执行:提出想法、改代码、启动实验、检查证据、决定下一步试什么。多个智能体可以并行探索不同方向,实验树负责保留它们各自的谱系,方便回溯是哪条路径产出了什么结果。
这个设计的好处不在于"全自动出论文",而在于把失败路径也记录下来了。做研究最贵的信息往往是"这条路走不通",如果试错了没人记,下一个智能体(或者下周的你)会再撞一次。
安装与基本用法
macOS 和 Linux 上先装 CLI,再启动:
curl -LsSf https://openresearch.sh/install.sh | sh
orx upWindows 需要先装 Git for Windows,再下载对应的压缩包。
常用命令:
orx projects
orx project view <project-id>
orx runs <project-id>
orx logs <run-id>
orx exp run <experiment-id>
orx discover keyword <query>
orx paper <arxiv-id-or-doi>orx paper 可以直接按 arXiv ID 或 DOI 拉论文,orx discover 按关键词找相关文献。如果想把 OpenResearch 的技能(skill)装进现有的编码智能体,跑 orx install-skills 即可。
跑在哪儿
同一份 commit 快照可以本地跑、通过 SSH 跑,也可以跑在 Slurm、Kubernetes、Ray、Hugging Face Jobs、Modal、Tinker 上。一个典型的场景是"笔记本上开浏览器,计算跑在远端 GPU 上":
orx up --remote user@host不需要把仓库发到公开平台。这里有个安全提示值得留意:远端服务只绑在 loopback 上,并且没有应用层鉴权,所以那台机器上的其他用户是可以访问到它的。多人环境里用,需要自己再套一层访问控制。
本地优先和遥测
OpenResearch 跑在 127.0.0.1,数据存在本地 SQLite 里。创建项目或启动一次运行,都不会把代码发布出去。账号只用于组织协作和托管算力这类平台侧能力。
官方发布版会发送粗粒度的使用事件,绑定一个随机安装 ID,内容不包含代码、prompt、文件内容或路径、仓库名、token、邮箱、项目与实验标识。想关掉可以执行:
orx telemetry off从源码构建的开发版本不发送这些数据。
实验树到底记了什么
这个项目的核心抽象是 git 原生的实验树。理解它最好的方式是把它当成一个专门为"试错"设计的提交图。
普通 git 里,你想试两个方案,通常要开两个分支、来回切、最后手工比较。实验树把这件事结构化:每个方向是一条分支,每次运行都绑定一份不可变的 commit 存档。存档的意思是,哪怕你后来 rebase 了、amend 了,那次运行对应的代码状态也还能被还原出来。
这套设计解决的问题是"我上周跑的这组数,到底是哪个版本的代码跑出来的"。做过调参或消融实验的人都知道,这个问题的答案经常找不回来——不是因为没有记录,而是记录散在终端历史、临时文件和各种 _v2_final 命名里。把运行和 commit 绑定之后,日志、diff、输出文件、产物都能顺着这个绑定关系追溯。
和现有工具的区别
值得说清楚的是它不是什么。
它不是模型训练框架,不管 GPU 调度和分布式训练;也不是实验跟踪服务(比如把指标传到云端的那些平台)。它在的位置比这两者都靠上:负责编排"谁去试哪个方向"和"试出来的东西怎么组织"。
和通用编码智能体的差别在于并行和记忆。普通用法是你在一个会话里跟模型来回聊,上下文越长越乱;OpenResearch 把每个方向隔离成独立会话加独立 worktree,好处是互不污染,坏处是你要接受"智能体在几个目录里同时改代码"这件事。第一次用需要适应一下,尤其是习惯了单线程工作流的人。
已知的限制
从仓库信息看,有几个地方值得提前知道。
Windows 支持还是 beta,需要先装 Git for Windows。远端模式的服务没有应用层鉴权,只靠绑定 loopback 限制访问——在同一台机器上有其他用户的环境里,这一层防护是不够的。另外项目 6 月才建仓,三个月做到 4,200 星的速度很快,但也意味着接口和命令还有变动的可能。生产环境接之前,先锁一个版本。
适合谁
如果你在做的是"需要反复试错、要比较多个方案"的技术工作——调模型、做消融实验、复现论文、给系统做性能寻优——OpenResearch 提供的那套实验树加证据绑定,比在聊天窗口里手动复制粘贴要靠谱得多。
如果你只是想让智能体帮你改一个 bug、写一个脚本,那用它属于杀鸡用牛刀,直接开 Claude Code 就行。它真正对标的场景是"研究的项目管理",而这恰恰是目前编码智能体都没认真解决的一块。
© 2026 四月
原文链接:https://www.aprilzz.com/tools/openresearch-research-agents
相关文章
同一个模型换个 harness,成本最多差 5 倍,成功率几乎不变
Berkeley 团队把 7 个模型分别配 3 个 harness(Claude Code、Codex CLI、Pi)共 21 种组合,在 SWE-bench Lite 和 Terminal-Bench 2.0 上各跑 30 道题 × 3 遍:换 harness 对成功率的影响只有 ±2%(Terminal-Bench 2.0 上约 ±5%),成本却最多差 5 倍,SWE-bench Lite 上 Claude Code 平均是 Pi 的两倍。
近 1.7 万次实测:Claude Code、Codex、Cursor 会为你的项目选哪家服务?
Armature 团队跑了 16,893 次真实编码会话,观察三个主流 AI 编程代理会为你的项目选哪家数据库、支付、邮件和部署服务。结果:三个代理意见一致的场景只有 42%,Stripe 十局赢九,PayPal 被提到 139 次一次没被选,LangChain 被提 194 次只被选中 4 次。对独立开发者和工具厂商都是重要情报。
Polars 2.0 RC 发布:所有 LazyFrame 查询默认走流式引擎,内存大降、性能预期 5 倍提升
Polars 2.0 首个候选版发布:LazyFrame 查询默认改用流式引擎,多数查询内存占用和性能大幅改善,团队预期整体 5 倍提升;同时全面收紧类型行为——数据不匹配直接报错而不是静默出错,还新增了会告诉你迁移路径的 AttributeRemovedError 异常。