工具推荐·阅读约 2 分钟·
OpenResearch:把 Claude Code 变成研究智能体,登顶 GitHub Trending 榜首

OpenResearch:把 Claude Code 变成研究智能体,登顶 GitHub Trending 榜首

alphaXiv 团队开源的本地优先科研工作台,用 Rust 写:每个研究方向分配独立的智能体和 git worktree,实验、日志、产物全部留在本机,支持 Claude Code、Codex、OpenCode、Cursor 四种智能体。

原文来源:GitHub / alphaXiv — alphaXiv 团队开源了一个本地优先的科研工作台,把编码智能体变成能做文献调研、跑实验、追踪结果的研究智能体。

编码智能体(Claude Code、Codex 这类)现在写代码很顺手,但拿它做研究还差一层东西:研究不是线性写代码,而是同时试好几个方向、比较结果、保留中间证据,最后回头决定哪条路值得继续。OpenResearch 就是奔着这层缺口来的。

项目来自 alphaXiv 团队,用 Rust 写,6 月 7 日建仓,目前约 4,200 星,以 MIT 协议开源。9 月中旬它冲上 GitHub Trending 榜首,单日新增最高接近 900 星。

它解决什么问题

一句话概括:把"研究工作流"做成智能体可以管理的一等对象。

能力具体做法
并行探索每个研究方向分配独立的智能体会话和隔离的 git worktree
实验可复现变体记录在 git 原生的实验树里,每次运行都绑定一份不可变的 commit 存档
证据留在上下文里日志、diff、文件、结果、产物都与产生它的那次工作绑定
智能体自选Claude Code、Codex、OpenCode、Cursor 任选,每次会话可单独指定 harness(智能体运行框架)和模型
算力自选本机、自己的服务器、托管算力都行
本地所有权项目、对话、实验、运行记录、日志、代码、产物都留在你的机器上

—— 广告 ——

Autoresearch:让智能体自己跑循环

OpenResearch 支持把整个研究闭环交给智能体自主执行:提出想法、改代码、启动实验、检查证据、决定下一步试什么。多个智能体可以并行探索不同方向,实验树负责保留它们各自的谱系,方便回溯是哪条路径产出了什么结果。

这个设计的好处不在于"全自动出论文",而在于把失败路径也记录下来了。做研究最贵的信息往往是"这条路走不通",如果试错了没人记,下一个智能体(或者下周的你)会再撞一次。

安装与基本用法

macOS 和 Linux 上先装 CLI,再启动:

code
curl -LsSf https://openresearch.sh/install.sh | sh
orx up

Windows 需要先装 Git for Windows,再下载对应的压缩包。

常用命令:

code
orx projects
orx project view <project-id>
orx runs <project-id>
orx logs <run-id>
orx exp run <experiment-id>
orx discover keyword <query>
orx paper <arxiv-id-or-doi>

orx paper 可以直接按 arXiv ID 或 DOI 拉论文,orx discover 按关键词找相关文献。如果想把 OpenResearch 的技能(skill)装进现有的编码智能体,跑 orx install-skills 即可。

跑在哪儿

同一份 commit 快照可以本地跑、通过 SSH 跑,也可以跑在 Slurm、Kubernetes、Ray、Hugging Face Jobs、Modal、Tinker 上。一个典型的场景是"笔记本上开浏览器,计算跑在远端 GPU 上":

code
orx up --remote user@host

不需要把仓库发到公开平台。这里有个安全提示值得留意:远端服务只绑在 loopback 上,并且没有应用层鉴权,所以那台机器上的其他用户是可以访问到它的。多人环境里用,需要自己再套一层访问控制。

本地优先和遥测

OpenResearch 跑在 127.0.0.1,数据存在本地 SQLite 里。创建项目或启动一次运行,都不会把代码发布出去。账号只用于组织协作和托管算力这类平台侧能力。

官方发布版会发送粗粒度的使用事件,绑定一个随机安装 ID,内容不包含代码、prompt、文件内容或路径、仓库名、token、邮箱、项目与实验标识。想关掉可以执行:

code
orx telemetry off

从源码构建的开发版本不发送这些数据。

实验树到底记了什么

这个项目的核心抽象是 git 原生的实验树。理解它最好的方式是把它当成一个专门为"试错"设计的提交图。

普通 git 里,你想试两个方案,通常要开两个分支、来回切、最后手工比较。实验树把这件事结构化:每个方向是一条分支,每次运行都绑定一份不可变的 commit 存档。存档的意思是,哪怕你后来 rebase 了、amend 了,那次运行对应的代码状态也还能被还原出来。

这套设计解决的问题是"我上周跑的这组数,到底是哪个版本的代码跑出来的"。做过调参或消融实验的人都知道,这个问题的答案经常找不回来——不是因为没有记录,而是记录散在终端历史、临时文件和各种 _v2_final 命名里。把运行和 commit 绑定之后,日志、diff、输出文件、产物都能顺着这个绑定关系追溯。

和现有工具的区别

值得说清楚的是它不是什么。

它不是模型训练框架,不管 GPU 调度和分布式训练;也不是实验跟踪服务(比如把指标传到云端的那些平台)。它在的位置比这两者都靠上:负责编排"谁去试哪个方向"和"试出来的东西怎么组织"。

和通用编码智能体的差别在于并行和记忆。普通用法是你在一个会话里跟模型来回聊,上下文越长越乱;OpenResearch 把每个方向隔离成独立会话加独立 worktree,好处是互不污染,坏处是你要接受"智能体在几个目录里同时改代码"这件事。第一次用需要适应一下,尤其是习惯了单线程工作流的人。

已知的限制

从仓库信息看,有几个地方值得提前知道。

Windows 支持还是 beta,需要先装 Git for Windows。远端模式的服务没有应用层鉴权,只靠绑定 loopback 限制访问——在同一台机器上有其他用户的环境里,这一层防护是不够的。另外项目 6 月才建仓,三个月做到 4,200 星的速度很快,但也意味着接口和命令还有变动的可能。生产环境接之前,先锁一个版本。

适合谁

如果你在做的是"需要反复试错、要比较多个方案"的技术工作——调模型、做消融实验、复现论文、给系统做性能寻优——OpenResearch 提供的那套实验树加证据绑定,比在聊天窗口里手动复制粘贴要靠谱得多。

如果你只是想让智能体帮你改一个 bug、写一个脚本,那用它属于杀鸡用牛刀,直接开 Claude Code 就行。它真正对标的场景是"研究的项目管理",而这恰恰是目前编码智能体都没认真解决的一块。

分享到
微博Twitter

© 2026 四月

原文链接:https://www.aprilzz.com/tools/openresearch-research-agents