>_ DevTrendszh

语言

首页

语言

板块

前端 后端 移动端 DevOps AI / ML 游戏开发 区块链 嵌入式 安全
Rust

让 AI Agent 测试假设并运行基准测试:OpenResearch

机器学习和算法实验通常遵循一个重复的循环。你在 arXiv 上阅读一篇新论文,想到一个架构修改方案,创建一个新的 git 分支,开始训练,然后等待图表。如果想法没有奏效,你就回滚更改并重试。几周后,你的仓库会积累十几个废弃的分支,你的脑子里充满了纠缠不清的参数和指标。

alphaXiv 团队发布了 OpenResearch(工具 orx)。这个项目旨在自动化这个循环。想法是将像 Claude CodeCodexOpenCode 这样的编码 Agent 转变为能够独立研究文献、在隔离分支中修改代码、运行测试并记录产物的研究者。

OpenResearch Logo

工作原理

OpenResearch 采用本地优先的方法。整个 SQLite 数据库、运行历史、日志和实验树都保存在你的机器本地。源代码使用 Rust 编写,因此 CLI 运行快速,不需要沉重的运行时环境。

开发者仅在团队协作或租用预配置服务器池时才提供云账户。对于个人运行,无需向任何地方发送数据。

该工具解决了自动化研究的四个主要挑战:

  • 通过 git worktree 实现并行分支。 如果你同时给 Agent 多个任务,项目不会变成一团冲突混乱。每个方向都有独立的工作树。
  • 实验树。 每次运行都与提交、差异、指标和生成文件紧密关联。结果以不可变形式保存。
  • 灵活的基础设施选择。 相同的代码快照可以在本地 CPU、通过 SSH 的远程服务器,或 Slurm、Ray、Kubernetes 和 Modal 集群上运行。
  • 与科学来源集成。 Agent 可以按关键词搜索论文,并通过 DOI 或 arXiv 标识符直接下载出版物。

启动工作区

你可以用终端脚本在 macOS 或 Linux 上安装该工具:

curl -LsSf https://openresearch.sh/install.sh | sh
orx up

命令 orx up 启动本地服务器并在地址 http://127.0.0.1:4791 打开 Web 仪表板。如果你偏好图形界面而不想使用浏览器,该项目提供了现成的桌面应用程序。

当需要在远程 GPU 机器上运行重型计算时,工作区通过 SSH 启动:

orx up --remote user@gpu-box

在这种模式下,服务在远程服务器上的本地接口监听。你不需要向外部开放端口。但请记住一个细节:远程实例没有内置身份验证,因此任何能访问该机器的用户都可以连接到开放端口。

连接 Agent

要为你正在使用的 Agent 提供处理仓库的命令,请运行技能安装:

orx install-skills

之后,Agent 开始理解研究任务的上下文并执行特定命令:

# Поиск релевантных статей
orx discover keyword "mixture of experts routing"

# Загрузка конкретной публикации
orx paper 2401.12345

# Запуск эксперимента и просмотр логов
orx exp run exp_01h8abc
orx logs run_01h8xyz

在自主搜索模式(autoresearch)下,Agent 自己制定假设、进行代码修改、运行测试、从日志中读取指标,并决定下一步行动。

隐私和遥测

CLI 的发布版本默认发送匿名化的使用统计数据,用随机安装 ID 进行加盐处理。这不包含文件路径、仓库名称、令牌或提示内容。

如果你不需要指标收集,可以通过一条命令轻松禁用遥测功能:

orx telemetry off

从源代码直接编译的版本默认禁用分析发送。

局限性和注意事项

该项目还很新,仓库约有 600 颗星。部分文档内容较为简洁,你需要深入代码才能理解某些参数的用途。

第二点涉及自主循环。如果你让 Agent 无人看管过夜,它很容易耗尽整个 API 令牌余额,陷入尝试修复测试中库不兼容的问题。建议先在短迭代中测试设置,并明确限制步数。

谁适合使用这个项目

OpenResearch 值得一试的对象是那些厌倦手动维护运行结果电子表格和在 Git 中切换分支的 ML 工程师和研究人员。该工具提供了一个便捷框架,将终端、远程服务器执行和论文阅读技能整合到统一的工作流中。

源代码以 MIT 许可证开源,仓库可在 GitHub 上获取:alphaXiv/openresearch-cli

相关项目