Jak agenty AI testują hipotezy i uruchamiają testy porównawcze dzięki OpenResearch
Eksperymenty z uczeniem maszynowym i algorytmami zwykle podążają za powtarzalnym cyklem. Czytasz nowy artykuł na arXiv, wymyślasz modyfikację architektury, tworzysz nową gałąź git, uruchamiasz trenowanie i czekasz na wykresy. Jeśli pomysł się nie sprawdził, cofasz zmiany i próbujesz ponownie. Po kilku tygodniach Twoje repozytorium gromadzi tuzin porzuconych gałęzi, a w głowie masz całą masę pogmatwanych parametrów i metryk.
Zespół alphaXiv udostępnił OpenResearch (narzędzie orx). Projekt ma na celu automatyzację tego cyklu. Pomysł polega na przekształceniu agentów kodujących, takich jak Claude Code, Codex czy OpenCode, w badaczy, którzy samodzielnie analizują literaturę, modyfikują kod w izolowanych gałęziach, uruchamiają testy i logują artefakty.
Jak to działa
OpenResearch stosuje podejście local-first. Cała baza danych SQLite, historia uruchomień, logi i drzewo eksperymentów znajdują się lokalnie na Twojej maszynie. Kod źródłowy jest napisany w Rust, więc CLI działa szybko i nie wymaga ciężkiego środowiska uruchomieniowego.
Twórcy oferują konto w chmurze wyłącznie do współpracy zespołowej lub wynajęcia swojej puli wstępnie skonfigurowanych serwerów. W przypadku osobistych uruchomień nic nie musi być wysyłane w żadne miejsce.
Narzędzie rozwiązuje cztery główne wyzwania automatyzacji badań:
- Równoległe gałęzie poprzez git worktree. Jeśli zlecisz agentowi wiele zadań jednocześnie, projekt nie zamieni się w chaos konfliktów. Każdy kierunek otrzymuje izolowane drzewo robocze.
- Drzewo eksperymentów. Każde uruchomienie jest ściśle powiązane z commitem, diffami, metrykami i wygenerowanymi plikami. Wyniki są zapisywane w niezmiennej formie.
- Elastyczny wybór infrastruktury. Ten sam snapshot kodu działa na lokalnym CPU, zdalnym serwerze przez SSH lub w klastrach Slurm, Ray, Kubernetes i Modal.
- Integracja ze źródłami naukowymi. Agent może wyszukiwać artykuły po słowach kluczowych i pobierać publikacje bezpośrednio przez DOI lub identyfikator arXiv.
Uruchamianie workspace'a
Możesz zainstalować narzędzie na macOS lub Linuxie za pomocą skryptu terminalowego:
curl -LsSf https://openresearch.sh/install.sh | sh
orx up
Polecenie orx up uruchamia lokalny serwer i otwiera panel webowy pod adresem http://127.0.0.1:4791. Jeśli wolisz interfejsy graficzne bez korzystania z przeglądarki, projekt oferuje gotową aplikację desktopową.
Gdy potrzebujesz uruchomić ciężkie obliczenia na zdalnej maszynie z GPU, workspace uruchamia się przez SSH:
orx up --remote user@gpu-box
W tym trybie usługa nasłuchuje na lokalnym interfejsie na zdalnym serwerze. Nie trzeba otwierać portów na zewnątrz. Ale weź pod uwagę jedną kwestię: na zdalnej instancji nie ma wbudowanego uwierzytelniania, więc każdy użytkownik mający dostęp do tej maszyny będzie mógł połączyć się z otwartym portem.
Podłączanie agentów
Aby wyposażyć używanego agenta w polecenia do pracy z repozytorium, uruchom instalację umiejętności:
orx install-skills
Po tym agent zaczyna rozumieć kontekst zadań badawczych i wykonuje określone polecenia:
# Поиск релевантных статей
orx discover keyword "mixture of experts routing"
# Загрузка конкретной публикации
orx paper 2401.12345
# Запуск эксперимента и просмотр логов
orx exp run exp_01h8abc
orx logs run_01h8xyz
W trybie autonomicznego wyszukiwania (autoresearch) agent sam formułuje hipotezę, wprowadza zmiany w kodzie, uruchamia przebieg, odczytuje metryki z logów i decyduje, co robić dalej.
Prywatność i telemetria
Wersje release CLI domyślnie wysyłają zanonimizowane statystyki użycia, posolone losowym identyfikatorem instalacji. Nie obejmują one ścieżek plików, nazw repozytoriów, tokenów ani treści promptów.
Jeśli nie potrzebujesz zbierania metryk, telemetrię można łatwo wyłączyć jednym poleceniem:
orx telemetry off
W kompilacjach tworzonych bezpośrednio z kodu źródłowego wysyłanie analityki jest domyślnie wyłączone.
Ograniczenia i zastrzeżenia
Projekt jest świeży, z około 600 gwiazdkami w repozytorium. Dokumentacja jest w niektórych miejscach zwięzła, więc będziesz musiał zajrzeć do kodu, aby zrozumieć przeznaczenie niektórych parametrów.
Druga kwestia dotyczy autonomicznych cykli. Jeśli zostawisz agenta bez nadzoru na noc, może łatwo wydać całą pulę Twojego salda API, utknąwszy przy próbie naprawy niezgodności bibliotek w testach. Mądrzej jest najpierw przetestować konfigurację na krótkich iteracjach z wyraźnymi limitami liczby kroków.
Dla kogo jest ten projekt
OpenResearch warto wypróbować inżynierom ML i badaczom, którzy są zmęczeni ręcznym utrzymywaniem arkuszy kalkulacyjnych z wynikami uruchomień i przełączaniem gałęzi w Git. Narzędzie zapewnia wygodne ramy, które łączą terminal, zdalne wykonywanie kodu i umiejętności czytania artykułów w jeden workflow.
Kod źródłowy jest otwarty na licencji MIT, a repozytorium jest dostępne na GitHubie: alphaXiv/openresearch-cli.
Powiązane projekty