>_ DevTrendsnl

Taal

Home

Talen

Secties

Frontend Backend Mobiel DevOps AI / ML GameDev Blockchain Embedded Beveiliging
Rust

AI-agents hypotheses laten testen en benchmarks uitvoeren met OpenResearch

Machine learning en algoritmische experimenten volgen typisch een repetitieve cyclus. Je leest een nieuw artikel op arXiv, bedenkt een architectuurwijziging, maakt een nieuwe git-branch, begint met trainen en wacht op de plots. Als het idee niet werkte, maak je de wijzigingen ongedaan en probeer je het opnieuw. Na een paar weken heeft je repository een dozijn verlaten branches verzameld en zit je hoofd vol met verwarde parameters en metrieken.

Het alphaXiv-team heeft OpenResearch (utility orx) uitgebracht. Het project is bedoeld om deze cyclus te automatiseren. Het idee is om codeeragents zoals Claude Code, Codex of OpenCode om te toveren in onderzoekers die zelfstandig literatuur bestuderen, code wijzigen in geïsoleerde branches, tests uitvoeren en artifacts loggen.

OpenResearch Logo

Hoe het werkt

OpenResearch volgt een local-first benadering. De hele SQLite-database, run-historie, logs en experimentboom leven lokaal op je machine. De broncode is geschreven in Rust, dus de CLI draait snel en sleept geen zware runtime mee.

De ontwikkelaars bieden een cloudaccount alleen aan voor teampartnerschap of het huren van hun voorgeconfigureerde serverpool. Voor persoonlijke runs hoeft er niets ergens naartoe te worden gestuurd.

Het tool pakt vier hoofduitdagingen van geautomatiseerd onderzoek aan:

  • Parallelle branches via git worktree. Als je een agent meerdere taken tegelijk geeft, verandert het project niet in een rommeltje van conflicten. Elke richting krijgt een geïsoleerde working tree.
  • Experimentboom. Elke run is strikt gekoppeld aan een commit, diffs, metrieken en gegenereerde bestanden. Resultaten worden opgeslagen in onveranderlijke vorm.
  • Flexibele infrastructuurselectie. Dezelfde code-snapshot draait op een lokale CPU, een remote server via SSH, of in Slurm-, Ray-, Kubernetes- en Modal-clusters.
  • Integratie met wetenschappelijke bronnen. De agent kan zoeken naar artikelen op trefwoorden en publicaties direct downloaden via DOI of arXiv-identifier.

Een workspace starten

Je kunt de utility installeren op macOS of Linux met een terminalscript:

curl -LsSf https://openresearch.sh/install.sh | sh
orx up

Met de opdracht orx up start je een lokale server en open je het webdashboard op adres http://127.0.0.1:4791. Als je de voorkeur geeft aan grafische interfaces zonder met een browser te werken, heeft het project een kant-en-klare desktopapplicatie.

Wanneer je zware berekeningen moet uitvoeren op een remote GPU-machine, wordt de workspace gestart via SSH:

orx up --remote user@gpu-box

In deze modus luistert de service op de lokale interface op de remote server. Je hoeft geen poorten naar buiten te openen. Maar houd één detail in gedachten: er is geen ingebouwde authenticatie op het remote exemplaar, dus elke gebruiker met toegang tot die machine kan verbinden met de open poort.

Agents verbinden

Om het agent dat je gebruikt opdrachten te geven voor het werken met de repository, voer je de skills-installatie uit:

orx install-skills

Daarna begint de agent de context van onderzoekstaken te begrijpen en voert specifieke opdrachten uit:

# Поиск релевантных статей
orx discover keyword "mixture of experts routing"

# Загрузка конкретной публикации
orx paper 2401.12345

# Запуск эксперимента и просмотр логов
orx exp run exp_01h8abc
orx logs run_01h8xyz

In de autonome zoekmodus (autoresearch) formuleert de agent zelf een hypothese, brengt codewijzigingen aan, voert een run uit, leest metrieken uit logs en beslist waar het als volgende naartoe gaat.

Privacy en telemetrie

Release-builds van de CLI sturen standaard geanonimiseerde gebruiksstatistieken, gezouten met een willekeurige installatie-ID. Dit omvat geen bestandspaden, repository-namen, tokens of prompt-inhoud.

Als je geen metriekverzameling nodig hebt, kan telemetrie eenvoudig worden uitgeschakeld met één opdracht:

orx telemetry off

In builds die direct uit broncode worden gecompileerd, is het verzenden van analyses standaard uitgeschakeld.

Beperkingen en valkuilen

Het project is vers, met ongeveer 600 sterren in de repository. Documentatie is beknopt op sommige plaatsen, dus je zult in de code moeten duiken om het doel van bepaalde parameters te begrijpen.

Het tweede punt betreft autonome cycli. Als je een agent een nacht onbewaakt laat, kan hij gemakkelijk je hele API-tokenbalans uitgeven, terwijl hij probeert library-incompatibiliteiten in tests op te lossen. Het is verstandiger om eerst de setup te testen op korte iteraties met expliciete limieten op het aantal stappen.

Voor wie dit project bedoeld is

OpenResearch is de moeite waard om te proberen voor ML-engineers en onderzoekers die het beu zijn om handmatig spreadsheets met run-resultaten bij te houden en branches in Git te wisselen. Het tool biedt een handig framework dat de terminal, remote server-uitvoering en vaardigheden voor het lezen van artikelen verenigt in één workflow.

De broncode is open onder de MIT-licentie en de repository is beschikbaar op GitHub: alphaXiv/openresearch-cli.

Gerelateerde projecten