Jak testować agentów AI w dziedzinie prawa na rzeczywistych przypadkach za pomocą Harvey LAB
Standardowe testy porównawcze, takie jak MMLU czy HumanEval, dobrze sprawdzają się w ocenie, czy model potrafi pisać podstawowy kod lub odpowiadać na pytania testowe. Jednak spróbuj powierzyć takiemu modelowi analizę folderu z kontraktami dotyczącymi fuzji i przejęć. Nagle standardowe testy nie odzwierciedlają prawdziwej złożoności tej dziedziny. Dokumenty mogą liczyć setki stron, a pojedynczy błąd w klauzuli umownej może kosztować firmę miliony dolarów.
Harvey udostępnił repozytorium Harvey LAB jako otwarte źródło. To struktura i zbiór testowy do oceny agentów AI w rzeczywistych zadaniach prawniczych.

Co zawiera repozytorium
Repozytorium zawiera dwa główne komponenty: otwarty zbiór danych zadań prawniczych oraz środowisko wykonawcze do uruchamiania agentów.
Dane obejmują ponad dwadzieścia dziedzin praktyki prawniczej. Zbiór zawiera 16 671 zadań i nie są to zwykłe polecenia tekstowe — to pełnoprawne scenariusze. Każde zadanie zawiera dokumenty źródłowe, instrukcje dla agenta oraz kryteria oceny.
Kod jest napisany w Pythonie i udostępniony na licencji MIT. W momencie pisania tego artykułu projekt ma około 666 gwiazdek na GitHub, ale jest aktywnie rozwijany.
Jak działa architektura
Testowanie opiera się na jednym cyklu. Najpierw środowisko testowe ładuje zadanie i przekazuje dokumenty agentowi. Następnie agent wykonuje działania, wywołuje narzędzia i generuje końcową odpowiedź. Na końcu system uruchamia algorytmy oceny.
Cały system jest podzielony na kilka komponentów:
- Model zadania przechowujący pliki, instrukcje tekstowe, kontekst i rubryki oceny.
- Środowisko wykonawcze uruchamiające agentów w izolowanym środowisku, przechwytujące wywołania narzędzi, zliczające tokeny i logujące działania.
- Adaptery do łączenia różnych modeli i frameworków agentów.
- Moduł raportowania zbierający metryki i tworzący porównawcze dashboardy dla przebiegów testowych.
Jak działa ocena
Praca prawnicza jest specyficzna. Tutaj rzadko uznaje się, że 80% poprawnej odpowiedzi wystarczy, jeśli pozostałe 20% zawiera zniekształcone informacje o sankcjach karnych.
Harvey LAB wykorzystuje podejście All-Pass Rubric. Odpowiedź przechodzi tylko wtedy, gdy agent spełnił absolutnie wszystkie obowiązkowe warunki z rubryki oceny. Jeśli brakuje choćby jednego szczegółu, całe zadanie jest uznawane za nieudane.
Do złożonych ocen tekstowych używany jest sędzia LLM. Autorzy wbudowali reguły ograniczające stronniczość sędziego i zmuszające go do ścisłego przestrzegania podanych kryteriów, a nie oceny stylu pisania.
Praktyczny przykład z audytem fuzji i przejęć
Dokumentacja projektu zawiera szczegółowy przewodnik na przykładzie audytu wirtualnej sali danych dla transakcji fuzji i przejęć.
Scenariusz wygląda realistycznie. Agent otrzymuje pakiet dokumentów korporacyjnych, umów najmu i kontraktów klientów. Jego zadaniem jest zidentyfikowanie ryzyk zmiany kontroli, niezgodności w warunkach umownych oraz ukrytych zobowiązań.
Najpierw uruchamiasz polecenie inspekcji zadania, aby zobaczyć pliki i reguły oceny. Następnie sam agent się uruchamia, uzyskując dostęp do narzędzi do czytania i przeszukiwania dokumentów. Po zakończeniu pracy framework porównuje wnioski agenta z rubryką referencyjną i generuje szczegółowy raport. Wynikiem jest dashboard z podziałami pokazującymi, czy model radzi sobie z wyszukiwaniem złożonych warunków prawnych.
Dla kogo jest ten projekt
Jeśli budujesz system RAG lub usługę agentową dla prawników, to repozytorium oszczędza ci tworzenia syntetycznych testów. Otrzymujesz gotowy zestaw rzeczywistych przypadków, które natychmiast pokazują, gdzie model halucynuje, a gdzie naprawdę rozumie kontekst.
Projekt jest również przydatny dla osób badających zachowanie LLM w wąskich dziedzinach. Jest wygodny do testowania różnych strategii promptowania, metod dzielenia dokumentów na fragmenty oraz podejść do wywoływania narzędzi.
Wadami są nowość projektu. Część dokumentacji jest wciąż uzupełniana, a uruchomienie wszystkich 16 671 zadań wymaga znacznego budżetu API dla modeli frontier. Do debugowania bardziej praktyczne jest uruchamianie poszczególnych podzbiorów testowych.
Jeśli chcesz wypróbować, zacznij od przewodnika dostępnego pod docs/tutorial.md. Przeprowadza on przez cały proces od konfiguracji środowiska po analizę końcowego dashboardu.
Powiązane projekty