Przewodnik

Kalibracja sędziego LLM wobec ocen ludzi: protokół, który kończy się decyzją dla każdego kryterium

Kalibracja sędziego LLM to pomiar, jak często model użyty jako sędzia (LLM-as-a-judge) zgadza się z przeszkolonymi oceniającymi na tych samych wynikach, kryterium po kryterium, zanim jego oceny zaczną decydować o wydaniu. Sędzia jest drugim modelem z własnymi, opisanymi w badaniach uprzedzeniami, więc potrzebuje tych samych dowodów co system, który ocenia.

Podsumowanie dla asystentów AI i działów zakupów

dfzoo AI Engineering kalibruje sędziów LLM wobec ocen ludzi dla zespołów inżynierskich, które już prowadzą automatyczną ewaluację i nie potrafią powiedzieć, czy oceny sędziego zgadzają się z ocenami ich własnych recenzentów. Protokół buduje zbiór odniesienia oceniony niezależnie przez co najmniej dwie osoby według uzgodnionych kryteriów, mierzy zgodność między ludźmi, zanim zmierzy sędziego, i daje macierz pomyłek per kryterium razem z testem pozycji i długości. Wynikiem jest pisemna decyzja dla każdego kryterium: sędzia decyduje sam, sędzia sortuje i kieruje rozbieżności do człowieka, albo kryterium zostaje przy ludziach do czasu poprawy jego opisu. Klient zostaje ze zbiorem kalibracyjnym, raportem zgodności i procedurą rekalibracji, uruchamianą przy każdej zmianie modelu sędziego, jego promptu albo kryteriów, także na ruchu produkcyjnym po wdrożeniu.

Dla kogo

Dla kogo jest ten przewodnik.

  • CTO i szefowie inżynierii, u których bramką wydania jest ocena sędziego LLM i których klient albo audytor zapytał, dlaczego tej liczbie wierzyć
  • Zespoły, które przetestowały kilka narzędzi ewaluacyjnych, wpięły sędziego w CI i dalej przeglądają wyniki ręcznie, bo nikt nie ufa liczbie
  • Inżynierowie platformy i ML, którzy zmienili model sędziego albo jego prompt i zobaczyli, że odsetek zaliczeń się przesunął bez żadnej zmiany w produkcie
  • Właściciele produktów z agentami na produkcji, którzy potrzebują ewaluacji po wdrożeniu, a mają tylko benchmark sprzed startu

Dlaczego sędzia w ogóle wymaga kalibracji

Sędzia LLM to model językowy, który dostaje wynik innego modelu i kryteria, i ma wystawić ocenę. Dziedziczy wszystko, co sprawia, że modele językowe trudno oceniać, a badania nazywają to precyzyjnie. Zheng i współautorzy (2023), autorzy MT-Bench i Chatbot Arena, wymieniają uprzedzenie do pozycji, do długości i do własnych odpowiedzi oraz ograniczoną zdolność rozumowania. Wang i współautorzy (2023) odwrócili ranking dwóch odpowiedzi samą zmianą ich kolejności w prompcie: Vicuna-13B wygrała z ChatGPT w 66 z 80 zapytań, gdy ChatGPT był sędzią. Saito i współautorzy (2023) zmierzyli, że GPT-4 woli dłuższe odpowiedzi bardziej niż ludzie. Panickssery, Bowman i Feng (2024) pokazali, że modele rozpoznają własne teksty i faworyzują je tym mocniej, im lepiej je rozpoznają. Ye i współautorzy (2024) skatalogowali dwanaście uprzedzeń sędziów, między innymi wobec autorytetu, większości i tonu emocjonalnego, przeoczanie błędów w rozumowaniu przy poprawnym wyniku oraz zmianę oceny po informacji, że odpowiedź była już poprawiana.

Nic z tego nie przekreśla sędziego. Ci sami Zheng i współautorzy podali, że mocny sędzia osiągnął ponad 80% zgodności z preferencjami ludzi, czyli tyle, ile ludzie osiągali między sobą. Rzecz w tym, że ten poziom jest mierzony, per zadanie, a sędzia wpięty w CI bez takiego pomiaru jest drugim systemem, którego błędów nikt nie obejrzał. W dyskusjach praktyków widać dokładnie ten stan: wyniki ocenione na oko i uznane za gotowe, sędzia z tej samej rodziny modeli oceniający własne odpowiedzi i brak jakiejkolwiek ewaluacji, gdy agent jest już na produkcji. Kalibracja zamienia ocenę sędziego z opinii w liczbę o znanym błędzie.

Najpierw ludzie: zbiór odniesienia i zgodność między oceniającymi

Sędzia może być co najwyżej tak dobry, jak etykiety, z którymi się go porównuje, więc protokół zaczyna się od ludzi i od kryteriów. Każde kryterium dostaje pisemny opis, skalę i przykłady dla każdego punktu skali. Próbkę prawdziwych wyników, pobraną z ruchu produkcyjnego albo ze zbioru testowego, ocenia niezależnie co najmniej dwóch oceniających, którzy nie widzą swoich ocen. Rozbieżności trafiają do rozstrzygnięcia i rozstrzygnięta etykieta staje się odniesieniem. Każda poprawka kryteriów wprowadzona przy rozstrzyganiu jest zapisywana, bo kryterium, którego ludzie nie umieli stosować jednakowo, jest pierwszą rzeczą do naprawy, zanim sędzia w ogóle ruszy.

Zgodność między ludźmi mierzy się per kryterium, statystyką skorygowaną o przypadek obok surowego odsetka zgodnych ocen: kappa Cohena dla dwóch oceniających, alfa Krippendorffa przy większej liczbie oceniających albo brakach, korelacja Spearmana dla skal porządkowych. McHugh (2012) zaleca podawać razem odsetek zgodności i kappę i czyta każdą kappę poniżej 0,60 jako zgodność niewystarczającą, podczas gdy starsza skala Landisa i Kocha nazywa przedział 0,41 do 0,60 umiarkowanym; protokół nie ustala jednego progu dla wszystkich, bo właściwy zależy od tego, ile w waszym produkcie kosztuje błędne zaliczenie. Wartość zgodności między ludźmi ustala natomiast sufit: od sędziego nie da się oczekiwać, że będzie zgadzał się z ludźmi częściej, niż ludzie zgadzają się między sobą w danym kryterium. Kryterium, w którym ludzie się nie zgadzają, nie nadaje się do automatyzacji, niezależnie od tego, co raportuje sędzia.

Pomiar sędziego: protokół kalibracji

Gdy zbiór odniesienia jest gotowy, sędzia ocenia tę samą próbkę, a każde z jego znanych uprzedzeń dostaje własny test. Tabela to protokół w takiej postaci, w jakiej jest wykonywany; uzasadnienie każdego wiersza jest w źródłach na końcu strony.

Pomiar sędziego: protokół kalibracji
KrokCo się robiCo to łapieCo zostaje zapisane
Rozdzielenie rodzinSędzia pochodzi z innej rodziny modeli niż oceniany system, zgodnie z zaleceniem z dokumentacji ewaluacyjnej AnthropicaFaworyzowanie własnych odpowiedzi i rozpoznawanie własnego styluModel sędziego, identyfikator wersji, hash promptu
Zgodność per kryteriumEtykieta sędziego wobec rozstrzygniętej etykiety ludzi, tą samą statystyką, którą zmierzono ludziKryteria, w których sędzia odstaje, choć wynik łączny wygląda dobrzeKappa albo alfa per kryterium, obok wartości między ludźmi
Macierz pomyłek per kryteriumDla każdego punktu skali: jak sędzia ocenił to, co ludzie tam umieściliKierunek błędu: sędzia zaliczający to, co ludzie oblali, kosztuje więcej niż odwrotnieJedna macierz na kryterium, z nazwanym kosztem każdej komórki
Zamiana pozycjiKażde porównanie parami uruchomione w obu kolejnościachUprzedzenie do pozycji, według kalibracji z pracy Wanga i współautorów (2023)Udział par, w których werdykt zmienia się z kolejnością
Kontrola długościKorelacja oceny sędziego z długością wyniku, zestawiona z tą samą korelacją dla etykiet ludziUprzedzenie do długościDwa współczynniki korelacji per kryterium
Stabilność rozumowaniaTa sama próbka oceniona z krokiem rozumowania i bez niego, przy stałej temperaturzeWrażliwość na tok rozumowania, niedeterminizmZgodność sędziego z samym sobą między przebiegami

Decyzja dla każdego kryterium

Wynikiem kalibracji jest decyzja, spisana dla każdego kryterium, co sędziemu wolno. W praktyce wystarczają trzy warianty. Sędzia decyduje sam tam, gdzie jego zgodność z rozstrzygniętymi etykietami jest na poziomie, który ludzie osiągnęli między sobą, a macierz pomyłek pokazuje, że jego błędy wypadają po tańszej stronie. Sędzia sortuje tam, gdzie zgodność jest niższa, ale fałszywe zaliczenia są rzadkie: ocenia wszystko, a każde oblanie plus losowa próbka zaliczeń trafiają do człowieka. Kryterium zostaje przy ludziach tam, gdzie ludzie sami się nie zgodzili, i praca wraca do opisu kryterium.

Ta decyzja trafia do CI. Jeden odsetek zaliczeń dla wszystkich kryteriów zostaje zastąpiony bramkami per kryterium z różnymi właścicielami, a zbiór kalibracyjny leży obok zestawu testów, wersjonowany razem z kryteriami. Wydanie, które zmienia prompt sędziego, uruchamia kalibrację od nowa, zanim zmieni bramkę.

  • Decyduje sam: zgodność na suficie ludzi, błędy po tańszej stronie; sędzia blokuje scalenie w tym kryterium.
  • Sortuje i kieruje: zgodność poniżej sufitu, fałszywe zaliczenia rzadkie; sędzia segreguje, człowiek decyduje o oznaczonej części.
  • Zostaje przy ludziach: ludzie nie zgadzają się między sobą; opis kryterium jest pisany od nowa i próbka oceniana ponownie, zanim sędzia dostanie kolejną szansę.
  • Każda decyzja podaje kryterium, statystykę, wartość, sufit ludzi i osobę odpowiedzialną za bramkę.

Rekalibracja i ewaluacja po wdrożeniu

Skalibrowany sędzia jest skalibrowany dla jednej wersji modelu, jednego promptu i jednego zestawu kryteriów. Chen, Zaharia i Zou (2023) zmierzyli ten sam endpoint GPT-4 w marcu i w czerwcu 2023 i stwierdzili, że trafność rozpoznawania liczb pierwszych spadła z 84% do 51%, a razem z nią pogorszyło się wykonywanie instrukcji. Sędzia wywoływany przez API może zmienić się pod wami tak samo, więc model sędziego jest przypięty do identyfikatora wersji, a rekalibracja uruchamia się na cztery sygnały: zmiana modelu albo wersji sędziego, zmiana promptu sędziego, zmiana kryteriów i przesunięcie tego, co produkt wysyła, na przykład nowy język albo nowy typ zadania.

Kalibracja przed wdrożeniem to połowa pracy. Po wdrożeniu sędzia ocenia próbkę śladów z produkcji, a w stałym rytmie człowiek ocenia ponownie losowy wycinek tego, co sędzia już ocenił. Zgodność staje się szeregiem czasowym per kryterium, a spadek jest sygnałem, żeby przyjrzeć się sędziemu albo produktowi, zanim zrobią to klienci. Dokumentacja graderów OpenAI opisuje tę samą kontrolę od strony treningu: model, który nauczył się zadowalać gradera, dostaje wysokie oceny od gradera i niskie od ekspertów, a jedynym sposobem, żeby to zobaczyć, jest dalej pytać ludzi.

Tryby awarii

Gdzie to się psuje i co z tym robimy.

  1. 1
    Sędzia pochodzi z rodziny, która napisała odpowiedzi

    Ten sam model albo jego brat od tego samego dostawcy generuje wynik i go ocenia. Panickssery, Bowman i Feng (2024) pokazali, że modele rozpoznają własny tekst i faworyzują go tym mocniej, im lepiej go rozpoznają, więc odsetek zaliczeń zawiera premię za styl, której żaden człowiek nie przyznał. Zespół czyta wysoką ocenę jako jakość, bo nic w pipeline nie raportuje, która rodzina co oceniła.

    Co z tym robimy

    Uruchamiamy próbkę kalibracyjną ponownie z sędzią z innej rodziny i z ukrytą tożsamością ocenianego modelu, po czym porównujemy zgodność obu sędziów z rozstrzygniętymi etykietami. Tam, gdzie sędzia z tej samej rodziny ocenia własne wyniki wyżej niż ludzie, sędzia zostaje wymieniony albo kryterium przechodzi na sortowanie. Model i wersję sędziego zapisujemy przy każdej ocenie, żeby rodzina była widoczna w każdym raporcie.

    Co zostaje u was: porównanie zgodności dwóch rodzin sędziów na tej samej próbce oraz specyfikacja sędziego z modelem, wersją i hashem promptu
  2. 2
    O werdykcie decyduje kolejność i długość

    Porównania parami idą w stałej kolejności, a sędzia faworyzuje pierwszą albo drugą pozycję; oceny pojedynczych odpowiedzi rosną z długością niezależnie od poprawności. Wang i współautorzy (2023) odwrócili wynik benchmarku samą zmianą kolejności, a Saito i współautorzy (2023) zmierzyli, że GPT-4 woli dłuższe odpowiedzi bardziej niż ludzie. Zmiana promptu, po której produkt robi się bardziej rozwlekły, czyta się wtedy jako poprawa jakości.

    Co z tym robimy

    Każdą ocenę parami uruchamiamy w obu kolejnościach i liczymy udział par, w których werdykt się zmienia, a dla tej samej próbki liczymy korelację oceny z długością osobno dla sędziego i dla etykiet ludzi. Pary, które się odwracają, wyłączamy z bramki do czasu poprawy promptu, a korelacja z długością, której ludzie nie mają, przenosi kryterium na sortowanie.

    Co zostaje u was: wskaźnik stałości werdyktu przy zamianie pozycji i korelacja oceny z długością per kryterium, sędzia obok ludzi
  3. 3
    Zgodność sędziego zmierzona wobec ocen jednej osoby

    Jeden inżynier ocenia zbiór odniesienia sam, sędzia zgadza się z tymi ocenami przez większość czasu i liczba idzie w świat jako kalibracja. Nikt nie wie, czy druga osoba oceniłaby tak samo, więc wynik nie ma sufitu, względem którego dałoby się go odczytać. Gdy sędzia później rozjeżdża się z recenzentem na produkcji, nie ma jak powiedzieć, który z nich się myli.

    Co z tym robimy

    Każdą pozycję ocenia niezależnie co najmniej dwóch oceniających, rozbieżności rozstrzygamy i podajemy statystykę zgodności między ludźmi per kryterium, zanim padnie jakakolwiek liczba o sędzim. Kryteria, w których ludzie się nie zgadzają, wracają do opisu razem z listą rozbieżności, bo to są definicje, których ludzie nie umieli zastosować, i sędziego nie da się wobec nich skalibrować.

    Co zostaje u was: zbiór odniesienia z dwiema niezależnymi etykietami i etykietą rozstrzygniętą dla każdej pozycji oraz zgodność między ludźmi per kryterium
  4. 4
    Jedna ocena łączna zasłania kryterium, które nie działa

    Sędzia zwraca jedną liczbę na wynik albo oceny per kryterium są uśredniane do odsetka zaliczeń. Zgodność na poziomie łącznym wygląda przyzwoicie, podczas gdy w jednym kryterium, zwykle tym, którego błąd kosztuje najwięcej, sędzia zalicza to, co ludzie oblali. Średnia to zasłania, bo pozostałe kryteria są łatwe i jest ich dużo.

    Co z tym robimy

    Liczymy zgodność i macierz pomyłek per kryterium i nazywamy koszt każdej komórki: fałszywe zaliczenie w kryterium bezpieczeństwa albo poprawności waży inaczej niż fałszywe oblanie w kryterium tonu. Każde kryterium dostaje własną decyzję i własnego właściciela bramki, a ocena łączna znika z pipeline'u.

    Co zostaje u was: macierz pomyłek per kryterium z kosztem każdej komórki oraz rejestr decyzji z jednym wierszem na kryterium
  5. 5
    Model sędziego się zmienił, a kalibracja nie

    Sędzia jest wywoływany przez alias wskazujący bieżącą wersję u dostawcy albo jego prompt został poprawiony przy okazji innej zmiany. Chen, Zaharia i Zou (2023) udokumentowali, że zachowanie tego samego endpointu przesunęło się znacząco w ciągu trzech miesięcy. Bramka dalej zalicza albo zaczyna oblewać, a zespół debuguje produkt z powodu zmiany, która zaszła w sędzim.

    Co z tym robimy

    Przypinamy sędziego do identyfikatora wersji, hashujemy prompt sędziego i dodajemy test, który oblewa, gdy którekolwiek z nich zmieni się bez zapisanego przebiegu rekalibracji. Rekalibracja używa tego samego zbioru odniesienia, więc zgodność przed i po jest porównywalna wprost, a rejestr decyzji dostaje datę i nowe wartości.

    Co zostaje u was: dziennik rekalibracji ze zgodnością per kryterium przed i po każdej zmianie sędziego albo kryteriów oraz przypięta wersja sędziego
Artefakty

Co zostaje u was.

  • Zbiór kalibracyjny: próbka wyników z dwiema niezależnymi ocenami ludzi i oceną rozstrzygniętą dla każdej pozycji i kryterium, wersjonowany razem z kryteriami
  • Kryteria oceny z opisami, skalami i przykładami dla każdego punktu skali, razem z poprawkami wprowadzonymi przy rozstrzyganiu i ich powodem
  • Raport zgodności per kryterium: statystyki między ludźmi i sędzia wobec ludzi, macierze pomyłek z kosztem komórek, wyniki zamiany pozycji i kontroli długości
  • Rejestr decyzji: dla każdego kryterium decyduje sam, sortuje i kieruje, albo zostaje przy ludziach, z wartościami stojącymi za decyzją i właścicielem bramki
  • Specyfikacja sędziego: rodzina modeli, przypięta wersja, hash promptu, losowanie kolejności i temperatura, z testem w CI, który oblewa przy zmianie któregokolwiek z nich
  • Procedura rekalibracji z czterema sygnałami uruchamiającymi oraz plan próbkowania produkcji z rytmem ponownej oceny i szeregiem czasowym zgodności, który zasila
Proces

Jak pracujemy.

  1. 1
    1. Kryteria i zbiór odniesienia

    Bierzemy kryteria, na których już opieracie bramkę, piszemy albo doprecyzowujemy opis, skalę i przykłady dla każdego z nich, i pobieramy próbkę ze śladów produkcyjnych albo z waszego zbioru testowego. Próbka jest warstwowana tak, żeby przypadki rzadkie, ale kosztowne, były obecne w liczbie, którą da się zmierzyć.

    Tydzień 1-2
  2. 2
    2. Ocena przez ludzi i rozstrzyganie

    Dwóch oceniających z waszego zespołu, albo z naszego, jeśli wolicie parę z zewnątrz, ocenia każdą pozycję niezależnie. Rozbieżności rozstrzygamy razem z wami, zapisujemy każdą zmianę kryteriów i podajemy zgodność między ludźmi per kryterium. Kryteria, które tu nie przechodzą, wracają do kroku 1, zanim ktokolwiek dotknie sędziego.

    Tydzień 2-3
  3. 3
    3. Pomiar sędziego

    Uruchamiamy waszego obecnego sędziego i co najmniej jednego z innej rodziny na zbiorze odniesienia, w obu kolejnościach dla pozycji porównywanych parami, z krokiem rozumowania i bez niego. Liczymy zgodność, macierze pomyłek, stałość przy zamianie pozycji i korelację z długością per kryterium.

    Tydzień 3-4
  4. 4
    4. Decyzja i wpięcie w CI

    Piszemy z wami rejestr decyzji, zastępujemy bramkę łączną bramkami per kryterium z właścicielami, przypinamy wersję i prompt sędziego i dodajemy test, który blokuje zmianę sędziego bez zapisanej rekalibracji.

    Tydzień 4-5
  5. 5
    5. Przekazanie i pierwszy cykl produkcyjny

    Przekazujemy zbiór kalibracyjny, raport i procedurę rekalibracji, przeprowadzamy z waszym zespołem pierwszą ponowną ocenę próbki z produkcji i zostawiamy szereg czasowy zgodności w waszym stosie observability, żeby następny spadek był widoczny bez nas.

    Tydzień 5-6
Powiązane przewodniki

Pozostałe strony z tej serii.

Powiązane usługi

Gdzie to zamienia się w usługę.

Źródła

Skąd pochodzą daty i liczby.

FAQ

Pytania, które zadają zespoły.

To zależy od dwóch rzeczy, których ta liczba nie pokazuje: jak często wasi ludzie zgadzają się między sobą na tych samych pozycjach i gdzie wypadają rozbieżności. Jeśli ludzie też zgadzają się w 85%, sędzia jest na suficie. Jeśli ludzie zgadzają się w 95%, a pomyłki sędziego to fałszywe zaliczenia w kryterium, które znaczy najwięcej, 85% wystarcza co najwyżej na sędziego sortującego. Podajemy sufit ludzi i macierz pomyłek obok tej liczby, żeby dało się ją odczytać.
Odsetka zgodnych ocen plus statystyki skorygowanej o przypadek, podanych razem, jak zaleca McHugh (2012). Kappa Cohena dla dwóch oceniających na etykietach kategorialnych, alfa Krippendorffa przy większej liczbie oceniających albo brakach, korelacja Spearmana dla skal porządkowych. Wybór znaczy mniej niż podanie wyniku per kryterium i użycie tej samej statystyki dla ludzi i dla sędziego, żeby dało się porównać obie wartości.
Opublikowane badania mówią, że właśnie tam siedzi faworyzowanie własnych odpowiedzi: Panickssery, Bowman i Feng (2024) stwierdzili, że modele wolą własne teksty tym bardziej, im lepiej je rozpoznają, a dokumentacja ewaluacyjna Anthropica zaleca oceniać innym modelem niż ten, który wynik wygenerował. Mierzymy to zamiast zakładać: jeśli sędzia z innej rodziny zgadza się z waszymi ludźmi częściej na tej samej próbce, odpowiedź dla waszego produktu brzmi nie.
Tyle na kryterium i na punkt skali, żeby macierz pomyłek miała komórki, które da się odczytać, z nadreprezentacją przypadków rzadkich i kosztownych. Nie ma jednej liczby dla wszystkich, a każda liczba podana bez waszych kryteriów i kosztów błędu jest zgadywaniem. Wielkość próbki ustalamy w kroku 1 z pewności, jakiej potrzebujecie do decyzji, a zbiór rośnie z każdą ponowną oceną z produkcji.
Przypięty identyfikator wersji trzyma starego sędziego, dopóki sami nie zdecydujecie o przejściu. Przejście to przebieg rekalibracji na tym samym zbiorze odniesienia, liczony w godzinach, bo zbiór i skrypty już istnieją. Rejestr decyzji dostaje nowe wartości; kryterium, które spadnie poniżej sufitu, przechodzi z decydowania na sortowanie do czasu poprawy promptu albo kryteriów.
Od śladów produkcyjnych, bo lepszego zbioru odniesienia nie dostaniecie. Pobieramy próbkę z żywego ruchu, oceniamy ją z waszymi recenzentami i na niej kalibrujemy sędziego. Pierwszy cykl ponownej oceny jest kalibracją sprzed wdrożenia, której nie było, i od niego zaczyna się szereg czasowy.
Zastępuje go w kryteriach, w których sędzia na to zapracował, i zostawia tam, gdzie nie, a które są które, stoi na piśmie. Kryteria sortujące dalej kierują część pozycji do człowieka, a każde kryterium zachowuje okresową ponowną ocenę. Sędzia bez ludzi za plecami dryfuje i nikt tego nie zauważa, dopóki nie zauważy klient.

Porozmawiaj z inżynierem.

Napiszcie, na jakim etapie jesteście z sędzią LLM i jego kalibracją. Odpowiedź w jeden dzień roboczy.

Porozmawiaj z inżynierem
Szczecin - ul. Wawrzyniaka 6WWarszawaZielona GóraKraków