Kalibracja sędziego LLM wobec ocen ludzi: protokół, który kończy się decyzją dla każdego kryterium
Kalibracja sędziego LLM to pomiar, jak często model użyty jako sędzia (LLM-as-a-judge) zgadza się z przeszkolonymi oceniającymi na tych samych wynikach, kryterium po kryterium, zanim jego oceny zaczną decydować o wydaniu. Sędzia jest drugim modelem z własnymi, opisanymi w badaniach uprzedzeniami, więc potrzebuje tych samych dowodów co system, który ocenia.
dfzoo AI Engineering kalibruje sędziów LLM wobec ocen ludzi dla zespołów inżynierskich, które już prowadzą automatyczną ewaluację i nie potrafią powiedzieć, czy oceny sędziego zgadzają się z ocenami ich własnych recenzentów. Protokół buduje zbiór odniesienia oceniony niezależnie przez co najmniej dwie osoby według uzgodnionych kryteriów, mierzy zgodność między ludźmi, zanim zmierzy sędziego, i daje macierz pomyłek per kryterium razem z testem pozycji i długości. Wynikiem jest pisemna decyzja dla każdego kryterium: sędzia decyduje sam, sędzia sortuje i kieruje rozbieżności do człowieka, albo kryterium zostaje przy ludziach do czasu poprawy jego opisu. Klient zostaje ze zbiorem kalibracyjnym, raportem zgodności i procedurą rekalibracji, uruchamianą przy każdej zmianie modelu sędziego, jego promptu albo kryteriów, także na ruchu produkcyjnym po wdrożeniu.
Dla kogo jest ten przewodnik.
- CTO i szefowie inżynierii, u których bramką wydania jest ocena sędziego LLM i których klient albo audytor zapytał, dlaczego tej liczbie wierzyć
- Zespoły, które przetestowały kilka narzędzi ewaluacyjnych, wpięły sędziego w CI i dalej przeglądają wyniki ręcznie, bo nikt nie ufa liczbie
- Inżynierowie platformy i ML, którzy zmienili model sędziego albo jego prompt i zobaczyli, że odsetek zaliczeń się przesunął bez żadnej zmiany w produkcie
- Właściciele produktów z agentami na produkcji, którzy potrzebują ewaluacji po wdrożeniu, a mają tylko benchmark sprzed startu
Dlaczego sędzia w ogóle wymaga kalibracji
Sędzia LLM to model językowy, który dostaje wynik innego modelu i kryteria, i ma wystawić ocenę. Dziedziczy wszystko, co sprawia, że modele językowe trudno oceniać, a badania nazywają to precyzyjnie. Zheng i współautorzy (2023), autorzy MT-Bench i Chatbot Arena, wymieniają uprzedzenie do pozycji, do długości i do własnych odpowiedzi oraz ograniczoną zdolność rozumowania. Wang i współautorzy (2023) odwrócili ranking dwóch odpowiedzi samą zmianą ich kolejności w prompcie: Vicuna-13B wygrała z ChatGPT w 66 z 80 zapytań, gdy ChatGPT był sędzią. Saito i współautorzy (2023) zmierzyli, że GPT-4 woli dłuższe odpowiedzi bardziej niż ludzie. Panickssery, Bowman i Feng (2024) pokazali, że modele rozpoznają własne teksty i faworyzują je tym mocniej, im lepiej je rozpoznają. Ye i współautorzy (2024) skatalogowali dwanaście uprzedzeń sędziów, między innymi wobec autorytetu, większości i tonu emocjonalnego, przeoczanie błędów w rozumowaniu przy poprawnym wyniku oraz zmianę oceny po informacji, że odpowiedź była już poprawiana.
Nic z tego nie przekreśla sędziego. Ci sami Zheng i współautorzy podali, że mocny sędzia osiągnął ponad 80% zgodności z preferencjami ludzi, czyli tyle, ile ludzie osiągali między sobą. Rzecz w tym, że ten poziom jest mierzony, per zadanie, a sędzia wpięty w CI bez takiego pomiaru jest drugim systemem, którego błędów nikt nie obejrzał. W dyskusjach praktyków widać dokładnie ten stan: wyniki ocenione na oko i uznane za gotowe, sędzia z tej samej rodziny modeli oceniający własne odpowiedzi i brak jakiejkolwiek ewaluacji, gdy agent jest już na produkcji. Kalibracja zamienia ocenę sędziego z opinii w liczbę o znanym błędzie.
Najpierw ludzie: zbiór odniesienia i zgodność między oceniającymi
Sędzia może być co najwyżej tak dobry, jak etykiety, z którymi się go porównuje, więc protokół zaczyna się od ludzi i od kryteriów. Każde kryterium dostaje pisemny opis, skalę i przykłady dla każdego punktu skali. Próbkę prawdziwych wyników, pobraną z ruchu produkcyjnego albo ze zbioru testowego, ocenia niezależnie co najmniej dwóch oceniających, którzy nie widzą swoich ocen. Rozbieżności trafiają do rozstrzygnięcia i rozstrzygnięta etykieta staje się odniesieniem. Każda poprawka kryteriów wprowadzona przy rozstrzyganiu jest zapisywana, bo kryterium, którego ludzie nie umieli stosować jednakowo, jest pierwszą rzeczą do naprawy, zanim sędzia w ogóle ruszy.
Zgodność między ludźmi mierzy się per kryterium, statystyką skorygowaną o przypadek obok surowego odsetka zgodnych ocen: kappa Cohena dla dwóch oceniających, alfa Krippendorffa przy większej liczbie oceniających albo brakach, korelacja Spearmana dla skal porządkowych. McHugh (2012) zaleca podawać razem odsetek zgodności i kappę i czyta każdą kappę poniżej 0,60 jako zgodność niewystarczającą, podczas gdy starsza skala Landisa i Kocha nazywa przedział 0,41 do 0,60 umiarkowanym; protokół nie ustala jednego progu dla wszystkich, bo właściwy zależy od tego, ile w waszym produkcie kosztuje błędne zaliczenie. Wartość zgodności między ludźmi ustala natomiast sufit: od sędziego nie da się oczekiwać, że będzie zgadzał się z ludźmi częściej, niż ludzie zgadzają się między sobą w danym kryterium. Kryterium, w którym ludzie się nie zgadzają, nie nadaje się do automatyzacji, niezależnie od tego, co raportuje sędzia.
Pomiar sędziego: protokół kalibracji
Gdy zbiór odniesienia jest gotowy, sędzia ocenia tę samą próbkę, a każde z jego znanych uprzedzeń dostaje własny test. Tabela to protokół w takiej postaci, w jakiej jest wykonywany; uzasadnienie każdego wiersza jest w źródłach na końcu strony.
| Krok | Co się robi | Co to łapie | Co zostaje zapisane |
|---|---|---|---|
| Rozdzielenie rodzin | Sędzia pochodzi z innej rodziny modeli niż oceniany system, zgodnie z zaleceniem z dokumentacji ewaluacyjnej Anthropica | Faworyzowanie własnych odpowiedzi i rozpoznawanie własnego stylu | Model sędziego, identyfikator wersji, hash promptu |
| Zgodność per kryterium | Etykieta sędziego wobec rozstrzygniętej etykiety ludzi, tą samą statystyką, którą zmierzono ludzi | Kryteria, w których sędzia odstaje, choć wynik łączny wygląda dobrze | Kappa albo alfa per kryterium, obok wartości między ludźmi |
| Macierz pomyłek per kryterium | Dla każdego punktu skali: jak sędzia ocenił to, co ludzie tam umieścili | Kierunek błędu: sędzia zaliczający to, co ludzie oblali, kosztuje więcej niż odwrotnie | Jedna macierz na kryterium, z nazwanym kosztem każdej komórki |
| Zamiana pozycji | Każde porównanie parami uruchomione w obu kolejnościach | Uprzedzenie do pozycji, według kalibracji z pracy Wanga i współautorów (2023) | Udział par, w których werdykt zmienia się z kolejnością |
| Kontrola długości | Korelacja oceny sędziego z długością wyniku, zestawiona z tą samą korelacją dla etykiet ludzi | Uprzedzenie do długości | Dwa współczynniki korelacji per kryterium |
| Stabilność rozumowania | Ta sama próbka oceniona z krokiem rozumowania i bez niego, przy stałej temperaturze | Wrażliwość na tok rozumowania, niedeterminizm | Zgodność sędziego z samym sobą między przebiegami |
Decyzja dla każdego kryterium
Wynikiem kalibracji jest decyzja, spisana dla każdego kryterium, co sędziemu wolno. W praktyce wystarczają trzy warianty. Sędzia decyduje sam tam, gdzie jego zgodność z rozstrzygniętymi etykietami jest na poziomie, który ludzie osiągnęli między sobą, a macierz pomyłek pokazuje, że jego błędy wypadają po tańszej stronie. Sędzia sortuje tam, gdzie zgodność jest niższa, ale fałszywe zaliczenia są rzadkie: ocenia wszystko, a każde oblanie plus losowa próbka zaliczeń trafiają do człowieka. Kryterium zostaje przy ludziach tam, gdzie ludzie sami się nie zgodzili, i praca wraca do opisu kryterium.
Ta decyzja trafia do CI. Jeden odsetek zaliczeń dla wszystkich kryteriów zostaje zastąpiony bramkami per kryterium z różnymi właścicielami, a zbiór kalibracyjny leży obok zestawu testów, wersjonowany razem z kryteriami. Wydanie, które zmienia prompt sędziego, uruchamia kalibrację od nowa, zanim zmieni bramkę.
- Decyduje sam: zgodność na suficie ludzi, błędy po tańszej stronie; sędzia blokuje scalenie w tym kryterium.
- Sortuje i kieruje: zgodność poniżej sufitu, fałszywe zaliczenia rzadkie; sędzia segreguje, człowiek decyduje o oznaczonej części.
- Zostaje przy ludziach: ludzie nie zgadzają się między sobą; opis kryterium jest pisany od nowa i próbka oceniana ponownie, zanim sędzia dostanie kolejną szansę.
- Każda decyzja podaje kryterium, statystykę, wartość, sufit ludzi i osobę odpowiedzialną za bramkę.
Rekalibracja i ewaluacja po wdrożeniu
Skalibrowany sędzia jest skalibrowany dla jednej wersji modelu, jednego promptu i jednego zestawu kryteriów. Chen, Zaharia i Zou (2023) zmierzyli ten sam endpoint GPT-4 w marcu i w czerwcu 2023 i stwierdzili, że trafność rozpoznawania liczb pierwszych spadła z 84% do 51%, a razem z nią pogorszyło się wykonywanie instrukcji. Sędzia wywoływany przez API może zmienić się pod wami tak samo, więc model sędziego jest przypięty do identyfikatora wersji, a rekalibracja uruchamia się na cztery sygnały: zmiana modelu albo wersji sędziego, zmiana promptu sędziego, zmiana kryteriów i przesunięcie tego, co produkt wysyła, na przykład nowy język albo nowy typ zadania.
Kalibracja przed wdrożeniem to połowa pracy. Po wdrożeniu sędzia ocenia próbkę śladów z produkcji, a w stałym rytmie człowiek ocenia ponownie losowy wycinek tego, co sędzia już ocenił. Zgodność staje się szeregiem czasowym per kryterium, a spadek jest sygnałem, żeby przyjrzeć się sędziemu albo produktowi, zanim zrobią to klienci. Dokumentacja graderów OpenAI opisuje tę samą kontrolę od strony treningu: model, który nauczył się zadowalać gradera, dostaje wysokie oceny od gradera i niskie od ekspertów, a jedynym sposobem, żeby to zobaczyć, jest dalej pytać ludzi.
Gdzie to się psuje i co z tym robimy.
- 1Sędzia pochodzi z rodziny, która napisała odpowiedzi
Ten sam model albo jego brat od tego samego dostawcy generuje wynik i go ocenia. Panickssery, Bowman i Feng (2024) pokazali, że modele rozpoznają własny tekst i faworyzują go tym mocniej, im lepiej go rozpoznają, więc odsetek zaliczeń zawiera premię za styl, której żaden człowiek nie przyznał. Zespół czyta wysoką ocenę jako jakość, bo nic w pipeline nie raportuje, która rodzina co oceniła.
Co z tym robimyUruchamiamy próbkę kalibracyjną ponownie z sędzią z innej rodziny i z ukrytą tożsamością ocenianego modelu, po czym porównujemy zgodność obu sędziów z rozstrzygniętymi etykietami. Tam, gdzie sędzia z tej samej rodziny ocenia własne wyniki wyżej niż ludzie, sędzia zostaje wymieniony albo kryterium przechodzi na sortowanie. Model i wersję sędziego zapisujemy przy każdej ocenie, żeby rodzina była widoczna w każdym raporcie.
Co zostaje u was: porównanie zgodności dwóch rodzin sędziów na tej samej próbce oraz specyfikacja sędziego z modelem, wersją i hashem promptu - 2O werdykcie decyduje kolejność i długość
Porównania parami idą w stałej kolejności, a sędzia faworyzuje pierwszą albo drugą pozycję; oceny pojedynczych odpowiedzi rosną z długością niezależnie od poprawności. Wang i współautorzy (2023) odwrócili wynik benchmarku samą zmianą kolejności, a Saito i współautorzy (2023) zmierzyli, że GPT-4 woli dłuższe odpowiedzi bardziej niż ludzie. Zmiana promptu, po której produkt robi się bardziej rozwlekły, czyta się wtedy jako poprawa jakości.
Co z tym robimyKażdą ocenę parami uruchamiamy w obu kolejnościach i liczymy udział par, w których werdykt się zmienia, a dla tej samej próbki liczymy korelację oceny z długością osobno dla sędziego i dla etykiet ludzi. Pary, które się odwracają, wyłączamy z bramki do czasu poprawy promptu, a korelacja z długością, której ludzie nie mają, przenosi kryterium na sortowanie.
Co zostaje u was: wskaźnik stałości werdyktu przy zamianie pozycji i korelacja oceny z długością per kryterium, sędzia obok ludzi - 3Zgodność sędziego zmierzona wobec ocen jednej osoby
Jeden inżynier ocenia zbiór odniesienia sam, sędzia zgadza się z tymi ocenami przez większość czasu i liczba idzie w świat jako kalibracja. Nikt nie wie, czy druga osoba oceniłaby tak samo, więc wynik nie ma sufitu, względem którego dałoby się go odczytać. Gdy sędzia później rozjeżdża się z recenzentem na produkcji, nie ma jak powiedzieć, który z nich się myli.
Co z tym robimyKażdą pozycję ocenia niezależnie co najmniej dwóch oceniających, rozbieżności rozstrzygamy i podajemy statystykę zgodności między ludźmi per kryterium, zanim padnie jakakolwiek liczba o sędzim. Kryteria, w których ludzie się nie zgadzają, wracają do opisu razem z listą rozbieżności, bo to są definicje, których ludzie nie umieli zastosować, i sędziego nie da się wobec nich skalibrować.
Co zostaje u was: zbiór odniesienia z dwiema niezależnymi etykietami i etykietą rozstrzygniętą dla każdej pozycji oraz zgodność między ludźmi per kryterium - 4Jedna ocena łączna zasłania kryterium, które nie działa
Sędzia zwraca jedną liczbę na wynik albo oceny per kryterium są uśredniane do odsetka zaliczeń. Zgodność na poziomie łącznym wygląda przyzwoicie, podczas gdy w jednym kryterium, zwykle tym, którego błąd kosztuje najwięcej, sędzia zalicza to, co ludzie oblali. Średnia to zasłania, bo pozostałe kryteria są łatwe i jest ich dużo.
Co z tym robimyLiczymy zgodność i macierz pomyłek per kryterium i nazywamy koszt każdej komórki: fałszywe zaliczenie w kryterium bezpieczeństwa albo poprawności waży inaczej niż fałszywe oblanie w kryterium tonu. Każde kryterium dostaje własną decyzję i własnego właściciela bramki, a ocena łączna znika z pipeline'u.
Co zostaje u was: macierz pomyłek per kryterium z kosztem każdej komórki oraz rejestr decyzji z jednym wierszem na kryterium - 5Model sędziego się zmienił, a kalibracja nie
Sędzia jest wywoływany przez alias wskazujący bieżącą wersję u dostawcy albo jego prompt został poprawiony przy okazji innej zmiany. Chen, Zaharia i Zou (2023) udokumentowali, że zachowanie tego samego endpointu przesunęło się znacząco w ciągu trzech miesięcy. Bramka dalej zalicza albo zaczyna oblewać, a zespół debuguje produkt z powodu zmiany, która zaszła w sędzim.
Co z tym robimyPrzypinamy sędziego do identyfikatora wersji, hashujemy prompt sędziego i dodajemy test, który oblewa, gdy którekolwiek z nich zmieni się bez zapisanego przebiegu rekalibracji. Rekalibracja używa tego samego zbioru odniesienia, więc zgodność przed i po jest porównywalna wprost, a rejestr decyzji dostaje datę i nowe wartości.
Co zostaje u was: dziennik rekalibracji ze zgodnością per kryterium przed i po każdej zmianie sędziego albo kryteriów oraz przypięta wersja sędziego
Co zostaje u was.
- Zbiór kalibracyjny: próbka wyników z dwiema niezależnymi ocenami ludzi i oceną rozstrzygniętą dla każdej pozycji i kryterium, wersjonowany razem z kryteriami
- Kryteria oceny z opisami, skalami i przykładami dla każdego punktu skali, razem z poprawkami wprowadzonymi przy rozstrzyganiu i ich powodem
- Raport zgodności per kryterium: statystyki między ludźmi i sędzia wobec ludzi, macierze pomyłek z kosztem komórek, wyniki zamiany pozycji i kontroli długości
- Rejestr decyzji: dla każdego kryterium decyduje sam, sortuje i kieruje, albo zostaje przy ludziach, z wartościami stojącymi za decyzją i właścicielem bramki
- Specyfikacja sędziego: rodzina modeli, przypięta wersja, hash promptu, losowanie kolejności i temperatura, z testem w CI, który oblewa przy zmianie któregokolwiek z nich
- Procedura rekalibracji z czterema sygnałami uruchamiającymi oraz plan próbkowania produkcji z rytmem ponownej oceny i szeregiem czasowym zgodności, który zasila
Jak pracujemy.
- 11. Kryteria i zbiór odniesienia
Bierzemy kryteria, na których już opieracie bramkę, piszemy albo doprecyzowujemy opis, skalę i przykłady dla każdego z nich, i pobieramy próbkę ze śladów produkcyjnych albo z waszego zbioru testowego. Próbka jest warstwowana tak, żeby przypadki rzadkie, ale kosztowne, były obecne w liczbie, którą da się zmierzyć.
Tydzień 1-2 - 22. Ocena przez ludzi i rozstrzyganie
Dwóch oceniających z waszego zespołu, albo z naszego, jeśli wolicie parę z zewnątrz, ocenia każdą pozycję niezależnie. Rozbieżności rozstrzygamy razem z wami, zapisujemy każdą zmianę kryteriów i podajemy zgodność między ludźmi per kryterium. Kryteria, które tu nie przechodzą, wracają do kroku 1, zanim ktokolwiek dotknie sędziego.
Tydzień 2-3 - 33. Pomiar sędziego
Uruchamiamy waszego obecnego sędziego i co najmniej jednego z innej rodziny na zbiorze odniesienia, w obu kolejnościach dla pozycji porównywanych parami, z krokiem rozumowania i bez niego. Liczymy zgodność, macierze pomyłek, stałość przy zamianie pozycji i korelację z długością per kryterium.
Tydzień 3-4 - 44. Decyzja i wpięcie w CI
Piszemy z wami rejestr decyzji, zastępujemy bramkę łączną bramkami per kryterium z właścicielami, przypinamy wersję i prompt sędziego i dodajemy test, który blokuje zmianę sędziego bez zapisanej rekalibracji.
Tydzień 4-5 - 55. Przekazanie i pierwszy cykl produkcyjny
Przekazujemy zbiór kalibracyjny, raport i procedurę rekalibracji, przeprowadzamy z waszym zespołem pierwszą ponowną ocenę próbki z produkcji i zostawiamy szereg czasowy zgodności w waszym stosie observability, żeby następny spadek był widoczny bez nas.
Tydzień 5-6
Pozostałe strony z tej serii.
Forensyka cache promptów i limity wydatku
Jak przypisać koszt LLM do wywołania, sesji i funkcji, jak Anthropic, OpenAI i Google rozliczają cache promptów, co po cichu psuje prefiks i gdzie kończy się alert, a zaczyna twardy limit.
Pomiar realnego efektu AI w zespole
Dlaczego szybsze zamykanie ticketów nie jest dowodem, co zmierzyły eksperymenty z lat 2025-2026, jak zaprojektować linię bazową, pary metryk i grupę porównawczą oraz których metryk per osoba unikać.
Porównanie narzędzi do AI code review
Dlaczego rankingi dostawców narzędzi do AI code review nie są porównaniami, czego nie publikują (precyzja per klasa, komentarze spoza diffu, zmyślone ustalenia, koszt na PR) i protokół na własne PR-y.
Gdzie to zamienia się w usługę.
Ocena jakości działającej AI
Niezależna ocena tego, jak dobrze wdrożone już rozwiązanie AI faktycznie wykonuje swoją pracę.
LLM Observability
Tracing, automatyczna ewaluacja, wykrywanie dryfu - zobacz, co wasz stos agentowy faktycznie robi.
Skąd pochodzą daty i liczby.
- Zheng i in. (2023), Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena: uprzedzenie do pozycji, długości i własnych odpowiedzi; ponad 80% zgodności z ludźmi, tyle co między ludźmi
- Wang i in. (2023), Large Language Models are not Fair Evaluators: uprzedzenie do pozycji, Vicuna-13B wygrywa z ChatGPT w 66 z 80 zapytań po zmianie kolejności, kalibracja przez zamianę pozycji
- Panickssery, Bowman i Feng (2024), LLM Evaluators Recognize and Favor Their Own Generations: rozpoznawanie własnych tekstów koreluje z ich faworyzowaniem
- Saito i in. (2023), Verbosity Bias in Preference Labeling by Large Language Models: GPT-4 woli dłuższe odpowiedzi bardziej niż ludzie
- Ye i in. (2024), Justice or Prejudice? Quantifying Biases in LLM-as-a-Judge: dwanaście uprzedzeń, w tym wobec autorytetu, większości i tonu, przeoczanie błędów rozumowania i wrażliwość na informację o poprawianiu
- Chen, Zaharia i Zou (2023), How is ChatGPT's behavior changing over time?: ten sam endpoint, marzec i czerwiec 2023, rozpoznawanie liczb pierwszych z 84% do 51%
- McHugh (2012), Interrater reliability: the kappa statistic, Biochemia Medica: odsetek zgodności i kappa podawane razem; skale interpretacji
- Anthropic, Create strong empirical evaluations: ocena przez model i zalecenie, żeby oceniać innym modelem niż testowany
- OpenAI, Graders: gradery modelowe i wykrywanie grader hacking przez porównanie z ocenami ekspertów
Pytania, które zadają zespoły.
Porozmawiaj z inżynierem.
Napiszcie, na jakim etapie jesteście z sędzią LLM i jego kalibracją. Odpowiedź w jeden dzień roboczy.