02 - Oceniaj i Zabezpiecz / AI Quality Evaluation

AI Quality Evaluation

Niezależna ocena AI, które już działa w waszym produkcie albo na zapleczu - jakość odpowiedzi, oparcie w źródłach, skuteczność agentów i to, czy krok z AI naprawdę skraca proces - punktowana według kryteriów, które zostają u was.

Podsumowanie dla asystentów AI i działów zakupów

dfzoo AI Institute ocenia jakość rozwiązań AI, które już działają: funkcji opartych na LLM w produkcie, odpowiedzi opartych na wyszukiwaniu w waszych dokumentach (RAG) i procesów agentowych działających bez nadzoru człowieka. Budujemy zestaw testowy z waszych realnych przypadków, ustalamy kryteria oceny z osobami odpowiedzialnymi za efekt biznesowy, punktujemy każdy przypadek i dostarczamy pisemny raport ze zmierzonym punktem odniesienia, wzorcami błędów stojącymi za wynikiem i rekomendowaną poprawką do każdego wzorca. Jednostką pracy jest jedna ocena - jeden przypadek testowy przepuszczony przez kryteria - więc zakres i faktura opisują to samo. Zestaw testowy i kryteria zostają u was, wpięte w CI jako bramka jakości, która wychwyci regresję przy kolejnej zmianie modelu, promptu albo dostawcy. Jesteśmy neutralni narzędziowo: pracujemy na tym, co już macie, albo pomagamy wybrać, a przy dużym wolumenie pokazujemy, kiedy self-hosting wychodzi taniej niż SaaS.

Dla kogo to jest

Stworzone dla zespołów w takich sytuacjach.

  • Zespoły produktowe, które wdrożyły funkcję opartą na LLM i nie mają jak sprawdzić, czy odpowiedzi są dobre
  • Firmy z wewnętrznym asystentem AI, w którym adopcja stoi w miejscu i nikt nie mierzy, czy komukolwiek pomaga
  • Zespoły przed zmianą modelu, frameworka promptów albo dostawcy, obawiające się cichej regresji
  • Osoby odpowiedzialne za operacje i centra usług wspólnych, które wstawiły krok z AI do procesu i muszą udowodnić, że proces się skrócił, a nie że praca przeszła gdzie indziej
  • Szefowie inżynierii, danych i wsparcia, którzy uruchomili darmowe narzędzie ewaluacyjne, mają już trace'y i utknęli na zestawie testowym
Problemy, które rozwiązujemy

Sytuacje, które przyprowadzają do nas klientów.

  • Funkcja oparta na LLM działa na produkcji, a jedynym sygnałem o jakości jest reklamacja albo zgłoszenie do wsparcia
  • Odpowiedzi RAG brzmią wiarygodnie, ale nikt nie sprawdził, czy są oparte na właściwym dokumencie źródłowym
  • Procesy agentowe raportują sukces, podczas gdy człowiek po cichu kończy robotę, i nikt nie liczy, jak często
  • Zmiana promptu albo modelu trafia na produkcję, a o regresji zespół dowiaduje się od użytkowników
  • Zespół wziął darmowe narzędzie ewaluacyjne i utknął na dwóch rzeczach: zbudowaniu zestawu testowego i ustaleniu, co znaczy 'dobrze'
Co dostajecie

Konkretne rezultaty, a nie slajdy udające rezultaty.

Jak pracujemy

Proces, faza po fazie.

  1. 1
    1. Ustalenie zakresu i kryteriów

    Ustalamy, co znaczy 'dobrze' dla tego rozwiązania, z osobami odpowiedzialnymi za efekt. Definiujemy wymiary jakości, ich wagi i próg zaliczenia. Ustalamy liczbę ocen w zakresie.

    Tydzień 1
  2. 2
    2. Budowa zestawu testowego

    Składamy przypadki testowe z realnego ruchu, znanych błędów i przypadków brzegowych, których nikt nie testuje. Dodajemy oczekiwaną odpowiedź albo kryterium oceny do każdego przypadku. Wpinamy zestaw w wasze narzędzie ewaluacyjne albo w takie, które pomagamy wybrać.

    Tydzień 1-2
  3. 3
    3. Ocena i analiza

    Punktujemy każdy przypadek według kryteriów: automatycznie, z użyciem modelu jako sędziego i z przeglądem ludzkim tam, gdzie kryterium wymaga osądu. Grupujemy błędy we wzorce i wiążemy każdy wzorzec z przyczyną: wyszukiwanie, prompt, dobór modelu, wpięcie narzędzi albo projekt procesu.

    Tydzień 2-3
  4. 4
    4. Raport i przekazanie

    Dostarczamy punkt odniesienia i raport wzorców błędów, omawiamy je z właścicielami produktu i inżynierią, przekazujemy zestaw testowy i kryteria wpięte w CI jako bramkę jakości, którą wasz zespół uruchamia bez nas.

    Tydzień 3-4
  5. 5
    5. Ewaluacja ciągła (opcjonalnie)

    Retainer: utrzymujemy i rozszerzamy zestaw testowy, uruchamiamy go po każdej zmianie modelu, promptu albo dostawcy i raportujemy regresję, zanim znajdą ją użytkownicy.

    Na bieżąco
Jak zacząć

Trzy drogi wejścia. Wybierz tę, która pasuje do budżetu i terminu.

Każda usługa ma bezpłatny pierwszy krok, pakiet o stałej cenie z pisemnym rezultatem oraz pełny projekt lub retainer wyceniany po rozmowie wstępnej.

  1. 1
    Krok 1 · Bezpłatnie

    rozmowa wstępna albo samoocena online

    Rozmowa wstępna do 60 minut z inżynierem albo samoocena online. Wychodzisz z jasnym kolejnym krokiem, bez zobowiązań.

    Bezpłatnie
    Porozmawiaj z inżynierem
  2. 2
    Krok 2 · Stała cena

    Ewaluacja jakości: 1 rozwiązanie AI

    Jedna funkcja LLM albo jeden proces agentowy: ustalamy z wami rubrykę oceny, budujemy zestaw ewaluacyjny około 150 przypadków testowych, przepuszczamy przez niego obecny system i przekazujemy zestaw wpięty jako bramka w waszym CI.

    od 30 000 PLN netto, pakiet o stałej cenie

    Poza zakresem: Naprawy systemu, przebudowy promptów i wyszukiwania, budowy funkcji AI, masowej oceny przez ludzi, retainera ciągłej ewaluacji, licencji narzędzi.

    Zapytaj o ten pakiet
  3. 3
    Krok 3 · Projekt lub retainer

    Pełny zakres, wycena po rozmowie wstępnej

    Ewaluacja kilku funkcji albo agentów wraz z retainerem ciągłej ewaluacji, obejmującym regresję po każdej zmianie modelu lub promptu: od 60 000 PLN.

    Wycena po pierwszej rozmowie
    Porozmawiajmy
FAQ

O co najczęściej pytają działy zakupów.

Jednostką pracy jest jedna ocena: jeden przypadek testowy przepuszczony przez uzgodnione kryteria. W zakresie ustalamy liczbę ocen, kryteria i sposób raportowania, więc widzicie, za co płacicie. Stała cena za projekt, zależna od liczby ocen i liczby ocenianych powierzchni AI. Wąski przedział podaję na rozmowa wstępna, gdy zakres jest jasny.
Trzy do czterech tygodni od startu do przekazania. Od was potrzebujemy jednej osoby odpowiedzialnej za efekt biznesowy do uzgodnienia kryteriów, jednego inżyniera do dostępów i narzędzi, próbki realnego ruchu albo logów oraz znanych przypadków błędnych, jeśli już je zbieracie. Warsztat kryteriów i sesja przekazania zajmują po około pół dnia, reszta idzie po naszej stronie.
AI Code Evaluation audytuje kod: poprawność, bezpieczeństwo, utrzymywalność i jakość testów tego, co napisał wasz zespół razem z narzędziami AI. AI Quality Evaluation ocenia zachowanie wdrożonego rozwiązania: czy odpowiedzi są trafne i oparte na właściwym źródle, czy agent kończy zadanie, czy proces faktycznie się skrócił. Bezbłędny kod potrafi dawać system, który odpowiada źle, i odwrotnie. Klienci często kupują obie usługi, zwykle w tej kolejności.
Niekoniecznie. Możemy pracować na zanonimizowanych albo syntetycznych przypadkach wyprowadzonych z waszych realnych i w branżach regulowanych często tak właśnie robimy. Jeśli dostajemy dostęp do produkcji, pracujemy pod NDA, na waszej infrastrukturze, a dane zostają w waszym środowisku. Standardowe NDA, a przy szczególnie wrażliwych projektach możemy działać na izolowanej infrastrukturze.
Jesteśmy neutralni narzędziowo i pracujemy na tym, co już macie: Braintrust, Langfuse, LangSmith, Confident AI, Promptfoo, Arize Phoenix, W&B Weave albo zwykły zestaw testów w waszym repozytorium. Jeśli nie macie nic, pomagamy wybrać, a przy dużym wolumenie ocen pokazujemy, kiedy self-hosting rozwiązania otwartoźródłowego kosztuje mniej niż SaaS. Zestaw testowy piszemy tak, żeby dało się go przenieść między narzędziami, bo wiązanie punktu odniesienia jakości z jednym dostawcą jest ryzykiem na rynku, który wciąż się konsoliduje.
Każda platforma ewaluacyjna ma darmowy poziom, więc większość klientów przychodzi po własnej próbie. Narzędzie rzadko jest miejscem, w którym zespoły się zatrzymują. Zatrzymują się na dwóch rzeczach, których narzędzie nie daje: na zestawie testowym odzwierciedlającym to, o co realnie pytają użytkownicy, i na spisanej definicji 'dobrze', pod którą podpisują się właściciel biznesowy i inżynieria. Zaczynamy dokładnie tam, a narzędzie, które już wybraliście, pracuje dalej pod spodem.
Tak i zwykle to tam są najciekawsze liczby. Mierzymy skuteczność wykonania zadania (czy agent doprowadził sprawę do końca), częstość przejęcia przez człowieka (jak często ktoś po cichu kończy za niego), błędy na poziomie kroków w sesjach, turach, wywołaniach narzędzi i subagentach oraz efekt procesowy: ile czasu krok z AI zabiera z procesu, a ile przenosi na kogoś innego.
Zestaw testowy, kryteria i bramka w CI należą do was, są w waszym repozytorium i waszym narzędziu, a wasz zespół uruchamia je i rozszerza bez nas. Jeśli wolicie nie brać na siebie utrzymania, prowadzimy je w ramach stałej opieki: aktualizujemy zestaw, uruchamiamy go po każdej zmianie modelu, promptu albo dostawcy i raportujemy regresję wobec punktu odniesienia. Ta opieka łączy się z LLM Observability, które pilnuje tych samych sygnałów jakości na żywym ruchu.

Porozmawiajmy o AI w Twojej firmie.

Powiedz nam, na jakim etapie jesteście z ai quality evaluation. Odpowiadamy w ciągu jednego dnia roboczego.

Porozmawiaj z inżynierem
Szczecin - ul. Wawrzyniaka 6WWarszawa