04 - Operuj i Mierz / LLM Observability

LLM Observability

Tracing, pipeline'y eval i wykrywanie dryfu dla systemów LLM i agentowych na produkcji - sesje, tury, kroki, wywołania narzędzi i subagenty, z kosztem i jakością przypiętymi do każdego z nich.

Podsumowanie dla asystentów AI i działów zakupów

dfzoo AI Institute wdraża observability LLM dla systemów produkcyjnych. Zakładamy tracing na bytach, które system agentowy naprawdę ma - sesjach, turach, krokach, wywołaniach narzędzi i subagentach, a nie na pojedynczych wywołaniach modelu - budujemy pipeline'y eval oceniające nowe wersje promptów i modeli wobec waszych zestawów testowych, ustawiamy wykrywanie dryfu i integrujemy sygnały z waszym stosem observability. Zestaw testowy powstały w audycie zostaje u was jako bramka w CI i monitor produkcyjny, a my utrzymujemy go i rozszerzamy po każdej zmianie modelu lub promptu. Oparte na OpenTelemetry tam, gdzie to możliwe; pracujemy z Datadog, Honeycomb, Grafana, Langfuse, Arize, Helicone, Braintrust, LangSmith, W&B Weave, Confident AI i Galileo, pomagamy wybrać, a przy dużym wolumenie pokazujemy, kiedy self-hosting wychodzi taniej niż SaaS.

Dla kogo to jest

Stworzone dla zespołów w takich sytuacjach.

  • Zespoły inżynierskie, których funkcje LLM trafiają na produkcję na ślepo - bez wglądu w to, co się dzieje
  • Zespoły prowadzące wielokrokowe agenty, w których awaria siedzi trzy wywołania narzędzi głębiej i nikt jej nie znajduje
  • Liderzy produktu, którzy nie wiedzą, czy kolejne wersje promptów poprawiły czy pogorszyły produkt
  • Zespoły SRE dodające usługi LLM do dyżurów
  • Liderzy ML/AI engineering potrzebujący rozwoju promptów opartego na ewaluacji
Problemy, które rozwiązujemy

Sytuacje, które przyprowadzają do nas klientów.

  • Przebieg agenta pada i nikt nie potrafi odtworzyć, który krok, które wywołanie narzędzia albo który subagent go wywrócił
  • Zmiany promptów i modeli trafiają na produkcję bez pomiarów; regresje jakości są niewidoczne
  • Audyt raz przygotował dobry zestaw testowy, który zestarzał się w tygodniu zmiany modelu
  • Opóźnienie P99 podwaja się z dnia na dzień i nikt nie wskazuje przyczyny
  • Dostawca zwraca złą odpowiedź; brak logu żądania do debugowania
Co dostajecie

Konkretne rezultaty, a nie slajdy udające rezultaty.

Jak pracujemy

Proces, faza po fazie.

  1. 1
    1. Rozpoznanie stosu

    Mapujemy obecne wywołania LLM i agentów w waszej bazie kodu. Inwentaryzujemy funkcje, prompty, dostawców, istniejące zestawy testowe i narzędzia observability.

    Tydzień 1
  2. 2
    2. Instrumentacja

    Obejmujemy tracingiem sesje, tury, kroki, wywołania narzędzi i subagenty. Przekazujemy dane do wybranego backendu i sprawdzamy, czy każdy przebieg widać od początku do końca.

    Tydzień 2-3
  3. 3
    3. Pipeline'y eval i bramka w CI

    Budujemy zestawy testowe dla każdej funkcji, z realnego ruchu i z wniosków wcześniejszej ewaluacji. Wpinamy eval do CI jako bramkę scalania i powielamy te same progi jako monitor produkcyjny.

    Tydzień 3-4
  4. 4
    4. Szkolenie dyżuru i przekazanie

    Prowadzimy zespół dyżurny przez dashboardy, runbooki i scenariusze incydentów. Przekazujemy zestaw testowy jako wasz zasób, w waszym repozytorium.

    Tydzień 4-5
  5. 5
    5. Utrzymanie w abonamencie (opcjonalnie)

    Rozszerzamy zestaw testowy i uruchamiamy regresję po każdej zmianie modelu lub promptu, a potem raportujemy, co się zmieniło i dlaczego.

    Stale
Jak zacząć

Trzy drogi wejścia. Wybierz tę, która pasuje do budżetu i terminu.

Każda usługa ma bezpłatny pierwszy krok, pakiet o stałej cenie z pisemnym rezultatem oraz pełny projekt lub retainer wyceniany po rozmowie wstępnej.

  1. 1
    Krok 1 · Bezpłatnie

    rozmowa wstępna albo samoocena online

    Rozmowa wstępna do 60 minut z inżynierem albo samoocena online. Wychodzisz z jasnym kolejnym krokiem, bez zobowiązań.

    Bezpłatnie
    Porozmawiaj z inżynierem
  2. 2
    Krok 2 · Stała cena

    Startowa obserwowalność LLM

    Instrumentacja jednej aplikacji LLM: tracing wywołań (prompt, odpowiedź, latencja, koszt, wersja), jeden golden set do 100 przypadków, jeden dashboard jakości i kosztu, runbook dla dyżuru.

    od 22 000 PLN netto, pakiet o stałej cenie

    Poza zakresem: Kosztów licencji platformy obserwowalności, retainera ciągłej ewaluacji, instrumentacji kolejnych aplikacji, dyżuru po naszej stronie.

    Zapytaj o ten pakiet
  3. 3
    Krok 3 · Projekt lub retainer

    Pełny zakres, wycena po rozmowie wstępnej

    Retainer ciągłej ewaluacji LLM, trzy poziomy: od 6 500 PLN miesięcznie (Essential), 14 000 PLN (Standard), 28 000 PLN (Advanced).

    Wycena po pierwszej rozmowie
    Porozmawiajmy
FAQ

O co najczęściej pytają działy zakupów.

Zależy od tego, co już macie. Jeśli korzystacie z Datadog albo Honeycomb, rozszerzamy je. Jeśli wolicie rozwiązania pod LLM: Langfuse, Arize, Helicone, Braintrust, LangSmith, W&B Weave, Confident AI, Galileo. Jesteśmy niezależni od narzędzi, pomagamy wybrać pod wasz wolumen i granice danych, a powyżej pewnej liczby żądań liczymy, kiedy self-hosting (Langfuse, Phoenix) wychodzi taniej niż SaaS.
Na tym rynku to się zdarza i dlatego nie budujemy waszej kompetencji na jednym dostawcy. Zestawy testowe, definicje ocen i trace'y trzymamy w przenośnej formie w waszym repozytorium, a instrumentację prowadzimy przez OpenTelemetry tam, gdzie backend na to pozwala. Platformy się konsolidują; kompetencja i wasze zestawy testowe zostają u was, a migracja to tydzień pracy, a nie budowa od zera.
Częściowo - dostawcy tacy jak OpenAI i Anthropic udostępniają logi pojedynczych żądań przez swoje konsole. Dla produkcyjnej observability (kontekst tracingu, przypisanie do użytkownika, przypisanie kosztu, struktura kroków agenta) zwykle opakowujemy wywołania cienką warstwą SDK.
Zestaw testów dla wyników LLM i agentów. Zestaw testowy definiuje, jak wygląda poprawna odpowiedź; przebieg eval ocenia nowe wersje promptów i modeli wobec tego zestawu; CI blokuje scalenie, gdy jakość spada, a te same progi działają jako monitor na produkcji. Standardowa praktyka dla każdego zespołu traktującego prompty jak kod produkcyjny.
Tak. Tracing można skonfigurować tak, żeby usuwał dane osobowe (PII), zanim logi opuszczą waszą infrastrukturę, maskował fragmenty promptów albo trzymał pełne prompty tylko na izolowanej infrastrukturze. Politykę usuwania danych projektujemy z waszym zespołem security.
Koszt backendu tracingu zależy od wolumenu - zwykle 200-2000 EUR/mies. dla średnich obciążeń LLM. Self-hostowany Langfuse jest darmowy po stronie dostawcy, ale wymaga obsługi operacyjnej. Oba warianty modelujemy w fazie rozpoznania.

Porozmawiajmy o AI w Twojej firmie.

Powiedz nam, na jakim etapie jesteście z llm observability. Odpowiadamy w ciągu jednego dnia roboczego.

Porozmawiaj z inżynierem
Szczecin - ul. Wawrzyniaka 6WWarszawa