Niezależna ocena AI, które już działa w waszym produkcie albo na zapleczu - jakość odpowiedzi, oparcie w źródłach, skuteczność agentów i to, czy krok z AI naprawdę skraca proces - punktowana według kryteriów, które zostają u was.
dfzoo AI Institute ocenia jakość rozwiązań AI, które już działają: funkcji opartych na LLM w produkcie, odpowiedzi opartych na wyszukiwaniu w waszych dokumentach (RAG) i procesów agentowych działających bez nadzoru człowieka. Budujemy zestaw testowy z waszych realnych przypadków, ustalamy kryteria oceny z osobami odpowiedzialnymi za efekt biznesowy, punktujemy każdy przypadek i dostarczamy pisemny raport ze zmierzonym punktem odniesienia, wzorcami błędów stojącymi za wynikiem i rekomendowaną poprawką do każdego wzorca. Jednostką pracy jest jedna ocena - jeden przypadek testowy przepuszczony przez kryteria - więc zakres i faktura opisują to samo. Zestaw testowy i kryteria zostają u was, wpięte w CI jako bramka jakości, która wychwyci regresję przy kolejnej zmianie modelu, promptu albo dostawcy. Jesteśmy neutralni narzędziowo: pracujemy na tym, co już macie, albo pomagamy wybrać, a przy dużym wolumenie pokazujemy, kiedy self-hosting wychodzi taniej niż SaaS.
Ustalamy, co znaczy 'dobrze' dla tego rozwiązania, z osobami odpowiedzialnymi za efekt. Definiujemy wymiary jakości, ich wagi i próg zaliczenia. Ustalamy liczbę ocen w zakresie.
Składamy przypadki testowe z realnego ruchu, znanych błędów i przypadków brzegowych, których nikt nie testuje. Dodajemy oczekiwaną odpowiedź albo kryterium oceny do każdego przypadku. Wpinamy zestaw w wasze narzędzie ewaluacyjne albo w takie, które pomagamy wybrać.
Punktujemy każdy przypadek według kryteriów: automatycznie, z użyciem modelu jako sędziego i z przeglądem ludzkim tam, gdzie kryterium wymaga osądu. Grupujemy błędy we wzorce i wiążemy każdy wzorzec z przyczyną: wyszukiwanie, prompt, dobór modelu, wpięcie narzędzi albo projekt procesu.
Dostarczamy punkt odniesienia i raport wzorców błędów, omawiamy je z właścicielami produktu i inżynierią, przekazujemy zestaw testowy i kryteria wpięte w CI jako bramkę jakości, którą wasz zespół uruchamia bez nas.
Retainer: utrzymujemy i rozszerzamy zestaw testowy, uruchamiamy go po każdej zmianie modelu, promptu albo dostawcy i raportujemy regresję, zanim znajdą ją użytkownicy.
Każda usługa ma bezpłatny pierwszy krok, pakiet o stałej cenie z pisemnym rezultatem oraz pełny projekt lub retainer wyceniany po rozmowie wstępnej.
Rozmowa wstępna do 60 minut z inżynierem albo samoocena online. Wychodzisz z jasnym kolejnym krokiem, bez zobowiązań.
Jedna funkcja LLM albo jeden proces agentowy: ustalamy z wami rubrykę oceny, budujemy zestaw ewaluacyjny około 150 przypadków testowych, przepuszczamy przez niego obecny system i przekazujemy zestaw wpięty jako bramka w waszym CI.
Poza zakresem: Naprawy systemu, przebudowy promptów i wyszukiwania, budowy funkcji AI, masowej oceny przez ludzi, retainera ciągłej ewaluacji, licencji narzędzi.
Zapytaj o ten pakietEwaluacja kilku funkcji albo agentów wraz z retainerem ciągłej ewaluacji, obejmującym regresję po każdej zmianie modelu lub promptu: od 60 000 PLN.
Powiedz nam, na jakim etapie jesteście z ai quality evaluation. Odpowiadamy w ciągu jednego dnia roboczego.