AI evals

AI eval je systematické testování, jak dobře AI model nebo agent zvládá svoji práci na sadě vzorových úkolů. Místo dojmu „funguje to dobře“ dostanete měřitelné skóre, které jde sledovat v čase a porovnávat mezi verzemi modelu nebo promptu.

Jak eval funguje

Základ evalu tvoří tři části: dataset vzorových úkolů (tzv. „goldens“ – vstup a očekávaný nebo přijatelný výstup), metrika neboli „scorer“, který odpověď vyhodnotí, a smyčka, která projede celý dataset a sesbírá výsledky. Scorer může být jednoduchý – třeba jestli odpověď obsahuje určité klíčové slovo nebo jestli sedí délka – nebo měkčí, kdy odpověď posoudí další AI model podle zadaných kritérií. Tomuto přístupu se říká „LLM-as-judge“.

Od klasického testování v softwaru se eval liší ve třech věcech. Testuje chování celého výstupu (přesnost, konzistenci, tón), ne jestli kód dělá přesně to, co má dělat podle zadání. Počítá s tím, že stejný vstup dá pokaždé trochu jinou odpověď – LLM jsou nedeterministické – takže se měří výkon na vzorku případů, ne na jednom testu. A hodnotí produkt, tedy co uživatel skutečně dostane, ne jestli je kód napsaný správně. Časté přirovnání „eval je jako unit test, jen pro AI“ je zjednodušené – hranice mezi oběma přístupy je v praxi rozmazaná, spíš jde o navazující vrstvu kontroly.

Typy evalů

  • Golden dataset – sada referenčních příkladů, proti kterým se odpovědi porovnávají. Je to spíš startovní bod než hotové řešení. Dataset se průběžně rozšiřuje o nové případy, na kterých agent chyboval.
  • LLM-as-judge – jiný model posoudí odpověď podle zadaných kritérií. Podle studie Zheng a kol. (2023, MT-Bench) dosahuje GPT-4 v roli soudce přes 80 % shody s lidským hodnocením, tedy zhruba stejné úrovně jako lidští hodnotitelé mezi sebou. Metoda má ale slabiny – známá jsou zkreslení podle pozice odpovědi, podle délky textu nebo sklon hodnotit vlastní styl výstupu lépe.
  • Human / SME review (kontrola odborníkem na obor) – ruční kontrola vzorku odborníkem na daný obor. Nenahraditelná tam, kde jde o specializované znalosti nebo citlivá rozhodnutí.
  • Regression testing – opakované spuštění stejného datasetu po každé změně promptu nebo modelu, aby se odhalilo, že oprava jednoho problému tiše nevytvořila jiný.

Praxe rozlišuje ještě offline a online evaluaci. Offline eval běží před nasazením na pečlivě sestaveném datasetu a funguje jako brána – dokud neprojde, nový Prompt nebo model se nepustí do provozu. Online eval pak sleduje reálný provoz a chytá věci, které se v testovacím datasetu vůbec neobjevily. Podobnou logiku znáte možná z A/B testování – i tam jde o to změřit reálné chování na vzorku, ne se spolehnout na dojem.

Kdy se evaly hodí

Evaly dávají smysl všude, kde AI agent nebo automatizace dělá něco opakovaně a s dopadem na zákazníka – odpovídá na dotazy, generuje obsah, rozhoduje o dalším kroku v procesu. Bez nich se změna promptu nebo přechod na novější model testuje jen „od oka“, což u provozního nasazení nestačí. Kombinovat oba přístupy bývá doporučovaná praxe – offline bránu před vydáním a online monitoring živého provozu – jako dvě vrstvy stejné kontroly, podobně jako u human-in-the-loop nastavení, kde člověk zůstává poslední pojistkou.

Evaly bývají první věc, na kterou se u nasazeného AI agenta zapomene, a pak přijde překvapení, že po aktualizaci modelu agent najednou dělá chyby, které dřív nedělal. Když stavím a napojuju AI agenty na míru, do dodávky rovnou popisuju i to, na jaké sadě úkolů se dá jejich výkon opakovaně ověřit. Víc o službě →

Limity a rizika

Evaly nejsou neomylné. LLM-as-judge trpí zkreslením podle pozice odpovědi, délky textu i preferencí vlastního stylu – shoda mezi více soudci (tzv. multi-judge konsensus) podle jedné studie u kreativních nebo otevřených úloh výrazně klesá. Tvorba a údržba kvalitního datasetu stojí čas i peníze a malý dataset o pár desítkách případů dá jen orientační signál, ne jistotu.

Dalším rizikem je takzvaný Goodhartův zákon – jakmile se metrika stane cílem, přestává být dobrou metrikou. Model i tým se mohou naučit na benchmark „hrát“, aniž by se reálně zlepšila kvalita výstupu. U veřejných benchmarků se navíc ukazuje kontaminace dat – testovací otázky prosakují do trénovacích dat a skóre pak nic neříká o skutečné schopnosti modelu. U benchmarku MMLU kontaminace dat vzrostla z 9 na 29,4 procenta za tři roky. A evaly typicky nezachytí to, co v testovací sadě chybí – bezpečnostní mezery, prompt injection nebo neobvyklé vstupy potřebují samostatné testování navrch.

Nástrojů na stavbu evalů je dnes víc – mezi rozšířené patří třeba Inspect AI, Promptfoo nebo OpenAI Evals. Podrobné srovnání přesahuje rámec tohoto hesla.

Pokud plánujete AI agenta nebo automatizaci nasadit do provozu firmy, evaly jsou způsob, jak ověřit, že to, co funguje na pár testovacích dotazech, funguje spolehlivě i za měsíc nebo po aktualizaci modelu. Víc o nasazování agentů v malých firmách píšu i v týdeníku o levnější AI a agentech pro malé firmy.

Pavel Szabo

Programátor webů, eshopů a informačních systémů s více než 23 lety praxe. Pomáhám firmám i jednotlivcům s online podnikáním, automatizacemi a využitím AI v praxi.

Domluvte si konzultaci zdarma

Znáte někoho komu by článek mohl pomoct? Budu rád za sdílení!

Nejnovější články

Nabídka služeb

Vyberte si z nabídky níže, co zrovna potřebujete nebo mi rovnou zavolejte a probereme Vaše potřeby.

Weby a portály

Kódování a programování

Marketing a obsah

Praha, Brno, Ostrava či zahraničí? Na tom nezáleží

Osobní schůzky jsou možné, ale většinu záležitostí — od tvorby webů po AI automatizace — lze vyřešit pohodlně přes videohovor. Působím po celé ČR, s klienty z mnoha měst: Praha, Brno, Ostrava, Jičín, Liberec, Olomouc, Hradec Králové, České Budějovice, Karviná, Frýdek-Místek, Opava, Třinec, Orlová, Český Těšín, Nový Jičín, Krnov, Bohumín, Kopřivnice, Bruntál...
Pro lepší porozumění vašim potřebám je ideální online hovor. Rezervujte si schůzku přes můj formulář nebo mě kontaktujte telefonicky. Můžeme se taky domluvit na výjezdu a osobní schůzce.
Praha, Brno, Ostrava či zahraničí? Na tom nezáleží