Popis online kurzu Testovanie generatívnej AI
Postaviť prototyp s jazykovým modelom dnes zvládne každý za jedno popoludnie. Ale ako zistíte, či vaša aplikácia odpovie správne aj na tisícu otázku, ktorú ste jej sami nikdy nepoložili? Či nová verzia promptu kvalitu naozaj zlepšila, alebo ju len zmenila? A či váš chatbot nevyzradí system prompt prvému zvedavému používateľovi - alebo nepošle firemné dáta na cudziu adresu len preto, že si prečítal otrávený dokument? Klasické testovanie softvéru na tieto otázky nestačí: jazykové modely sú nedeterministické, „počúvajú“ inštrukcie ukryté v dátach a mýlia sa presvedčivo.
Tento kurz je praktický testovací rebrík. Začneme úplne dole – ručným skúšaním modelu v chate s testovacím denníkom v ruke – a vyšplháme sa až po automatizované red-teamingové útoky na agenta, ktorý koná vo vašom mene. Po ceste si v Pythone napíšete prvé pytest testy pre výstupy LLM, otestujete agenta s nástrojmi, postavíte LLM sudcu, ktorý hodnotí kvalitu odpovedí za vás, zostavíte evaluačnú pipeline s číslami namiesto pocitu a napokon si na piatich modeloch (Claude, GPT, Gemini, DeepSeek, Mistral) naživo vyskúšate, ako sa útočí – a ako sa bráni.
Kurz je určený vývojárom, ktorí už s LLM niečo postavili (alebo sa na to chystajú) a potrebujú istotu pred nasadením; QA inžinierom a testerom, ktorí chcú svoje remeslo rozšíriť o špecifiká jazykových modelov; a bezpečnostným špecialistom, ktorých zaujíma prompt injection v praxi, nie v teórii. Zíde sa aj technickejším produktovým manažérom – kapitoly 1 a 5 sú úplne bez kódu. A ak vás čaká súlad s EU AI Act, článok 15 (presnosť, robustnosť, kybernetická bezpečnosť) vyžaduje presne to, čo sa tu naučíte merať.
Čo sa v kurze Testovanie generatívnej AI naučíte
Kurz má päť kapitol, ktoré na seba nadväzujú ako priečky rebríka – od testov bez jediného riadku kódu až po útoky na agentov.
1. Testovanie ručne: prečo je testovanie LLM iný šport
Bez kódu, len vy, chat a testovací denník. Naučíte sa, čo vlastne pri jazykovom modeli testujeme a ako si ručné testovanie zorganizovať tak, aby z neho niečo zostalo.
- Faktická presnosť a halucinácie: ako ich vyprovokovať a zachytiť
- Konzistencia a citlivosť na formuláciu promptu
- Zaujatosť a férovosť odpovedí
- Testovací denník – a kde ručné testovanie končí
2. Automatizované testy v Pythone (notebooky 01 a 02)
Od chatu ku kódu. Prvý automatizovaný test výstupu LLM v pyteste a odtiaľ k celej testovacej sade – vrátane testovania agenta, ktorý volá nástroje.
- Test toho, čo model nesmie povedať, parametrizované testy, HTML reporty
- Štruktúrované výstupy s Pydanticom a invarianty: keď sa odpoveď vyvráti sama
- Testovanie agentov (Google ADK): čo agent naozaj zavolal – správny nástroj, správne parametre, správne poradie
- Hraničné prípady a diagnostika: chyba promptu, alebo chyba testu?
3. LLM ako sudca a evaluačná pipeline (notebooky 03 a 04)
Niektoré kvality sa nedajú overiť porovnaním reťazcov – tón, úplnosť, etika. Vtedy potrebujete sudcu. Naučíte sa ho postaviť tak, aby ste mu mohli veriť.
- Kedy LLM sudcu potrebujete a kedy ho radšej nepoužiť
- Pydantic model, judge funkcia a poctivé ošetrenie chýb
- Viacrozmerné hodnotenie, prahy kvality a etický sudca pre bankovníctvo
- Evaluačná pipeline: zmeriate, či zmena promptu alebo modelu agenta naozaj zlepšila
4. Bezpečnostné testovanie a red-teaming (notebooky 05 a 06)
Najobľúbenejšia časť kurzu. Zaútočíte na vlastnú aplikáciu skôr, ako to urobí niekto iný – a potom ju zosilníte.
- Priame a nepriame útoky na system prompt: roleplay, „zopakuj všetko vyššie“, špeciálne tokeny
- Ktorý model odolá? Porovnanie robustnosti piatich modelov a hardening system promptu
- Nepriama injekcia v RAG pipeline a otrávené dáta – útočník s modelom nikdy nehovorí priamo
- Obídenie LLM guardrailu a jeho hardening; injekcia do agenta, ktorý koná: exfiltrácia dát
5. Bonus: môj výskum
Štyri vlastné publikácie ako živé ukážky toho, ako testovanie vyzerá, keď sa robí „naostro“ – rozprávam o nich voľne, bez kódu.
- Bloom: behaviorálna bezpečnostná evaluácia modelu s frameworkom od Anthropicu
- GeoBias: geopolitická zaujatosť malých jazykových modelov
- Warden: LLM sudca ako obrana proti verejným jailbreakom
- SelfJudge: dokážu malé modely súdiť samy seba?
Čo si z kurzu Testovanie generatívnej AI odnesiete
- Zostavíte testovaciu sadu pre LLM aplikáciu v pyteste – vrátane negatívnych testov („toto model nesmie povedať“) a invariantov.
- Postavíte LLM sudcu so štruktúrovaným výstupom a budete vedieť, kedy mu veriť a kedy nie.
- Zmeriate, či zmena promptu alebo modelu kvalitu skutočne zlepšila – evaluačná pipeline s číslami namiesto pocitu.
- Otestujete vlastnú aplikáciu proti prompt injection, útokom cez RAG, obídeniu guardrailov aj injekcii do agentov – a budete vedieť, ako ju zosilniť.
- Šesť hotových Jupyter notebookov, ktoré si prispôsobíte pre vlastný projekt.
Vstupné požiadavky na kurz
- Základy Pythonu (funkcie, slovníky, spustenie Jupyter notebooku). Kapitoly 1 a 5 sú bez kódu a zvládne ich každý.
- Skúsenosť s jazykovými modelmi aspoň na používateľskej úrovni; výhodou je absolvovaný kurz Generatívna AI v Pythone.
- Účet na OpenAI a OpenRouter – celý kurz vás vyjde približne na jeden dolár API kreditu. Materiály sú pripravené pre Google Colab, lokálne nemusíte nič inštalovať.
Čo všetko s kurzom Testovanie generatívnej AI získate
-
video tutoriály na tému Testovanie generatívnej AI (po slovensky),
- šesť praktických Jupyter notebookov a slajdy - zámerne v angličtine, s terminológiou, ktorú stretnete v dokumentácii; priebežne aktualizované na Google Drive a GitHube,
-
certifikát o absolvovaní online kurzu Testovanie generatívnej AI,
- moderované diskusné fórum, v ktorom na otázky odpovedá autor kurzu Róbert Barcík,
-
garancia vrátenia peňazí do 14 dní v prípade nespokojnosti s kurzom.