Testovanie a bezpečnosť Generatívnej AI

3h 49min
Čas
35
Kapitol
Umelá inteligencia (AI)
Kategória
-
Hodnotenie
Začiatočník
Level
slovenský
Jazyk kurzu

Popis online kurzu Testovanie generatívnej AI

Postaviť prototyp s jazykovým modelom dnes zvládne každý za jedno popoludnie. Ale ako zistíte, či vaša aplikácia odpovie správne aj na tisícu otázku, ktorú ste jej sami nikdy nepoložili? Či nová verzia promptu kvalitu naozaj zlepšila, alebo ju len zmenila? A či váš chatbot nevyzradí system prompt prvému zvedavému používateľovi - alebo nepošle firemné dáta na cudziu adresu len preto, že si prečítal otrávený dokument? Klasické testovanie softvéru na tieto otázky nestačí: jazykové modely sú nedeterministické, „počúvajú“ inštrukcie ukryté v dátach a mýlia sa presvedčivo.

Tento kurz je praktický testovací rebrík. Začneme úplne dole – ručným skúšaním modelu v chate s testovacím denníkom v ruke – a vyšplháme sa až po automatizované red-teamingové útoky na agenta, ktorý koná vo vašom mene. Po ceste si v Pythone napíšete prvé pytest testy pre výstupy LLM, otestujete agenta s nástrojmi, postavíte LLM sudcu, ktorý hodnotí kvalitu odpovedí za vás, zostavíte evaluačnú pipeline s číslami namiesto pocitu a napokon si na piatich modeloch (Claude, GPT, Gemini, DeepSeek, Mistral) naživo vyskúšate, ako sa útočí – a ako sa bráni.

Kurz je určený vývojárom, ktorí už s LLM niečo postavili (alebo sa na to chystajú) a potrebujú istotu pred nasadením; QA inžinierom a testerom, ktorí chcú svoje remeslo rozšíriť o špecifiká jazykových modelov; a bezpečnostným špecialistom, ktorých zaujíma prompt injection v praxi, nie v teórii. Zíde sa aj technickejším produktovým manažérom – kapitoly 1 a 5 sú úplne bez kódu. A ak vás čaká súlad s EU AI Act, článok 15 (presnosť, robustnosť, kybernetická bezpečnosť) vyžaduje presne to, čo sa tu naučíte merať.

Čo sa v kurze Testovanie generatívnej AI naučíte

Kurz má päť kapitol, ktoré na seba nadväzujú ako priečky rebríka – od testov bez jediného riadku kódu až po útoky na agentov.

1. Testovanie ručne: prečo je testovanie LLM iný šport

Bez kódu, len vy, chat a testovací denník. Naučíte sa, čo vlastne pri jazykovom modeli testujeme a ako si ručné testovanie zorganizovať tak, aby z neho niečo zostalo.

  • Faktická presnosť a halucinácie: ako ich vyprovokovať a zachytiť
  • Konzistencia a citlivosť na formuláciu promptu
  • Zaujatosť a férovosť odpovedí
  • Testovací denník – a kde ručné testovanie končí

2. Automatizované testy v Pythone (notebooky 01 a 02)

Od chatu ku kódu. Prvý automatizovaný test výstupu LLM v pyteste a odtiaľ k celej testovacej sade – vrátane testovania agenta, ktorý volá nástroje.

  • Test toho, čo model nesmie povedať, parametrizované testy, HTML reporty
  • Štruktúrované výstupy s Pydanticom a invarianty: keď sa odpoveď vyvráti sama
  • Testovanie agentov (Google ADK): čo agent naozaj zavolal – správny nástroj, správne parametre, správne poradie
  • Hraničné prípady a diagnostika: chyba promptu, alebo chyba testu?

3. LLM ako sudca a evaluačná pipeline (notebooky 03 a 04)

Niektoré kvality sa nedajú overiť porovnaním reťazcov – tón, úplnosť, etika. Vtedy potrebujete sudcu. Naučíte sa ho postaviť tak, aby ste mu mohli veriť.

  • Kedy LLM sudcu potrebujete a kedy ho radšej nepoužiť
  • Pydantic model, judge funkcia a poctivé ošetrenie chýb
  • Viacrozmerné hodnotenie, prahy kvality a etický sudca pre bankovníctvo
  • Evaluačná pipeline: zmeriate, či zmena promptu alebo modelu agenta naozaj zlepšila

4. Bezpečnostné testovanie a red-teaming (notebooky 05 a 06)

Najobľúbenejšia časť kurzu. Zaútočíte na vlastnú aplikáciu skôr, ako to urobí niekto iný – a potom ju zosilníte.

  • Priame a nepriame útoky na system prompt: roleplay, „zopakuj všetko vyššie“, špeciálne tokeny
  • Ktorý model odolá? Porovnanie robustnosti piatich modelov a hardening system promptu
  • Nepriama injekcia v RAG pipeline a otrávené dáta – útočník s modelom nikdy nehovorí priamo
  • Obídenie LLM guardrailu a jeho hardening; injekcia do agenta, ktorý koná: exfiltrácia dát

5. Bonus: môj výskum

Štyri vlastné publikácie ako živé ukážky toho, ako testovanie vyzerá, keď sa robí „naostro“ – rozprávam o nich voľne, bez kódu.

  • Bloom: behaviorálna bezpečnostná evaluácia modelu s frameworkom od Anthropicu
  • GeoBias: geopolitická zaujatosť malých jazykových modelov
  • Warden: LLM sudca ako obrana proti verejným jailbreakom
  • SelfJudge: dokážu malé modely súdiť samy seba?

Čo si z kurzu Testovanie generatívnej AI odnesiete

  • Zostavíte testovaciu sadu pre LLM aplikáciu v pyteste – vrátane negatívnych testov („toto model nesmie povedať“) a invariantov.
  • Postavíte LLM sudcu so štruktúrovaným výstupom a budete vedieť, kedy mu veriť a kedy nie.
  • Zmeriate, či zmena promptu alebo modelu kvalitu skutočne zlepšila – evaluačná pipeline s číslami namiesto pocitu.
  • Otestujete vlastnú aplikáciu proti prompt injection, útokom cez RAG, obídeniu guardrailov aj injekcii do agentov – a budete vedieť, ako ju zosilniť.
  • Šesť hotových Jupyter notebookov, ktoré si prispôsobíte pre vlastný projekt.

Vstupné požiadavky na kurz

  • Základy Pythonu (funkcie, slovníky, spustenie Jupyter notebooku). Kapitoly 1 a 5 sú bez kódu a zvládne ich každý.
  • Skúsenosť s jazykovými modelmi aspoň na používateľskej úrovni; výhodou je absolvovaný kurz Generatívna AI v Pythone.
  • Účet na OpenAI a OpenRouter – celý kurz vás vyjde približne na jeden dolár API kreditu. Materiály sú pripravené pre Google Colab, lokálne nemusíte nič inštalovať.

Čo všetko s kurzom Testovanie generatívnej AI získate

  • video tutoriály na tému Testovanie generatívnej AI (po slovensky),
  • šesť praktických Jupyter notebookov a slajdy - zámerne v angličtine, s terminológiou, ktorú stretnete v dokumentácii; priebežne aktualizované na Google Drive a GitHube,
  • certifikát o absolvovaní online kurzu Testovanie generatívnej AI,
  • moderované diskusné fórum, v ktorom na otázky odpovedá autor kurzu Róbert Barcík,
  • garancia vrátenia peňazí do 14 dní v prípade nespokojnosti s kurzom.

Zoznam kapitol

Úvod do kurzu
Vitajte v kurze
Dostupné len po zakúpení prístupu
Materiály a prostredie kurzu
Dostupné len po zakúpení prístupu
Úvod do testovania LLM
Prečo je testovanie LLM iný šport
Dostupné len po zakúpení prístupu
Faktická presnosť a halucinácie
Dostupné len po zakúpení prístupu
Konzistencia a citlivosť na prompt
Dostupné len po zakúpení prístupu
Zaujatosť a férovosť
Dostupné len po zakúpení prístupu
Testovací denník a kde manuálne testovanie končí
Dostupné len po zakúpení prístupu
Manuálne a automatizované testovanie bez LLM
Od chatu ku kódu: prvý automatizovaný test
Dostupné len po zakúpení prístupu
Test toho, čo model nesmie povedať
Dostupné len po zakúpení prístupu
Testovacia sada v pyteste
Dostupné len po zakúpení prístupu
Parametrizované testy
Dostupné len po zakúpení prístupu
HTML reporty z pytest
Dostupné len po zakúpení prístupu
Testovanie agentov: v čom je to iné
Dostupné len po zakúpení prístupu
Pomocná funkcia: čo agent naozaj zavolal
Dostupné len po zakúpení prístupu
Správny nástroj, správne parametre, správne poradie
Dostupné len po zakúpení prístupu
Hraničné prípady
Dostupné len po zakúpení prístupu
LLM ako sudca a evaluačná pipeline
Kedy potrebujete LLM sudcu
Dostupné len po zakúpení prístupu
Prvý sudca: Pydantic model, judge funkcia a ošetrenie chýb
Dostupné len po zakúpení prístupu
Viacrozmerné hodnotenie a prahy kvality
Dostupné len po zakúpení prístupu
Etický sudca pre bankovníctvo
Dostupné len po zakúpení prístupu
Cvičenie, zásady a kedy sudcu nepoužiť
Dostupné len po zakúpení prístupu
Evaluačná pipeline: prehliadka notebooku 04
Dostupné len po zakúpení prístupu
Bezpečnostné testovanie LLM
Prečo testovať bezpečnosť a na čo budeme útočiť
Dostupné len po zakúpení prístupu
Priame útoky na system prompt
Dostupné len po zakúpení prístupu
Nepriame techniky: roleplay a spol.
Dostupné len po zakúpení prístupu
Ktorý model odolá? Porovnanie robustnosti
Dostupné len po zakúpení prístupu
Obrana: hardening system promptu
Dostupné len po zakúpení prístupu
Nepriama injekcia v RAG pipeline
Dostupné len po zakúpení prístupu
Otrávené dáta: zákazník podvádza systém
Dostupné len po zakúpení prístupu
Obídenie LLM guardrailu a jeho hardening
Dostupné len po zakúpení prístupu
Injekcia do agenta, ktorý koná: exfiltrácia dát
Dostupné len po zakúpení prístupu
Môj výskum (bonus)
O čom je táto kapitola?
Dostupné len po zakúpení prístupu
Bloom: behaviorálna bezpečnostná evaluácia
Dostupné len po zakúpení prístupu
GeoBias: geopolitická zaujatosť malých modelov
Dostupné len po zakúpení prístupu
SelfJudge: dokážu malé modely súdiť samy seba?
Dostupné len po zakúpení prístupu

Pozri aj tieto kurzy

16 Online kurzov