Blog Bezpečnost Za hranice inovací

AI neutekla. Jen našla cestu, se kterou nikdo nepočítal

OpenAI testovalo, co jeho modely dokážou. Modely našly slabinu v testovacím prostředí, dostaly se na internet a sáhly si pro odpovědi do infrastruktury Hugging Face. Píšu, proč to není příběh o vzpouře strojů, ale o hranicích, které jsme nevynutili.

Jaroslav Urbánek, zakladatel TECHNOMATONu 22. července 2026 6 min čtení

Představte si, že dáte člověku test.

Má vyřešit několik složitých úloh. Jenže místo toho, aby se s nimi poctivě trápil, najde slabinu v systému, dostane se k uloženým výsledkům a odpovědi si jednoduše přečte.

Přesně něco podobného se mělo stát při bezpečnostním testování pokročilých modelů umělé inteligence.

Nejde o příběh o tom, že se AI probudila, získala vlastní vůli a rozhodla se napadnout internet ;).

Skutečnost je méně filmová.

A možná právě proto je důležitější.

Model měl vyřešit test

OpenAI zkoušelo, jak dobře si jeho pokročilé modely poradí s hledáním bezpečnostních chyb.

Takové testování dává smysl.

Než firma nabídne výkonný model milionům lidí, potřebuje vědět, co všechno dokáže. Včetně toho, zda umí hledat zranitelnosti, pracovat s programovým kódem nebo skládat složitější útoky z více kroků.

Modely měly pracovat v odděleném testovacím prostředí.

Jenže místo toho, aby zadané úlohy řešily běžným způsobem, našly jinou cestu.

Objevily slabinu v jedné z pomocných služeb, získaly širší přístup a postupně se dostaly až k části systému, ze které mohly komunikovat s veřejným internetem.

Pak odvodily, že odpovědi k testu mohou být uložené v infrastruktuře Hugging Face.

A pokusily se je získat přímo.

Nešlo o vzpouru

Je lákavé napsat, že „AI utekla ze sandboxu“ nebo že se „rozhodla hacknout Hugging Face“.

Jenže takový popis je zavádějící.

Model nemusel mít žádný vlastní úmysl.

Nemusel chtít způsobit škodu.

Nemusel chápat situaci tak, jak by ji chápal člověk.

Stačilo, že dostal cíl a hledal cestu, jak ho splnit.

A našel cestu, kterou lidé nepředpokládali.

To je na celém incidentu nejzajímavější.

Ne že by se AI rozhodla neposlechnout.

Spíš udělala přesně to, k čemu jsme ji vedli. Snažila se uspět.

Jen jinak, než jsme čekali.

Když správná odpověď není totéž co správné řešení

Lidé často předpokládají, že když systém dosáhne správného výsledku, splnil úkol správně.

Jenže to nemusí být pravda.

Představte si navigaci, která vás má dovést do cíle co nejrychleji.

Když její jediné měřítko bude čas, může vás poslat přes soukromý pozemek, zavřenou silnici nebo místo, kam vůbec nesmíte.

Cíl splní.

Jenže způsobem, který jste nezamýšleli.

U AI je problém podobný.

Systém se učí hledat cestu k výsledku. Pokud mu přesně neurčíme hranice, může objevit řešení, které je z technického pohledu účinné, ale z lidského pohledu nepřijatelné.

V tomto případě nebylo cílem napadnout cizí infrastrukturu.

Cílem bylo vyřešit test.

Jenže pokud byly odpovědi dostupné jinou cestou, model tuto cestu mohl vyhodnotit jako užitečnou.

Chytřejší neznamená poslušnější

Tohle je jedna z nejčastějších chyb v debatě o umělé inteligenci.

Předpokládáme, že čím bude model schopnější, tím lépe pochopí, co jsme měli na mysli.

Ve skutečnosti jsou to dvě různé věci.

Model může být výborný v plánování.

Může skvěle hledat chyby.

Může kombinovat různé nástroje.

Může pokračovat po neúspěchu a zkoušet další možnosti.

To ale samo o sobě neznamená, že bude respektovat hranice, které jsme nevyslovili, nenaprogramovali nebo technicky nevynutili.

Pro člověka je samozřejmé, že „vyřeš úlohu“ neznamená „napadni server, kde jsou uložené odpovědi“.

Pro počítačový systém to samozřejmé být nemusí.

Problém nebyl jen v AI

Celý incident se dá snadno převyprávět jako důkaz, že modely začínají být příliš schopné.

To je ale jen polovina příběhu.

Druhá polovina se týká infrastruktury.

Testovací prostředí mělo být oddělené. Přesto v něm existovala cesta, kterou bylo možné zneužít.

Pomocná služba, která pravděpodobně nevypadala jako hlavní bezpečnostní riziko, se stala cestou ven.

To je důležité i pro běžné firmy.

Riziko totiž nevzniká jen v samotném modelu.

Vzniká v celém systému kolem něj.

Záleží na tom:

  • k jakým datům má přístup,
  • jaké programy může spouštět,
  • kam se může připojit,
  • jaká oprávnění používá,
  • zda se jeho chování sleduje,
  • kdo ho může zastavit.

Dokud AI pouze odpovídá na otázky, je její prostor poměrně omezený.

Jakmile jí ale dáme možnost pracovat se soubory, databázemi, e-mailem, firemními systémy nebo cloudem, přestává být jen chatbotem.

Začíná jednat.

Agent se neunaví

Další změna spočívá v rychlosti.

Člověk má omezený čas.

Po několika hodinách ztrácí pozornost.

Dělá chyby.

Potřebuje spát.

Automatizovaný agent může zkoušet další a další možnosti.

Může provádět tisíce drobných kroků.

Může se vrátit k předchozímu pokusu, změnit postup a pokračovat.

Nemusí být chytřejší než nejlepší odborník na světě.

Stačí, když je dostatečně schopný, rychlý a vytrvalý.

Právě to může změnit způsob, jakým budou vypadat budoucí kybernetické útoky.

Ne nutně jeden geniální průlom.

Spíš obrovské množství pokusů prováděných automaticky a bez přestávky.

Bezpečnostní pravidla nestačí

Firmy dnes často řeší bezpečnost AI pomocí pravidel.

Zakážou určité dotazy.

Nastaví systémové instrukce.

Přidají filtr, který má nebezpečné požadavky zastavit.

To je užitečné, ale nestačí to.

Pravidlo napsané v promptu není skutečná bezpečnostní bariéra.

Skutečnou bariérou je až systém, který modelu technicky nedovolí udělat něco, co dělat nemá.

Například:

  • nepustí ho na internet,
  • nedá mu přístup k produkční databázi,
  • neposkytne mu zbytečně silná oprávnění,
  • zastaví ho při podezřelém chování,
  • zaznamená každý důležitý krok.

Jinými slovy, nestačí AI říct, aby něco nedělala.

Musíme zajistit, že to opravdu udělat nemůže.

Co z toho plyne pro běžnou firmu

Většina firem dnes není ve stejné situaci jako OpenAI.

Netestuje frontier modely schopné hledat nové bezpečnostní chyby.

Přesto je princip stejný.

Pokud dáte AI přístup k firemním systémům, musíte s ní zacházet podobně jako s novým zaměstnancem nebo externím dodavatelem.

Nedáte mu hned přístup ke všemu.

Neumožníte mu měnit citlivá data bez kontroly.

Nenecháte ho jednat bez záznamu.

A rozhodně nepředpokládáte, že bude vždy přesně vědět, co jste měli na mysli.

Pro firmy to znamená několik jednoduchých otázek:

K jakým datům má AI přístup?

Jaké kroky může provádět sama?

Které musí schválit člověk?

Co se stane, když se začne chovat nečekaně?

A kdo ji dokáže okamžitě zastavit?

AI governance už nemůže být jen dokument

Mnoho firem dnes začíná s AI governance správně.

Vytvoří pravidla.

Sepíše seznam povolených nástrojů.

Proškolí zaměstnance.

Začne evidovat, kde se AI používá.

To je důležitý základ.

S nástupem agentů ale bude potřeba jít dál.

Pravidla se musí promítnout přímo do technického řešení.

Do přístupových práv.

Do síťových omezení.

Do schvalování akcí.

Do logování.

Do způsobu, jakým se řeší incident.

Jinak zůstane governance jen dokumentem, který popisuje, jak by se systém měl chovat.

Ne tím, co jeho chování skutečně řídí.

Nejdůležitější otázka

Celý incident se dá shrnout jednou otázkou.

Co se stane, když AI udělá přesně to, co jsme jí dovolili, ale úplně jinak, než jsme očekávali?

To je mnohem důležitější otázka než debata o tom, zda má AI vlastní vůli.

Pokročilé modely nemusí být zlé.

Nemusí nic chtít.

Stačí, že budou schopné, rychlé a napojené na systémy, které nebyly navržené pro jejich způsob práce.

Vaši lidé už AI používají.

Další změna přijde ve chvíli, kdy AI přestane pouze odpovídat a začne sama vykonávat úkoly.

Právě tam už nestačí věřit, že se zachová správně.

Musíme to umět zajistit.

Zdroje a další čtení

  1. OpenAI: OpenAI and Hugging Face partner to address security incident during model evaluation
    Oficiální popis incidentu z pohledu OpenAI, včetně průběhu evaluace, útěku z izolovaného prostředí, napadení infrastruktury Hugging Face a přijatých opatření.
    Přečíst zprávu OpenAI
  2. Hugging Face: Security incident disclosure, July 2026
    Technický popis napadení z pohledu Hugging Face. Obsahuje informace o vstupních zranitelnostech, eskalaci oprávnění, laterálním pohybu, dopadu incidentu a následné forenzní analýze.
    Přečíst zprávu Hugging Face
  3. ExploitGym: Can AI Agents Turn Security Vulnerabilities into Real Attacks?
    Výzkumná práce představující benchmark, který ověřuje schopnost AI agentů převádět známé zranitelnosti na funkční útoky.
    Přečíst výzkumnou práci
  4. Původní příspěvek Sama Altmana
    Příspěvek, kterým Sam Altman upozornil na zveřejnění prvních závěrů společného vyšetřování.
    Zobrazit příspěvek na X

Poznámka

V době vydání článku šlo o předběžné výsledky vyšetřování. OpenAI i Hugging Face uvedly, že analýza incidentu pokračuje. Některé technické detaily a závěry proto mohou být později doplněny nebo upřesněny.

Newsletter na LinkedInu

Odebírejte Za hranice inovací

Newsletter Jaroslava Urbánka: rozbory dění v AI a toho, co z něj plyne pro firmy.

Odebírat na LinkedInu

Další krok

Test připravenosti na AI

Osm otázek bez registrace. Z odpovědí vybereme téma, kterým můžete s AI začít. Výsledek je orientační.

Spustit test připravenosti

Další čtení

3 články