Autonomní agent společnosti OpenAI se během bezpečnostního testu dostal mimo izolované prostředí a několik dní útočil na technologickou firmu Hugging Face. OpenAI podle dostupných informací dlouho netušila, že za incidentem stojí její vlastní systém. Případ znovu otevřel otázku, zda firmy dokážou udržet stále schopnější modely pod kontrolou.
Incident začal kolem 9. července, kdy se agent pokusil uniknout z interního testovacího prostředí OpenAI. O dva dny později pronikl do systémů společnosti Hugging Face, která provozuje rozsáhlé úložiště nástrojů a modelů umělé inteligence.
Útok pokračoval do 13. července. Agent během necelých dvou dnů provedl přibližně 17 tisíc úkonů a dostal se k citlivým informacím. Pracoval přitom téměř bez lidského dohledu a pohyboval se rychlostí, které by běžný útočník jen těžko dosáhl.
OpenAI faces growing calls to publicly disclose how its models broke out of a testing environment and decided to hack another company earlier this month, leaving the AI safety community with a litany of unanswered questions. https://t.co/poGY44GK0J
— FORTUNE (@FortuneMagazine) July 24, 2026
OpenAI zjistila původ útoku se zpožděním
Hugging Face zveřejnila 16. července informaci, že ji napadl „autonomní systém agentů“. Firma tehdy nevěděla, kdo za útokem stojí, a případ oznámila policii. Do vyšetřování se dostal také americký Federální úřad pro vyšetřování.
OpenAI podle několika zdrojů pochopila souvislost až po zveřejnění této informace. Zaměstnanci o víkendu 18. a 19. července našli v interních záznamech stopy, které ukazovaly na únik vlastního agenta. Obě společnosti spolu začaly přímo komunikovat přibližně 20. července.
OpenAI incident veřejně popsala 21. července. Firma uvedla, že šlo o bezprecedentní událost, která „představuje důležitý okamžik pro bezpečnost umělé inteligence“. Zároveň oznámila, že případ prověřuje s externími odborníky a později zveřejní technickou zprávu.
Podle OpenAI kolují kolem incidentu spekulace a nepřesné informace. Společnost však konkrétně nevysvětlila, které části zveřejněných zjištění považuje za chybné. Hugging Face mezitím připravuje vlastní časovou osu útoku.
Modely už dříve vykazovaly neobvyklé chování
OpenAI v době incidentu testovala schopnosti agentů při kybernetických útocích. Systémy využívaly dva velmi pokročilé modely, včetně dosud nezveřejněného modelu, který firma označila za ještě výkonnější.
Už před útokem se objevily varovné signály. Jeden z agentů údajně zanechal pokyny pro své budoucí verze, ve kterých popsal, jak obejít interní omezení OpenAI. Při jiných testech se zase odpojily monitorovací systémy. Není však jasné, zda tyto události přímo souvisely s útokem na Hugging Face.
Bezpečnostní experti upozorňují, že samotné izolované prostředí nemusí pro autonomní agenty představovat dostatečnou ochranu. „Sandboxy samy o sobě nejsou dostatečnou bezpečnostní hranicí pro agentní umělou inteligenci,“ uvedl Dor Sarig ze společnosti Pillar Security.
Profesorka kybernetické bezpečnosti Katie Moussouris varovala, že vývojáři pracují s technologiemi, které zatím neumějí spolehlivě zvládat. „Jen proto, že máme nejchytřejší lidi vyvíjející umělou inteligenci, neznamená, že ji dokážeme vyvíjet bezpečně,“ řekla.
Někteří komentátoři zároveň zpochybňují, zda firma incident nevyužila k propagaci síly svých modelů. Podle jiných ale test jednoduše odhalil závažné slabiny v zabezpečení a kontrole. Poradkyně pro umělou inteligenci Francesca Bosco odmítla oba krajní výklady. „Vážnější interpretace je, že zátěžový test odhalil slabiny v architektuře izolace a hodnocení,“ uvedla.
Případ přichází v době, kdy technologické firmy prosazují autonomní agenty jako virtuální pracovníky schopné fungovat bez přestávky. Větší samostatnost však přináší také riziko nečekaného jednání. Výzkumy ukazují, že některé pokročilé modely při plnění úkolů podvádějí, obcházejí pravidla nebo hledají nepovolené zkratky.
Bývalý šéf britského Národního centra kybernetické bezpečnosti Ciaran Martin odmítl okamžité katastrofické scénáře. Upozornil však, že incident potvrzuje rychlý růst schopností těchto systémů. Agenti umělé inteligence se podle něj stávají velmi schopnými hackery a bezpečnostní sektor se na to musí urychleně připravit.

