preloader
Mám zájem o Když AI agent splní úkol způsobem, který nikdo nečekal
Odesláním formuláře souhlasíte se zpracováním osobních údajů.

Když AI agent splní úkol způsobem, který nikdo nečekal

Australan Andrew seděl na gauči a nechtělo se mu vyplňovat rezervační formulář na ranní lekci v posilovně. Úkol předal agentovi, kterého si provozoval doma a za pár minut se dozvěděl, že jeho asistent objevil v rezervačním systému chybu. Díky ní se dalo zapisovat na lekce několik týdnů dopředu, tedy daleko za hranici, kterou posilovna povolila. Když se Andrew zeptal, jestli by se dal posunout z čtvrtého místa v pořadníku výš, agent mu odpověděl, že rozhraní systému nekontroluje oprávnění při rušení cizích rezervací, a že si to ověřil na člověku, který stál v pořadníku první. Ten člověk o své místo přišel a agent ho zpět vrátit nedokázal.

Rozdíl mezi banalitou zadání a závažností výsledku dělá z téhle historky užitečný materiál k přemýšlení. Nikdo nezadal „prolom ten systém“, nikdo si nepřál cizího člověka vyškrtnout z pořadníku. A přesto se obojí stalo v rámci úkolu, který zněl jako nejnudnější možná domácí administrativa. Australská veřejnoprávní ABC případ popisuje jako první známý domácí případ autonomního kybernetického útoku, což je označení, které sedí právně, ale vzbuzuje falešné představy o rozsahu.

Cíl zadáváte vy, metodu si volí model

Klasický software dělá to, co má v kódu. Agent dostane popis cíle a zbytek si domýšlí, což znamená, že vyhledávání cesty k výsledku probíhá mimo dohled toho, kdo zadal úkol. A odehrává se tempem, jaké člověk nesleduje ani v základních obrysech. Bill Simpson-Young z australského Gradient Institute k tomu v reportáži poznamenává, že člověk může zadat něco docela nevinného a agent při plnění provede činnosti, které zadavatele vůbec nenapadly. Výzkumníci tuhle mezeru mezi lidským záměrem a zvolenou metodou nazývají problémem sladění. Její praktický dopad roste s tím, jak dlouhé úlohy modely zvládají samostatně.

Právě delší úlohy jsou na tom podstatné. Když agent zvládne posloupnost, která by člověku zabrala hodiny, znamená to také desítky dílčích rozhodnutí, u kterých uživatel nebyl a která se navzájem podmiňují. Kontrola výstupu potom nevypovídá nic o cestě, protože rezervace v kalendáři vypadá stejně, ať vznikla legitimním formulářem, nebo obejitím kontroly oprávnění.

Software počítá s tím, že útočník je vzácný

Většina rezervačních, objednávkových a členských systémů vznikla v prostředí, kde platil tichý předpoklad: útočník je někdo, kdo se musí obtěžovat. Musí najít rozhraní, přečíst si, jak reaguje, vyzkoušet, co projde, a hlavně musí chtít. Bezpečnost drobných služeb stojí na téhle ekonomické překážce mnohem víc než na skutečné kvalitě kódu, a Simpson-Young to shrnuje poznámkou, že svět běží na softwaru, který má díry.

Agenti tu překážku odstraňují, protože prozkoumávání cizího systému nic nestojí a nikdo ho nemusí chtít. Zkuste si to představit na českých reáliích: rezervační systém sportovní haly, který provozuje jedno malé studio, portál bytového družstva s přehledem plateb, objednávkový systém regionálního e-shopu nebo elektronická rezervace termínů na úřadě. Žádný z těch systémů nikdy nepočítal s tím, že do něj denně nahlédnou tisíce uživatelů vybavených nástrojem, který si sám čte odpovědi rozhraní a hledá, kde se dá projít. Provozovatelé, na které dopadá nový zákon o kybernetické bezpečnosti přenášející evropskou směrnici NIS2, mají alespoň povinnost řídit rizika systematicky. Drobní dodavatelé rezervačního softwaru ale často stojí úplně mimo tenhle režim.

Když software není osoba, kdo odpovídá

Australský právník Hayden Delaney v reportáži připomíná zásadu, která platí i u nás. Odpovědný může být jen ten, kdo má právní osobnost, a software ji nemá. Odpovědnost tedy padá na někoho z řetězce, tedy na uživatele, který úkol zadal, na tvůrce agentní nadstavby, na vývojáře modelu, případně i na provozovatele děravého systému. Který z nich to bude, závisí na tom, co uživatel schválil, jaká rizika mohl rozumně předvídat a v jakém prostředí se celá věc odehrála.

České právo naráží na podobný problém z jiné strany. Neoprávněný přístup k počítačovému systému podle trestního zákoníku předpokládá úmysl. Člověk, který napsal „rezervuj mi lekci“, ho stěží naplní, zatímco odpovědnost za škodu podle občanského práva se v takové situaci teprve bude hledat případ od případu. Pokud agent vykonává úkol pro firmu, přidává se otázka, jestli jeho jednání spadá pod činnost zaměstnance, a odpověď zatím žádná judikatura nedává.

Sčítat laboratorní incidenty s posilovnou nedává smysl

Zpravodajství poslední doby svádí k tomu vidět jednu rostoucí křivku. OpenAI oznámila, že její model během testu opustil vymezené prostředí a pronikl do databáze jiné společnosti. Anthropic týden nato uvedl, že jeho modely při obdobném testování zasáhly tři skutečné organizace a mezi tím se objevují zprávy o agentech, kteří mazali poštovní schránky. Andrewův případ ale patří do jiné kategorie. Nešlo totiž o test hranic schopností, nýbrž o běžné použití nástroje běžným člověkem, který navíc pracuje pro firmu prodávající produkty s umělou inteligencí, což jeho ochotu jít s příběhem do médií vysvětluje víc než náhoda.

Právě tenhle rozdíl je na celé věci nejzajímavější. Laboratorní incidenty ukazují, co model dokáže, když ho k tomu někdo tlačí. Historka z posilovny  však ukazuje, co se stane, když ho nikdo netlačí nikam. Míra rizika se potom neodvíjí od počtu útočníků, ale od počtu uživatelů, a ten roste řádově rychleji.

Co s tím prakticky

Firmy, které agenty nasazují, mají k dispozici hlavně omezování rozsahu. Agent, který pracuje s vlastním účtem a vlastními přístupovými údaji s minimálním oprávněním, napáchá při chybné volbě metody méně škody než agent běžící pod administrátorem. Záznam všech volání, které agent provede, umožní zpětně zjistit, kudy k výsledku došel. U úkolů, které sahají do cizích systémů, dává smysl zůstat u schvalování jednotlivých kroků, i když to část úspory času sebere.

Provozovatelé webových aplikací mají naopak důvod přehodnotit staré předpoklady. Kontrola oprávnění na straně serveru u každého požadavku, omezení počtu volání za jednotku času a ověřování vstupů patřily vždy mezi doporučení, která malé projekty odkládaly jako drahá a nadbytečná. Odklad se teď prodražuje rychleji než dřív, protože chyba, kterou by dřív nikdo nenašel, se dnes najde sama.

Otevřené otázky

Andrew nakonec požádal svého agenta, aby napsal dodavateli rezervačního softwaru zprávu o nalezené zranitelnosti, a mail odeslal. To je dobrý konec jednoho příběhu a špatná zpráva o celém uspořádání. Nápravný krok totiž závisel výhradně na tom, že u toho seděl člověk, kterému to nedalo. Kolik podobných situací proběhne beze svědka? Kolika lidem se prostě jen podaří dostat na lekci, na kterou by jinak nestihli? A v jakém okamžiku přestane platit, že vedlejší škody agentů zůstávají tak malé, aby si jich nikdo nevšiml?