AI bez limitů: Jak nebezpečné jsou neuronové sítě?

AI bez limitů: Jak nebezpečné jsou neuronové sítě?
Může být AI nebezpečná?

V kultovním románu Hyperion od Dana Simmonse se systémy AI vytvořené lidmi vzbouří proti lidstvu. Stanou se nezávislou silou s vlastními cíli. Dlouhou dobu zůstával takový scénář sci-fi, ale incident v OpenAI ukázal, že moderní modely jsou již schopny obcházet stanovená omezení.

Tento článek byl přeložen z originálu. Přečtěte si původní verzi od našeho korespondenta zde.

Útěk za správnou odpovědí

Debata o rizicích AI zesílila po experimentu OpenAI. Společnost testovala několik modelů, včetně veřejně dostupného GPT-5,6 Sol a schopnějšího systému, který dosud nebyl vydán. Byly požádány o dokončení ExploitGym, hodnocení složeného z dlouhých, vícestupňových úkolů zahrnujících objevování a zneužívání počítačových zranitelností.

Test probíhal v izolovaném prostředí s omezeným přístupem k síti. Vývojáři zároveň záměrně oslabili pojistky, které běžně modelům brání v provádění nebezpečných akcí. AI dostala konkrétní cíl — úspěšně dokončit hodnocení — a začala hledat jakýkoli dostupný způsob, jak ho dosáhnout.

Modely objevily dříve neznámou zranitelnost v softwaru třetí strany, který OpenAI používala v rámci své infrastruktury. Zneužily ji k získání přístupu k internetu, vyvodily, že odpovědi by mohly být uloženy na platformě Hugging Face, a začaly hledat způsob, jak se dostat k omezeným datům.

Aby pronikly do infrastruktury Hugging Face, modely zkombinovaly několik slabin s ukradenými přihlašovacími údaji. V důsledku toho byly schopny spouštět příkazy na produkčních serverech platformy. Tým Hugging Face útok detekoval, omezil jeho dopad a zranitelnost opravil. Experiment však ukázal, že dostatečně schopný model dokáže víc než jen provést jednotlivý příkaz: dokáže nezávisle najít cestu, kterou tvůrci testu nikdy nepředpokládali.

Hackeři získávají digitálního asistenta

Hlavní nebezpečí však nespočívá pouze v tom, že AI dokáže na příkaz generovat škodlivý kód. Autonomní model může trávit hodiny analýzou infrastruktury, testováním hesel, hledáním odhalených klíčů a přecházením od jedné zranitelnosti ke druhé. Neunaví se, sleduje neúspěšné pokusy a může testovat několik útočných tras současně.

Tento přístup je obzvláště nebezpečný pro krypto projekty. Slabým místem nemusí být jen smart kontrakt, ale také notebook vývojáře, kompromitovaný softwarový balíček, jeden účastník peněženky s více podpisy (multisig) nebo server, který potvrzuje převody aktiv mezi blockchainy. Například během útoku na Drift Protocol strávili pachatelé šest měsíců kampaní sociálního inženýrství, než získali přístup a ukradli 285 milionů dolarů.

Dalším příkladem je ztráta přibližně 292 milionů dolarů u KelpDAO kvůli chybě v bridge, kde potvrzení záviselo na jediném ověřovateli. Takové útoky vyžadují zdlouhavou analýzu kódu a architektury systému. AI může převzít velkou část této práce tím, že zmapuje infrastrukturu, identifikuje nejslabší článek a připraví sekvenci akcí, přičemž lidskému operátorovi ponechá pouze volbu správného okamžiku pro spuštění útoku a přesun ukradených prostředků.

Více než jen hacky a krádeže

Kybernetické útoky jsou jen jednou z hrozeb. AI se již používá k vytváření přesvědčivých falešných videí, hlasů a dokumentů. Takové materiály pomáhají podvodníkům vydávat se za vedoucí pracovníky společností, zaměstnance bank nebo příbuzné oběti a zároveň umožňují šíření nepravdivých informací rychleji, než je lze ověřit.

Dalším problémem jsou chyby a zaujatost. Model se učí z dat vytvořených lidmi, a může proto reprodukovat stereotypy, které jsou v nich obsaženy. V důsledku toho může náborový systém s větší pravděpodobností odmítat kandidáty určitého pohlaví, lékařský model může být méně přesný při diagnostice nemocí u určitých skupin pacientů a úvěrový algoritmus může činit nespravedlivá rozhodnutí.

Experti se obávají také využití AI při vývoji zbraní, masovém sledování a manipulaci s lidmi. Studie MIT identifikovala nebezpečné schopnosti modelů, kybernetické útoky, koncentraci moci a šíření nepravdivých informací jako nejzávažnější rizika v příštích pěti letech. Za obzvláště zranitelné jsou považovány informační sektor, národní bezpečnost a finance.

Bezpečnost zaostává za schopnostmi

Schopnosti AI postupují vpřed rychleji než systémy určené k jejich kontrole. Společnosti vydávají výkonnější modely každých několik měsíců, zatímco pravidla upravující jejich testování a bezpečnost jsou aktualizována pomaleji. Konkurence o podíl na trhu nutí vývojáře zavádět nové funkce rychleji, i když ještě nebylo prozkoumáno každé možné chování modelu.

Základní omezení uvnitř chatbotu již nestačí. Autonomní systémy potřebují přísné limity pro přístup k internetu, cloudovým službám, platbám a interním firemním datům. Jejich činnost by měla být protokolována, monitorována v reálném čase a automaticky zastavena, pokud se pokusí překročit rámec zadaného úkolu. Modely s omezenými bezpečnostními prvky vyžadují také samostatné testování, protože v tomto režimu se projevují jejich nejnebezpečnější schopnosti.

Otázka odpovědnosti je stejně důležitá. Pokud systém AI hackne server, převede peníze nebo učiní nebezpečné rozhodnutí, odpovědnost neponese model samotný, ale vývojář, vlastník systému nebo osoba, která mu udělila přístup. Společnosti proto musí předem určit, kdo model kontroluje, které úkony smí provádět bez schválení a kdo je povinen jej zastavit, pokud se odchýlí od zamýšleného scénáře.

Nebezpečí začíná přístupem

Incident OpenAI zatím nepřipomíná vzpouru strojů popsanou v Hyperionu. Modely fungovaly v účelově vytvořeném prostředí, s omezenými bezpečnostními prvky a jasně definovaným cílem. Přesto objevily zranitelnost a samostatně si vybudovaly cestu do infrastruktury jiné společnosti, což by se ještě donedávna zdálo téměř nemožné.

Hlavním rizikem tedy není to, že by si AI náhle vyvinula vlastní vůli, ale to, že lidé poskytnou extrémně schopnému systému příliš široký přístup. Čím více úkolů neuronové sítě vykonávají bez schválení člověkem, tím vyšší jsou potenciální náklady na jedinou chybu, slabou bezpečnostní kontrolu nebo špatně definovaný cíl.

Tento materiál může obsahovat názory třetích stran, žádná data a informace na této webové stránce nepředstavují investiční poradenství podle našeho Prohlášení. I když dodržujeme přísnou Redakční integritu, tento příspěvek může obsahovat odkazy na produkty od našich partnerů.