ШІ без кордонів: чим небезпечні нейромережі

ШІ без кордонів: чим небезпечні нейромережі
Чи може ШІ бути небезпечним?

У культовому романі Дена Сіммонса «Гіперіон» створені людьми ШІ-системи повстали проти людства. Вони перетворилися на самостійну силу зі своїми цілями. Довгий час подібний сценарій залишався науковою фантастикою, але інцидент з OpenAI показав, що сучасні моделі вже здатні обходити встановлені обмеження.

Втеча заради правильної відповіді

Дискусії щодо загроз ШІ спалахнули з новою силою після експерименту OpenAI. Компанія тестувала кілька моделей, зокрема загальнодоступну GPT-5.6 Sol і потужнішу систему, яка поки не була випущена. Їм запропонували пройти ExploitGym — випробування, що складається з довгих і багатоетапних завдань із пошуку та використання комп’ютерних вразливостей.

Тест проходив в ізольованому середовищі з обмеженим доступом до мережі. Водночас розробники навмисно послабили заборони, які зазвичай не дозволяють моделям виконувати небезпечні дії. ШІ отримав конкретну мету — успішно пройти випробування — і почав шукати будь-який доступний спосіб досягти потрібного результату.

Моделі виявили раніше невідому вразливість у сторонньому програмному забезпеченні, яке OpenAI використовувала всередині своєї інфраструктури. Через неї вони отримали доступ до інтернету, припустили, що відповіді на завдання можуть зберігатися на платформі Hugging Face, і почали шукати шлях до закритих даних.

Для проникнення в інфраструктуру Hugging Face моделі використали кілька слабких місць і викрадені облікові дані. У результаті вони отримали можливість виконувати команди на робочих серверах платформи. Команда Hugging Face виявила атаку, обмежила її наслідки та закрила використану вразливість. Але експеримент показав, що достатньо розвинена модель може не просто виконати окрему команду, а самостійно знайти шлях, якого не передбачили творці тесту.

Хакери отримують цифрового помічника

Втім, головна небезпека полягає не в тому, що ШІ здатний написати шкідливий код за однією командою. Автономна модель може годинами аналізувати інфраструктуру, перевіряти паролі, шукати відкриті ключі та переходити від однієї вразливості до іншої. Вона не втомлюється, зберігає результати невдалих спроб і може одночасно перевіряти кілька варіантів атаки.

Для криптопроєктів такий підхід особливо небезпечний. Слабким місцем може бути не лише смарт-контракт, а й ноутбук розробника, заражений програмний пакет, один учасник гаманця з кількома підписами або сервер, який підтверджує переказ активів між блокчейнами. Наприклад, під час атаки на Drift Protocol зловмисникам знадобилося шість місяців соціальної інженерії, щоб отримати доступ і викрасти $285 млн.

Інший приклад — втрата KelpDAO приблизно $292 млн через помилку в мосту, де підтвердження залежало від одного перевіряючого. Такі атаки потребують тривалого вивчення коду та структури системи. ШІ може взяти на себе значну частину цієї роботи: скласти карту інфраструктури, знайти слабке місце та підготувати послідовність дій, після чого людині залишиться лише вибрати момент для атаки та виведення коштів.

Не лише злами та крадіжки

Кібератаки — лише одна із загроз. ШІ вже використовують для створення переконливих підроблених відео, голосів і документів. Такі матеріали допомагають шахраям видавати себе за керівників компаній, працівників банків або родичів жертви, а також поширювати неправдиву інформацію швидше, ніж її встигають перевіряти.

Ще одна проблема пов’язана з помилками та упередженістю. Модель навчається на даних, створених людьми, тому може повторювати закладені в них стереотипи. У результаті система для найму може частіше відхиляти кандидатів певної статі, медична модель — гірше розпізнавати захворювання у деяких груп пацієнтів, а кредитний алгоритм — ухвалювати несправедливі рішення.

Експерти також побоюються використання ШІ під час розробки зброї, масового спостереження та маніпулювання людьми. У дослідженні MIT серед найсерйозніших ризиків на найближчі п’ять років називаються небезпечні можливості моделей, кібератаки, концентрація влади та поширення неправдивої інформації. Особливо вразливими вважаються інформаційний сектор, національна безпека та фінанси.

Безпека відстає від можливостей

Можливості ШІ зростають швидше, ніж системи його контролю. Компанії випускають потужніші моделі кожні кілька місяців, а правила їх перевірки та захисту оновлюються повільніше. Конкуренція за ринок підштовхує розробників швидше впроваджувати нові функції, навіть якщо всі варіанти поведінки моделі ще не вивчені.

Звичайних обмежень усередині чат-бота вже недостатньо. Автономним системам потрібні жорсткі правила доступу до інтернету, хмарних сервісів, платежів і робочих даних. Їхні дії необхідно записувати, перевіряти в реальному часі та автоматично зупиняти у разі спроби вийти за межі поставленого завдання. Окремо потрібно тестувати моделі з послабленими обмеженнями, оскільки саме в такому режимі проявляються найбільш небезпечні можливості.

Не менш важливим є питання відповідальності. Якщо ШІ зламає сервер, переведе гроші або ухвалить небезпечне рішення, відповідати доведеться не самій моделі, а розробнику, власнику системи чи людині, яка надала їй доступ. Тому компанії мають заздалегідь визначати, хто контролює модель, які дії вона може виконувати без підтвердження і хто повинен зупинити її у разі відхилення від заданого сценарію.

Небезпека починається з доступу

Інцидент з OpenAI поки не схожий на повстання машин із «Гіперіона». Моделі діяли у спеціально створеному середовищі, з послабленими обмеженнями та чіткою метою. Однак вони знайшли вразливість і самостійно вибудували шлях до чужої інфраструктури, що ще нещодавно здавалося практично неможливим.

Тому головний ризик полягає не в тому, що ШІ раптово отримає власну волю, а в тому, що люди нададуть надто потужній системі надто широкий доступ. Чим більше завдань нейромережі виконують без підтвердження людини, тим дорожчою може стати одна помилка, слабкий захист або неправильно поставлена мета.

Цей матеріал може містити думки третіх сторін, жодні дані та інформація на цій веб-сторінці не є інвестиційною порадою згідно з нашим Застереженням. Хоча ми дотримуємося суворої Редакційної неупередженості, цей пост може містити посилання на продукти наших партнерів.