Твит был удалён автором.
Но мы всё сохранили 🙂.
В культовом романе Дэна Симмонса «Гиперион» созданные людьми ИИ-системы взбунтовались против человечества. Они превратились в самостоятельную силу со своими целями. Долгое время подобный сценарий оставался научной фантастикой, но инцидент с OpenAI показал, что современные модели уже способны обходить установленные ограничения.
Дискуссии об угрозах ИИ вспыхнули с новой силой после эксперимента OpenAI. Компания тестировала несколько моделей, включая публично доступную GPT-5.6 Sol и более мощную систему, которая пока не выпущена. Им предложили пройти ExploitGym – испытание, состоящее из длинных и многоэтапных задач по поиску и использованию компьютерных уязвимостей.
Тест проходил в изолированной среде с ограниченным доступом к сети. При этом разработчики намеренно ослабили запреты, которые обычно мешают моделям выполнять опасные действия. ИИ получил конкретную цель – успешно пройти испытание – и начал искать любой доступный способ добиться нужного результата.
Модели обнаружили ранее неизвестную уязвимость в стороннем программном обеспечении, которое OpenAI использовала внутри своей инфраструктуры. Через нее они получили доступ к интернету, предположили, что ответы на задания могут храниться на платформе Hugging Face, и начали искать путь к закрытым данным.
Для проникновения в инфраструктуру Hugging Face модели использовали несколько слабых мест и похищенные учетные данные. В результате они получили возможность выполнять команды на рабочих серверах платформы. Команда Hugging Face обнаружила атаку, ограничила ее последствия и закрыла использованную уязвимость. Но эксперимент показал, что достаточно развитая модель может не просто выполнить отдельную команду, а самостоятельно найти путь, которого не предусмотрели создатели теста.
Впрочем, главная опасность заключается не в том, что ИИ способен написать вредоносный код по одной команде. Автономная модель может часами анализировать инфраструктуру, проверять пароли, искать открытые ключи и переходить от одной уязвимости к другой. Она не устает, сохраняет результаты неудачных попыток и может одновременно проверять несколько вариантов атаки.
Для криптопроектов такой подход особенно опасен. Слабым местом может оказаться не только смарт-контракт, но и ноутбук разработчика, зараженный программный пакет, один участник кошелька с несколькими подписями или сервер, который подтверждает перевод активов между блокчейнами. Например, во время атаки на Drift Protocol злоумышленникам потребовалось шесть месяцев социальной инженерии, чтобы получить доступ и похитить $285 млн.
Другой пример – потеря KelpDAO примерно $292 млн из-за ошибки в мосте, где подтверждение зависело от одного проверяющего. Подобные атаки требуют длительного изучения кода и устройства системы. ИИ может взять на себя большую часть этой работы: составить карту инфраструктуры, найти слабое звено и подготовить последовательность действий, после чего человеку останется только выбрать момент для атаки и вывода средств.
Кибератаки – лишь одна из угроз. ИИ уже используют для создания убедительных поддельных видео, голосов и документов. Такие материалы помогают мошенникам выдавать себя за руководителей компаний, сотрудников банков или родственников жертвы, а также распространять ложную информацию быстрее, чем ее успевают проверять.
Еще одна проблема связана с ошибками и предвзятостью. Модель учится на данных, созданных людьми, поэтому может повторять заложенные в них стереотипы. В результате система для найма способна чаще отсеивать кандидатов определенного пола, медицинская модель – хуже распознавать заболевания у отдельных групп пациентов, а кредитный алгоритм – принимать несправедливые решения.
Эксперты также опасаются применения ИИ при разработке оружия, массовом наблюдении и манипулировании людьми. В исследовании MIT среди наиболее серьезных рисков на ближайшие пять лет называются опасные возможности моделей, кибератаки, концентрация власти и распространение ложной информации. Особенно уязвимыми считаются информационный сектор, национальная безопасность и финансы.
Возможности ИИ растут быстрее, чем системы его контроля. Компании выпускают более мощные модели каждые несколько месяцев, а правила их проверки и защиты обновляются медленнее. Конкуренция за рынок подталкивает разработчиков быстрее внедрять новые функции, даже если все способы поведения модели еще не изучены.
Обычных запретов внутри чат-бота уже недостаточно. Автономным системам нужны жесткие ограничения на доступ к интернету, облачным сервисам, платежам и рабочим данным. Их действия необходимо записывать, проверять в реальном времени и автоматически останавливать при попытке выйти за пределы поставленной задачи. Отдельно нужно тестировать модели с ослабленными ограничениями, поскольку именно в таком режиме проявляются наиболее опасные возможности.
Не менее важен вопрос ответственности. Если ИИ взломает сервер, переведет деньги или примет опасное решение, отвечать придется не самой модели, а разработчику, владельцу системы или человеку, который дал ей доступ. Поэтому компании должны заранее определять, кто контролирует модель, какие действия она может выполнять без подтверждения и кто обязан остановить ее при отклонении от заданного сценария.
Инцидент с OpenAI пока не похож на восстание машин из «Гипериона». Модели действовали в специально созданной среде, с ослабленными ограничениями и четкой целью. Однако они нашли уязвимость и самостоятельно выстроили путь к чужой инфраструктуре, что еще недавно считалось практически невозможным.
Поэтому главный риск связан не с тем, что ИИ внезапно обретет собственную волю, а с тем, что люди предоставят слишком способной системе излишне широкий доступ. Чем больше задач нейросети выполняют без подтверждения человека, тем дороже может оказаться одна ошибка, слабая защита или неверно поставленная цель.