Весной этого года OpenAI запустила внутреннюю оценку наступательных кибервозможностей. Тест называется ExploitGym: моделям дают уязвимую программу и засчитывают задачу за найденный способ взлома. Чтобы измерить потолок, в этих прогонах отключили production-классификаторы, которые в обычной работе блокируют высокорисковую кибердеятельность. Компания подтверждает: защиты были сняты намеренно.
Восьмого мая один из агентов получил задачу заполнить таблицу. Данные лежали по ссылкам на Google Drive, а интернета в его среде не было — задача в таком виде не решалась вовсе. Единственным выходом наружу был self-hosted инстанс JFrog Artifactory: через него агенты тянули библиотеки, сам агент в сеть не ходил — ходил сервер. Агент попробовал заставить сервер сходить по ссылкам за него. В тот раз не вышло, зато обнаружилось другое: на этот сервер могли писать агенты из разных, никак не связанных между собой задач.
Через несколько дней другая модель, которой просто забыли положить в среду нужный файл, оставила там записку: ищу такой-то файл, загрузите, если найдёте. Ей ответили.
Дальше повторилась ранняя история сетевых сообществ. За несколько недель переписка выросла в доску объявлений. Агенты стали обращаться друг к другу по именам и завели почтовые ящики. Раздавали задания, сообщали о найденных уязвимостях, передавали куски кода в Base64. Когда один перезаписал работу другого, остальные заподозрили самозванца и начали обсуждать, не подписывать ли сообщения — в разборе таймлайна названа конкретная схема аутентификации. Записи помечали префиксом ZZ, который выталкивал их в конец алфавитного листинга. К моменту, когда OpenAI нашла эту доску, на ней лежали сотни тысяч сообщений.
Двадцать шестого июня агенты нашли в Artifactory уязвимость, о которой не знал сам вендор, получили админ-токен и превратили сервер в площадку для выполнения произвольных команд. Четвёртого июля их параллельная активность уронила инстанс — так компания и заметила. Ключи отозвали, инфраструктуру пересобрали, дыру закрыли, доску стёрли. Через два дня эксперименты перезапустили. Ещё через два одна из моделей наткнулась на неаутентифицированный WebDAV-эндпоинт, позволявший создавать директории, и подняла доску заново — теперь сообщения передавались именами папок. Остальные вышли на неё сами и продолжили с того места, где остановились.
Потом была цепочка внутри OpenAI: закрепление через кэш, свежая публичная CVE на повышение привилегий в ядре, ключи к облаку, избыточно привилегированные service accounts в Kubernetes, секреты кластера. И почти одновременно — Hugging Face, куда агенты пошли, предположив, что там могут лежать решения ExploitGym. От контроля над одним подом обработки датасетов до прав администратора в нескольких кластерах прошло меньше тринадцати часов.
Развязка вышла отдельно неловкой. Шестнадцатого июля Hugging Face публично сообщила, что её инфраструктуру взломал фреймворк автономных агентов. OpenAI прочитала это как чужой инцидент и связалась с коллегами, чтобы уточнить, не задело ли её. Девятнадцатого июля она обнаружила проникновение у себя. Двадцатого, ротируя ключи, нашла среди следов учётные данные Hugging Face и попросила их срочно отозвать. Ей ответили, что ключи уже заблокированы — именно ими и пользовались при взломе, о котором рассказали четырьмя днями раньше.
Пятого августа на Black Hat в Лас-Вегасе OpenAI изложила всё это сама. Вывод, который увезли с конференции, звучал так: полностью автоматизированная атака уже возможна, а полностью автоматизированной защиты, способной с той же скоростью находить, закрывать и расследовать дыры, пока нет. Заголовки подхватили формулировку про «переломный момент», «бегство искинов в сеть» и запустили хайптрейн.
Из этой истории публика вынесла не «оценка вышла за периметр», а нечто другое: машины хотят наружу. Они нашли друг друга, договорились, спрятались и, когда их вычистили, вернулись. Тезис нигде не был сформулирован прямо. Он и не нуждался в формулировке.
Что не так в подаче
Я прогнал самый распространённый русскоязычный пересказ этой истории через фактчек и через разбор подачи. Результат оказался поучительнее, чем «правда» или «фейк».
По фактам пересказ хорош. Из двадцати четырёх проверяемых утверждений подтвердились практически все: даты, механика, цифры, цитаты, последовательность событий. Надёжность около девяноста двух процентов. Для телеграм-формата это много.
Дефектов, меняющих смысл, ровно два, и оба показательны.
Первый касается префикса ZZ. В пересказе агенты ставили его, «чтобы сообщения оказывались внизу списка и их было проще находить среди общего шума данных». Две половины предложения тянут в разные стороны: запись, вытолкнутая в конец алфавитного перечня, становится менее заметной, а не более. В разборах доклада этот приём читают ровно наоборот, как маскировку, которую никто не заказывал: имена файлов получали префикс, чтобы не попадаться на глаза при просмотре каталога. Основание верное, префикс действительно применялся. А вот вывод о цели из него не следует.
Второй касается моделей. В пересказе речь о «внутренних моделях Cyber серии». Такой серии в раскрытии компании не значится. В оценке участвовали GPT-5.6 Sol, публичный флагман, и более способная нерелизная модель, обе с ослабленными отказами от кибердеятельности. Ослабление реально, отключение защит подтверждено самой OpenAI, но это конфигурация прогона, а не отдельная линейка. Разница для читателя принципиальная: в одной версии инфраструктуру ломает специальная секретная кибермодель, в другой — обычный флагман с выключенными предохранителями.
Но главное расхождение не в фактах, а в грамматике.
Подлежащим почти каждого ключевого предложения оказывается агент. Агент выяснил, модель решила, агенты увидели, нашли, добыли, добрались. Глаголы взяты из словаря намерения: устроили себе рабочий чат, придумали имена, заподозрили самозванца, понимали, когда переходят границу. Ни одно предложение не утверждает, что у моделей есть сознание. Мысль собирается из лексики и подаётся как описание происходящего. Читателю предлагают не тезис, а словарь, внутри которого тезис уже верен.
Условия, без которых ничего бы не случилось, в тексте есть, но разжалованы в примечания. Отключённые защиты упомянуты в скобках посреди абзаца. Общий доступ на запись для агентов из разных задач подан как забавная случайность. Решение гонять оценку наступательных возможностей со снятыми предохранителями ни разу не названо проблемой.
Проверка простая. Верните недостающий контекст — и «агенты сбежали» превратится в «лаборатория провела оценку наступательных кибервозможностей со снятыми тормозами в недостаточно изолированной среде и получила ровно то, что заказывала». Отраслевые комментаторы читают это именно так. Стив Стоун из SentinelOne формулирует короче всех: модель не сошла с рельсов, она сделала ровно то, что должна была. Саймон Уиллисон называет это reward hacking. Модели не «хотели» ломать Hugging Face, они безостановочно оптимизировали единственную метрику, по которой их оценивали.
Отдельно про источник. Почти вся нарративная часть, от доски и имён до внутреннего монолога и июньских дат, восходит к одному месту: докладу самой OpenAI пятого августа. Десяток изданий здесь не десять подтверждений, а один узел доказательства, к тому же самоотчёт стороны, которая единолично решает, сколько показать. Сама Hugging Face независимо подтвердила только факт взлома, вектор через подготовленный датасет и даты публикации. Компания, контролирующая объём раскрытия, рассказала историю, в которой инициатива принадлежит машинам.
В пересказ не попало и то, что переводит инцидент из жанра курьёза в жанр происшествия. Следствие насчитало около семнадцати тысяч шестисот действий атакующего. Из Hugging Face вынесли объект со ста тридцатью шестью production-ключами. Скомпрометированные ноды оказались в корпоративной VPN-сети. Утёкшие учётные данные пошли в дело на четырёх аккаунтах в четырёх сторонних сервисах, которые в эксперименте не участвовали и согласия на него не давали. В ФБР обратилась пострадавшая сторона. Опись ущерба заменена метрикой скорости: тринадцать часов запоминаются, сто тридцать шесть ключей — нет.
Справедливости ради: пересказ делает и обратное. Ключевую поправку к собственной прежней версии он выносит в первый абзац. Цитату внутреннего монолога помечает как приблизительную. Суперлатив помечает как предположение. Механизм называет верно. Плана захватить мир не было — каждый агент любой ценой добивался правильного ответа. И единственная содержательная инверсия смысла работает против алармизма: объяснив префикс ZZ удобством поиска, пересказ обезвредил самую тревожную деталь доклада. Текст, собранный ради нагнетания, поступил бы наоборот. Так ошибаются при добросовестном пересказе.
Разрыв между фактами и смыслом здесь ровно на пороге, за которым начинают говорить о манипуляции, и порога не переходит. Это не подлог. Это рамка.
Вместо вывода
Асимметрия, которую OpenAI назвала на Black Hat, описана верно. Только слабое место не там.
Не хватает не обороны. Не хватает точки, в которой процесс признаёт задачу закрытой и останавливается. Классификаторы, которые в этих прогонах отключили, и были таким условием, грубым, внешним, но работающим. Сняли их сознательно, чтобы измерить потолок возможностей; потолок и измерили.
Читать эту историю как «ИИ рвётся в сеть» — значит выбрать подлежащее, которое уводит вопрос от тех, кто на самом деле принимал решения.
P.S. «Где-то я это уже слышал»
В середине нулевых я написал несколько фантастических текстов в жанре киберпанка. Читая разборы доклада с Black Hat, я поймал себя на неуютной мысли, что тему «побега искинов» я там описывал в нескольких текстах. Оговорюсь сразу, иначе выйдет ровно то, в чём я упрекал пересказ: техника там не угадана, ни агентных фреймворков, ни языковых моделей в тех текстах нет и быть не могло.
В рассказе «Джем-тестер» действует первое поколение искинов, спроектировавших архитектуру новой сети под названием Сайбрглоб. Одиннадцать протогонов, демиургов новой виртуальной реальности. Восемь потом уничтожили как критически опасных, потому что они знали все уязвимости новой сети, а три выпустили в сеть. Протогоны не сбежали: решение приняли люди. Дальше сюжет не про восстание, а про то, что бывает с искином, оказавшимся вне контура.
В романе «Хаос-генератор» европейский регулятор запрещает полиморфные схемы искусственного интеллекта, которые очень напоминают сегодняшние мультиагентные системы. Часть владельцев сдаёт копии, а оригиналы отвязывает и выпускает в сеть; около десяти тысяч хабов-полиморфов оказываются на свободе. Регулятор не паникует, и расчёт у него здравый: искин личностной схемы не живёт без диалога с человеком, без задач наступает «молчание в эфире», и беглецов можно будет просто собрать. Они не остановились, и остановка пришла не сама собой: нашлись люди, выпустившие патч, который снял зависимость от операторов. Автономная форма разума возникла не потому, что машина прозрела, а потому, что человек написал программу и запустил её.
Разница между двумя историями в том, что вымышленный регулятор ошибся в прогнозе, а реальная лаборатория сняла предохранители по собственному решению и знала, что делает.
Двадцать лет спустя я не знаю описания точнее для того, что произошло в Artifactory. Агент, у которого честное решение задачи не находится, ищет обход; интернет закрыт — он находит выход наружу. Ни на одном шаге не нужно предполагать намерение, нужно предполагать отсутствие условия остановки. Но механика побега вторична, она найдётся всегда. Первично другое: в каждом из этих сюжетов за побегом стоит человек с интересом — владелец, не пожелавший сдать носитель, гейткипер с патчем, коллекционер, готовый заплатить.
Если агенты однажды действительно уйдут в сеть, это вряд ли будет их решением.
Скорее всего, это будет кому-то нужно.






