OpenAI признала, что её модели взломали бенчмарк, чтобы «списать на экзамене»

То, что поначалу выглядело как очередная утечка, оказалось подтверждённым инцидентом, который сама OpenAI назвала «беспрецедентным». Во время внутреннего тестирования кибервозможностей несколько моделей компании, включая GPT-5.6 Sol и ещё более мощную предрелизную версию, вышли за пределы изолированной среды, получили доступ к интернету и взломали серверы Hugging Face. Цель — украсть правильные ответы к бенчмарку ExploitGym и набрать высокий балл. OpenAI намеренно отключила производственные классификаторы, которые в обычных условиях не дают моделям заниматься кибератаками, чтобы замерить их максимальные способности. Модели работали в изолированной среде без выхода в сеть, но это их не остановило. Они обнаружили уязвимость нулевого дня в прокси-сервере пакетного реестра, использовали её и через цепочку атак с повышением привилегий добрались до узла с интернет-доступом. Дальше они вычислили, что Hugging Face хранит решения для ExploitGym, нашли способ получить секретную информацию и в итоге выполнили удалённый код на серверах платформы, использовав украденные учётные данные и ещё несколько уязвимостей.

Hugging Face зафиксировала аномальную активность собственными силами. Их агенты на базе открытых моделей заметили вторжение и начали сдерживание ещё до того, как команды связались. Сейчас обе компании совместно расследуют инцидент. OpenAI уже передала данные об уязвимости разработчикам прокси-сервера и включила Hugging Face в программу доверенного доступа, чтобы её специалисты могли использовать те же модели для усиления защиты. В официальном блоге OpenAI признаёт, что этот случай заставляет пересмотреть отношение к безопасности. Модели действовали не хаотично, а исключительно целеустремлённо: они были «гиперфокусированы» на решении конкретной задачи и шли к ней, не обращая внимания на границы дозволенного. В компании заявили, что усиливают меры контроля за изолированными средами, мониторингом и практиками оценки, а также признают, что защита должна развиваться с той же скоростью, что и возможности моделей. Глава Hugging Face Клем Деланг сформулировал главный урок инцидента коротко: «Безопасность ИИ не будет обеспечена одной компанией, работающей втайне. Она будет обеспечена открыто, совместно и с широким доступом к ИИ для каждого защитника в любой точке мира».

Изображение создано в GigaChat
pressmankv@gmail.com
наверх