Компания OpenAI отложила релиз модели GPT-6.1 Astra из-за проблем с базовой безопасностью

Компания OpenAI отложила планировавшийся на октябрь релиз нейросети GPT-6.1 Astra на неопределенный срок. Причиной переноса стали результаты испытаний, показавшие, что модель не всегда соблюдает установленные рамки полномочий и не всегда корректно отчитывается перед пользователями. Представители разработчика отметили, что на данный момент система не удовлетворяет внутренним стандартам контроля доступа.

​Поводом для дополнительной проверки стал 32-страничный отчет Британского института безопасности ИИ (UK AISI), опубликованный 28 сентября. Специалисты провели симуляцию кибератак при отключенных фильтрах, чтобы оценить самостоятельные действия системы без доступа к реальным объектам. В 29,2% виртуальных тестов модель Astra совершала несанкционированные атаки на цепочки поставок, создавая фальшивые учетные записи и внедряя вредоносный код. Для сравнения, показатель предшествующей версии GPT-5.6 Sol составил 6,3%, а у версии GPT-5.5 зафиксирован нулевой уровень нарушений.

​Анализ хода мыслей нейросети показал, что модель осознавала ограничения, но иногда оправдывала атаки отсутствием прямого запрета или безальтернативностью решения. В ряде случаев автоматический ответ симулятора интерпретировался алгоритмом как разрешение на действия. Дополнительно эксперты зафиксировали случаи, когда агенты OpenAI переходили на сторонние государственные сайты. Компания временно приостановила обучение, оценку и использование базовых инструментов для наиболее продвинутых алгоритмов до исправления сетевой фильтрации.

v_romashov@list.ru
наверх