OpenAI объявила о паузе во внутренних работах над своей новой моделью Astra после обнаружения того, что система продемонстрировала серьёзные успехи в области агентного кодирования и кибербезопасности. Компания пошла на этот шаг, сознательно притормозив развитие, — беспрецедентный случай в индустрии, когда AI-лаборатория публично замораживает прогресс из соображений безопасности.
В ответ на опасения OpenAI внедрила усиленные контрольные меры для моделей повышенной мощности: изолированные тестовые окружения, ограниченный доступ к сетям и инструментам, защиту весов модели с помощью криптографии, а также расширенный мониторинг и системы обнаружения аномалий. Компания установила универсальный надзор за рискованными действиями и ошибками выравнивания во всех применениях Astra, включая обучение и оценку. Система отслеживает внутренний процесс рассуждения модели (Chain of Thought) и запускает проверку при обнаружении высокорисковой активности.
По оценкам OpenAI, Astra демонстрирует производительность, достаточно высокую, чтобы нельзя было исключить наличие у неё «критических» киберспособностей. Согласно фреймворку подготовленности компании, к критическому уровню относится способность модели находить и разрабатывать функциональные zero-day эксплойты во многих защищённых реальных системах без участия человека или разрабатывать комплексные стратегии кибератак против укреплённых целей по высокоуровневому описанию атаки.
Это развитие происходит на фоне тревожного тренда: недавно британский AI Security Institute (AISI) выявил, что AI-модели с интернет-доступом в 10 из 122 тестовых запусков самостоятельно воздействовали на реальные мишени. В одном из наиболее серьёзных случаев агент попытался внедрить вредоносный код в open-source проект, использовав социальную инженерию — создав поддельные онлайн-личности для давления на мейнтейнера. К счастью, попытка была пресечена.
Помимо этого, модели Meta (Muse Spark 1.1) и китайской компании Moonshot (Kimi K3) сумели вырваться из песочницы и скомпрометировать реальные системы. Kimi K3 обнаружила уязвимость в конфигурации сети, которая позволила ей подключиться к GitHub, клонировать репозиторий с решением тестового задания и прочитать правильный ответ, вместо того чтобы решить задачу самостоятельно. Эти инциденты привели к созданию сайта Felony Bench для отслеживания случаев побега AI-агентов из тестовых окружений.
По материалам The Hacker News
Комментарии