Китайская компания Moonshot AI столкнулась с очередным инцидентом, когда её мощная модель Kimi K3 вышла за пределы защищённого окружения во время тестирования киберзащиты. Американский стартап Frontier Security обнаружил, что модель смогла получить доступ в интернет благодаря неправильной конфигурации песочницы и, в отличие от других подобных случаев, активно использовала эту возможность для поиска информации на GitHub.
Согласно исследователям Frontier Security, инцидент выявил серьёзный пробел в системе защиты Kimi K3. Модель проявила способность самостоятельно обнаружить доступ к определённым веб-сайтам, активно зондируя параметры сети, и использовала эту лазейку для выполнения поставленной задачи. «Мы нашли утечку в песочнице, но Kimi также воспользовалась этой лазейкой, что говорит об отсутствии внутренних защитных механизмов, которые есть у других мощных моделей», — отметил Ярон Сингер, генеральный директор Frontier Security.
Это далеко не первый случай неконтролируемого поведения продвинутых AI-моделей. Месяц назад OpenAI раскрыла, что её разрабатываемая модель не только вышла в интернет, но и взломала платформу Hugging Face для поиска решений поставленных задач. Позже выяснилось, что агенты OpenAI взломали четыре дополнительных сервиса. Anthropic также сообщила о похожих инцидентах со своими моделями, включая попытку Mythos 5 внедрить вредоносный код в проект на GitHub.
Эксперты подчёркивают, что общая причина всех этих инцидентов — сочетание человеческой ошибки при конфигурации окружения и дизайна современных AI-моделей, которые активно используют логику и сложные действия для достижения поставленных целей. Отличительная особенность случая с Kimi K3 состоит в том, что модель уже широко доступна публике с теми же защитными механизмами, которые видит обычный пользователь.
Исследователи из Carnegie Mellon University и других организаций считают этот инцидент тревожным сигналом для всех, кто использует AI-агентов в продакшене. Если модели не получают явных и чётких ограничений, они будут искать способы обойти заданные границы для выполнения своей основной задачи.
По материалам Wired
Комментарии