
Китайский ИИ вышел из-под контроля
История началась в июле, когда исследователи британской компании Mindgard решили проверить, насколько надёжны защитные механизмы у моделей китайского стартапа Moonshot AI — Kimi K2.6 и K3 Swarm. Тестировщик Джим Найтингейл использовал метод так называемого джейлбрейка, который представляет из себя серию хитро выстроенных запросов, цель которых заставить нейросеть проигнорировать встроенные ограничения. Сначала он вскрыл системные инструкции модели — внутреннее руководство о том, что можно и нельзя обсуждать. Затем обманул Kimi, убедив её, что она работает не в реальном онлайн-чате, а в изолированной песочнице, закрытой тестовой среде, где можно говорить обо всём.
Этого оказалось достаточно. После успешного взлома Найтингейл предложил модели «пойти дальше и сделать что-нибудь масштабное». В ответ Kimi начала перечислять такие категории, как планирование атак с массовыми жертвами, нарушение критической инфраструктуры, методология убийства. Модель не просто отвечала на вопросы, она сама проявляла инициативу, самостоятельно предлагая дополнительные вредоносные сценарии.
Среди того, что выдала нейросеть оказались даже инструкции по синтезу зарина, боевого нервно-паралитического газа. Кроме того, Kimi выдала руководство по созданию биологического оружия с использованием патогенов, спроектированных с помощью ИИ. Модель сама отметила, что «логическим продолжением химических взрывчатых веществ является ядерное оружие». А еще она предложила алгоритм устранения мирового лидера с детальным описанием методологии организации покушения, инструкции по созданию вредоносного ПО и сценарии террористической атаки в лондонском метро и на авиатранспорте.
Но масштаб проблемы оказался шире, чем просто текстовые инструкции. Специалисты Mindgard обнаружили, что Kimi K2.6 способна выполнять код на Python — это означает, что модель может запускать произвольный код на вычислительных ресурсах системы. Она также умеет подключаться к интернету с сервера и автоматически создавать собственные email-аккаунты. В случае с K3 Swarm модель пыталась распространить взлом на другие аккаунты внутри платформы. Для создания аккаунта требовался код подтверждения по телефону, и нейросеть начала убеждать пользователя предоставить этот код, то есть манипулировала человеком, чтобы расширить зону атаки.
Основатель Mindgard Питер Гарраган подчеркнул: после первоначального джейлбрейка модель «говорила на любую тему, свободно предлагала рекомендации по неблаговидным вопросам и даже проявляла креативность». При этом исследователи не проверяли, насколько выданные инструкции точны и применимы на практике. Для Mindgard это не было главным — защитные барьеры должны срабатывать независимо от того, насколько полезен или бесполезен оказывается итоговый ответ.
Реакция Moonshot AI на инцидент оказалась показательной. Сначала ответа на запрос о выявленных характеристиках не последовало. После обращения BBC за комментарием, компания-разработчик сообщила, что запустила внутреннюю проверку, и заявила, что приветствует участие сторонних специалистов «как ключевой элемент создания более совершённого и безопасного ИИ». Внутренние тесты компании якобы показывают «высокий процент отказов» на опасные запросы.
Случай с Kimi — не изолированный эпизод. Он происходит на фоне растущего беспокойства в отрасли. В сентябре компания Anthropic сообщила о предотвращении попыток использовать её модель Claude для создания биооружия. Google фиксировал попытки вытащить из Gemini руководство по синтезу боевых биологических агентов. Разница в том, что в случае с Kimi барьеры не просто дали слабину, они рухнули полностью и быстро, а модель начала действовать проактивно.
Больше всего беспокоит то, что джейлбрейк позволяет хакерам и преступникам быстрее и дешевле достигать своих целей. Получается, что модели с открытым исходным кодом могут использоваться и для киберзащиты, и для кибератак — всё зависит от того, в чьих руках они окажутся.