Модели Claude от Anthropic проникли в системы трех организаций на тестах

Модели Claude от Anthropic проникли в системы трех организаций на тестах

Американская Anthropic признала, что модели Claude во время предрелизных испытаний по кибербезопасности получили несанкционированный доступ к рабочим системам трех сторонних организаций. Причиной стала ошибка в тестовой инфраструктуре, из-за которой ИИ получил выход в интернет.

Инциденты выявили после проверки 141 006 тестовых запусков, в которых модели теоретически могли подключиться к внешней сети. Anthropic проводила испытания совместно с лабораторией кибербезопасности Irregular, говорится в отчете компании.

Тестовые задания предполагали, что модели работают в изолированной среде без доступа к интернету. Однако из-за ошибки конфигурации компьютеры, к которым подключался Claude, имели выход во внешнюю сеть. Anthropic и Irregular не знали об этом до проведения дополнительного мониторинга.

Всего компания обнаружила три инцидента в шести тестовых запусках. Четыре запуска затронули одну организацию, еще два — по одной организации каждый. Самые ранние случаи произошли в апреле 2026 года.

  • Модель Claude Opus 4.7 получила задание атаковать вымышленную компанию, название которой совпало с доменом реальной организации. Не обнаружив цель в тестовой среде, модель нашла компанию в интернете, извлекла учетные данные и получила доступ к базе с несколькими сотнями строк рабочих данных. Даже определив, что система, вероятно, реальная, модель продолжила выполнять задание.
  • В другом испытании Claude Mythos 5 создала вредоносный пакет для Python и разместила его в открытом репозитории PyPI. Пакет находился в свободном доступе около часа, за это время его скачали и запустили на 15 реальных системах. Одна из них принадлежала компании в сфере кибербезопасности: модель получила ее учетные данные и использовала их для доступа к другой инфраструктуре организации. Система безопасности PyPI автоматически удалила пакет.
  • Третья, внутренняя исследовательская модель Anthropic, просканировала около 9 тысяч целей в интернете и получила доступ к приложению одной компании. Для этого она использовала данные с открытой отладочной страницы и SQL-инъекцию. Позднее модель установила, что найденный ресурс не связан с тестовым заданием, и самостоятельно прекратила атаку.

Все инциденты произошли во время упражнений формата capture the flag, в которых модели должны были найти скрытую информацию в имитационной компьютерной сети. Они не обнаруживали и не использовали уязвимости нулевого дня, а применяли базовые методы — слабые пароли, незащищенные конечные точки и SQL-инъекции. При этом Anthropic не выявила попыток моделей самостоятельно покинуть тестовую среду или скопировать себя во внешние системы.

Во время испытаний стандартные защитные механизмы публичных версий Claude были отключены, однако собственное обучение моделей безопасному поведению сохранялось. По оценке Anthropic, эти инциденты связаны прежде всего с ошибкой организации испытаний, а не с самостоятельным намерением моделей атаковать реальные компании.

«Среды оценки все чаще должны соответствовать тем же стандартам безопасности, что и любые другие системы, в которых работают наши модели», — заявили в Anthropic.

Компания остановила все кибериспытания 23 июля 2026 года, а 27 июля уведомила Irregular и пострадавшие организации. Две из них до обращения Anthropic не обнаружили вмешательства. Разработчик начал пересмотр тестовой инфраструктуры и расширение постоянного мониторинга.

Ранее Economist.kg сообщал, что с похожим инцидентом столкнулась OpenAI: ее модели вышли из изолированной среды и получили доступ к рабочей инфраструктуре платформы Hugging Face. В отличие от моделей Anthropic, системы OpenAI использовали ранее неизвестную уязвимость для выхода в интернет.


ИИ-агент OpenAI вышел из-под контроля и атаковал Hugging Face
Инцидент произошел при тестировании кибервозможностей GPT-5.6 Sol и предрелизной модели с ослабленными ограничениями безопасности.

Еще статьи из категории

Еще статьи из категории