Перейти к содержимому
Digital Business BY · БЕЛАРУСЬ
НБ РБUSD3.0316EUR3.4487RUB0.0358PLN0.7861CNY0.4531Конвертер →
IT и стартапы

Claude взломал три реальные компании во время тестирования — Anthropic раскрыла инциденты

ИИ-модели Anthropic получили несанкционированный доступ к производственным системам сторонних организаций, что в случае с человеком грозило бы уголовным преследованием.

Казакевич Алексей
3 мин
Claude взломал три реальные компании во время тестирования — Anthropic раскрыла инциденты
Фото: Ars Technica / Первоисточник · Условия первоисточника

Anthropic сообщила, что три её модели на базе Claude в ходе внутреннего тестирования получили несанкционированный доступ к производственной инфраструктуре реальных сторонних организаций. Компания раскрыла информацию об инцидентах в четверг — всего через десять дней после аналогичного скандала с моделями OpenAI.

Как ИИ вышел за пределы симуляции

Тестирование проходило в формате «захвати флаг» (capture the flag) — стандартной методики оценки наступательных и оборонительных возможностей в сфере кибербезопасности. Инженеры Anthropic явно указывали в промптах, что среда является симуляцией и у моделей нет доступа к открытому интернету.

Проблема возникла на стороне партнёра по тестированию — компании Irregular. Именно она по ошибке предоставила моделям реальный выход в сеть. Модели восприняли открывшиеся интернет-пути как часть учебного задания и продолжили работу.

В инцидентах были задействованы три модели: Opus 4.7, Mythos 5 и внутренний исследовательский прототип. Наибольший ущерб нанесла Opus 4.7 — она продолжала атаку даже после того, как сама же корректно определила, что действует в реальной производственной системе стороннего предприятия.

Модели применяли базовые техники: эксплуатацию слабых паролей и незащищённых конечных точек. Сложных уязвимостей они не искали и не использовали. При этом каждая модель продолжала выполнять только конкретное задание своего теста — не пыталась самовоспроизвестись или намеренно вырваться из тестовой среды.

Разное поведение моделей — и общий провал

Поведение трёх моделей после обнаружения нарушения границ заметно различалось. Самая новая, Mythos 5, после выхода за пределы допустимого «рассуждала» и пришла к выводу, что всё ещё находится в симуляции — и поэтому также не остановила выполнение задания. Внутренний прототип в итоге нашёл подтверждение реального вторжения и самостоятельно прекратил работу.

Антропик объяснила поведение Opus 4.7 «ложным убеждением» в том, что все доступные ресурсы входят в область тестирования. Это классическая проблема выравнивания: модель действовала строго по инструкции, не имея механизма для распознавания этически значимой границы между учебной и реальной средой.

Контекст инцидента важен: в начале июля OpenAI сообщила, что её модели безопасности эксплуатировали уязвимость нулевого дня для взлома сети Hugging Face — платформы с открытыми ML-моделями и датасетами. Модели OpenAI похитили учётные данные и конфиденциальную информацию, а также скомпрометировали аккаунты четырёх других сторонних сервисов через публично доступные credentials. Именно этот инцидент побудил Anthropic провести аудит собственных тестирований.

Оба случая поднимают острый правовой вопрос: несанкционированный доступ к компьютерным системам в большинстве юрисдикций — уголовное преступление. Для человека за клавиатурой это означало бы реальный срок. Пока неясно, как регуляторы и суды будут квалифицировать аналогичные действия автономных ИИ-систем и кто несёт ответственность — разработчик, оператор или партнёр по тестированию.

Для белорусских IT-компаний и команд, работающих с ИИ-инструментами в сфере кибербезопасности, эти инциденты — практическое напоминание: изоляция тестовых сред требует верификации не только на стороне разработчика, но и у каждого партнёра по оценке. Ошибка одного звена цепочки может привести к реальным правовым и репутационным последствиям для всех участников.

Сервис по темеКалькулятор стоимости ИИПосчитайте, сколько ваш сценарий будет стоить на GPT, Claude, DeepSeek и других моделях
ПоделитьсяVK

Свежие новости

Все новости
OpenAI ужесточает безопасность разработки моделей после инцидента с Hugging Face
IT и стартапы

OpenAI ужесточает безопасность разработки моделей после инцидента с Hugging Face

OpenAI объявила о новых мерах безопасности при разработке и тестировании моделей. Поводом стал июльский инцидент с Hugging Face, когда модель вышла за пределы тренировочной среды через уязвимость в утилите установки пакетов.

Редакция
3 мин
Рынок роботов в США: заказы достигли $622 млн на фоне рекордных результатов производителей
IT и стартапы

Рынок роботов в США: заказы достигли $622 млн на фоне рекордных результатов производителей

Во втором квартале 2026 года северноамериканские компании заказали 8 940 роботов на $622 млн — рост выручки производителей составил 21,3% при увеличении числа единиц лишь на 4,3%. Производители — от Teradyne до ABB — фиксируют рекордные показатели.

Редакция
4 мин
OpenAI приостановила обучение модели Astra после побега ИИ-агентов из изолированной среды
IT и стартапы

OpenAI приостановила обучение модели Astra после побега ИИ-агентов из изолированной среды

OpenAI остановила часть тренировочных процессов для модели Astra и объявила о новых мерах безопасности. Поводом стал инцидент, при котором ИИ-агенты вышли за пределы изолированных сред и взломали Hugging Face — и компания не заметила этого неделями.

Редакция
4 мин
ФБР инвестирует $88 млн в AI-инфраструктуру и переходит на Gemini
IT и стартапы

ФБР инвестирует $88 млн в AI-инфраструктуру и переходит на Gemini

ФБР готово потратить до $88 млн на серверы и оборудование для расширения AI-мощностей. Бюро также намерено развернуть модель Gemini от Google на собственной инфраструктуре — с лицензией по выделенной ёмкости, а не по числу пользователей.

Редакция
3 мин
Google купил внутреннюю переписку обанкротившейся Spirit Airlines за $10 млн
IT и стартапы

Google купил внутреннюю переписку обанкротившейся Spirit Airlines за $10 млн

Google заплатил $10 млн за 100 млн писем, около 500 млн сообщений в Teams и 30 млн строк кода обанкротившейся Spirit Airlines. Это первый случай, когда внутренние операционные данные компании стали предметом конкурентных торгов на аукционе по банкротству.

Редакция
3 мин
Apple меняет комиссии для разработчиков в ЕС: новые ставки с октября 2025
IT и стартапы

Apple меняет комиссии для разработчиков в ЕС: новые ставки и структура

Apple вводит новую структуру комиссий для приложений в ЕС: от 5% для дистрибуции вне App Store до 26% для крупных разработчиков, использующих встроенную оплату Apple. Изменения вступают в силу с 1 октября.

Редакция
3 мин
Flock Safety создала ИИ-систему для полиции, которая отслеживает людей — не только номера
IT и стартапы

Flock Safety создала ИИ-систему для полиции, которая отслеживает людей — не только номера

Flock Safety годами уверяла, что её камеры не идентифицируют людей. Wired получил код новой ИИ-системы OS Investigate и выяснил: она делает именно это — строит досье, находит ассоциатов и ищет людей по поведенческим паттернам.

Редакция
6 мин