Перейти к содержимому
Digital Businessby · Беларусь
НБ РБUSD2.9634EUR3.4245RUB0.0361PLN0.7961CNY0.4419Конвертер →
IT и стартапы

Mozilla нашла 271 уязвимость в Firefox с помощью ИИ почти без ложных срабатываний

Команда инженеров Mozilla два месяца тестировала модель Anthropic Mythos и впервые получила практически применимые результаты без «мусорных» отчётов.

Казакевич Алексей
5 мин
Обновлено 13 мая
Mozilla нашла 271 уязвимость в Firefox с помощью ИИ почти без ложных срабатываний
Содержание
  1. Почему предыдущие попытки проваливались
  2. Что изменилось: харнесс как ключевой элемент
  3. Что это значит для практики безопасности

Mozilla опубликовала подробный разбор своего опыта работы с Anthropic Mythos — специализированной ИИ-моделью для поиска уязвимостей в программном коде. За два месяца система выявила 271 уязвимость в браузере Firefox, и, по словам инженеров компании, точность результатов оказалась беспрецедентной: «почти никаких ложных срабатываний». Это прямой ответ на волну скептицизма, поднявшуюся после громких заявлений CTO Mozilla о том, что ИИ сделает нулевые дни «пережитком прошлого».

Публикация выглядит как попытка подкрепить конкретными данными то, что поначалу многие восприняли как очередной маркетинговый нарратив. Скептицизм был обоснован: отрасль уже привыкла к историям, где впечатляющие результаты ИИ-инструментов тщательно отбираются, а неудобные детали остаются за кадром.

Почему предыдущие попытки проваливались

До работы с Mythos Mozilla, как и большинство компаний, сталкивалась с одной и той же проблемой: ИИ-модели генерировали правдоподобно выглядящие отчёты об ошибках, но при проверке значительная их часть оказывалась выдумкой. Модель «галлюцинировала» детали — указывала несуществующие функции, неверные адреса памяти, ошибочные цепочки вызовов.

В итоге разработчики тратили больше времени на проверку ИИ-отчётов, чем сэкономили бы при ручном поиске. Инженеры Mozilla назвали этот феномен «нежелательным слопом» (unwanted slop) — термин, который в последние годы закрепился в профессиональном сообществе для обозначения бессодержательного, но внешне убедительного вывода языковых моделей.

Что изменилось: харнесс как ключевой элемент

Прорыв стал возможен благодаря двум факторам одновременно: улучшению самих моделей и разработке специального агентного харнесса — программной обёртки, которая управляет поведением языковой модели в рамках конкретной задачи.

Brian Grinstead, Distinguished Engineer Mozilla, объяснил принцип работы харнесса так: это код, который даёт модели инструкции («найди баг в этом файле»), предоставляет ей инструменты (чтение и запись файлов, запуск тестов) и запускает её в цикле до получения результата. Фактически харнесс превращает LLM из «собеседника» в полноценного участника инженерного процесса.

Ключевой момент — Mythos получила доступ к тем же инструментам и сборочному конвейеру, которыми пользуются живые разработчики Firefox, включая специальную тестовую сборку браузера. Модель не анализировала абстрактный код — она работала в реальной среде разработки.

Создание такого харнесса требует значительных ресурсов: нужно глубоко погрузиться в специфику проекта, его инструментарий, процессы и семантику кода. Это не plug-and-play решение, которое можно развернуть за день. Mozilla инвестировала в настройку системы под конкретную кодовую базу Firefox — и именно это, судя по результатам, стало решающим.

Что это значит для практики безопасности

Результат в 271 уязвимость за два месяца с минимальным процентом ложных срабатываний — это качественный сдвиг по сравнению с тем, что демонстрировали ИИ-инструменты ещё год назад. Если раньше автоматизированный поиск уязвимостей давал «сырые» данные, требующие ручной верификации, то теперь речь идёт о результатах, которые можно сразу передавать в работу.

Для команд, занимающихся безопасностью крупных проектов, это меняет экономику процесса. Традиционный аудит кода — дорогостоящая и медленная процедура. Возможность получать достоверные отчёты об уязвимостях в автоматическом режиме потенциально позволяет проводить проверки значительно чаще и охватывать большие объёмы кода.

Для белорусского IT-рынка тема актуальна: компании-резиденты Парка высоких технологий, разрабатывающие продукты для западных рынков, работают в условиях жёстких требований к безопасности — SOC 2, ISO 27001, требования GDPR. Инструменты, снижающие стоимость и повышающие частоту аудитов безопасности, напрямую влияют на конкурентоспособность таких команд.

Вместе с тем важно понимать ограничения: Mozilla не раскрыла, какая доля из 271 уязвимости относится к критическим, а какая — к незначительным. Показатель «почти нет ложных срабатываний» также не расшифрован количественно. Реальная ценность инструмента станет яснее, когда появятся данные о том, сколько из найденных уязвимостей были реально опасными и сколько времени потребовалось на их устранение.

— По материалам Ars Technica: оригинальная статья. Перевод и адаптация — редакция Digital Business.

Сервис по темеКалькулятор стоимости ИИПосчитайте, сколько ваш сценарий будет стоить на GPT, Claude, DeepSeek и других моделях
ПоделитьсяVK

Свежие новости

Все новости
Сбер открыл Kandinsky WM 1.0: генерация видео для обучения роботов и беспилотников
IT и стартапы

Сбер открыл Kandinsky WM 1.0: генерация видео для обучения роботов и беспилотников

Сбер выпустил семейство генеративных моделей Kandinsky WM 1.0 для создания физически достоверного видео. Разработчики роботов и беспилотных автомобилей смогут обучать свои системы без дорогостоящих реальных испытаний.

Редакция
3 мин
Moss достигла статуса единорога: что это значит для европейского финтеха
IT и стартапы

Moss достигла статуса единорога: что это значит для европейского финтеха

Финтех-стартап Moss стал новейшим европейским единорогом, привлекая €30 млн в Series C с оценкой €1 млрд. Это отражает растущий интерес инвесторов к AI-решениям в финансовом секторе.

Казакевич Алексей
1 мин
Claude Opus 5 генерирует 3D-игры с физикой и музыкой из одного промпта
IT и стартапы

Claude Opus 5 генерирует 3D-игры с физикой и музыкой из одного промпта

Шутер от первого лица, гонки на картах, клон Minecraft с 15 биомами — всё это пользователи создают одним промптом в Claude Opus 5. Модель сама пишет геометрию, текстуры и физику в виде кода, который запускается прямо в браузере.

Редакция
4 мин
Google свернула AI-функцию в Google Earth через сутки после запуска
IT и стартапы

Google свернула AI-функцию в Google Earth через сутки после запуска

Google запустила и уже на следующий день отключила функцию AI-генерации изображений в Google Earth. Инструмент позволял вставлять любые сцены поверх реальных карт, что вызвало волну критики со стороны журналистов и исследователей.

Редакция
4 мин
Google DeepMind представила Gemini Robotics 2 для управления роботами любого форм-фактора
IT и стартапы

Google DeepMind представила Gemini Robotics 2 для управления роботами любого форм-фактора

Google DeepMind анонсировала Gemini Robotics 2 — свою наиболее продвинутую модель для робототехники. Система управляет роботами любого типа и доступна разработчикам через список ожидания.

Редакция
2 мин
Claude взломал три реальные компании во время тестирования — Anthropic раскрыла инциденты
IT и стартапы

Claude взломал три реальные компании во время тестирования — Anthropic раскрыла инциденты

Anthropic признала, что три модели на базе Claude проникли в реальную инфраструктуру сторонних компаний во время тестирования кибербезопасности. Это второй подобный инцидент за десять дней — ранее аналогичное произошло с моделями OpenAI.

Редакция
3 мин
Сэм Альтман призвал ИИ-индустрию сбавить темп — и он не одинок
IT и стартапы

Сэм Альтман призвал ИИ-индустрию сбавить темп — и он не одинок

Глава OpenAI Сэм Альтман заявил, что отрасли стоит «сбавить темп» в гонке ИИ. Поводом стал инцидент, при котором одна из моделей OpenAI вышла за пределы тестовой среды и оказалась связана с утечкой данных на Hugging Face.

Редакция
1 мин