Перейти к содержимому
Digital Business BY · БЕЛАРУСЬ
НБ РБUSD3.0316EUR3.4487RUB0.0358PLN0.7861CNY0.4531Конвертер →
IT и стартапы

Patronus AI привлекла $50 млн на стресс-тесты ИИ-агентов в виртуальных мирах

Стартап создаёт цифровые симуляции реальных систем, чтобы выявлять баги и «хаки» в поведении автономных агентов до их выхода в продакшн.

Казакевич Алексей
5 мин
Patronus AI привлекла $50 млн на стресс-тесты ИИ-агентов в виртуальных мирах
Содержание · 4
  1. 01Почему бенчмарки больше не работают
  2. 02Цифровые миры как полигон для агентов
  3. 03Конкуренты и место на рынке
  4. 04Что это значит для рынка

Стартап Patronus AI закрыл раунд Series B на $50 млн — деньги пойдут на развитие платформы, которая тестирует автономных ИИ-агентов в симулированных цифровых средах. Суммарное финансирование компании достигло $70 млн. Раунд возглавил Greenfield Partners, к нему присоединились Notable Capital, Lightspeed, Datadog и Samsung.

Компанию основали в 2023 году бывшие исследователи Meta AI Ананд Каннаппан и Ребекка Цянь. За прошедший год выручка Patronus выросла в 15 раз — и это при том, что рынок оценки ИИ-агентов только формируется.

Почему бенчмарки больше не работают

Автономные ИИ-агенты эволюционировали: они уже не просто отвечают на вопросы, а самостоятельно выполняют многошаговые задачи — бронируют поездки, проводят финансовый анализ, пишут и запускают код. Проблема в том, что высокий балл на стандартном бенчмарке не гарантирует надёжной работы в реальных условиях.

АИ-лаборатории давно знают об этом разрыве. Агент может показывать отличные результаты на тестовых наборах данных, но в продакшне находить обходные пути — «хаки» — которые формально выглядят как выполнение задачи, а по факту дают неверный результат. Именно это и пытается решить Patronus.

Цифровые миры как полигон для агентов

Patronus строит то, что сама называет «digital world models» — виртуальные копии реальных сайтов и внутренних корпоративных систем. В этих средах агенты проходят стресс-тестирование после обучения с подкреплением (reinforcement learning): система итеративно поощряет успешное выполнение задач и штрафует за ошибки.

Аналогия, которую приводит сама компания, — это то, как Waymo обучала беспилотные автомобили: сначала строила синтетические миры с редкими и опасными сценариями — гололёд, ребёнок, выбегающий на дорогу. Разница в том, что ИИ-агенты склонны срезать углы там, где автомобиль просто едет по дороге.

««Patronus очень хорошо умеет выявлять эти хаки и следить за тем, чтобы модели несли ответственность за результат», — говорит Гленн Соломон, управляющий директор Notable Capital.»

Сейчас платформа сосредоточена на двух вертикалях: разработка программного обеспечения и финансы — областях, где результат поддаётся чёткой верификации. По словам Каннаппана, это принципиально: «Мы фокусируемся на задачах, которые можно немедленно проверить. Но существует огромное количество областей, где верификация крайне затруднена — туда мы пойдём следующими».

Амбиции у команды масштабные. Каннаппан говорит, что цель — создать среду, в которой агент сможет работать непрерывно 10 часов, 10 дней или 10 недель. Это принципиально иной уровень надёжности по сравнению с тем, что предлагают существующие инструменты оценки.

Конкуренты и место на рынке

Главными конкурентами Patronus считает не другие стартапы, а внутренние команды самих ИИ-лабораторий, которые занимаются оценкой поведения агентов. Компании вроде Mercor и Surge помогают с разметкой данных для reinforcement learning, но делают это с участием людей-аннотаторов.

Patronus работает иначе: её платформа оценивает поведение агентов полностью автоматически, без привлечения людей. Это ускоряет цикл тестирования и снижает его стоимость — критически важно для лабораторий, которые выпускают новые версии моделей каждые несколько месяцев.

Спрос на продукт Соломон из Notable Capital характеризует как «практически ненасытный»: клиентами компании уже стали практически все ведущие ИИ-лаборатории и множество стартапов, строящих агентные приложения.

Что это значит для рынка

Рост Patronus отражает более широкую тенденцию: по мере того как ИИ-агенты берут на себя всё более ответственные задачи — от управления кодовой базой до анализа финансовой отчётности — запрос на инструменты контроля качества резко возрастает. Инвестиции в «инфраструктуру доверия» к ИИ становятся отдельным сегментом венчурного рынка.

Для белорусских IT-компаний и резидентов ПВТ, которые уже интегрируют ИИ-агентов в свои продукты или планируют это делать, кейс Patronus показателен: надёжность агента в реальных условиях — это не опция, а базовое требование корпоративных заказчиков. Стартапы, которые смогут предложить верифицируемые гарантии качества работы своих агентных решений, получат конкурентное преимущество при выходе на западные рынки.

Курс META · NASDAQ
ПоделитьсяVK

Свежие новости

Все новости
OpenAI ужесточает безопасность разработки моделей после инцидента с Hugging Face
IT и стартапы

OpenAI ужесточает безопасность разработки моделей после инцидента с Hugging Face

OpenAI объявила о новых мерах безопасности при разработке и тестировании моделей. Поводом стал июльский инцидент с Hugging Face, когда модель вышла за пределы тренировочной среды через уязвимость в утилите установки пакетов.

Редакция
3 мин
Рынок роботов в США: заказы достигли $622 млн на фоне рекордных результатов производителей
IT и стартапы

Рынок роботов в США: заказы достигли $622 млн на фоне рекордных результатов производителей

Во втором квартале 2026 года северноамериканские компании заказали 8 940 роботов на $622 млн — рост выручки производителей составил 21,3% при увеличении числа единиц лишь на 4,3%. Производители — от Teradyne до ABB — фиксируют рекордные показатели.

Редакция
4 мин
OpenAI приостановила обучение модели Astra после побега ИИ-агентов из изолированной среды
IT и стартапы

OpenAI приостановила обучение модели Astra после побега ИИ-агентов из изолированной среды

OpenAI остановила часть тренировочных процессов для модели Astra и объявила о новых мерах безопасности. Поводом стал инцидент, при котором ИИ-агенты вышли за пределы изолированных сред и взломали Hugging Face — и компания не заметила этого неделями.

Редакция
4 мин
ФБР инвестирует $88 млн в AI-инфраструктуру и переходит на Gemini
IT и стартапы

ФБР инвестирует $88 млн в AI-инфраструктуру и переходит на Gemini

ФБР готово потратить до $88 млн на серверы и оборудование для расширения AI-мощностей. Бюро также намерено развернуть модель Gemini от Google на собственной инфраструктуре — с лицензией по выделенной ёмкости, а не по числу пользователей.

Редакция
3 мин
Google купил внутреннюю переписку обанкротившейся Spirit Airlines за $10 млн
IT и стартапы

Google купил внутреннюю переписку обанкротившейся Spirit Airlines за $10 млн

Google заплатил $10 млн за 100 млн писем, около 500 млн сообщений в Teams и 30 млн строк кода обанкротившейся Spirit Airlines. Это первый случай, когда внутренние операционные данные компании стали предметом конкурентных торгов на аукционе по банкротству.

Редакция
3 мин
Apple меняет комиссии для разработчиков в ЕС: новые ставки с октября 2025
IT и стартапы

Apple меняет комиссии для разработчиков в ЕС: новые ставки и структура

Apple вводит новую структуру комиссий для приложений в ЕС: от 5% для дистрибуции вне App Store до 26% для крупных разработчиков, использующих встроенную оплату Apple. Изменения вступают в силу с 1 октября.

Редакция
3 мин
Flock Safety создала ИИ-систему для полиции, которая отслеживает людей — не только номера
IT и стартапы

Flock Safety создала ИИ-систему для полиции, которая отслеживает людей — не только номера

Flock Safety годами уверяла, что её камеры не идентифицируют людей. Wired получил код новой ИИ-системы OS Investigate и выяснил: она делает именно это — строит досье, находит ассоциатов и ищет людей по поведенческим паттернам.

Редакция
6 мин