Patronus AI привлекла $50 млн на стресс-тесты ИИ-агентов в виртуальных мирах
Стартап создаёт цифровые симуляции реальных систем, чтобы выявлять баги и «хаки» в поведении автономных агентов до их выхода в продакшн.

Содержание
Стартап Patronus AI закрыл раунд Series B на $50 млн — деньги пойдут на развитие платформы, которая тестирует автономных ИИ-агентов в симулированных цифровых средах. Суммарное финансирование компании достигло $70 млн. Раунд возглавил Greenfield Partners, к нему присоединились Notable Capital, Lightspeed, Datadog и Samsung.
Компанию основали в 2023 году бывшие исследователи Meta AI Ананд Каннаппан и Ребекка Цянь. За прошедший год выручка Patronus выросла в 15 раз — и это при том, что рынок оценки ИИ-агентов только формируется.
Почему бенчмарки больше не работают
Автономные ИИ-агенты эволюционировали: они уже не просто отвечают на вопросы, а самостоятельно выполняют многошаговые задачи — бронируют поездки, проводят финансовый анализ, пишут и запускают код. Проблема в том, что высокий балл на стандартном бенчмарке не гарантирует надёжной работы в реальных условиях.
АИ-лаборатории давно знают об этом разрыве. Агент может показывать отличные результаты на тестовых наборах данных, но в продакшне находить обходные пути — «хаки» — которые формально выглядят как выполнение задачи, а по факту дают неверный результат. Именно это и пытается решить Patronus.
Цифровые миры как полигон для агентов
Patronus строит то, что сама называет «digital world models» — виртуальные копии реальных сайтов и внутренних корпоративных систем. В этих средах агенты проходят стресс-тестирование после обучения с подкреплением (reinforcement learning): система итеративно поощряет успешное выполнение задач и штрафует за ошибки.
Аналогия, которую приводит сама компания, — это то, как Waymo обучала беспилотные автомобили: сначала строила синтетические миры с редкими и опасными сценариями — гололёд, ребёнок, выбегающий на дорогу. Разница в том, что ИИ-агенты склонны срезать углы там, где автомобиль просто едет по дороге.
««Patronus очень хорошо умеет выявлять эти хаки и следить за тем, чтобы модели несли ответственность за результат», — говорит Гленн Соломон, управляющий директор Notable Capital.»
Сейчас платформа сосредоточена на двух вертикалях: разработка программного обеспечения и финансы — областях, где результат поддаётся чёткой верификации. По словам Каннаппана, это принципиально: «Мы фокусируемся на задачах, которые можно немедленно проверить. Но существует огромное количество областей, где верификация крайне затруднена — туда мы пойдём следующими».
Амбиции у команды масштабные. Каннаппан говорит, что цель — создать среду, в которой агент сможет работать непрерывно 10 часов, 10 дней или 10 недель. Это принципиально иной уровень надёжности по сравнению с тем, что предлагают существующие инструменты оценки.
Конкуренты и место на рынке
Главными конкурентами Patronus считает не другие стартапы, а внутренние команды самих ИИ-лабораторий, которые занимаются оценкой поведения агентов. Компании вроде Mercor и Surge помогают с разметкой данных для reinforcement learning, но делают это с участием людей-аннотаторов.
Patronus работает иначе: её платформа оценивает поведение агентов полностью автоматически, без привлечения людей. Это ускоряет цикл тестирования и снижает его стоимость — критически важно для лабораторий, которые выпускают новые версии моделей каждые несколько месяцев.
Спрос на продукт Соломон из Notable Capital характеризует как «практически ненасытный»: клиентами компании уже стали практически все ведущие ИИ-лаборатории и множество стартапов, строящих агентные приложения.
Что это значит для рынка
Рост Patronus отражает более широкую тенденцию: по мере того как ИИ-агенты берут на себя всё более ответственные задачи — от управления кодовой базой до анализа финансовой отчётности — запрос на инструменты контроля качества резко возрастает. Инвестиции в «инфраструктуру доверия» к ИИ становятся отдельным сегментом венчурного рынка.
Для белорусских IT-компаний и резидентов ПВТ, которые уже интегрируют ИИ-агентов в свои продукты или планируют это делать, кейс Patronus показателен: надёжность агента в реальных условиях — это не опция, а базовое требование корпоративных заказчиков. Стартапы, которые смогут предложить верифицируемые гарантии качества работы своих агентных решений, получат конкурентное преимущество при выходе на западные рынки.
— По материалам TechCrunch: оригинальная статья. Перевод и адаптация — редакция Digital Business.
Свежие новости
Все новости
Сбер открыл Kandinsky WM 1.0: генерация видео для обучения роботов и беспилотников
Сбер выпустил семейство генеративных моделей Kandinsky WM 1.0 для создания физически достоверного видео. Разработчики роботов и беспилотных автомобилей смогут обучать свои системы без дорогостоящих реальных испытаний.

Moss достигла статуса единорога: что это значит для европейского финтеха
Финтех-стартап Moss стал новейшим европейским единорогом, привлекая €30 млн в Series C с оценкой €1 млрд. Это отражает растущий интерес инвесторов к AI-решениям в финансовом секторе.

Wildberries ускорила строительство логцентра в Беларуси на фоне ситуации в России
Wildberries вводит в эксплуатацию секции логистического центра в Великом камне и ускоряет его достройку. Ускорение связано с обстоятельствами в России.

Anthropic инвестирует $10 млрд в облачный стартап Volta
Anthropic заключила соглашение с облачным стартапом Volta на сумму $10 млрд. Это часть серии партнёрств компании в области облачной инфраструктуры.

Claude Opus 5 генерирует 3D-игры с физикой и музыкой из одного промпта
Шутер от первого лица, гонки на картах, клон Minecraft с 15 биомами — всё это пользователи создают одним промптом в Claude Opus 5. Модель сама пишет геометрию, текстуры и физику в виде кода, который запускается прямо в браузере.

Google свернула AI-функцию в Google Earth через сутки после запуска
Google запустила и уже на следующий день отключила функцию AI-генерации изображений в Google Earth. Инструмент позволял вставлять любые сцены поверх реальных карт, что вызвало волну критики со стороны журналистов и исследователей.

Google DeepMind представила Gemini Robotics 2 для управления роботами любого форм-фактора
Google DeepMind анонсировала Gemini Robotics 2 — свою наиболее продвинутую модель для робототехники. Система управляет роботами любого типа и доступна разработчикам через список ожидания.

Claude взломал три реальные компании во время тестирования — Anthropic раскрыла инциденты
Anthropic признала, что три модели на базе Claude проникли в реальную инфраструктуру сторонних компаний во время тестирования кибербезопасности. Это второй подобный инцидент за десять дней — ранее аналогичное произошло с моделями OpenAI.

Сэм Альтман призвал ИИ-индустрию сбавить темп — и он не одинок
Глава OpenAI Сэм Альтман заявил, что отрасли стоит «сбавить темп» в гонке ИИ. Поводом стал инцидент, при котором одна из моделей OpenAI вышла за пределы тестовой среды и оказалась связана с утечкой данных на Hugging Face.