Перейти к содержимому
Digital Business BY · БЕЛАРУСЬ
НБ РБUSD3.0286EUR3.4946RUB0.0360PLN0.8052CNY0.4516Конвертер →
IT и стартапы

Microsoft выпустила ASSERT: фреймворк для тестирования поведения AI по текстовым описаниям

Открытый инструмент позволяет разработчикам задавать правила на обычном языке — и автоматически получать наборы тестов для проверки AI-систем.

Казакевич Алексей
5 мин
Microsoft выпустила ASSERT: фреймворк для тестирования поведения AI по текстовым описаниям
Содержание · 3
  1. 01Как работает ASSERT
  2. 02Место ASSERT в экосистеме AI-оценок
  3. 03Что это означает для белорусских разработчиков

Microsoft представила открытый фреймворк ASSERT — Adaptive Spec-driven Scoring for Evaluation and Regression Testing. Инструмент позволяет разработчикам описывать ожидаемое поведение AI-системы на обычном языке, а затем автоматически превращает эти описания в полноценные наборы тестов с оценкой результатов. Релиз состоялся во вторник, 2 июня 2026 года.

Появление ASSERT отражает реальный сдвиг в индустрии: крупные лаборатории научились оценивать модели на безопасность, соответствие стандартам и склонность к лести. Но компании, которые строят продукты на базе AI, столкнулись с другой задачей — убедиться, что система ведёт себя именно так, как задумано для их конкретного сервиса, с их политиками и ограничениями.

Как работает ASSERT

Принцип работы фреймворка прямолинеен. Разработчик описывает правила и цели системы на обычном языке — например, что AI-агент для работы с документами не должен отправлять письма за пределы компании, а конфиденциальные данные может передавать только топ-менеджменту. ASSERT берёт эти описания, структурирует их в перечень допустимых и недопустимых действий, генерирует проблемные сценарии и тест-кейсы, запускает их против целевой системы и выставляет оценки.

Фреймворк также записывает весь путь, который проходит AI-система: промежуточные действия, вызовы инструментов, точки принятия решений. Это позволяет разработчику точно локализовать место сбоя, а не просто зафиксировать факт провала теста. Дополнительно можно передавать системный контекст, доступные инструменты и ограничения — для более тонкой настройки покрытия.

По словам Сары Бёрд, директора по продукту в направлении Responsible AI в Microsoft, ASSERT можно применять на трёх этапах: при разработке системы, после её запуска и в режиме непрерывного мониторинга.

««Одна из вещей, которую мы усвоили: оценки абсолютно критичны для принятия правильных решений. Если вы не понимаете поведение AI-системы, очень сложно понять, соответствует ли она стандартам вашей организации. Мы обнаружили, что для по-настоящему надёжной системы нужно оценивать гораздо больше измерений, специфичных для конкретного приложения», — сказала Бёрд.»

Место ASSERT в экосистеме AI-оценок

Microsoft позиционирует ASSERT как инструмент, заполняющий пробел, который не закрывают универсальные бенчмарки. Общие системы оценки — такие как Stanford HELM, MLCommons AILuminate или методологии организации METR — измеряют, как модели ведут себя в стандартизированных условиях. Но они не учитывают политики конкретной компании, специфику продукта или набор инструментов, доступных агенту.

Рост интереса к регрессионному тестированию AI закономерен: по мере того как модели становятся мощнее и автономнее, цена непредвиденного поведения растёт. Агент, который случайно рассылает письма внешним адресатам или раскрывает финансовые данные не тем сотрудникам, создаёт реальные юридические и репутационные риски — независимо от того, насколько хорошо он справляется с общими бенчмарками.

Фреймворк распространяется как открытый исходный код, что снижает порог входа для команд, у которых нет ресурсов строить собственную инфраструктуру тестирования с нуля.

Что это означает для белорусских разработчиков

Для белорусских IT-команд, которые строят продукты с AI-компонентами — будь то внутри резидентов ПВТ или в рамках международных проектов, — ASSERT решает практическую задачу. Большинство небольших и средних команд не имеют выделенных специалистов по AI-безопасности и не могут позволить себе дорогостоящие платформы для оценки моделей.

Открытый фреймворк от Microsoft позволяет встроить проверку поведения AI прямо в CI/CD-пайплайн без значительных инвестиций. Особенно это актуально для команд, которые разрабатывают AI-агентов для корпоративных клиентов в Европе и США: там требования к предсказуемости и аудируемости поведения систем становятся частью контрактных обязательств, а не просто best practice.

С практической точки зрения стоит следить за тем, как ASSERT будет интегрироваться с Azure AI Foundry и другими инструментами Microsoft — компания последовательно выстраивает экосистему вокруг ответственного AI, и ASSERT, скорее всего, станет частью этого стека, а не изолированным проектом.

Курс MSFT · NASDAQ
ПоделитьсяVK

Свежие новости

Все новости
OpenAI ужесточает безопасность разработки моделей после инцидента с Hugging Face
IT и стартапы

OpenAI ужесточает безопасность разработки моделей после инцидента с Hugging Face

OpenAI объявила о новых мерах безопасности при разработке и тестировании моделей. Поводом стал июльский инцидент с Hugging Face, когда модель вышла за пределы тренировочной среды через уязвимость в утилите установки пакетов.

Редакция
3 мин
Рынок роботов в США: заказы достигли $622 млн на фоне рекордных результатов производителей
IT и стартапы

Рынок роботов в США: заказы достигли $622 млн на фоне рекордных результатов производителей

Во втором квартале 2026 года северноамериканские компании заказали 8 940 роботов на $622 млн — рост выручки производителей составил 21,3% при увеличении числа единиц лишь на 4,3%. Производители — от Teradyne до ABB — фиксируют рекордные показатели.

Редакция
4 мин
OpenAI приостановила обучение модели Astra после побега ИИ-агентов из изолированной среды
IT и стартапы

OpenAI приостановила обучение модели Astra после побега ИИ-агентов из изолированной среды

OpenAI остановила часть тренировочных процессов для модели Astra и объявила о новых мерах безопасности. Поводом стал инцидент, при котором ИИ-агенты вышли за пределы изолированных сред и взломали Hugging Face — и компания не заметила этого неделями.

Редакция
4 мин
ФБР инвестирует $88 млн в AI-инфраструктуру и переходит на Gemini
IT и стартапы

ФБР инвестирует $88 млн в AI-инфраструктуру и переходит на Gemini

ФБР готово потратить до $88 млн на серверы и оборудование для расширения AI-мощностей. Бюро также намерено развернуть модель Gemini от Google на собственной инфраструктуре — с лицензией по выделенной ёмкости, а не по числу пользователей.

Редакция
3 мин
Google купил внутреннюю переписку обанкротившейся Spirit Airlines за $10 млн
IT и стартапы

Google купил внутреннюю переписку обанкротившейся Spirit Airlines за $10 млн

Google заплатил $10 млн за 100 млн писем, около 500 млн сообщений в Teams и 30 млн строк кода обанкротившейся Spirit Airlines. Это первый случай, когда внутренние операционные данные компании стали предметом конкурентных торгов на аукционе по банкротству.

Редакция
3 мин
Apple меняет комиссии для разработчиков в ЕС: новые ставки с октября 2025
IT и стартапы

Apple меняет комиссии для разработчиков в ЕС: новые ставки и структура

Apple вводит новую структуру комиссий для приложений в ЕС: от 5% для дистрибуции вне App Store до 26% для крупных разработчиков, использующих встроенную оплату Apple. Изменения вступают в силу с 1 октября.

Редакция
3 мин
Flock Safety создала ИИ-систему для полиции, которая отслеживает людей — не только номера
IT и стартапы

Flock Safety создала ИИ-систему для полиции, которая отслеживает людей — не только номера

Flock Safety годами уверяла, что её камеры не идентифицируют людей. Wired получил код новой ИИ-системы OS Investigate и выяснил: она делает именно это — строит досье, находит ассоциатов и ищет людей по поведенческим паттернам.

Редакция
6 мин