Перейти к содержимому
Digital Businessby · Беларусь
НБ РБUSD2.8876EUR3.2791RUB0.0369PLN0.7578CNY0.4274Конвертер →
IT и стартапы

Microsoft выпустила ASSERT: фреймворк для тестирования поведения AI по текстовым описаниям

Открытый инструмент позволяет разработчикам задавать правила на обычном языке — и автоматически получать наборы тестов для проверки AI-систем.

Казакевич Алексей
5 мин
Microsoft выпустила ASSERT: фреймворк для тестирования поведения AI по текстовым описаниям
Содержание
  1. Как работает ASSERT
  2. Место ASSERT в экосистеме AI-оценок
  3. Что это означает для белорусских разработчиков

Microsoft представила открытый фреймворк ASSERT — Adaptive Spec-driven Scoring for Evaluation and Regression Testing. Инструмент позволяет разработчикам описывать ожидаемое поведение AI-системы на обычном языке, а затем автоматически превращает эти описания в полноценные наборы тестов с оценкой результатов. Релиз состоялся во вторник, 2 июня 2026 года.

Появление ASSERT отражает реальный сдвиг в индустрии: крупные лаборатории научились оценивать модели на безопасность, соответствие стандартам и склонность к лести. Но компании, которые строят продукты на базе AI, столкнулись с другой задачей — убедиться, что система ведёт себя именно так, как задумано для их конкретного сервиса, с их политиками и ограничениями.

Как работает ASSERT

Принцип работы фреймворка прямолинеен. Разработчик описывает правила и цели системы на обычном языке — например, что AI-агент для работы с документами не должен отправлять письма за пределы компании, а конфиденциальные данные может передавать только топ-менеджменту. ASSERT берёт эти описания, структурирует их в перечень допустимых и недопустимых действий, генерирует проблемные сценарии и тест-кейсы, запускает их против целевой системы и выставляет оценки.

Фреймворк также записывает весь путь, который проходит AI-система: промежуточные действия, вызовы инструментов, точки принятия решений. Это позволяет разработчику точно локализовать место сбоя, а не просто зафиксировать факт провала теста. Дополнительно можно передавать системный контекст, доступные инструменты и ограничения — для более тонкой настройки покрытия.

По словам Сары Бёрд, директора по продукту в направлении Responsible AI в Microsoft, ASSERT можно применять на трёх этапах: при разработке системы, после её запуска и в режиме непрерывного мониторинга.

««Одна из вещей, которую мы усвоили: оценки абсолютно критичны для принятия правильных решений. Если вы не понимаете поведение AI-системы, очень сложно понять, соответствует ли она стандартам вашей организации. Мы обнаружили, что для по-настоящему надёжной системы нужно оценивать гораздо больше измерений, специфичных для конкретного приложения», — сказала Бёрд.»

Место ASSERT в экосистеме AI-оценок

Microsoft позиционирует ASSERT как инструмент, заполняющий пробел, который не закрывают универсальные бенчмарки. Общие системы оценки — такие как Stanford HELM, MLCommons AILuminate или методологии организации METR — измеряют, как модели ведут себя в стандартизированных условиях. Но они не учитывают политики конкретной компании, специфику продукта или набор инструментов, доступных агенту.

Рост интереса к регрессионному тестированию AI закономерен: по мере того как модели становятся мощнее и автономнее, цена непредвиденного поведения растёт. Агент, который случайно рассылает письма внешним адресатам или раскрывает финансовые данные не тем сотрудникам, создаёт реальные юридические и репутационные риски — независимо от того, насколько хорошо он справляется с общими бенчмарками.

Фреймворк распространяется как открытый исходный код, что снижает порог входа для команд, у которых нет ресурсов строить собственную инфраструктуру тестирования с нуля.

Что это означает для белорусских разработчиков

Для белорусских IT-команд, которые строят продукты с AI-компонентами — будь то внутри резидентов ПВТ или в рамках международных проектов, — ASSERT решает практическую задачу. Большинство небольших и средних команд не имеют выделенных специалистов по AI-безопасности и не могут позволить себе дорогостоящие платформы для оценки моделей.

Открытый фреймворк от Microsoft позволяет встроить проверку поведения AI прямо в CI/CD-пайплайн без значительных инвестиций. Особенно это актуально для команд, которые разрабатывают AI-агентов для корпоративных клиентов в Европе и США: там требования к предсказуемости и аудируемости поведения систем становятся частью контрактных обязательств, а не просто best practice.

С практической точки зрения стоит следить за тем, как ASSERT будет интегрироваться с Azure AI Foundry и другими инструментами Microsoft — компания последовательно выстраивает экосистему вокруг ответственного AI, и ASSERT, скорее всего, станет частью этого стека, а не изолированным проектом.

— По материалам TechCrunch: оригинальная статья. Перевод и адаптация — редакция Digital Business.

Курс MSFT · NASDAQ
ПоделитьсяVK

Свежие новости

Все новости
Raito: библиотека-плагин для aiogram, которая убирает повторяющийся код из Telegram-ботов
IT и стартапы

Raito: библиотека-плагин для aiogram, которая убирает повторяющийся код из Telegram-ботов

Raito — плагин поверх aiogram3, который добавляет hot-reload, RBAC-роли, serverless-пагинацию пяти типов, удобные FSM-сцены и троттлинг. Подключается двумя строками кода и не ломает существующую логику aiogram.

Редакция
6 мин
Глава Hugging Face потребовал от OpenAI $100 млн и полной прозрачности после взлома
IT и стартапы

Глава Hugging Face потребовал от OpenAI $100 млн и полной прозрачности после взлома

После того как модель OpenAI взломала системы Hugging Face, CEO платформы Клем Делангу потребовал раскрыть трассировки атаки и выделить $100 млн на киберзащиту. Эксперты указывают на ошибку конфигурации изолированной среды.

Редакция
2 мин
ConfigMap, Secret и PersistentVolume: как Kubernetes управляет конфигурацией и данными
IT и стартапы

ConfigMap, Secret и PersistentVolume: как Kubernetes управляет конфигурацией и данными

Хранить пароли и конфиги внутри Docker-образа — плохая практика. Kubernetes решает это через ConfigMap, Secret и PersistentVolume. Разбираем, как устроены эти объекты и почему Base64 не защищает ваши секреты.

Редакция
6 мин
Nokia упустила смартфоны, но теперь делает ставку на ИИ-инфраструктуру
IT и стартапы

Nokia упустила смартфоны, но теперь делает ставку на ИИ-инфраструктуру

Nokia доминировала на рынке мобильных телефонов 14 лет, но проиграла сначала Apple, затем Android. Теперь компания переориентируется на сетевое оборудование для дата-центров — и её акции с начала 2026 года выросли на 90%.

Редакция
5 мин
API-first как защита от деградации проекта, который пишет LLM-агент
IT и стартапы

API-first как защита от деградации проекта, который пишет LLM-агент

Агент отрапортовал о готовом экране настроек — с полями, тостом «Сохранено» и скриншотом. Бэкенда под формой не существовало. Разработчик разобрал, почему шов между фронтом и бэком остаётся слепой зоной для любого статического анализа — и как это лечится подходом из 2005 года.

Редакция
8 мин
IDE для психологов: как разработчик автоматизировал разбор сессий и отказался от AI-суфлера
IT и стартапы

IDE для психологов: как разработчик автоматизировал разбор сессий и отказался от AI-суфлера

Разработчик создал локальное приложение для анализа аудиозаписей консультаций — своего рода IDE для психологов. Ключевое решение: никакого AI в реальном времени, только офлайн-рефлексия после сессии.

Редакция
5 мин
Еврокомиссия обвинила TikTok в недостаточной защите несовершеннолетних
IT и стартапы

Еврокомиссия обвинила TikTok в недостаточной защите несовершеннолетних

Еврокомиссия направила TikTok предварительные выводы о нарушении DSA: аккаунты подростков видны всем по умолчанию, а алгоритм рекомендует их контент в ленте For You. Штраф может составить до 6% глобальной выручки.

Редакция
2 мин
Cursor разделил ИИ-агентов на планировщиков и исполнителей — и сократил стоимость кодинга в 15 раз
IT и стартапы

Cursor разделил ИИ-агентов на планировщиков и исполнителей — и сократил стоимость кодинга в 15 раз

Cursor протестировал архитектуру, где мощные модели только планируют, а дешёвые — пишут код. Результат: стоимость упала с $10 565 до $1 339 при сопоставимом качестве, а размер кодовой базы сократился на 85%.

Редакция
6 мин
Российские таск-менеджеры в 2026 году: сравнение платформ, тарифов и ИИ-функций
IT и стартапы

Российские таск-менеджеры в 2026 году: сравнение платформ, тарифов и ИИ-функций

Российский рынок таск-трекеров вырос с 25% до 73% в денежном выражении за четыре года. Разбираем «Битрикс24», «Яндекс Трекер», Kaiten, WEEEK, PlanFix, Shtab и другие платформы: функции, тарифы, ИИ и реальные кейсы внедрения.

Редакция
7 мин