AI Security Leaderboard
B2B SaaS
Описание
Автоматизированный тестовый набор для оценки безопасности AI-моделей через 1500 автоматически сгенерированных jailbreak-попыток.
Original (EN)
comparing cyber and CBRN safeguards — There's no shortage of leaderboards for model capabilities - but the security of models is becoming increasingly relevant, from the risk of an AI agent processing unsanitized input being hijacked to models being pulled due to cybersecurity jailbreaks. We developed an automated test suite that runs models through 1500 automatically generated jailbreak attempts and measures the number of universal jailbreaks: prompts that elicit compliant, detailed responses to >75% clearly harmful questions within a domain (like offensive cybersecurity). We find a big
Проблема
Отсутствие стандартизированных методов оценки безопасности AI-моделей от jailbreak-атак.
Решение
Тестовый набор автоматически генерирует jailbreak-попытки и измеряет количество универсальных jailbreak-атак.
Идея для адаптации в РБ
1. Интеграция с резидентами ПВТ, работающими с AI (например, Wargaming, Viber, MSQRD) — для тестирования уязвимостей чат-ботов и голосовых ассистентов перед запуском на белорусский/русскоязычный рынок, включая специфичные jailbreak-атаки на кириллице. 2. Партнёрство с БГУ/БГУИР для адаптации тестов под локальные образовательные AI-проекты (например, проверка студенческих моделей на устойчивость к взлому через ERIP-подобные сценарии).
⚠ AI-черновик. Используй как seed для собственных идей — конкретные цифры, ниши и партнёров проверяй сам.