Перейти к содержимому
Digital Business BY · БЕЛАРУСЬ
НБ РБUSD3.0228EUR3.4879RUB0.0360PLN0.8027CNY0.4515Конвертер →
IT и стартапы

Claude Opus 5 установил рекорд на бенчмарке ARC-AGI-3, опередив GPT-5.6 Sol почти в четыре раза

Модель Anthropic набрала 30,2% против прежнего рекорда в 7,8% и впервые самостоятельно применила алгебраическую нотацию для решения задач

Казакевич Алексей
4 мин
Claude Opus 5 установил рекорд на бенчмарке ARC-AGI-3, опередив GPT-5.6 Sol почти в четыре раза
Содержание · 2
  1. 01Что измеряет ARC-AGI-3 и почему это важно
  2. 02Реальный прогресс или точечная оптимизация под бенчмарк

Модель Claude Opus 5 от Anthropic заняла первое место в рейтинге бенчмарка ARC-AGI-3, набрав 30,2% — почти вчетверо больше прежнего рекорда в 7,8%, который принадлежал GPT-5.6 Sol (Max) от OpenAI. Создатели теста из организации ARC Prize утверждают: такой отрыв объясняется качественно более сильным логическим мышлением, а не просто дополнительными вычислениями.

Opus 5 решил пять ранее не взятых сред из набора задач, причём четыре из них — на уровне человека или выше. Это также ставит его впереди собственных «Fable-class» моделей Anthropic, которые, по данным ARC Prize, показывали около 20%. Из 25 публичных демо-сред на сегодня решены шесть; полные результаты, записи прохождений и код для воспроизведения тестов опубликованы в открытом доступе.

Что измеряет ARC-AGI-3 и почему это важно

ARC-AGI-3 — не классический тест на знания. Он устроен как игра: модель попадает в незнакомую интерактивную среду, должна самостоятельно вывести её правила, спланировать действия и выполнить их шаг за шагом. Задачи специально подобраны так, чтобы исключить возможность «вспомнить» правильный ответ из обучающей выборки — большинство из них человек решает без труда, опираясь на общий здравый смысл.

Важная оговорка: официальный зачёт идёт только за результат самой языковой модели без внешних программных надстроек (harness). ARC Prize принципиально настаивает на этом: будущий AGI не должен зависеть от вспомогательного ПО при решении новых задач. По оценкам организации, в среде Claude Code Opus 5 показал бы результат ещё выше.

На более ранних версиях теста Opus 5 также держится в топе: 90,4% на ARC-AGI-2 и 97,5% на ARC-AGI-1. Оба результата сопоставимы с прежними рекордами, хотя и достигнуты при несколько более высоких вычислительных затратах.

Реальный прогресс или точечная оптимизация под бенчмарк

Anthropicне раскрывает детали обучения Opus 5. Однако есть существенный нюанс: модель разрабатывалась уже после того, как формат ARC-AGI-3 стал публичным. Это теоретически позволяло команде целенаправленно готовить модель к типу задач и логике головоломок, не тренируясь на конкретных примерах из теста. Вероятные инструменты — разметка цепочек рассуждений и шагов восстановления после ошибок на похожих задачах, а также обучение с подкреплением, вознаграждающее исследование, планирование и самокоррекцию.

Независимую проверку провёл исследователь Guanghan Ning на приватном бенчмарке Witness, ориентированном на интерактивные головоломки. Там Opus 5 набрал 43,4 балла, статистически сравнявшись с Kimi K3 и Fable 5, — прирост относительно Opus 4.8 оказался значительно скромнее, чем на ARC-AGI-3. На одной из игр с нестандартной механикой Opus 5 и вовсе уступил предшественнику.

Нинг предположил, что такая картина характерна для обучения на жанрово-специфичных данных. Впрочем, он же уточнил: Opus 5 всё-таки обобщает знания на Witness — просто в значительно меньшей степени, чем на ARC-AGI-3. Greg Kamradt, один из авторов бенчмарка, возражает: один слабый результат на знакомой механике не перевешивает общего прогресса модели, а Witness сам построен по образцу ARC-AGI-3, так что улучшение там тоже может отражать реальный перенос навыков.

Нинг проводит аналогию с эволюцией кодинг-бенчмарков: сначала модели насыщали HumanEval, затем индустрия перешла к регулярно обновляемым соревнованиям и агентам для реального кода. ARC-AGI-3 как главная цель для интерактивного рассуждения, вероятно, привлечёт наибольшие усилия по обучению — и со временем это должно подтолкнуть модели к более широкому обобщению на абстрактные задачи.

Для разработчиков и исследователей, следящих за прогрессом AGI, результат Opus 5 — значимый сигнал: разрыв между лучшей моделью и остальными на самом сложном публичном бенчмарке рассуждений вырос резко. Насколько это отражает фундаментальный скачок интеллекта, а не умелую оптимизацию под конкретный формат — вопрос, который отрасль будет выяснять на следующих итерациях теста.

Сервис по темеКалькулятор стоимости ИИПосчитайте, сколько ваш сценарий будет стоить на GPT, Claude, DeepSeek и других моделях
Курс SOL/USDT · Binance
ПоделитьсяVK

Свежие новости

Все новости
OpenAI ужесточает безопасность разработки моделей после инцидента с Hugging Face
IT и стартапы

OpenAI ужесточает безопасность разработки моделей после инцидента с Hugging Face

OpenAI объявила о новых мерах безопасности при разработке и тестировании моделей. Поводом стал июльский инцидент с Hugging Face, когда модель вышла за пределы тренировочной среды через уязвимость в утилите установки пакетов.

Редакция
3 мин
Рынок роботов в США: заказы достигли $622 млн на фоне рекордных результатов производителей
IT и стартапы

Рынок роботов в США: заказы достигли $622 млн на фоне рекордных результатов производителей

Во втором квартале 2026 года северноамериканские компании заказали 8 940 роботов на $622 млн — рост выручки производителей составил 21,3% при увеличении числа единиц лишь на 4,3%. Производители — от Teradyne до ABB — фиксируют рекордные показатели.

Редакция
4 мин
OpenAI приостановила обучение модели Astra после побега ИИ-агентов из изолированной среды
IT и стартапы

OpenAI приостановила обучение модели Astra после побега ИИ-агентов из изолированной среды

OpenAI остановила часть тренировочных процессов для модели Astra и объявила о новых мерах безопасности. Поводом стал инцидент, при котором ИИ-агенты вышли за пределы изолированных сред и взломали Hugging Face — и компания не заметила этого неделями.

Редакция
4 мин
ФБР инвестирует $88 млн в AI-инфраструктуру и переходит на Gemini
IT и стартапы

ФБР инвестирует $88 млн в AI-инфраструктуру и переходит на Gemini

ФБР готово потратить до $88 млн на серверы и оборудование для расширения AI-мощностей. Бюро также намерено развернуть модель Gemini от Google на собственной инфраструктуре — с лицензией по выделенной ёмкости, а не по числу пользователей.

Редакция
3 мин
Google купил внутреннюю переписку обанкротившейся Spirit Airlines за $10 млн
IT и стартапы

Google купил внутреннюю переписку обанкротившейся Spirit Airlines за $10 млн

Google заплатил $10 млн за 100 млн писем, около 500 млн сообщений в Teams и 30 млн строк кода обанкротившейся Spirit Airlines. Это первый случай, когда внутренние операционные данные компании стали предметом конкурентных торгов на аукционе по банкротству.

Редакция
3 мин
Apple меняет комиссии для разработчиков в ЕС: новые ставки с октября 2025
IT и стартапы

Apple меняет комиссии для разработчиков в ЕС: новые ставки и структура

Apple вводит новую структуру комиссий для приложений в ЕС: от 5% для дистрибуции вне App Store до 26% для крупных разработчиков, использующих встроенную оплату Apple. Изменения вступают в силу с 1 октября.

Редакция
3 мин
Flock Safety создала ИИ-систему для полиции, которая отслеживает людей — не только номера
IT и стартапы

Flock Safety создала ИИ-систему для полиции, которая отслеживает людей — не только номера

Flock Safety годами уверяла, что её камеры не идентифицируют людей. Wired получил код новой ИИ-системы OS Investigate и выяснил: она делает именно это — строит досье, находит ассоциатов и ищет людей по поведенческим паттернам.

Редакция
6 мин