Claude Opus 5 установил рекорд на бенчмарке ARC-AGI-3, опередив GPT-5.6 Sol почти в четыре раза
Модель Anthropic набрала 30,2% против прежнего рекорда в 7,8% и впервые самостоятельно применила алгебраическую нотацию для решения задач

Модель Claude Opus 5 от Anthropic заняла первое место в рейтинге бенчмарка ARC-AGI-3, набрав 30,2% — почти вчетверо больше прежнего рекорда в 7,8%, который принадлежал GPT-5.6 Sol (Max) от OpenAI. Создатели теста из организации ARC Prize утверждают: такой отрыв объясняется качественно более сильным логическим мышлением, а не просто дополнительными вычислениями.
Opus 5 решил пять ранее не взятых сред из набора задач, причём четыре из них — на уровне человека или выше. Это также ставит его впереди собственных «Fable-class» моделей Anthropic, которые, по данным ARC Prize, показывали около 20%. Из 25 публичных демо-сред на сегодня решены шесть; полные результаты, записи прохождений и код для воспроизведения тестов опубликованы в открытом доступе.
Что измеряет ARC-AGI-3 и почему это важно
ARC-AGI-3 — не классический тест на знания. Он устроен как игра: модель попадает в незнакомую интерактивную среду, должна самостоятельно вывести её правила, спланировать действия и выполнить их шаг за шагом. Задачи специально подобраны так, чтобы исключить возможность «вспомнить» правильный ответ из обучающей выборки — большинство из них человек решает без труда, опираясь на общий здравый смысл.
Важная оговорка: официальный зачёт идёт только за результат самой языковой модели без внешних программных надстроек (harness). ARC Prize принципиально настаивает на этом: будущий AGI не должен зависеть от вспомогательного ПО при решении новых задач. По оценкам организации, в среде Claude Code Opus 5 показал бы результат ещё выше.
На более ранних версиях теста Opus 5 также держится в топе: 90,4% на ARC-AGI-2 и 97,5% на ARC-AGI-1. Оба результата сопоставимы с прежними рекордами, хотя и достигнуты при несколько более высоких вычислительных затратах.
Реальный прогресс или точечная оптимизация под бенчмарк
Anthropicне раскрывает детали обучения Opus 5. Однако есть существенный нюанс: модель разрабатывалась уже после того, как формат ARC-AGI-3 стал публичным. Это теоретически позволяло команде целенаправленно готовить модель к типу задач и логике головоломок, не тренируясь на конкретных примерах из теста. Вероятные инструменты — разметка цепочек рассуждений и шагов восстановления после ошибок на похожих задачах, а также обучение с подкреплением, вознаграждающее исследование, планирование и самокоррекцию.
Независимую проверку провёл исследователь Guanghan Ning на приватном бенчмарке Witness, ориентированном на интерактивные головоломки. Там Opus 5 набрал 43,4 балла, статистически сравнявшись с Kimi K3 и Fable 5, — прирост относительно Opus 4.8 оказался значительно скромнее, чем на ARC-AGI-3. На одной из игр с нестандартной механикой Opus 5 и вовсе уступил предшественнику.
Нинг предположил, что такая картина характерна для обучения на жанрово-специфичных данных. Впрочем, он же уточнил: Opus 5 всё-таки обобщает знания на Witness — просто в значительно меньшей степени, чем на ARC-AGI-3. Greg Kamradt, один из авторов бенчмарка, возражает: один слабый результат на знакомой механике не перевешивает общего прогресса модели, а Witness сам построен по образцу ARC-AGI-3, так что улучшение там тоже может отражать реальный перенос навыков.
Нинг проводит аналогию с эволюцией кодинг-бенчмарков: сначала модели насыщали HumanEval, затем индустрия перешла к регулярно обновляемым соревнованиям и агентам для реального кода. ARC-AGI-3 как главная цель для интерактивного рассуждения, вероятно, привлечёт наибольшие усилия по обучению — и со временем это должно подтолкнуть модели к более широкому обобщению на абстрактные задачи.
Для разработчиков и исследователей, следящих за прогрессом AGI, результат Opus 5 — значимый сигнал: разрыв между лучшей моделью и остальными на самом сложном публичном бенчмарке рассуждений вырос резко. Насколько это отражает фундаментальный скачок интеллекта, а не умелую оптимизацию под конкретный формат — вопрос, который отрасль будет выяснять на следующих итерациях теста.
— По материалам The Decoder: оригинальная статья. Перевод и адаптация — редакция Digital Business.
Свежие новости
Все новости
ИИ как причина увольнений: 20 крупных технокомпаний сократили 140 000 сотрудников в 2026 году
С начала 2026 года американские технокомпании уволили почти 140 000 сотрудников, называя ИИ одним из ключевых факторов. Monday.com стала последней в этом списке, сократив 20% штата. Разбираем, кто, сколько и почему.

Российский разработчик открыл код ИИ-ассистента «Свой» с end-to-end шифрованием и RAG поверх локальных файлов
Разработчик опубликовал под лицензией AGPL-3.0 персонального ИИ-ассистента «Свой»: стриминговый чат, долговременная память, RAG по локальным файлам с E2E-шифрованием и генерация тем интерфейса через LLM.

Резидент ПВТ: налоговые льготы, преференции и правовое регулирование деятельности
Парк высоких технологий представляет собой уникальную правовую форму, которая позволяет резидентам динамично развиваться в результате применения особых правовых правил и налоговых льгот.

Код — за день, доверие — неделями: как Олег Старков строит «Где Бензин?»
Олег Старков за две недели собрал краудсорсинговую карту 26 450 АЗС в шести странах. Почему главным барьером стали не технологии, а доверие водителей.

Kimi выпустила открытую модель K3 на 2,8 трлн параметров — и подняла цены вслед за западными конкурентами
Kimi K3 — мультимодальная модель с 2,8 трлн параметров и контекстным окном в 1 млн токенов. По независимым тестам она уступает только двум топовым проприетарным моделям, однако цена на неё выросла в разы по сравнению с предшественником.

Си Цзиньпин на WAIC-2026: четыре принципа глобального управления ИИ и новая международная организация
Председатель КНР выступил на WAIC-2026 с программной речью об управлении ИИ и объявил о создании Всемирной организации сотрудничества в области искусственного интеллекта — её учредили 29 стран.

Databricks достигла оценки $188 млрд — крупнейшей среди частных AI-компаний
Databricks объявила о новом раунде финансирования с оценкой $188 млрд под руководством Coatue. Сумма раунда — около $3 млрд. За 18 месяцев компания провела четыре раунда и утроила капитализацию.

Meta и Anthropic обсуждают аренду вычислительных мощностей на $10 млрд
Meta ведёт переговоры с Anthropic об аренде вычислительных мощностей своих дата-центров. По данным New York Times, сумма контракта может достичь $10 млрд за два года — и это только начало новой бизнес-модели компании.

Thinking Machines Муради выпустила модель Inkling: лидер среди американских open-weights, но уступает Китаю
Thinking Machines Lab Миры Муради выпустила Inkling — мультимодальную модель на 975 млрд параметров. Она возглавила рейтинг американских open-weights моделей, но по общей производительности уступает лучшим китайским аналогам.