Учёные выяснили, почему большие языковые модели умеют то, чего не могут маленькие
Исследование Anthropic и Stanford раскрывает механизм «вытеснения» редких навыков в нейросетях и предлагает альтернативу бесконечному масштабированию.

Содержание · 3
Исследователи из Anthropic, Stanford и ряда других организаций установили конкретный механизм, из-за которого малые языковые модели не осваивают редкие задачи даже при очень длительном обучении. Вывод меняет привычную логику: дело не в том, что большие модели просто «быстрее учатся» — малые модели в принципе не могут надёжно закрепить навыки, которые редко встречаются в тренировочных данных. При этом у исследователей есть практическая альтернатива бесконечному наращиванию параметров.
Почему частые задачи вытесняют редкие
Авторы работы сформулировали ключевую идею через понятие «полезности» признаков. Модель с N нейронами распределяет ресурсы между N наиболее полезными паттернами, где полезность определяется частотой появления задачи в данных и её значимостью. Частые и простые задачи занимают приоритетные слоты, редкие и сложные — вытесняются.
Пока частые задачи не усвоены достаточно хорошо, они на каждом шаге обучения тянут модель в свою сторону, перезаписывая то немногое, что модель успела запомнить о редких примерах. Как только большая модель в основном справляется с частыми задачами, этот «гравитационный» эффект ослабевает — и освободившаяся ёмкость уходит на редкие паттерны.
Малые модели до этой точки не доходят. Они попадают в петлю «выучил — забыл»: редкий пример ненадолго фиксируется, затем стирается следующими шагами на частых задачах. Когда редкий пример встречается снова, модель начинает с нуля.
Отдельный эксперимент изолировал этот эффект: суммарная частота редкой задачи оставалась постоянной, но менялся интервал между отдельными примерами. Чем больше разрыв — тем сильнее сигнал затухает в узких моделях. Широкие модели удерживают накопленное между наблюдениями и надстраивают поверх него.
Эксперименты на OLMo и феномен «grokking»
Для проверки теории команда обучала модели OLMo с числом параметров от 4 миллионов до 4 миллиардов на корпусе Dolma объёмом до 210 миллиардов токенов. В данные были намеренно подмешаны две искусственные задачи — сравнение чисел и модульное сложение — с частотой от примерно 1 000 примеров на батч до одного примера на каждые десять батчей.
Только крупные модели OLMo надёжно освоили редкие задачи: они выводили правило и применяли его к новым случаям, а не просто запоминали отдельные примеры. Особенно наглядно это проявилось с модульным сложением, где наблюдался феномен grokking — модель сначала заучивает задачу механически, а затем в какой-то момент «щёлкает» и понимает принцип. До этого момента доходили только большие модели, и только при достаточной частоте задачи в данных.
Взгляд внутрь моделей подтверждает картину. В модели на 1 миллиард параметров каждый тренировочный шаг с редкой задачей давал чёткий сигнал в сторону правильного ответа. В модели на 20 миллионов параметров этот сигнал тонул в шуме от всего остального — реального обучения почти не происходило.
Авторы также переосмысливают роль запоминания: в их трактовке меморизация — не нежелательный побочный эффект, а необходимая ступень к обобщению. Модель должна удерживать отдельные наблюдения достаточно долго, чтобы через множество батчей сформировался более широкий паттерн.
Практический вывод: частота данных как альтернатива масштабированию
Главный прикладной результат исследования — возможность заменить рост модели целенаправленным увеличением частоты нужной задачи в тренировочных данных. Если конкретный навык редко встречается в корпусе, его можно «заякорить» даже в относительно небольшой модели, просто повысив его представленность при составлении датасета.
Это важно в контексте нынешней гонки за параметрами. Обучение и инференс сверхбольших моделей требуют колоссальных вычислительных ресурсов и энергии. Для белорусских IT-компаний и стартапов из экосистемы ПВТ, которые работают с собственными или дообученными моделями, вывод практичен: прежде чем тянуться к более тяжёлой архитектуре, стоит проверить, насколько хорошо целевая задача представлена в тренировочном наборе.
Исследование существует не в вакууме. В мае 2025 года команда MIT связала законы масштабирования с геометрией моделей — тем, как нейросети хранят концепции через суперпозицию, превышая номинальную размерность. Новая работа подходит с другой стороны: она смотрит не на структуру модели, а на то, что модель реально способна извлечь из конкретного распределения данных.
Параллельно продолжается старая дискуссия о том, действительно ли способности «возникают» скачкообразно при достижении определённого размера модели или это артефакт метрик измерения. Новое исследование не закрывает этот спор, но добавляет в него конкретный механистический аргумент: по крайней мере часть «эмерджентных» способностей объясняется не магией масштаба, а банальной статистикой — тем, как часто задача встречается в данных и успевает ли модель её удержать.
Свежие новости
Все новости
OpenAI ужесточает безопасность разработки моделей после инцидента с Hugging Face
OpenAI объявила о новых мерах безопасности при разработке и тестировании моделей. Поводом стал июльский инцидент с Hugging Face, когда модель вышла за пределы тренировочной среды через уязвимость в утилите установки пакетов.

Рынок роботов в США: заказы достигли $622 млн на фоне рекордных результатов производителей
Во втором квартале 2026 года северноамериканские компании заказали 8 940 роботов на $622 млн — рост выручки производителей составил 21,3% при увеличении числа единиц лишь на 4,3%. Производители — от Teradyne до ABB — фиксируют рекордные показатели.

OpenAI приостановила обучение модели Astra после побега ИИ-агентов из изолированной среды
OpenAI остановила часть тренировочных процессов для модели Astra и объявила о новых мерах безопасности. Поводом стал инцидент, при котором ИИ-агенты вышли за пределы изолированных сред и взломали Hugging Face — и компания не заметила этого неделями.

ФБР инвестирует $88 млн в AI-инфраструктуру и переходит на Gemini
ФБР готово потратить до $88 млн на серверы и оборудование для расширения AI-мощностей. Бюро также намерено развернуть модель Gemini от Google на собственной инфраструктуре — с лицензией по выделенной ёмкости, а не по числу пользователей.

Cursor запустил хостинг кода Origin — прямой конкурент GitHub
Cursor запустил Origin — платформу для хостинга кода с репозиториями, pull-request'ами и совместной работой. Старт совпал с шестичасовым глобальным сбоем GitHub.

Google купил внутреннюю переписку обанкротившейся Spirit Airlines за $10 млн
Google заплатил $10 млн за 100 млн писем, около 500 млн сообщений в Teams и 30 млн строк кода обанкротившейся Spirit Airlines. Это первый случай, когда внутренние операционные данные компании стали предметом конкурентных торгов на аукционе по банкротству.

Apple меняет комиссии для разработчиков в ЕС: новые ставки и структура
Apple вводит новую структуру комиссий для приложений в ЕС: от 5% для дистрибуции вне App Store до 26% для крупных разработчиков, использующих встроенную оплату Apple. Изменения вступают в силу с 1 октября.

Flock Safety создала ИИ-систему для полиции, которая отслеживает людей — не только номера
Flock Safety годами уверяла, что её камеры не идентифицируют людей. Wired получил код новой ИИ-системы OS Investigate и выяснил: она делает именно это — строит досье, находит ассоциатов и ищет людей по поведенческим паттернам.

Etched привлёк $700 млн при оценке $21 млрд — рост вдвое за месяц
Стартап Etched за один месяц удвоил оценку с $10,3 до $21 млрд, привлёкши $700 млн под руководством Jane Street. Фонд не просто вложился — он уже запустил стойку с чипами Etched в своём дата-центре.