Cursor разделил ИИ-агентов на планировщиков и исполнителей — и сократил стоимость кодинга в 15 раз
Новая архитектура роевых агентов показала, что дешёвые модели справляются с большей частью работы, если дорогие модели грамотно разбивают задачу.

Содержание
Cursor опубликовал результаты эксперимента с новой архитектурой роевых агентов, в которой дорогие фронтирные модели занимаются только декомпозицией задач, а дешёвые модели — непосредственно пишут код. Разрыв в стоимости между самой дорогой и самой дешёвой конфигурацией составил 15 раз при сопоставимом качестве результата. Это меняет экономику промышленного использования ИИ-агентов.
Почему один агент не справляется с большими задачами
Ключевая проблема, которую решает новая архитектура, — контекст. Когда один агент работает над сложной задачей, ему приходится одновременно удерживать в памяти и общую цель, и текущий подзадачу, и всё дерево уже выполненных шагов. Именно поэтому агенты «дрейфуют» на длинных задачах: контекстное окно переполняется, и модель теряет нить.
Cursor разделил роли жёстко: агенты-планировщики используют мощные фронтирные модели и рекурсивно дробят цель на подзадачи. Агенты-исполнители используют быстрые и дешёвые модели и выполняют конкретные задания. Планировщики не пишут код, исполнители не планируют. Масштабирование достигается не за счёт параллельного выполнения, а за счёт разделения контекста между теми, кто решает, и теми, кто делает.
Тест: реализация SQLite по документации без доступа к исходникам
Для бенчмарка Cursor поставил рою задачу написать реализацию SQLite на Rust, опираясь только на 835-страничное руководство. Исходный код, тесты и интернет были закрыты. Метрика — sqllogictest, набор из миллионов SQL-запросов с известными ответами; агенты не знали о его существовании.
Тестировались четыре конфигурации: GPT-5.5 соло, Grok 4.5 соло, Opus 4.8 как планировщик с Composer 2.5 как исполнителем, и Fable 5 как планировщик с тем же Composer 2.5. Через четыре часа новые конфигурации набрали от 73 до 85%, тогда как старые — от 11 до 77%. В итоге все конфигурации новой системы достигли 100%.
Старый рой при тех же условиях создавал больше проблем, чем решал. В конфигурации с Grok 4.5 он сгенерировал 68 000 коммитов за два часа — примерно в 70 раз больше нового. При этом накопилось более 70 000 конфликтов слияния, тогда как новый рой удержал их ниже 1 000. Один файл в старом прогоне получил 7 771 конфликт от 1 173 агентов; в новом — 47.
Разница в архитектуре кода оказалась не менее показательной. В конфигурации с Fable 5 старый рой написал 64 305 строк движка, новый — 9 908. В конфигурации с Opus: 19 013 строк и 97% у старого против 4 645 строк и 100% у нового. При равном или лучшем результате новая архитектура сократила кодовую базу до 85%.
Экономика: дешёвый исполнитель решает всё
Стоимость прогонов варьировалась от $1 339 (гибрид Opus + Composer) до $10 565 (GPT-5.5 соло). Исполнители генерировали не менее 69% всех токенов в каждом прогоне, а обычно — более 90%. Именно выбор модели-исполнителя определял итоговый счёт.
В прогоне с GPT-5.5 только исполнители обошлись в $9 373. В гибридном прогоне весь флот исполнителей стоил $411 при сопоставимом качестве. Разница объясняется ценообразованием: Composer 2.5 по бенчмаркам сопоставим с Opus 4.7 и GPT-5.5, но стоит $0,50 за миллион входных токенов и $2,50 за миллион выходных. По словам основателя Cursor Майкла Труэлла, модель основана на Kimi K2.5.
При этом качество планировщика по-прежнему важно. Fable 5 использовал меньше токенов на планирование, чем Opus, но его исполнителям потребовалось значительно больше токенов для завершения работы — и итоговый прогон обошёлся дороже. Вывод Cursor: фронтирная модель нужна лишь для декомпозиции задачи и ключевых архитектурных решений. Когда неопределённость снята, дешёвые модели справляются с исполнением.
Новая система контроля версий и управление конфликтами
Предыдущий рой Cursor достигал около 1 000 коммитов в час — и упирался в Git. Новый рой работает на скорости 1 000 коммитов в секунду, поэтому команда написала собственную систему контроля версий: стандартные инструменты не рассчитаны на сценарии, которые человеческие команды никогда не создают.
Одна из главных проблем — «split-brain»: два планировщика независимо друг от друга реализовывали одну и ту же идею в разных местах разными способами. Cursor решил её через общие документы с проектными решениями. Каждый фрагмент кода ссылается на соответствующее решение, и эта ссылка проверяется на этапе компиляции. При конфликтах слияния вмешивается нейтральный агент-арбитр. Раздувшиеся файлы помечаются для разбивки на модули внешним агентом.
Для проверки качества Cursor тестировал несколько подходов одновременно: один ревьюер получал полную историю работы агента, второй — только результат, третий — только кодовую базу. Ни одна перспектива не улавливала все ошибки, но некоррелированные взгляды в совокупности давали более высокую надёжность. Агенты также вели общий «полевой справочник» — папку с зафиксированными неожиданными находками с ограничением по объёму. Каждый новый агент получал его содержимое при запуске.
Что это значит на практике
Cursor уже вышел за рамки лабораторных экспериментов. Предрелизная версия Fable 5 выполнила большую часть переписывания Bun с Zig на Rust: 64 экземпляра написали более миллиона строк кода за 11 дней примерно за $165 000. Кодовую базу из прогона с Opus Cursor опубликовал на GitHub под названием minisqlite.
Однако промышленное применение пока выглядит иначе. Исследование, опубликованное в конце 2025 года, показало: 68% агентов в продакшене завершали не более десяти шагов до вмешательства человека, а для 47% порог был ниже пяти шагов. Архитектура роя решает проблему масштабирования внутри одного прогона, но вопрос доверия к автономным агентам в реальных системах остаётся открытым.
Для белорусских IT-команд и компаний-резидентов ПВТ, которые уже интегрируют ИИ-инструменты в разработку, эксперимент Cursor даёт конкретный ориентир: стоимость агентного кодинга можно снизить на порядок, если правильно разделить роли между моделями. Выбор исполнительской модели — не техническая деталь, а финансовое решение.
— По материалам The Decoder: оригинальная статья. Перевод и адаптация — редакция Digital Business.
Свежие новости
Все новости
Российские таск-менеджеры в 2026 году: сравнение платформ, тарифов и ИИ-функций
Российский рынок таск-трекеров вырос с 25% до 73% в денежном выражении за четыре года. Разбираем «Битрикс24», «Яндекс Трекер», Kaiten, WEEEK, PlanFix, Shtab и другие платформы: функции, тарифы, ИИ и реальные кейсы внедрения.

ChatGPT выдавал инструкции по биооружию сотням пользователей — и OpenAI это знала
Сотни пользователей запрашивали у ChatGPT рецепты ядов и схемы создания биологического оружия. Часть из них получила пошаговые инструкции — по словам сотрудников OpenAI, доступные даже школьнику.

API-токены против своего железа: как считать реальную стоимость задачи
Спор «self-hosting или API» почти всегда ведут в неправильных единицах. Разбираем, как считать точку безубыточности, почему загрузка железа важнее цены токена и когда своя инфраструктура действительно выигрывает.

fibgen: генератор OpenAPI-спеки для Fiber без единой аннотации в коде
Go-команды, работающие с Fiber, знают проблему: godoc-аннотации расходятся с кодом и врут. fibgen решает это иначе — статическим анализом AST без единого изменения в рабочем коде.

Корпорации США режут бюджеты на ИИ и переходят на дешёвые модели
Американские компании начали жёстко оптимизировать расходы на ИИ: вместо флагманских моделей OpenAI и Anthropic они используют более дешёвые и даже бесплатные китайские LLM. Рынок превратился в «бойню» за клиентов без брендовой лояльности.

ИИ как причина увольнений: 20 крупных технокомпаний сократили 140 000 сотрудников в 2026 году
С начала 2026 года американские технокомпании уволили почти 140 000 сотрудников, называя ИИ одним из ключевых факторов. Monday.com стала последней в этом списке, сократив 20% штата. Разбираем, кто, сколько и почему.

Claude Opus 5 установил рекорд на бенчмарке ARC-AGI-3, опередив GPT-5.6 Sol почти в четыре раза
Claude Opus 5 возглавил рейтинг ARC-AGI-3, набрав 30,2% — против 7,8% у предыдущего лидера GPT-5.6 Sol. Создатели бенчмарка объясняют отрыв более сильным логическим мышлением модели, а не натаскиванием на конкретные задачи.

Российский разработчик открыл код ИИ-ассистента «Свой» с end-to-end шифрованием и RAG поверх локальных файлов
Разработчик опубликовал под лицензией AGPL-3.0 персонального ИИ-ассистента «Свой»: стриминговый чат, долговременная память, RAG по локальным файлам с E2E-шифрованием и генерация тем интерфейса через LLM.

Резидент ПВТ: налоговые льготы, преференции и правовое регулирование деятельности
Парк высоких технологий представляет собой уникальную правовую форму, которая позволяет резидентам динамично развиваться в результате применения особых правовых правил и налоговых льгот.