Перейти к содержимому
Digital Businessby · Беларусь
НБ РБUSD2.8805EUR3.2808RUB0.0369PLN0.7588CNY0.4256Конвертер →
IT и стартапы

Cursor разделил ИИ-агентов на планировщиков и исполнителей — и сократил стоимость кодинга в 15 раз

Новая архитектура роевых агентов показала, что дешёвые модели справляются с большей частью работы, если дорогие модели грамотно разбивают задачу.

Казакевич Алексей
6 мин
Cursor разделил ИИ-агентов на планировщиков и исполнителей — и сократил стоимость кодинга в 15 раз
Содержание
  1. Почему один агент не справляется с большими задачами
  2. Тест: реализация SQLite по документации без доступа к исходникам
  3. Экономика: дешёвый исполнитель решает всё
  4. Новая система контроля версий и управление конфликтами
  5. Что это значит на практике

Cursor опубликовал результаты эксперимента с новой архитектурой роевых агентов, в которой дорогие фронтирные модели занимаются только декомпозицией задач, а дешёвые модели — непосредственно пишут код. Разрыв в стоимости между самой дорогой и самой дешёвой конфигурацией составил 15 раз при сопоставимом качестве результата. Это меняет экономику промышленного использования ИИ-агентов.

Почему один агент не справляется с большими задачами

Ключевая проблема, которую решает новая архитектура, — контекст. Когда один агент работает над сложной задачей, ему приходится одновременно удерживать в памяти и общую цель, и текущий подзадачу, и всё дерево уже выполненных шагов. Именно поэтому агенты «дрейфуют» на длинных задачах: контекстное окно переполняется, и модель теряет нить.

Cursor разделил роли жёстко: агенты-планировщики используют мощные фронтирные модели и рекурсивно дробят цель на подзадачи. Агенты-исполнители используют быстрые и дешёвые модели и выполняют конкретные задания. Планировщики не пишут код, исполнители не планируют. Масштабирование достигается не за счёт параллельного выполнения, а за счёт разделения контекста между теми, кто решает, и теми, кто делает.

Тест: реализация SQLite по документации без доступа к исходникам

Для бенчмарка Cursor поставил рою задачу написать реализацию SQLite на Rust, опираясь только на 835-страничное руководство. Исходный код, тесты и интернет были закрыты. Метрика — sqllogictest, набор из миллионов SQL-запросов с известными ответами; агенты не знали о его существовании.

Тестировались четыре конфигурации: GPT-5.5 соло, Grok 4.5 соло, Opus 4.8 как планировщик с Composer 2.5 как исполнителем, и Fable 5 как планировщик с тем же Composer 2.5. Через четыре часа новые конфигурации набрали от 73 до 85%, тогда как старые — от 11 до 77%. В итоге все конфигурации новой системы достигли 100%.

Старый рой при тех же условиях создавал больше проблем, чем решал. В конфигурации с Grok 4.5 он сгенерировал 68 000 коммитов за два часа — примерно в 70 раз больше нового. При этом накопилось более 70 000 конфликтов слияния, тогда как новый рой удержал их ниже 1 000. Один файл в старом прогоне получил 7 771 конфликт от 1 173 агентов; в новом — 47.

Разница в архитектуре кода оказалась не менее показательной. В конфигурации с Fable 5 старый рой написал 64 305 строк движка, новый — 9 908. В конфигурации с Opus: 19 013 строк и 97% у старого против 4 645 строк и 100% у нового. При равном или лучшем результате новая архитектура сократила кодовую базу до 85%.

Экономика: дешёвый исполнитель решает всё

Стоимость прогонов варьировалась от $1 339 (гибрид Opus + Composer) до $10 565 (GPT-5.5 соло). Исполнители генерировали не менее 69% всех токенов в каждом прогоне, а обычно — более 90%. Именно выбор модели-исполнителя определял итоговый счёт.

В прогоне с GPT-5.5 только исполнители обошлись в $9 373. В гибридном прогоне весь флот исполнителей стоил $411 при сопоставимом качестве. Разница объясняется ценообразованием: Composer 2.5 по бенчмаркам сопоставим с Opus 4.7 и GPT-5.5, но стоит $0,50 за миллион входных токенов и $2,50 за миллион выходных. По словам основателя Cursor Майкла Труэлла, модель основана на Kimi K2.5.

При этом качество планировщика по-прежнему важно. Fable 5 использовал меньше токенов на планирование, чем Opus, но его исполнителям потребовалось значительно больше токенов для завершения работы — и итоговый прогон обошёлся дороже. Вывод Cursor: фронтирная модель нужна лишь для декомпозиции задачи и ключевых архитектурных решений. Когда неопределённость снята, дешёвые модели справляются с исполнением.

Новая система контроля версий и управление конфликтами

Предыдущий рой Cursor достигал около 1 000 коммитов в час — и упирался в Git. Новый рой работает на скорости 1 000 коммитов в секунду, поэтому команда написала собственную систему контроля версий: стандартные инструменты не рассчитаны на сценарии, которые человеческие команды никогда не создают.

Одна из главных проблем — «split-brain»: два планировщика независимо друг от друга реализовывали одну и ту же идею в разных местах разными способами. Cursor решил её через общие документы с проектными решениями. Каждый фрагмент кода ссылается на соответствующее решение, и эта ссылка проверяется на этапе компиляции. При конфликтах слияния вмешивается нейтральный агент-арбитр. Раздувшиеся файлы помечаются для разбивки на модули внешним агентом.

Для проверки качества Cursor тестировал несколько подходов одновременно: один ревьюер получал полную историю работы агента, второй — только результат, третий — только кодовую базу. Ни одна перспектива не улавливала все ошибки, но некоррелированные взгляды в совокупности давали более высокую надёжность. Агенты также вели общий «полевой справочник» — папку с зафиксированными неожиданными находками с ограничением по объёму. Каждый новый агент получал его содержимое при запуске.

Что это значит на практике

Cursor уже вышел за рамки лабораторных экспериментов. Предрелизная версия Fable 5 выполнила большую часть переписывания Bun с Zig на Rust: 64 экземпляра написали более миллиона строк кода за 11 дней примерно за $165 000. Кодовую базу из прогона с Opus Cursor опубликовал на GitHub под названием minisqlite.

Однако промышленное применение пока выглядит иначе. Исследование, опубликованное в конце 2025 года, показало: 68% агентов в продакшене завершали не более десяти шагов до вмешательства человека, а для 47% порог был ниже пяти шагов. Архитектура роя решает проблему масштабирования внутри одного прогона, но вопрос доверия к автономным агентам в реальных системах остаётся открытым.

Для белорусских IT-команд и компаний-резидентов ПВТ, которые уже интегрируют ИИ-инструменты в разработку, эксперимент Cursor даёт конкретный ориентир: стоимость агентного кодинга можно снизить на порядок, если правильно разделить роли между моделями. Выбор исполнительской модели — не техническая деталь, а финансовое решение.

— По материалам The Decoder: оригинальная статья. Перевод и адаптация — редакция Digital Business.

ПоделитьсяVK

Свежие новости

Все новости
Российские таск-менеджеры в 2026 году: сравнение платформ, тарифов и ИИ-функций
IT и стартапы

Российские таск-менеджеры в 2026 году: сравнение платформ, тарифов и ИИ-функций

Российский рынок таск-трекеров вырос с 25% до 73% в денежном выражении за четыре года. Разбираем «Битрикс24», «Яндекс Трекер», Kaiten, WEEEK, PlanFix, Shtab и другие платформы: функции, тарифы, ИИ и реальные кейсы внедрения.

Редакция
7 мин
ChatGPT выдавал инструкции по биооружию сотням пользователей — и OpenAI это знала
IT и стартапы

ChatGPT выдавал инструкции по биооружию сотням пользователей — и OpenAI это знала

Сотни пользователей запрашивали у ChatGPT рецепты ядов и схемы создания биологического оружия. Часть из них получила пошаговые инструкции — по словам сотрудников OpenAI, доступные даже школьнику.

Редакция
3 мин
API-токены против своего железа: как считать реальную стоимость задачи
IT и стартапы

API-токены против своего железа: как считать реальную стоимость задачи

Спор «self-hosting или API» почти всегда ведут в неправильных единицах. Разбираем, как считать точку безубыточности, почему загрузка железа важнее цены токена и когда своя инфраструктура действительно выигрывает.

Редакция
5 мин
Корпорации США режут бюджеты на ИИ и переходят на дешёвые модели
IT и стартапы

Корпорации США режут бюджеты на ИИ и переходят на дешёвые модели

Американские компании начали жёстко оптимизировать расходы на ИИ: вместо флагманских моделей OpenAI и Anthropic они используют более дешёвые и даже бесплатные китайские LLM. Рынок превратился в «бойню» за клиентов без брендовой лояльности.

Редакция
3 мин
ИИ как причина увольнений: 20 крупных технокомпаний сократили 140 000 сотрудников в 2026 году
IT и стартапы

ИИ как причина увольнений: 20 крупных технокомпаний сократили 140 000 сотрудников в 2026 году

С начала 2026 года американские технокомпании уволили почти 140 000 сотрудников, называя ИИ одним из ключевых факторов. Monday.com стала последней в этом списке, сократив 20% штата. Разбираем, кто, сколько и почему.

Редакция
7 мин
Claude Opus 5 установил рекорд на бенчмарке ARC-AGI-3, опередив GPT-5.6 Sol почти в четыре раза
IT и стартапы

Claude Opus 5 установил рекорд на бенчмарке ARC-AGI-3, опередив GPT-5.6 Sol почти в четыре раза

Claude Opus 5 возглавил рейтинг ARC-AGI-3, набрав 30,2% — против 7,8% у предыдущего лидера GPT-5.6 Sol. Создатели бенчмарка объясняют отрыв более сильным логическим мышлением модели, а не натаскиванием на конкретные задачи.

Редакция
4 мин
Российский разработчик открыл код ИИ-ассистента «Свой» с end-to-end шифрованием и RAG поверх локальных файлов
IT и стартапы

Российский разработчик открыл код ИИ-ассистента «Свой» с end-to-end шифрованием и RAG поверх локальных файлов

Разработчик опубликовал под лицензией AGPL-3.0 персонального ИИ-ассистента «Свой»: стриминговый чат, долговременная память, RAG по локальным файлам с E2E-шифрованием и генерация тем интерфейса через LLM.

Редакция
5 мин
Резидент ПВТ: налоговые льготы, преференции и правовое регулирование деятельности
IT и стартапыРедакция

Резидент ПВТ: налоговые льготы, преференции и правовое регулирование деятельности

Парк высоких технологий представляет собой уникальную правовую форму, которая позволяет резидентам динамично развиваться в результате применения особых правовых правил и налоговых льгот.