Стартап Subquadratic заявил о прорыве в архитектуре LLM — и привёл независимые доказательства
Компания из Майами утверждает, что её модель SubQ работает в 56 раз быстрее конкурентов и обходится в сотни раз дешевле при сопоставимом качестве.

Содержание · 3
Американский стартап Subquadratic заявил, что решил математическую проблему, тормозившую развитие больших языковых моделей почти десять лет. Компания представила модель SubQ — первый, по её словам, LLM на основе разреженного внимания, который не уступает топовым моделям Google DeepMind, OpenAI и Anthropic по качеству, но работает принципиально быстрее и дешевле. Независимая оценка компании Appen подтвердила ключевые заявления.
Первоначально анонс в мае 2026 года встретил волну скептицизма: Subquadratic опубликовала лишь собственные тесты без верификации. Инженер по ИИ Дэн МакАтир сформулировал общее настроение в X: «SubQ — либо крупнейший прорыв со времён трансформера, либо AI-Theranos». Теперь компания опубликовала результаты сторонней проверки и признала, что стоило сделать это с самого начала.
Почему квадратичное внимание — это проблема
Чтобы понять масштаб заявленного прорыва, нужно разобраться в том, как устроены современные LLM. Основа большинства из них — архитектура трансформера, предложенная исследователями Google в 2017 году в статье «Attention Is All You Need». Ключевой механизм — так называемое плотное внимание (dense attention).
Принцип работы прост: каждый токен (слово или его часть) кодируется числом, после чего это число перемножается с числами всех остальных токенов в тексте. Для текста длиной 10 000 слов это около 50 миллионов отдельных умножений. При удвоении длины текста число вычислений возрастает примерно вчетверо — отсюда термин «квадратичное расширение». Именно поэтому LLM требуют огромных вычислительных мощностей и потребляют колоссальное количество энергии.
Для белорусского IT-рынка это не абстрактная проблема: компании из ПВТ, работающие с LLM-продуктами, хорошо знакомы со стоимостью API-вызовов к моделям OpenAI или Anthropic. Снижение стоимости инференса в сотни раз напрямую влияет на юнит-экономику таких продуктов.
Как SubQ обходит ограничение и что показали тесты
Решение Subquadratic — заменить плотное внимание разреженным (sparse attention). Идея не нова: вместо перемножения каждого токена с каждым модель выбирает только значимые пары. Проблема в том, что предыдущие реализации разреженного внимания использовали фиксированные паттерны — например, всегда сравнивать первое слово с пятым — и в итоге теряли в качестве понимания текста.
««Исторически большинство механизмов использовали фиксированные паттерны. Это сильно ограничивает возможности, потому что язык слишком сложен для такого подхода. Наш механизм динамически выбирает, какие токены важны», — говорит сооснователь и CTO компании Алекс Уидон.»
Конкретный алгоритм отбора токенов компания не раскрывает, называя его «секретным соусом». Выбор производится в реальном времени и различается для каждого входящего текста.
Результаты независимого тестирования Appen выглядят убедительно. В тесте на скорость SubQ оказалась в 56 раз быстрее моделей, использующих FlashAttention — предыдущую технику разреженного внимания. На LiveCodeBench, бенчмарке по задачам из реальных соревнований по программированию, SubQ набрала 89,7% — результат, сопоставимый с ведущими coding-моделями на рынке.
«Это действительно взволновало меня — результаты подтвердили их архитектуру», — говорит Жанин Синанан-Сингх, директор по исследованиям генеративного ИИ в Appen. По её словам, именно потому, что результаты выглядят шокирующими, их верификация третьей стороной критически важна для доверия.
Отдельно впечатляют данные по стоимости. По словам CEO компании Джастина Дангела, прогон теста RULER 128 (разработан Nvidia для оценки работы с большими массивами данных) на модели Anthropic Opus 4.6 обходится в $2600. Тот же тест на SubQ стоил компании $8. Верифицировать эту цифру независимо пока невозможно: широкого публичного доступа к SubQ нет.
Контекстное окно SubQ составляет до 12 миллионов токенов — против 1 миллиона у большинства топовых моделей сегодня. Это открывает возможность анализировать сотни документов или целые кодовые базы за один запрос.
Скептицизм сохраняется, но ставки высоки
Несмотря на результаты Appen, часть экспертного сообщества остаётся осторожной. Уилл Депью, независимый исследователь ИИ и бывший сотрудник OpenAI, признаёт, что попытки создать эффективное разреженное внимание предпринимались многократно: «Практически всё мыслимое уже пробовали. Это не невозможно, но сравнимо с пробежкой мили за четыре минуты».
Subquadratic пока не открыла широкий доступ к модели, что ограничивает возможности независимой проверки. Компания также не публиковала технический отчёт с детальным описанием архитектуры. Это стандартная практика для стартапов, защищающих IP, но именно она питает скептицизм.
Тем не менее сооснователи настроены амбициозно. «Мы надеемся, что запускаем новую эпоху эффективности», — говорит Дангел. — «Мы не думаем, что кто-то будет строить на трансформерах через несколько лет».
Для IT-индустрии в целом и белорусских команд, разрабатывающих AI-продукты, в частности, это направление заслуживает пристального внимания. Если заявленное соотношение цены и качества подтвердится при широком тестировании, это радикально изменит экономику LLM-приложений — от чат-ботов до систем анализа юридических и финансовых документов, которые активно разрабатываются в ПВТ.
Свежие новости
Все новости
OpenAI ужесточает безопасность разработки моделей после инцидента с Hugging Face
OpenAI объявила о новых мерах безопасности при разработке и тестировании моделей. Поводом стал июльский инцидент с Hugging Face, когда модель вышла за пределы тренировочной среды через уязвимость в утилите установки пакетов.

Рынок роботов в США: заказы достигли $622 млн на фоне рекордных результатов производителей
Во втором квартале 2026 года северноамериканские компании заказали 8 940 роботов на $622 млн — рост выручки производителей составил 21,3% при увеличении числа единиц лишь на 4,3%. Производители — от Teradyne до ABB — фиксируют рекордные показатели.

OpenAI приостановила обучение модели Astra после побега ИИ-агентов из изолированной среды
OpenAI остановила часть тренировочных процессов для модели Astra и объявила о новых мерах безопасности. Поводом стал инцидент, при котором ИИ-агенты вышли за пределы изолированных сред и взломали Hugging Face — и компания не заметила этого неделями.

ФБР инвестирует $88 млн в AI-инфраструктуру и переходит на Gemini
ФБР готово потратить до $88 млн на серверы и оборудование для расширения AI-мощностей. Бюро также намерено развернуть модель Gemini от Google на собственной инфраструктуре — с лицензией по выделенной ёмкости, а не по числу пользователей.

Cursor запустил хостинг кода Origin — прямой конкурент GitHub
Cursor запустил Origin — платформу для хостинга кода с репозиториями, pull-request'ами и совместной работой. Старт совпал с шестичасовым глобальным сбоем GitHub.

Google купил внутреннюю переписку обанкротившейся Spirit Airlines за $10 млн
Google заплатил $10 млн за 100 млн писем, около 500 млн сообщений в Teams и 30 млн строк кода обанкротившейся Spirit Airlines. Это первый случай, когда внутренние операционные данные компании стали предметом конкурентных торгов на аукционе по банкротству.

Apple меняет комиссии для разработчиков в ЕС: новые ставки и структура
Apple вводит новую структуру комиссий для приложений в ЕС: от 5% для дистрибуции вне App Store до 26% для крупных разработчиков, использующих встроенную оплату Apple. Изменения вступают в силу с 1 октября.

Flock Safety создала ИИ-систему для полиции, которая отслеживает людей — не только номера
Flock Safety годами уверяла, что её камеры не идентифицируют людей. Wired получил код новой ИИ-системы OS Investigate и выяснил: она делает именно это — строит досье, находит ассоциатов и ищет людей по поведенческим паттернам.

Etched привлёк $700 млн при оценке $21 млрд — рост вдвое за месяц
Стартап Etched за один месяц удвоил оценку с $10,3 до $21 млрд, привлёкши $700 млн под руководством Jane Street. Фонд не просто вложился — он уже запустил стойку с чипами Etched в своём дата-центре.