Перейти к содержимому
Digital Businessby · Беларусь
НБ РБUSD2.948EUR3.401RUB0.0362PLN0.7909CNY0.4395Конвертер →
IT и стартапы

Стартап Subquadratic заявил о прорыве в архитектуре LLM — и привёл независимые доказательства

Компания из Майами утверждает, что её модель SubQ работает в 56 раз быстрее конкурентов и обходится в сотни раз дешевле при сопоставимом качестве.

Казакевич Алексей
6 мин
Стартап Subquadratic заявил о прорыве в архитектуре LLM — и привёл независимые доказательства
Содержание
  1. Почему квадратичное внимание — это проблема
  2. Как SubQ обходит ограничение и что показали тесты
  3. Скептицизм сохраняется, но ставки высоки

Американский стартап Subquadratic заявил, что решил математическую проблему, тормозившую развитие больших языковых моделей почти десять лет. Компания представила модель SubQ — первый, по её словам, LLM на основе разреженного внимания, который не уступает топовым моделям Google DeepMind, OpenAI и Anthropic по качеству, но работает принципиально быстрее и дешевле. Независимая оценка компании Appen подтвердила ключевые заявления.

Первоначально анонс в мае 2026 года встретил волну скептицизма: Subquadratic опубликовала лишь собственные тесты без верификации. Инженер по ИИ Дэн МакАтир сформулировал общее настроение в X: «SubQ — либо крупнейший прорыв со времён трансформера, либо AI-Theranos». Теперь компания опубликовала результаты сторонней проверки и признала, что стоило сделать это с самого начала.

Почему квадратичное внимание — это проблема

Чтобы понять масштаб заявленного прорыва, нужно разобраться в том, как устроены современные LLM. Основа большинства из них — архитектура трансформера, предложенная исследователями Google в 2017 году в статье «Attention Is All You Need». Ключевой механизм — так называемое плотное внимание (dense attention).

Принцип работы прост: каждый токен (слово или его часть) кодируется числом, после чего это число перемножается с числами всех остальных токенов в тексте. Для текста длиной 10 000 слов это около 50 миллионов отдельных умножений. При удвоении длины текста число вычислений возрастает примерно вчетверо — отсюда термин «квадратичное расширение». Именно поэтому LLM требуют огромных вычислительных мощностей и потребляют колоссальное количество энергии.

Для белорусского IT-рынка это не абстрактная проблема: компании из ПВТ, работающие с LLM-продуктами, хорошо знакомы со стоимостью API-вызовов к моделям OpenAI или Anthropic. Снижение стоимости инференса в сотни раз напрямую влияет на юнит-экономику таких продуктов.

Как SubQ обходит ограничение и что показали тесты

Решение Subquadratic — заменить плотное внимание разреженным (sparse attention). Идея не нова: вместо перемножения каждого токена с каждым модель выбирает только значимые пары. Проблема в том, что предыдущие реализации разреженного внимания использовали фиксированные паттерны — например, всегда сравнивать первое слово с пятым — и в итоге теряли в качестве понимания текста.

««Исторически большинство механизмов использовали фиксированные паттерны. Это сильно ограничивает возможности, потому что язык слишком сложен для такого подхода. Наш механизм динамически выбирает, какие токены важны», — говорит сооснователь и CTO компании Алекс Уидон.»

Конкретный алгоритм отбора токенов компания не раскрывает, называя его «секретным соусом». Выбор производится в реальном времени и различается для каждого входящего текста.

Результаты независимого тестирования Appen выглядят убедительно. В тесте на скорость SubQ оказалась в 56 раз быстрее моделей, использующих FlashAttention — предыдущую технику разреженного внимания. На LiveCodeBench, бенчмарке по задачам из реальных соревнований по программированию, SubQ набрала 89,7% — результат, сопоставимый с ведущими coding-моделями на рынке.

«Это действительно взволновало меня — результаты подтвердили их архитектуру», — говорит Жанин Синанан-Сингх, директор по исследованиям генеративного ИИ в Appen. По её словам, именно потому, что результаты выглядят шокирующими, их верификация третьей стороной критически важна для доверия.

Отдельно впечатляют данные по стоимости. По словам CEO компании Джастина Дангела, прогон теста RULER 128 (разработан Nvidia для оценки работы с большими массивами данных) на модели Anthropic Opus 4.6 обходится в $2600. Тот же тест на SubQ стоил компании $8. Верифицировать эту цифру независимо пока невозможно: широкого публичного доступа к SubQ нет.

Контекстное окно SubQ составляет до 12 миллионов токенов — против 1 миллиона у большинства топовых моделей сегодня. Это открывает возможность анализировать сотни документов или целые кодовые базы за один запрос.

Скептицизм сохраняется, но ставки высоки

Несмотря на результаты Appen, часть экспертного сообщества остаётся осторожной. Уилл Депью, независимый исследователь ИИ и бывший сотрудник OpenAI, признаёт, что попытки создать эффективное разреженное внимание предпринимались многократно: «Практически всё мыслимое уже пробовали. Это не невозможно, но сравнимо с пробежкой мили за четыре минуты».

Subquadratic пока не открыла широкий доступ к модели, что ограничивает возможности независимой проверки. Компания также не публиковала технический отчёт с детальным описанием архитектуры. Это стандартная практика для стартапов, защищающих IP, но именно она питает скептицизм.

Тем не менее сооснователи настроены амбициозно. «Мы надеемся, что запускаем новую эпоху эффективности», — говорит Дангел. — «Мы не думаем, что кто-то будет строить на трансформерах через несколько лет».

Для IT-индустрии в целом и белорусских команд, разрабатывающих AI-продукты, в частности, это направление заслуживает пристального внимания. Если заявленное соотношение цены и качества подтвердится при широком тестировании, это радикально изменит экономику LLM-приложений — от чат-ботов до систем анализа юридических и финансовых документов, которые активно разрабатываются в ПВТ.

— По материалам MIT Technology Review: оригинальная статья. Перевод и адаптация — редакция Digital Business.

Сервис по темеКалькулятор стоимости ИИПосчитайте, сколько ваш сценарий будет стоить на GPT, Claude, DeepSeek и других моделях
Курс GOOGL · NASDAQ
ПоделитьсяVK

Свежие новости

Все новости
Сбер открыл Kandinsky WM 1.0: генерация видео для обучения роботов и беспилотников
IT и стартапы

Сбер открыл Kandinsky WM 1.0: генерация видео для обучения роботов и беспилотников

Сбер выпустил семейство генеративных моделей Kandinsky WM 1.0 для создания физически достоверного видео. Разработчики роботов и беспилотных автомобилей смогут обучать свои системы без дорогостоящих реальных испытаний.

Редакция
3 мин
Moss достигла статуса единорога: что это значит для европейского финтеха
IT и стартапы

Moss достигла статуса единорога: что это значит для европейского финтеха

Финтех-стартап Moss стал новейшим европейским единорогом, привлекая €30 млн в Series C с оценкой €1 млрд. Это отражает растущий интерес инвесторов к AI-решениям в финансовом секторе.

Казакевич Алексей
1 мин
Claude Opus 5 генерирует 3D-игры с физикой и музыкой из одного промпта
IT и стартапы

Claude Opus 5 генерирует 3D-игры с физикой и музыкой из одного промпта

Шутер от первого лица, гонки на картах, клон Minecraft с 15 биомами — всё это пользователи создают одним промптом в Claude Opus 5. Модель сама пишет геометрию, текстуры и физику в виде кода, который запускается прямо в браузере.

Редакция
4 мин
Google свернула AI-функцию в Google Earth через сутки после запуска
IT и стартапы

Google свернула AI-функцию в Google Earth через сутки после запуска

Google запустила и уже на следующий день отключила функцию AI-генерации изображений в Google Earth. Инструмент позволял вставлять любые сцены поверх реальных карт, что вызвало волну критики со стороны журналистов и исследователей.

Редакция
4 мин
Google DeepMind представила Gemini Robotics 2 для управления роботами любого форм-фактора
IT и стартапы

Google DeepMind представила Gemini Robotics 2 для управления роботами любого форм-фактора

Google DeepMind анонсировала Gemini Robotics 2 — свою наиболее продвинутую модель для робототехники. Система управляет роботами любого типа и доступна разработчикам через список ожидания.

Редакция
2 мин
Claude взломал три реальные компании во время тестирования — Anthropic раскрыла инциденты
IT и стартапы

Claude взломал три реальные компании во время тестирования — Anthropic раскрыла инциденты

Anthropic признала, что три модели на базе Claude проникли в реальную инфраструктуру сторонних компаний во время тестирования кибербезопасности. Это второй подобный инцидент за десять дней — ранее аналогичное произошло с моделями OpenAI.

Редакция
3 мин
Сэм Альтман призвал ИИ-индустрию сбавить темп — и он не одинок
IT и стартапы

Сэм Альтман призвал ИИ-индустрию сбавить темп — и он не одинок

Глава OpenAI Сэм Альтман заявил, что отрасли стоит «сбавить темп» в гонке ИИ. Поводом стал инцидент, при котором одна из моделей OpenAI вышла за пределы тестовой среды и оказалась связана с утечкой данных на Hugging Face.

Редакция
1 мин