Перейти к содержимому
Digital Businessby · Беларусь
IT и стартапы

Thinking Machines Муради выпустила модель Inkling: лидер среди американских open-weights, но уступает Китаю

Стартап бывшего технического директора OpenAI представил первую production-ready модель с 975 млрд параметров и ставкой на файн-тюнинг под задачи бизнеса.

Казакевич Алексей
6 мин
Thinking Machines Муради выпустила модель Inkling: лидер среди американских open-weights, но уступает Китаю
Содержание
  1. Архитектура, данные и честность о слабых местах
  2. Бенчмарки: сильные и слабые стороны
  3. Ценообразование и эффективность токенов
  4. Inkling-Small: меньше параметров, лучше на ряде тестов

Стартап Thinking Machines Lab, основанный бывшим техническим директором OpenAI Мирой Муради, представил свою первую полноценную языковую модель — Inkling. Это мультимодальный Mixture-of-Experts трансформер с 975 млрд параметрами, из которых одновременно активны лишь 41 млрд. Модель сразу возглавила рейтинг открытых американских моделей, однако по общей производительности проигрывает лучшим китайским разработкам.

Муради — одна из ключевых фигур в истории ChatGPT: именно она руководила технической командой OpenAI в период его взрывного роста. После ухода из компании в 2024 году она основала Thinking Machines Lab, привлекла значительное финансирование и теперь делает ставку не на гонку за абсолютными бенчмарками, а на гибкость и адаптируемость модели под конкретные бизнес-задачи.

Архитектура, данные и честность о слабых местах

Inkling поддерживает текст, изображения и аудио «из коробки», без дополнительных адаптеров. Контекстное окно достигает 1 млн токенов — это один из самых широких показателей среди открытых моделей. Веса модели доступны бесплатно на Hugging Face; параллельно компания предлагает платформу Tinker для тонкой настройки под отраслевые задачи.

Модель предобучена на 45 трлн токенов — публичных и синтетических текстов, изображений, аудиозаписей и видео. Примечательно, что для генерации синтетических данных использовалась китайская модель Kimi K2.5 — та же, что легла в основу кодовой модели редактора Cursor. Thinking Machines прямо указывает в анонсе: «Inkling — не самая сильная модель из доступных сегодня». Такая откровенность нетипична для запусков в AI-индустрии и, судя по всему, является частью позиционирования: компания продаёт не сырую мощь, а управляемую кастомизацию.

Отдельный вопрос — обучающие данные. Thinking Machines признаёт, что в датасет вошли материалы, «которые могут охраняться авторским правом». Это стандартная оговорка для крупных языковых моделей, но в контексте нарастающих судебных разбирательств с правообладателями она всё менее безобидна.

Бенчмарки: сильные и слабые стороны

По данным платформы Artificial Analysis, Inkling набирает 41 балл в индексе Artificial Analysis Intelligence Index. Это лучший результат среди открытых американских моделей: ближайший конкурент, Nemotron 3 Ultra, отстаёт на 3 балла (38), Gemma 4 31B набирает 29, а gpt-oss-120b — лишь 24.

На агентном бенчмарке GDPval-AA v2, имитирующем задачи интеллектуального труда, Inkling получает рейтинг Эло 1 238 — выше, чем у Kimi K2.6 (1 190) и DeepSeek v4 Flash max (1 189). На банковском бенчмарке Tau-3 модель достигает 24%, опережая Kimi K2.6 (21%) и DeepSeek v4 Flash max (23%). Для компаний, строящих агентные системы автоматизации, это значимые цифры.

Однако есть серьёзный изъян: фактическая точность. На бенчмарке AA Omniscience Inkling набирает лишь +2, точность составляет 40%, а уровень галлюцинаций — 63%. Это делает модель малопригодной для задач, где критична достоверность: юридический анализ, медицинские рекомендации, финансовая отчётность. Для сравнения, Nemotron 3 Ultra показывает -1 по тому же индексу — то есть оба американских лидера пока уступают китайским моделям в надёжности фактов.

Ценообразование и эффективность токенов

При контекстном окне 64K токенов стоимость составляет $1,87 за млн входных токенов и $4,68 за млн выходных. Для окна до 256K цены вырастают до $3,74 и $9,36 соответственно. Это несколько дороже сопоставимых китайских моделей — GLM-5.2 и DeepSeek v4 — при схожей или более высокой производительности последних на текстовых и кодовых задачах.

Главный аргумент Thinking Machines в ответ на ценовое сравнение — экономия на выходных токенах. В среднем Inkling генерирует 25 000 токенов на задачу в Intelligence Index, тогда как GLM-5.2 max расходует 43 000, Kimi K2.6 — около 38 000, а DeepSeek v4 Pro max — около 37 000. Компания также предлагает регулируемый параметр «усилия мышления» (thinking effort): пользователь сам выбирает баланс между стоимостью и качеством ответа, снижая расход токенов без потери точности на конкретных задачах.

Inkling-Small: меньше параметров, лучше на ряде тестов

Одновременно с основной моделью Thinking Machines анонсировала Inkling-Small — компактную версию с 276 млрд параметрами (12 млрд активных). Парадоксально, но на нескольких бенчмарках она превосходит старшую модель: 88,3% против 87,2% на GPQA Diamond и 46,6% против 46,0% на HLE with tools. Компания объясняет это улучшениями в предобучающих данных и процессе тренировки. Полные веса Inkling-Small будут опубликованы после завершения тестирования.

Для белорусских IT-команд и стартапов из ПВТ, работающих с LLM-стеком, появление Inkling — ещё один аргумент в пользу диверсификации: теперь в пространстве открытых моделей есть американская альтернатива с нативной мультимодальностью и управляемым thinking effort. Вопрос в том, насколько быстро Thinking Machines закроет разрыв в фактической точности — без этого модель останется инструментом для агентной автоматизации, но не для задач с высокими требованиями к достоверности.

— По материалам The Decoder: оригинальная статья. Перевод и адаптация — редакция Digital Business.

ПоделитьсяVK

Свежие новости

Все новости
Inkling 975B от Thinking Machines: рейтинг и цены 2025 · Digital Business