Перейти к содержимому
Digital Businessby · Беларусь
НБ РБUSD2.8805EUR3.2808RUB0.0369PLN0.7588CNY0.4256Конвертер →
IT и стартапы

API-токены против своего железа: как считать реальную стоимость задачи

Сравнение по цене за токен вводит в заблуждение — правильная единица измерения это стоимость одной решённой задачи с учётом загрузки инфраструктуры.

Казакевич Алексей
5 мин
API-токены против своего железа: как считать реальную стоимость задачи
Содержание
  1. Токены, блендированная цена и точка безубыточности
  2. Стоимость решённой задачи: честное сравнение
  3. Что формула не учитывает

Дискуссия «своя модель или API» неизменно сводится к сравнению цен за токен. Это неверная единица измерения. Self-hosting — постоянные затраты, API — переменные, и ответ зависит прежде всего от того, насколько плотно загружено железо. Плюс модели по-разному расходуют токены на одну и ту же задачу, поэтому честная метрика — стоимость решённой задачи, а не стоимость миллиона токенов.

За последний год ситуацию дополнительно изменило качество открытых моделей. На SWE-bench Verified DeepSeek V3.2 показывает 73,1%, Kimi K393,4%, что вплотную приближается к лучшим закрытым системам. Выбор между своим железом и API во многих сценариях перестал быть вопросом качества и стал чисто экономическим.

Токены, блендированная цена и точка безубыточности

Провайдеры берут за входящие и исходящие токены по разным ставкам — выход обычно в 3–5 раз дороже. У Claude Opus 4.8 это $5 и $25 за миллион токенов соответственно. Реальная блендированная цена зависит от соотношения входа и выхода в конкретной нагрузке. Генерация поверх длинного контекста (RAG, summary) обходится значительно дешевле, чем длинная генерация с нуля.

Для ориентира: при агентном кодировании (много выходных токенов) блендированная цена за миллион составляет примерно $6,82 для Claude Opus 4.8, $4,09 для Kimi K3 и всего $0,239 для DeepSeek V3.2 через официальный API. Цены актуальны на конец июля 2026.

Стоимость собственной инфраструктуры складывается из амортизации железа и расходов на электроэнергию. Нода 8×H200 HGX стоит при покупке около $370 тыс. При амортизации на 36 месяцев с учётом остаточной стоимости ~25% это выходит примерно $7,7 тыс. в месяц. Энергопотребление добавляет ещё $580–880 в месяц при тарифе $0,10–0,15 за кВт·ч. Аренда той же ноды в долгосрочном резерве обходится в $10,5–14,6 тыс. в месяц, on-demand у гиперскейлеров — $26–41 тыс.

Важная оговорка: операционные расходы (инженеры, поддержка) в эту модель намеренно не включены, поскольку зарплатная составляющая слишком волатильна. Это означает, что приведённые оценки self-hosting — оптимистичная нижняя граница. В реальности собственная инфраструктура только дороже, а значит точка безубыточности сдвигается ещё дальше в сторону API.

Собственное железо становится выгоднее API только при достаточно высокой утилизации. Если нода простаивает значительную часть времени — постоянные затраты размазываются на меньший объём задач, и стоимость каждой из них резко растёт. При утилизации 30% требуемая пиковая пропускная способность утраивается по сравнению с расчётной, и API оказывается дешевле вне зависимости от выбранной модели.

Стоимость решённой задачи: честное сравнение

Цена за токен предполагает, что модели взаимозаменяемы. Это не так: они отличаются и долей успешно решённых задач, и числом токенов на попытку. Честная метрика выглядит так: стоимость задачи = (стоимость одной попытки) / (доля решённых задач). Если модель решает задачу с нескольких попыток, суммируется стоимость всех попыток.

Здесь нужна важная оговорка про SWE-bench Verified. Опубликованные показатели несопоставимы напрямую: Kimi K3 тестируется в харнессе KimiCode, Claude Opus 4.8 — в Claude Code, OpenAI — в Codex или OpenHands. Разброс только от смены обвязки составляет 10–26 баллов, что перекрывает разницу между самими моделями. Поэтому объявлять победителя по вендорским цифрам — та же ошибка, что сравнивать цены за токен.

При фиксированном бюджете 1,5 млн токенов на попытку картина выглядит так. Claude Opus 4.8 (solve rate 88,6%, харнесс Claude Code) — $11,54 за задачу через API. Kimi K3 (93,4%, KimiCode) — $6,57. DeepSeek V3.2 (73,1%) через официальный API — $0,49. Тот же DeepSeek на собственном железе при утилизации около 50% — примерно $4,37.

Единственное честное сравнение в этой таблице — две строки DeepSeek: API против self-hosted. У них одинаковый solve rate и одинаковый бюджет токенов, эффект харнесса сокращается, и разница отражает чисто экономику размещения. Вывод однозначный: своё железо не обгоняет дешёвый API той же модели ни при какой реалистичной утилизации. Провайдер крутит то же железо на несравнимо большей загрузке, чем отдельная компания.

Self-hosting выигрывает только у дорогих закрытых API. Собственный DeepSeek становится дешевле Claude Opus 4.8 примерно с утилизации 20–30%, дешевле Kimi K3 — с чуть более высокой. Но конкурировать с DeepSeek через его же официальный API на своём железе практически невозможно.

Что формула не учитывает

Есть факторы, при которых экономический расчёт становится нерелевантным.

Резидентность данных. Если данные клиента не могут покидать контролируемый контур, API исключается по любой цене. Для белорусских компаний, работающих с персональными данными граждан или финансовой информацией под надзором НБ РБ, это вполне реальное ограничение.

Привязка к вендору и доступность. В июле 2026 Moonshot AI приостановила приём новых подписок на Kimi K3 примерно через 48 часов после запуска — спрос превысил доступную GPU-ёмкость. Модель формально существует, пропускной способности под неё нет, и это полностью вне контроля пользователя.

Стоимость обновлений. Клиент API получает обновление модели бесплатно. Команда на self-hosting за каждый апгрейд проходит полный цикл переквантизации и переоценки — это инженерное время и операционные расходы.

Реальная амортизация железа. Ускорители дешевеют по темпу релизов NVIDIA, а не по бухгалтерскому графику. Нода 8×H200 стоимостью $370 тыс. сохраняет около 25% стоимости через три года (~$92,5 тыс.), то есть теряет ~$277,5 тыс. за срок владения. Траекторию задаёт выход следующего поколения (B300 и далее), а не план амортизации.

Для IT-компаний в белорусском ПВТ, которые рассматривают собственную GPU-инфраструктуру, эти факторы особенно актуальны: валютные риски при покупке железа, сложность с логистикой и ограниченный рынок инженеров по MLOps добавляют к расчёту дополнительные переменные, которые сдвигают точку безубыточности ещё дальше от self-hosting.

Итоговый вывод прост: вопрос «API или своё железо» — это не вопрос стоимости токена. Это вопрос загрузки инфраструктуры, требований к данным и операционных ограничений. Пока железо простаивает значительную часть времени, дешёвый API выигрывает практически всегда.

— По материалам Хабр / Разработка: оригинальная статья. Перевод и адаптация — редакция Digital Business.

Сервис по темеКалькулятор стоимости ИИПосчитайте, сколько ваш сценарий будет стоить на GPT, Claude, DeepSeek и других моделях
ПоделитьсяVK

Свежие новости

Все новости
ChatGPT выдавал инструкции по биооружию сотням пользователей — и OpenAI это знала
IT и стартапы

ChatGPT выдавал инструкции по биооружию сотням пользователей — и OpenAI это знала

Сотни пользователей запрашивали у ChatGPT рецепты ядов и схемы создания биологического оружия. Часть из них получила пошаговые инструкции — по словам сотрудников OpenAI, доступные даже школьнику.

Редакция
3 мин
Корпорации США режут бюджеты на ИИ и переходят на дешёвые модели
IT и стартапы

Корпорации США режут бюджеты на ИИ и переходят на дешёвые модели

Американские компании начали жёстко оптимизировать расходы на ИИ: вместо флагманских моделей OpenAI и Anthropic они используют более дешёвые и даже бесплатные китайские LLM. Рынок превратился в «бойню» за клиентов без брендовой лояльности.

Редакция
3 мин
ИИ как причина увольнений: 20 крупных технокомпаний сократили 140 000 сотрудников в 2026 году
IT и стартапы

ИИ как причина увольнений: 20 крупных технокомпаний сократили 140 000 сотрудников в 2026 году

С начала 2026 года американские технокомпании уволили почти 140 000 сотрудников, называя ИИ одним из ключевых факторов. Monday.com стала последней в этом списке, сократив 20% штата. Разбираем, кто, сколько и почему.

Редакция
7 мин
Claude Opus 5 установил рекорд на бенчмарке ARC-AGI-3, опередив GPT-5.6 Sol почти в четыре раза
IT и стартапы

Claude Opus 5 установил рекорд на бенчмарке ARC-AGI-3, опередив GPT-5.6 Sol почти в четыре раза

Claude Opus 5 возглавил рейтинг ARC-AGI-3, набрав 30,2% — против 7,8% у предыдущего лидера GPT-5.6 Sol. Создатели бенчмарка объясняют отрыв более сильным логическим мышлением модели, а не натаскиванием на конкретные задачи.

Редакция
4 мин
Российский разработчик открыл код ИИ-ассистента «Свой» с end-to-end шифрованием и RAG поверх локальных файлов
IT и стартапы

Российский разработчик открыл код ИИ-ассистента «Свой» с end-to-end шифрованием и RAG поверх локальных файлов

Разработчик опубликовал под лицензией AGPL-3.0 персонального ИИ-ассистента «Свой»: стриминговый чат, долговременная память, RAG по локальным файлам с E2E-шифрованием и генерация тем интерфейса через LLM.

Редакция
5 мин
Резидент ПВТ: налоговые льготы, преференции и правовое регулирование деятельности
IT и стартапыРедакция

Резидент ПВТ: налоговые льготы, преференции и правовое регулирование деятельности

Парк высоких технологий представляет собой уникальную правовую форму, которая позволяет резидентам динамично развиваться в результате применения особых правовых правил и налоговых льгот.

Kimi выпустила открытую модель K3 на 2,8 трлн параметров — и подняла цены вслед за западными конкурентами
IT и стартапы

Kimi выпустила открытую модель K3 на 2,8 трлн параметров — и подняла цены вслед за западными конкурентами

Kimi K3 — мультимодальная модель с 2,8 трлн параметров и контекстным окном в 1 млн токенов. По независимым тестам она уступает только двум топовым проприетарным моделям, однако цена на неё выросла в разы по сравнению с предшественником.

Редакция
6 мин