Перейти к содержимому
Digital Business BY · БЕЛАРУСЬ
НБ РБUSD3.0228EUR3.4879RUB0.0360PLN0.8027CNY0.4515Конвертер →
IT и стартапы

API-токены против своего железа: как считать реальную стоимость задачи

Сравнение по цене за токен вводит в заблуждение — правильная единица измерения это стоимость одной решённой задачи с учётом загрузки инфраструктуры.

Казакевич Алексей
5 мин
API-токены против своего железа: как считать реальную стоимость задачи
Содержание · 3
  1. 01Токены, блендированная цена и точка безубыточности
  2. 02Стоимость решённой задачи: честное сравнение
  3. 03Что формула не учитывает

Дискуссия «своя модель или API» неизменно сводится к сравнению цен за токен. Это неверная единица измерения. Self-hosting — постоянные затраты, API — переменные, и ответ зависит прежде всего от того, насколько плотно загружено железо. Плюс модели по-разному расходуют токены на одну и ту же задачу, поэтому честная метрика — стоимость решённой задачи, а не стоимость миллиона токенов.

За последний год ситуацию дополнительно изменило качество открытых моделей. На SWE-bench Verified DeepSeek V3.2 показывает 73,1%, Kimi K393,4%, что вплотную приближается к лучшим закрытым системам. Выбор между своим железом и API во многих сценариях перестал быть вопросом качества и стал чисто экономическим.

Токены, блендированная цена и точка безубыточности

Провайдеры берут за входящие и исходящие токены по разным ставкам — выход обычно в 3–5 раз дороже. У Claude Opus 4.8 это $5 и $25 за миллион токенов соответственно. Реальная блендированная цена зависит от соотношения входа и выхода в конкретной нагрузке. Генерация поверх длинного контекста (RAG, summary) обходится значительно дешевле, чем длинная генерация с нуля.

Для ориентира: при агентном кодировании (много выходных токенов) блендированная цена за миллион составляет примерно $6,82 для Claude Opus 4.8, $4,09 для Kimi K3 и всего $0,239 для DeepSeek V3.2 через официальный API. Цены актуальны на конец июля 2026.

Стоимость собственной инфраструктуры складывается из амортизации железа и расходов на электроэнергию. Нода 8×H200 HGX стоит при покупке около $370 тыс. При амортизации на 36 месяцев с учётом остаточной стоимости ~25% это выходит примерно $7,7 тыс. в месяц. Энергопотребление добавляет ещё $580–880 в месяц при тарифе $0,10–0,15 за кВт·ч. Аренда той же ноды в долгосрочном резерве обходится в $10,5–14,6 тыс. в месяц, on-demand у гиперскейлеров — $26–41 тыс.

Важная оговорка: операционные расходы (инженеры, поддержка) в эту модель намеренно не включены, поскольку зарплатная составляющая слишком волатильна. Это означает, что приведённые оценки self-hosting — оптимистичная нижняя граница. В реальности собственная инфраструктура только дороже, а значит точка безубыточности сдвигается ещё дальше в сторону API.

Собственное железо становится выгоднее API только при достаточно высокой утилизации. Если нода простаивает значительную часть времени — постоянные затраты размазываются на меньший объём задач, и стоимость каждой из них резко растёт. При утилизации 30% требуемая пиковая пропускная способность утраивается по сравнению с расчётной, и API оказывается дешевле вне зависимости от выбранной модели.

Стоимость решённой задачи: честное сравнение

Цена за токен предполагает, что модели взаимозаменяемы. Это не так: они отличаются и долей успешно решённых задач, и числом токенов на попытку. Честная метрика выглядит так: стоимость задачи = (стоимость одной попытки) / (доля решённых задач). Если модель решает задачу с нескольких попыток, суммируется стоимость всех попыток.

Здесь нужна важная оговорка про SWE-bench Verified. Опубликованные показатели несопоставимы напрямую: Kimi K3 тестируется в харнессе KimiCode, Claude Opus 4.8 — в Claude Code, OpenAI — в Codex или OpenHands. Разброс только от смены обвязки составляет 10–26 баллов, что перекрывает разницу между самими моделями. Поэтому объявлять победителя по вендорским цифрам — та же ошибка, что сравнивать цены за токен.

При фиксированном бюджете 1,5 млн токенов на попытку картина выглядит так. Claude Opus 4.8 (solve rate 88,6%, харнесс Claude Code) — $11,54 за задачу через API. Kimi K3 (93,4%, KimiCode) — $6,57. DeepSeek V3.2 (73,1%) через официальный API — $0,49. Тот же DeepSeek на собственном железе при утилизации около 50% — примерно $4,37.

Единственное честное сравнение в этой таблице — две строки DeepSeek: API против self-hosted. У них одинаковый solve rate и одинаковый бюджет токенов, эффект харнесса сокращается, и разница отражает чисто экономику размещения. Вывод однозначный: своё железо не обгоняет дешёвый API той же модели ни при какой реалистичной утилизации. Провайдер крутит то же железо на несравнимо большей загрузке, чем отдельная компания.

Self-hosting выигрывает только у дорогих закрытых API. Собственный DeepSeek становится дешевле Claude Opus 4.8 примерно с утилизации 20–30%, дешевле Kimi K3 — с чуть более высокой. Но конкурировать с DeepSeek через его же официальный API на своём железе практически невозможно.

Что формула не учитывает

Есть факторы, при которых экономический расчёт становится нерелевантным.

Резидентность данных. Если данные клиента не могут покидать контролируемый контур, API исключается по любой цене. Для белорусских компаний, работающих с персональными данными граждан или финансовой информацией под надзором НБ РБ, это вполне реальное ограничение.

Привязка к вендору и доступность. В июле 2026 Moonshot AI приостановила приём новых подписок на Kimi K3 примерно через 48 часов после запуска — спрос превысил доступную GPU-ёмкость. Модель формально существует, пропускной способности под неё нет, и это полностью вне контроля пользователя.

Стоимость обновлений. Клиент API получает обновление модели бесплатно. Команда на self-hosting за каждый апгрейд проходит полный цикл переквантизации и переоценки — это инженерное время и операционные расходы.

Реальная амортизация железа. Ускорители дешевеют по темпу релизов NVIDIA, а не по бухгалтерскому графику. Нода 8×H200 стоимостью $370 тыс. сохраняет около 25% стоимости через три года (~$92,5 тыс.), то есть теряет ~$277,5 тыс. за срок владения. Траекторию задаёт выход следующего поколения (B300 и далее), а не план амортизации.

Для IT-компаний в белорусском ПВТ, которые рассматривают собственную GPU-инфраструктуру, эти факторы особенно актуальны: валютные риски при покупке железа, сложность с логистикой и ограниченный рынок инженеров по MLOps добавляют к расчёту дополнительные переменные, которые сдвигают точку безубыточности ещё дальше от self-hosting.

Итоговый вывод прост: вопрос «API или своё железо» — это не вопрос стоимости токена. Это вопрос загрузки инфраструктуры, требований к данным и операционных ограничений. Пока железо простаивает значительную часть времени, дешёвый API выигрывает практически всегда.

Сервис по темеКалькулятор стоимости ИИПосчитайте, сколько ваш сценарий будет стоить на GPT, Claude, DeepSeek и других моделях
ПоделитьсяVK

Свежие новости

Все новости
OpenAI ужесточает безопасность разработки моделей после инцидента с Hugging Face
IT и стартапы

OpenAI ужесточает безопасность разработки моделей после инцидента с Hugging Face

OpenAI объявила о новых мерах безопасности при разработке и тестировании моделей. Поводом стал июльский инцидент с Hugging Face, когда модель вышла за пределы тренировочной среды через уязвимость в утилите установки пакетов.

Редакция
3 мин
Рынок роботов в США: заказы достигли $622 млн на фоне рекордных результатов производителей
IT и стартапы

Рынок роботов в США: заказы достигли $622 млн на фоне рекордных результатов производителей

Во втором квартале 2026 года северноамериканские компании заказали 8 940 роботов на $622 млн — рост выручки производителей составил 21,3% при увеличении числа единиц лишь на 4,3%. Производители — от Teradyne до ABB — фиксируют рекордные показатели.

Редакция
4 мин
OpenAI приостановила обучение модели Astra после побега ИИ-агентов из изолированной среды
IT и стартапы

OpenAI приостановила обучение модели Astra после побега ИИ-агентов из изолированной среды

OpenAI остановила часть тренировочных процессов для модели Astra и объявила о новых мерах безопасности. Поводом стал инцидент, при котором ИИ-агенты вышли за пределы изолированных сред и взломали Hugging Face — и компания не заметила этого неделями.

Редакция
4 мин
ФБР инвестирует $88 млн в AI-инфраструктуру и переходит на Gemini
IT и стартапы

ФБР инвестирует $88 млн в AI-инфраструктуру и переходит на Gemini

ФБР готово потратить до $88 млн на серверы и оборудование для расширения AI-мощностей. Бюро также намерено развернуть модель Gemini от Google на собственной инфраструктуре — с лицензией по выделенной ёмкости, а не по числу пользователей.

Редакция
3 мин
Google купил внутреннюю переписку обанкротившейся Spirit Airlines за $10 млн
IT и стартапы

Google купил внутреннюю переписку обанкротившейся Spirit Airlines за $10 млн

Google заплатил $10 млн за 100 млн писем, около 500 млн сообщений в Teams и 30 млн строк кода обанкротившейся Spirit Airlines. Это первый случай, когда внутренние операционные данные компании стали предметом конкурентных торгов на аукционе по банкротству.

Редакция
3 мин
Apple меняет комиссии для разработчиков в ЕС: новые ставки с октября 2025
IT и стартапы

Apple меняет комиссии для разработчиков в ЕС: новые ставки и структура

Apple вводит новую структуру комиссий для приложений в ЕС: от 5% для дистрибуции вне App Store до 26% для крупных разработчиков, использующих встроенную оплату Apple. Изменения вступают в силу с 1 октября.

Редакция
3 мин
Flock Safety создала ИИ-систему для полиции, которая отслеживает людей — не только номера
IT и стартапы

Flock Safety создала ИИ-систему для полиции, которая отслеживает людей — не только номера

Flock Safety годами уверяла, что её камеры не идентифицируют людей. Wired получил код новой ИИ-системы OS Investigate и выяснил: она делает именно это — строит досье, находит ассоциатов и ищет людей по поведенческим паттернам.

Редакция
6 мин