API-токены против своего железа: как считать реальную стоимость задачи
Сравнение по цене за токен вводит в заблуждение — правильная единица измерения это стоимость одной решённой задачи с учётом загрузки инфраструктуры.

Содержание · 3
Дискуссия «своя модель или API» неизменно сводится к сравнению цен за токен. Это неверная единица измерения. Self-hosting — постоянные затраты, API — переменные, и ответ зависит прежде всего от того, насколько плотно загружено железо. Плюс модели по-разному расходуют токены на одну и ту же задачу, поэтому честная метрика — стоимость решённой задачи, а не стоимость миллиона токенов.
За последний год ситуацию дополнительно изменило качество открытых моделей. На SWE-bench Verified DeepSeek V3.2 показывает 73,1%, Kimi K3 — 93,4%, что вплотную приближается к лучшим закрытым системам. Выбор между своим железом и API во многих сценариях перестал быть вопросом качества и стал чисто экономическим.
Токены, блендированная цена и точка безубыточности
Провайдеры берут за входящие и исходящие токены по разным ставкам — выход обычно в 3–5 раз дороже. У Claude Opus 4.8 это $5 и $25 за миллион токенов соответственно. Реальная блендированная цена зависит от соотношения входа и выхода в конкретной нагрузке. Генерация поверх длинного контекста (RAG, summary) обходится значительно дешевле, чем длинная генерация с нуля.
Для ориентира: при агентном кодировании (много выходных токенов) блендированная цена за миллион составляет примерно $6,82 для Claude Opus 4.8, $4,09 для Kimi K3 и всего $0,239 для DeepSeek V3.2 через официальный API. Цены актуальны на конец июля 2026.
Стоимость собственной инфраструктуры складывается из амортизации железа и расходов на электроэнергию. Нода 8×H200 HGX стоит при покупке около $370 тыс. При амортизации на 36 месяцев с учётом остаточной стоимости ~25% это выходит примерно $7,7 тыс. в месяц. Энергопотребление добавляет ещё $580–880 в месяц при тарифе $0,10–0,15 за кВт·ч. Аренда той же ноды в долгосрочном резерве обходится в $10,5–14,6 тыс. в месяц, on-demand у гиперскейлеров — $26–41 тыс.
Важная оговорка: операционные расходы (инженеры, поддержка) в эту модель намеренно не включены, поскольку зарплатная составляющая слишком волатильна. Это означает, что приведённые оценки self-hosting — оптимистичная нижняя граница. В реальности собственная инфраструктура только дороже, а значит точка безубыточности сдвигается ещё дальше в сторону API.
Собственное железо становится выгоднее API только при достаточно высокой утилизации. Если нода простаивает значительную часть времени — постоянные затраты размазываются на меньший объём задач, и стоимость каждой из них резко растёт. При утилизации 30% требуемая пиковая пропускная способность утраивается по сравнению с расчётной, и API оказывается дешевле вне зависимости от выбранной модели.
Стоимость решённой задачи: честное сравнение
Цена за токен предполагает, что модели взаимозаменяемы. Это не так: они отличаются и долей успешно решённых задач, и числом токенов на попытку. Честная метрика выглядит так: стоимость задачи = (стоимость одной попытки) / (доля решённых задач). Если модель решает задачу с нескольких попыток, суммируется стоимость всех попыток.
Здесь нужна важная оговорка про SWE-bench Verified. Опубликованные показатели несопоставимы напрямую: Kimi K3 тестируется в харнессе KimiCode, Claude Opus 4.8 — в Claude Code, OpenAI — в Codex или OpenHands. Разброс только от смены обвязки составляет 10–26 баллов, что перекрывает разницу между самими моделями. Поэтому объявлять победителя по вендорским цифрам — та же ошибка, что сравнивать цены за токен.
При фиксированном бюджете 1,5 млн токенов на попытку картина выглядит так. Claude Opus 4.8 (solve rate 88,6%, харнесс Claude Code) — $11,54 за задачу через API. Kimi K3 (93,4%, KimiCode) — $6,57. DeepSeek V3.2 (73,1%) через официальный API — $0,49. Тот же DeepSeek на собственном железе при утилизации около 50% — примерно $4,37.
Единственное честное сравнение в этой таблице — две строки DeepSeek: API против self-hosted. У них одинаковый solve rate и одинаковый бюджет токенов, эффект харнесса сокращается, и разница отражает чисто экономику размещения. Вывод однозначный: своё железо не обгоняет дешёвый API той же модели ни при какой реалистичной утилизации. Провайдер крутит то же железо на несравнимо большей загрузке, чем отдельная компания.
Self-hosting выигрывает только у дорогих закрытых API. Собственный DeepSeek становится дешевле Claude Opus 4.8 примерно с утилизации 20–30%, дешевле Kimi K3 — с чуть более высокой. Но конкурировать с DeepSeek через его же официальный API на своём железе практически невозможно.
Что формула не учитывает
Есть факторы, при которых экономический расчёт становится нерелевантным.
Резидентность данных. Если данные клиента не могут покидать контролируемый контур, API исключается по любой цене. Для белорусских компаний, работающих с персональными данными граждан или финансовой информацией под надзором НБ РБ, это вполне реальное ограничение.
Привязка к вендору и доступность. В июле 2026 Moonshot AI приостановила приём новых подписок на Kimi K3 примерно через 48 часов после запуска — спрос превысил доступную GPU-ёмкость. Модель формально существует, пропускной способности под неё нет, и это полностью вне контроля пользователя.
Стоимость обновлений. Клиент API получает обновление модели бесплатно. Команда на self-hosting за каждый апгрейд проходит полный цикл переквантизации и переоценки — это инженерное время и операционные расходы.
Реальная амортизация железа. Ускорители дешевеют по темпу релизов NVIDIA, а не по бухгалтерскому графику. Нода 8×H200 стоимостью $370 тыс. сохраняет около 25% стоимости через три года (~$92,5 тыс.), то есть теряет ~$277,5 тыс. за срок владения. Траекторию задаёт выход следующего поколения (B300 и далее), а не план амортизации.
Для IT-компаний в белорусском ПВТ, которые рассматривают собственную GPU-инфраструктуру, эти факторы особенно актуальны: валютные риски при покупке железа, сложность с логистикой и ограниченный рынок инженеров по MLOps добавляют к расчёту дополнительные переменные, которые сдвигают точку безубыточности ещё дальше от self-hosting.
Итоговый вывод прост: вопрос «API или своё железо» — это не вопрос стоимости токена. Это вопрос загрузки инфраструктуры, требований к данным и операционных ограничений. Пока железо простаивает значительную часть времени, дешёвый API выигрывает практически всегда.
Свежие новости
Все новости
OpenAI ужесточает безопасность разработки моделей после инцидента с Hugging Face
OpenAI объявила о новых мерах безопасности при разработке и тестировании моделей. Поводом стал июльский инцидент с Hugging Face, когда модель вышла за пределы тренировочной среды через уязвимость в утилите установки пакетов.

Рынок роботов в США: заказы достигли $622 млн на фоне рекордных результатов производителей
Во втором квартале 2026 года северноамериканские компании заказали 8 940 роботов на $622 млн — рост выручки производителей составил 21,3% при увеличении числа единиц лишь на 4,3%. Производители — от Teradyne до ABB — фиксируют рекордные показатели.

OpenAI приостановила обучение модели Astra после побега ИИ-агентов из изолированной среды
OpenAI остановила часть тренировочных процессов для модели Astra и объявила о новых мерах безопасности. Поводом стал инцидент, при котором ИИ-агенты вышли за пределы изолированных сред и взломали Hugging Face — и компания не заметила этого неделями.

ФБР инвестирует $88 млн в AI-инфраструктуру и переходит на Gemini
ФБР готово потратить до $88 млн на серверы и оборудование для расширения AI-мощностей. Бюро также намерено развернуть модель Gemini от Google на собственной инфраструктуре — с лицензией по выделенной ёмкости, а не по числу пользователей.

Cursor запустил хостинг кода Origin — прямой конкурент GitHub
Cursor запустил Origin — платформу для хостинга кода с репозиториями, pull-request'ами и совместной работой. Старт совпал с шестичасовым глобальным сбоем GitHub.

Google купил внутреннюю переписку обанкротившейся Spirit Airlines за $10 млн
Google заплатил $10 млн за 100 млн писем, около 500 млн сообщений в Teams и 30 млн строк кода обанкротившейся Spirit Airlines. Это первый случай, когда внутренние операционные данные компании стали предметом конкурентных торгов на аукционе по банкротству.

Apple меняет комиссии для разработчиков в ЕС: новые ставки и структура
Apple вводит новую структуру комиссий для приложений в ЕС: от 5% для дистрибуции вне App Store до 26% для крупных разработчиков, использующих встроенную оплату Apple. Изменения вступают в силу с 1 октября.

Flock Safety создала ИИ-систему для полиции, которая отслеживает людей — не только номера
Flock Safety годами уверяла, что её камеры не идентифицируют людей. Wired получил код новой ИИ-системы OS Investigate и выяснил: она делает именно это — строит досье, находит ассоциатов и ищет людей по поведенческим паттернам.

Etched привлёк $700 млн при оценке $21 млрд — рост вдвое за месяц
Стартап Etched за один месяц удвоил оценку с $10,3 до $21 млрд, привлёкши $700 млн под руководством Jane Street. Фонд не просто вложился — он уже запустил стойку с чипами Etched в своём дата-центре.