Коротко: что значит «реальная стоимость» и кому это важно
Когда команда сравнивает open-source LLM против API, стоимость почти всегда считают неправильно: за open-source ставят ноль, потому что «лицензия бесплатная», а за API — цену за токены из прайса. На 2026 год это ловушка. Открытая модель вроде Llama или Qwen действительно бесплатна по лицензии, но не в эксплуатации: вы платите за GPU (покупка или аренда — ориентировочно от 60 000 ₽/мес за одну серьёзную карту в облаке), за инженеров, которые всё это держат в живом состоянии, и за простои, когда что-то падает. Это и есть TCO — совокупная стоимость владения. Закрытый API, наоборот, кажется дорогим по цене за миллион токенов, но не требует ни серверов, ни дежурного DevOps. Вывод простой: «бесплатно» и «дёшево» — разные вещи, и для 90% команд в 2026 году правильный ответ зависит не от идеологии, а от объёма нагрузки и наличия людей.
Эта статья — для тех, кто принимает решение деньгами, а не хайпом: CTO стартапа, который прикидывает окупаемость GPU-сервера; фаундера без глубокого DevOps, выбирающего между «своей» моделью и API; ML-инженера, считающего цену за 1M токенов на vLLM против OpenAI; и финдира, который просто хочет снизить расходы на нейросети. Дальше — конкретные диапазоны цен, три сценария нагрузки в цифрах, точка безубыточности и отдельный разбор про Россию: VPN, оплата картой и где open-source реально даёт независимость.
Кстати, чтобы прикинуть выгоду, необязательно сразу арендовать GPU или заводить зарубежную карту. В Zerocoder доступ к 25+ моделям — и открытым, и закрытым — собран в одном рабочем пространстве: работает из России без VPN, оплата российскими картами, а при регистрации дают бесплатные кредиты. Удобно протестировать нагрузку и цифры на реальных задачах, прежде чем что-то разворачивать у себя.
Две модели: закрытый API vs self-hosting open-source — как они устроены
Есть два принципиально разных способа получить работающую LLM в продукте, и они устроены по-разному не только технически, но и финансово. Закрытый API (OpenAI, Anthropic, Google) — это модель «плати по счётчику»: вы отправляете запрос, платите за токены, инфраструктуру держит вендор. Ноль капитальных затрат, мгновенный старт, но стоимость линейно растёт с объёмом. Self-hosting open-source — это модель «плати за мощность»: вы берёте открытую модель (на волне open-source ИИ вроде Yi-34B от 01.AI таких вариантов стало действительно много), поднимаете её на своих или арендованных GPU и платите за железо и людей — вне зависимости от того, обрабатываете вы 10 запросов в день или 10 миллионов. На 2026 год ключевое различие: API дорожает от нагрузки, self-hosting дорожает от простоя. Для низких объёмов почти всегда дешевле API; для высоких и стабильных — своя инфраструктура. Всё остальное — детали этих двух кривых.
Что вы платите за закрытый API (токены, тарифы, лимиты)
За закрытый API вы платите тремя вещами. Первая — токены: отдельно за входные (ваш промпт и контекст) и отдельно за выходные (ответ модели), причём выходные обычно в 3–5 раз дороже. Вторая — тарифная сетка: у одного вендора несколько моделей, от дешёвых «mini» до флагманов, и разница в цене между ними легко 10–20×. Третья — лимиты: rate limits по токенам в минуту, которые на старте душат нагрузку и требуют запроса на повышение. Плюсы очевидны: ноль вложений в железо, всегда свежая версия модели, SLA вендора. Минус — вы не контролируете ни цену (вендор меняет её сам), ни доступ.
Что вы платите за open-source (железо, люди, время)
За open-source вы платите тремя другими вещами, и токены в этот список не входят. Первая — железо: GPU под инференс, память, диск, сеть. Вторая — люди: инженер, который развернёт vLLM или аналог, настроит батчинг, квантизацию и мониторинг, а потом будет это обслуживать. Третья — время: недели на первый запуск и постоянный «налог» на обновления и инциденты. Взамен вы получаете полный контроль: модель не «уедет» из-под вас, данные не покидают периметр, а при высокой нагрузке цена за токен стремится к стоимости электричества. Именно поэтому open-source окупается не сразу, а после определённого порога объёма.
Из чего складывается TCO open-source LLM
TCO (total cost of ownership) open-source LLM на 2026 год складывается минимум из трёх крупных статей, и «покупка видеокарты» — только верхушка. Первая статья — вычисления: GPU в аренду обходятся ориентировочно в 60 000–200 000 ₽/мес за одну производительную карту уровня A100/H100-класса в облаке; покупка такой карты — это единовременно от 1,5–3 млн ₽ плюс сервер, размещение и электричество. Вторая статья — люди: MLOps/DevOps-инженер, который поднимает и обслуживает инференс, — это от 200 000 ₽/мес за часть его времени, и без него система живёт ровно до первого сбоя. Третья статья — простои и риски: обновления моделей, патчи безопасности, деградация под нагрузкой. На практике «голая» аренда GPU — это лишь 40–60% реального TCO; остальное — незаметные, но неизбежные расходы. Вывод на 2026: считать open-source «бесплатной» можно только до того момента, как её кто-то запустит в проде.
GPU: покупка vs аренда (цены 2026)
Главная развилка — арендовать GPU или покупать. Ориентиры на 2026 год (диапазоны, зависят от провайдера и региона):
| Вариант | Порядок цен (2026) | Когда выгоден |
|---|---|---|
| Аренда GPU в облаке (почасово) | ~150–500 ₽/час за карту | Пики, эксперименты, непостоянная нагрузка |
| Аренда выделенного GPU-сервера (мес) | ~60 000–200 000 ₽/мес | Стабильная круглосуточная нагрузка |
| Покупка карты + свой сервер | от 1,5–3 млн ₽ единовременно + обслуживание | Очень высокий объём + требования к данным |
Правило простое: если GPU не загружен близко к 100% почти всё время, аренда почти всегда дешевле покупки — купленная карта, простаивающая по ночам, всё равно «сжигает» амортизацию.
DevOps и MLOps: скрытая статья расходов
Это та самая строка, которую забывают в расчётах чаще всего. Развернуть модель — полдела; держать её стабильной под реальной нагрузкой — это отдельная постоянная работа: очереди и батчинг запросов, квантизация ради экономии памяти, автоскейлинг под пики, логирование, алерты, дежурства. Если своего профильного инженера нет, вы либо нанимаете (дорого и не сразу), либо пытаетесь усадить за это бэкендера, который в LLM-инференсе не силён — и тогда платите скрытую цену деградацией сервиса. Как вариант — точечно нанять эксперта по автоматизации под конкретную задачу, а не держать полную ставку в штате.

Простои, обновления, безопасность
Своя LLM — это сервис, который может упасть, и падение стоит денег: пока инференс лежит, ваш продукт не работает. Добавьте регулярные обновления моделей (вышла новая версия — надо тестировать и мигрировать), патчи безопасности и защиту эндпоинта от злоупотреблений. У закрытого API всё это — забота вендора и заложено в цену токена. У self-hosting это ваша ответственность, и её тоже нужно оцифровать: заложите хотя бы 10–20% сверху к «железным» расходам как резерв на инциденты и поддержку.
Из чего складывается стоимость закрытого API
Стоимость закрытого API на 2026 год выглядит обманчиво простой — «цена за миллион токенов» — но реальный счёт формируют минимум пять факторов. Базовый — цена за входные и выходные токены, где выходные дороже в 3–5 раз. Дальше идут множители, которые люди недооценивают: длинный контекст (каждый запрос тащит за собой инструкции и историю — это входные токены, за них платят каждый раз), повторные вызовы при ошибках (retries), отдельная тарификация эмбеддингов, а также разница между дешёвыми и флагманскими моделями внутри одного вендора. Диапазон на 2026 огромен: лёгкие модели стоят копейки за миллион токенов, флагманы — в десятки раз дороже, и, что важно, вендоры регулярно пересматривают прайс — подробнее о том, почему закрытые нейросети дорожают в 2026, стоит почитать отдельно. Вывод: «цена за токен» из прайса — это стартовая, а не итоговая цифра; реальный чек умножается на длину контекста и количество вызовов.
Цена за 1M входных/выходных токенов
Ключевая метрика для сравнения с self-hosting — стоимость за 1M токенов. Держите в голове три вещи. Первое: считать надо раздельно вход и выход, потому что в чат-сценарии выход небольшой, а в генерации длинных текстов — наоборот. Второе: между моделями одного вендора разброс достигает 10–20×, поэтому под простые задачи (классификация, короткие ответы) грех платить как за флагман — правильный подбор модели под задачу экономит больше, чем любая инфраструктурная оптимизация. Третье: именно на этой метрике self-hosting и API сходятся в одной точке, о которой ниже. Разумный подход — заранее решить, как выбрать закрытую модель под конкретную задачу, а не гонять всё через самую дорогую.
Скрытые множители: контекст, retries, эмбеддинги
Три множителя, которые превращают «дешёвый» API в неприятный счёт:
- Контекст. Если вы в каждый запрос кладёте системный промпт на 2000 токенов плюс историю диалога, вы платите за них снова и снова. При тысячах запросов это основная статья расхода.
- Retries. Таймауты и ошибки приводят к повторным вызовам. Один неудачно настроенный ретрай-механизм способен удвоить счёт незаметно.
- Эмбеддинги. Если у вас RAG-поиск, векторизация документов тарифицируется отдельно, и на больших базах это заметная сумма.
Хорошая новость: все три оптимизируются — кэширование промптов, разумные лимиты ретраев и батч-обработка эмбеддингов режут счёт на десятки процентов без потери качества.
Сравнение на цифрах: 3 сценария нагрузки
Универсального ответа «что дешевле» не существует — есть ответ под ваш объём. На 2026 год разница между тремя типовыми сценариями кардинальная: то, что разоряет на пет-проекте, окупается на высоконагруженном сервисе, и наоборот. Ниже — три реалистичных профиля с порядком цифр (диапазоны приблизительные, курс/тарифы меняются, но соотношение устойчиво). Общий принцип, который подтверждается на всех трёх: при низком объёме побеждает API (вы не платите за простаивающее железо), при среднем — «зависит от людей и стабильности нагрузки», при высоком и ровном — начинает выигрывать self-hosting. Если ваша задача — например, писать длинные тексты нейросетью или пачками генерировать статьи, обратите внимание: у вас большой выход токенов, и экономика сдвигается в сторону, где важнее цена за выходной токен, а не за входной.
Пет-проект / MVP (низкий объём)
Профиль: до ~50–100 тыс. запросов в месяц, короткие ответы. Через API это буквально сотни рублей — тысячи в месяц, ноль забот об инфраструктуре. Через self-hosting вам всё равно придётся оплачивать GPU-сервер целиком (от 60 000 ₽/мес), даже если он загружен на 3%. Итог однозначный: на этом объёме своя LLM дороже в разы, а то и на порядок. Вердикт — API или управляемый доступ, точка. Разворачивать железо здесь не окупается ничем, кроме желания «поиграться».
Продукт со стабильной нагрузкой (средний объём)
Профиль: миллионы токенов в день, ровная нагрузка. Здесь начинается настоящая математика. Через API вы можете выйти на десятки — сотни тысяч рублей в месяц. Через self-hosting один-два арендованных GPU (условно 120 000–250 000 ₽/мес) плюс частичная ставка инженера могут дать сопоставимую или чуть меньшую сумму — но только если железо загружено плотно и не простаивает. Именно в этой зоне решают детали: наличие DevOps, стабильность нагрузки, требования к данным. Честный вывод — «зависит», и считать надо на своих цифрах, а не по чужим кейсам.
Высоконагруженный сервис (точка окупаемости GPU)
Профиль: десятки-сотни миллионов токенов в сутки, круглосуточно. Здесь API по цене за токен становится дорогим удовольствием, а купленные или долгосрочно арендованные GPU, загруженные почти на 100%, дают цену за токен в разы ниже. Это классическая зона, где self-hosting выигрывает — при условии, что у вас есть команда, которая держит это стабильно. На таком объёме экономия окупает и железо, и инженеров, и резерв на простои. Именно ради этого сценария open-source и разворачивают всерьёз.

Точка безубыточности: когда своя LLM реально дешевле API
Точка безубыточности своей LLM на 2026 год наступает там, где ежемесячная стоимость плотно загруженного GPU-парка (аренда/амортизация + инженеры + резерв на простои) становится ниже, чем счёт за тот же объём токенов через API. Практическое правило: пока GPU не загружен близко к 100% почти круглосуточно, вы платите за воздух, и API дешевле. Порог сильно зависит от модели и задачи, но ориентир такой — self-hosting начинает обгонять API по деньгам на устойчиво высоких объёмах (десятки миллионов токенов в сутки и выше), и почти никогда — на низких. Ниже этого порога закрытый API выгоднее почти всегда: у него нет фиксированной платы за простой. Критично важен один параметр — коэффициент загрузки: сервер, работающий 30% времени, автоматически удорожает вашу «дешёвую» токеновую цену в три раза. Вывод на 2026: своя LLM дешевле API не «в принципе», а только при высокой и стабильной утилизации плюс наличии людей, которые её обслуживают.
Простой тест на безубыточность: возьмите месячный счёт за API и месячную стоимость эквивалентного GPU-парка вместе с людьми. Если первый устойчиво больше второго — считайте self-hosting всерьёз. Если нет — вы просто добавите себе работы за те же или большие деньги.
Фактор России: VPN, оплата и доступность
Для команд из России ключевой фактор в 2026 году — не только цена за токен, но и сама доступность: часть закрытых API официально недоступна из РФ и требует обходных схем и зарубежной карты, тогда как управляемый доступ через российский сервис снимает оба барьера. Это переворачивает обычное сравнение: даже если по чистой цене за токен зарубежный API выглядит привлекательно, к нему нужно прибавить стоимость и риски доступа — VPN, иностранное юрлицо или карту, вероятность блокировки платежа. Open-source в этом смысле даёт независимость (модель работает на вашем железе, никто её не отключит), но возвращает нас к полному TCO с GPU и инженерами. Золотая середина для большинства российских команд на 2026 — не «свой сервер против зарубежного API», а управляемый доступ к обеим категориям моделей через платформу, которая работает из РФ без VPN и принимает оплату российской картой. Вывод: в России к цене всегда добавляется коэффициент доступности, и его нельзя игнорировать в расчётах.
Доступ к закрытым API из РФ
Прямой доступ к ряду зарубежных API из России ограничен: нужны VPN, иностранное юрлицо или посредники. Каждый из этих слоёв — это не только неудобство, но и риск: сегодня работает, завтра нет, а ваш прод завязан на этот канал. Для пет-проекта терпимо; для бизнеса, где недоступность стоит денег и репутации, — серьёзный фактор, который обязан попасть в расчёт наравне с ценой токена.
Оплата российской картой
Отдельная боль — оплата. Многие зарубежные вендоры не принимают карты РФ, и командам приходится городить схемы с иностранными картами или посредниками, теряя на комиссиях и времени. Управляемый доступ через российский сервис решает это в лоб: оплата российской картой, закрывающие документы для юрлица, предсказуемый счёт в рублях. Для финдира это часто важнее, чем разница в пару процентов по цене за токен.
Где open-source даёт независимость
Главный неценовой аргумент за open-source — суверенность. Модель на вашем железе не зависит от санкций, тарифных решений вендора и блокировок платежей; данные не покидают периметр, что критично для медицины, финансов и госсектора. Это реальная ценность — но она не бесплатна: вы платите за неё тем самым TCO. Поэтому open-source ради независимости имеет смысл там, где требования к данным или к бесперебойности перевешивают экономику, а не «просто чтобы было своё».
Пошагово: как посчитать вашу стоимость за час
Чтобы сравнить open-source и API на своих цифрах, не нужен целый аудит — достаточно часа и таблицы. Порядок такой:
- Замерьте объём. Сколько запросов в месяц, сколько входных и выходных токенов на запрос (посмотрите в логах или прикиньте по типовому промпту и ответу).
- Посчитайте счёт за API. Умножьте объёмы на цену за вход и выход выбранной модели. Не забудьте контекст в каждом запросе и запас на retries (+10–20%).
- Посчитайте TCO self-hosting. Аренда/амортизация GPU + доля ставки инженера + резерв на простои (10–20%). Разделите на реальный коэффициент загрузки, а не на 100%.
- Сравните и добавьте коэффициент доступности. Для РФ прибавьте к зарубежному API стоимость и риск VPN/карты.
- Проверьте гипотезу на реальных задачах, прежде чем что-то разворачивать.
Если на шаге 3 вы понимаете, что своего инженера под LLM-инференс нет, — это не приговор, а сигнал: либо оставаться на управляемом доступе, либо точечно нанять эксперта по автоматизации под настройку и посчитать это как часть TCO, а не как «бесплатный» ресурс.
Частые ошибки в расчётах (и как не переплатить)
Большинство ошибок при сравнении open-source и API — одни и те же, и почти все они «в пользу» неверного решения развернуть своё. Вот главные:
- Считать open-source бесплатной. Лицензия — ноль, эксплуатация — нет. Без строки на GPU и людей расчёт заведомо неверен.
- Забыть про загрузку GPU. Делить стоимость сервера на «идеальные» 100% утилизации, хотя реально он загружен на треть.
- Игнорировать стоимость инженера. «Наш бэкендер справится» — до первого ночного инцидента.
- Брать цену токена из прайса без множителей. Контекст, retries и эмбеддинги легко удваивают счёт.
- Гонять всё через флагманскую модель. Простые задачи стоят в 10–20× дешевле на лёгких моделях.
- Не считать коэффициент доступности для РФ. VPN и карта — это тоже деньги и риск.

Если на любом из пунктов вы не уверены в цифрах — это как раз тот случай, когда дешевле привлечь того, кто поможет с автоматизацией и посчитает честно, чем разворачивать инфраструктуру «на глаз» и переплачивать месяцами.
Гибридный путь: единый доступ вместо «или-или»
На практике выбор редко бывает бинарным «своя LLM против API» — самая устойчивая по деньгам стратегия на 2026 год гибридная: дешёвые open-source-модели на потоковые массовые задачи, закрытые флагманы — точечно там, где нужно максимальное качество, и всё это под единым доступом, а не десятком разрозненных подписок. Разрозненность сама по себе дорого стоит: отдельные аккаунты, отдельные карты, отдельные лимиты, VPN под каждый сервис. Именно поэтому имеет смысл прикинуть, сколько на самом деле стоят подписки на нейросети, когда их несколько. Управляемый доступ к каталогу 25+ нейросетей в одном рабочем пространстве закрывает ту самую боль российских команд: без VPN, оплата картой РФ, единый счёт. А чтобы связать модели в рабочий процесс без своего сервера, необязательно писать инфраструктуру с нуля — можно собрать пайплайн без своего сервера на n8n, Make и AI-агентах. Для команд, которым нужны роли, лимиты и закрывающие документы, есть отдельные решения для бизнеса и команд.
Смысл гибрида в том, что вы платите за качество только там, где оно правда нужно, а массовый объём гоните через дешёвые модели — и при этом не тащите на себя GPU-парк, пока не дорастёте до его точки безубыточности.
Что дальше: как принять решение под свой кейс
Свести всё к одному решению проще, чем кажется, если опираться на объём, а не на моду. Три коротких правила на 2026 год:
- Низкий или нестабильный объём — берите API или управляемый доступ. Своё железо не окупится, зато добавит работы.
- Высокий и стабильный объём + есть команда — считайте self-hosting всерьёз, он реально дешевле после точки безубыточности.
- Вы из России и/или без сильного DevOps — гибридный управляемый доступ почти всегда выигрывает по деньгам и нервам: без VPN, оплата картой, единый счёт.
Практичный первый шаг — не покупать GPU и не заводить зарубежную карту, а протестировать нагрузку и цифры на живых задачах через один доступ к открытым и закрытым моделям, а уже потом решать, стоит ли что-то разворачивать у себя. Прикинуть бюджет под свой объём удобно на странице тарифов Zerocoder: там видно стоимость под реальную нагрузку без обязательств по железу.
FAQ
Open-source LLM — это бесплатно?
Бесплатна только лицензия. В эксплуатации вы платите за GPU (аренда от ~60 000 ₽/мес или покупка от 1,5 млн ₽), за инженера, который её обслуживает, и за простои. Это и есть TCO. На 2026 год «голая» аренда GPU — лишь 40–60% реальной стоимости владения; остальное — люди и резерв на инциденты.
Со скольких запросов свой сервер выгоднее API?
Ориентир на 2026 — устойчиво высокий объём, десятки миллионов токенов в сутки и выше, при загрузке GPU близко к 100% круглосуточно. Ниже этого порога закрытый API почти всегда дешевле, потому что у него нет фиксированной платы за простой. Точный порог зависит от модели, задачи и наличия команды.
Сколько стоит аренда GPU под LLM в 2026?
Ориентировочно: почасовая аренда карты — ~150–500 ₽/час, выделенный GPU-сервер — ~60 000–200 000 ₽/мес, покупка карты с сервером — от 1,5–3 млн ₽ единовременно плюс размещение и электричество. Диапазоны зависят от провайдера, класса карты и региона; почасовой формат выгоднее при непостоянной нагрузке.
Нужен ли VPN для open-source моделей?
Для самих открытых моделей на вашем железе — нет, они работают локально и от блокировок не зависят. VPN обычно нужен для доступа к части зарубежных закрытых API. Управляемый доступ через российский сервис снимает этот барьер: модели доступны из РФ без VPN, а оплата идёт российской картой.
Можно ли платить за API российской картой?
Напрямую у многих зарубежных вендоров — нет, приходится использовать иностранные карты или посредников с комиссиями. Проще платить через российскую платформу-агрегатор: оплата картой РФ, счёт в рублях и закрывающие документы для юрлица. Для финдира это часто важнее, чем разница в пару процентов по цене за токен.
Какая open-source модель ближе всего к флагманам?
На 2026 год топовые открытые модели (семейства Llama, Qwen, Yi и другие) вплотную подошли к закрытым флагманам на многих задачах, особенно после дообучения под домен. Универсального «убийцы» нет: на одних задачах разрыв почти исчез, на других закрытые модели ещё впереди. Выбирать стоит под конкретную задачу, а не по общим рейтингам.
Что дешевле для стартапа без DevOps?
Почти наверняка API или управляемый доступ. Без профильного инженера self-hosting превращается в скрытый долг: система живёт до первого сбоя, а простой стоит денег. На низком и среднем объёме своя LLM не окупает ни железо, ни наём. Разворачивать своё имеет смысл после точки безубыточности и при наличии команды.
Что учесть в TCO кроме железа?
Как минимум: доля ставки MLOps/DevOps-инженера, резерв на простои и инциденты (10–20%), обновления моделей и патчи безопасности, коэффициент загрузки GPU (делить надо на реальную утилизацию, а не на 100%), а для РФ — ещё коэффициент доступности: стоимость и риск VPN и зарубежной карты. Без этих строк расчёт всегда занижен.
Можно ли смешивать open-source и API?
Да, и это самая устойчивая по деньгам стратегия на 2026 год. Дешёвые открытые модели берут на себя массовые потоковые задачи, закрытые флагманы подключают точечно там, где нужно максимальное качество. Под единым управляемым доступом это удобнее и дешевле, чем десяток разрозненных подписок с отдельными картами и лимитами.
С чего начать, если я не разработчик?
Не покупайте железо и не заводите зарубежную карту на старте. Протестируйте нагрузку и цифры на реальных задачах через единый доступ к открытым и закрытым моделям, а рабочие процессы соберите на no-code-инструментах вроде n8n или Make. Когда объём вырастет и появится команда — тогда считайте self-hosting всерьёз.