Перейти к содержимому
arckep.ru — все нейросети в одном месте без VPN Перейти
>AISTUDY_
AUTHORСвежий выпуск №030 → Контекст, сессия, compact
Авторская колонка · Локаль или провайдерСЕРИЯ 026
Авторская колонка · выпуск №026

Локаль
или провайдер

Сколько токенов расходуют обычный пользователь и разработчик, во сколько обойдётся облако на 100 и 1000 человек, какие модели действительно разворачивают у себя — и почему попытка «поднять всё дома» на общем сервере почти никогда не экономит деньги.

3 исследовательских прогона • сверка цен с официальными источниками на 2026-08-02 • живые агрегаты из двух рабочих контуров • одна поучительная история с 23,7 ГБ оперативной памяти, которая отлично объясняет итоговое решение.
Раздел

Зачем этот текст

Разработчики и основатели сервисов часто задают один и тот же вопрос: «Зачем ежемесячно платить облачному провайдеру, если можно скачать открытую модель и крутить её на собственном сервере?»

Ответ «всё зависит от ситуации» здесь не помогает. Нужна чёткая арифметика: сколько токенов съедает ваш сценарий, во сколько обойдётся миллион токенов у провайдера, сколько стоит видеокарта, когда она не простаивает, и что происходит, когда «свой» ИИ сажают на сервер, где уже живут база данных, кэш и десяток других сервисов.

В выпуске №014 я уже разбирал похожий случай: фоновый фильтр для сторожа, локальная модель, сутки непрерывной работы и неизбежный откат на облачный API за копейки. Но тот разбор касался одной вспомогательной задачи на общем процессоре.

Этот выпуск — про продукт целиком:

  • лёгкая функция помощи на сайте,
  • полноценный чат с авто-агентами для реальных пользователей,
  • масштабирование на 100 и 1000 человек,
  • карта локальных моделей и оборудования,
  • момент, когда аренда мощной видеокарты наконец начинает выигрывать у облака по деньгам.

Внутри текста — три слоя проверенных данных:

  1. Официальные цены провайдеров и отраслевые ориентиры.
  2. Три коридора нагрузки: базовый, рабочий и агентный (это не перепись населения мира, а ориентиры для расчёта сметы).
  3. Живая статистика с двух моих контуров: почти бесплатная интерактивная зона на образовательном сайте и боевой чат продукта, где за месяц 18 активных пользователей прогнали десятки миллионов токенов.

Что полезного в выпуске

  1. Три коридора расхода токенов на человека в месяц: 50 тыс. / 500 тыс. / 5 млн — и почему медиана важнее среднего значения.
  2. Таблица стоимости облачных моделей на 100 и 1000 пользователей в месяц для бюджетного и рабочего класса (цены зафиксированы на 2026-08-02).
  3. Реальные цифры с серверов: фоновый фильтр — около 250 тыс. токенов в месяц и меньше $0,10; зона тестирования на сайте — всего $1,68 за всё время; рабочий чат — 76 млн токенов и около $103 провайдеру на 18 человек за 30 дней.
  4. Понимание, почему модели уровня DeepSeek могут забирать половину токенов сервиса и стоить при этом копейки — умная маршрутизация запросов решает экономику сильнее, чем спор «локаль или облако».
  5. Карта локального оборудования (ноутбук / видеокарта на 24 ГБ / 100 пользователей / 100 одновременных сессий) и точка окупаемости аренды видеокарты H100 против модели класса Sonnet.
  6. Понятное дерево решений: когда выбирать API, когда свой сервер, а когда гибрид — без фанатизма и споров.
Раздел

Две цены одного решения

Схема 01ДВЕ ЦЕНЫ

У каждого решения есть своя цена. У облачного API счёт приходит в долларах или рублях, и его сразу видно в личном кабинете. У собственного сервера счёт часто выглядит как «0 рублей» — и в этом главная ловушка.

Локальная модель, запущенная на общем сервере без отдельной видеокарты, расплачивается самым дорогим ресурсом: оперативной памятью, процессором, очередями запросов и стабильностью соседних сервисов.

Я убедился в этом на практике: модель семейства Gemma класса 26B раздувалась до 23,7 ГБ оперативной памяти на сервере, где всего было 43 ГБ. Скорость ответа составляла 5–12 секунд против 0,7–1,5 секунды у облачного API. Пакетная обработка занимала две с половиной минуты локально против одиннадцати секунд в облаке. При этом объём задачи составлял около четверти миллиона токенов в месяц. В облаке это стоит меньше десяти центов в месяц. А «бесплатная» модель забрала больше половины ресурсов сервера.

Если поставить отдельную видеокарту под один конкретный продукт, математика меняется. Появляются фиксированные затраты на аренду или покупку оборудования и переменная загрузка. Если видеокарта простаивает ночью — вы платите за простаивающее железо. Если вы прокачиваете через неё сотни миллионов токенов на качественной открытой модели — это может окупиться. Но это уже не «скачал бесплатную программу и сэкономил».

Главная мысль выпуска: Счёт за облачный API прозрачен и виден сразу. Цена локальной модели спрятана в оперативной памяти, видеокартах, задержках ответов и затратах на настройку. Ниже — цифры, на которых строится этот выбор.

Раздел

Сколько токенов расходуют люди (коридоры нагрузки)

Схема 02ТРИ КОРИДОРА

Разработчики ИИ-сервисов не публикуют формулу «один пользователь = N токенов в месяц». Потребительские чаты ограничены лимитами сообщений, а разработчики платящих продуктов платят за токены. Это разные принципы. Поэтому для расчёта сметы используют три коридора нагрузки.

2.1. Пользователь продуктового чата (без кодинг-агентов)

Коридор нагрузкиТокенов на человека в месяцКак это выглядит на практике
Базовый~50 00010–20 коротких вопросов, редкое использование
Рабочий~500 000ежедневный помощник, работа с документами, средний контекст
Агентный~5 000 000многошаговые агенты, длинная история диалога, вызов инструментов

Откуда взяты эти ориентиры. Платформа ChatGPT в середине 2025 года обрабатывала не менее 2,5 млрд сообщений в день (данные OpenAI для изданий TechCrunch и Business Insider). Это даёт понимание масштаба рынка, но не показывает расход по конкретным продуктам.

Ориентир OpenAI для английского языка: 1 токен ≈ ¾ слова ≈ 4 символа. Русский текст при передаче того же смысла из-за особенностей токенизаторов получается толще (примерно в 2–3 раза). Для продуктов на русском языке всегда закладывайте этот запас.

Для дальнейших расчётов сметы я использую именно эти три коридора. Если ваш продукт — «кнопка объяснить термин», вы находитесь в базовом коридоре. Если «автономный агент пишет отчёт неделю» — в агентном.

2.2. Разработчик с кодинг-агентом — совсем другой расход

Расходы разработчиков с ИИ-помощниками для кода на 1–2 порядка выше, чем у обычного пользователя чата.

  • Подписка Cursor Pro: стоит около $20 в месяц и включает пул использования флагманских моделей по оптовым ценам API. По данным разработчиков Cursor, медианный пользователь укладывается примерно в 225 сложных запросов уровня Sonnet, не выжигая лимит полностью.
  • Инструменты вроде Claude Code / командный API: по разборам профильных блогов (Faros, Finout), активный день работы разработчика обходится примерно в $6 (при этом 90% дней укладываются до $12). Месячный счёт на одного инженера часто составляет $100–250+. Используйте эти цифры как ориентир порядка величин.
  • Агентные режимы расходуют контекст очень быстро: при работе команды авто-агентов расход токенов возрастает примерно в 7 раз по сравнению с обычным диалогом. Разница междупростым вопросом к модели и автономной работой агента в течение часа — это разница в разы по деньгам.

Вывод для архитектуры: локальный ноутбук для личной разработки и сервер инференса под тысячу пользователей продукта — это совершенно разные задачи. Железо для одной задачи не масштабируется в другую простым умножением.

2.3. Живой стенд A: лёгкий ИИ на образовательном сайте

Образовательный сайт, интерактивная зона с выбором моделей, без платных барьеров. Из базы данных запросов (выгрузка на 2026-08-02):

ПоказательЗначение
Запросов за всё время98
Уникальных пользователей66
Период измеренийапрель–июль 2026
Сумма токенов (вход + выход)~118 тыс.
Итоговый счёт в логе~$1,68
Медиана запросов на человека1

Дополнительно на сайте работает RAG-чат по материалам курса: это единицы десятков запросов за несколько месяцев. При этом посещаемость самого сайта составляет порядка 10 тыс. визитов / 16 тыс. просмотров в месяц и ~20 тыс. уникальных посетителей за всё время.

Смысл этого стенда: лёгкие ИИ-функции на сайте при разумных лимитах и использовании бюджетных моделей стоят около нуля, даже когда на сайт приходят тысячи людей. Отсюда нельзя делать вывод «1000 активных пользователей чата ничего не стоят», но можно уверенно сказать: «не бойтесь добавлять вспомогательные ИИ-кнопки».

2.4. Живой стенд B: рабочий чат продукта с агентами (главный экспонат)

Второй контур: веб-студия с личным балансом пользователей, каталогом моделей и чатом с агентами (собственный учёт токенов поверх интерфейса). Данные выгружены 2026-08-02, только успешные списания.

За всё время работы (с конца апреля 2026):

ПоказательЗначение
Всего успешных списаний~2 460
Уникальных пользователей чата29
Входящий контекст (вход)~108 млн токенов
Сгенерированный ответ (выход)~2,6 млн токенов
Повторное чтение из кэша~66 млн токенов (~38% от общего контекста)
Списано с балансов пользователей~22 800 ₽
Оценка расходов у провайдера~$208

За последние 30 дней (рабочий месяц):

ПоказательЗначение
Запросов1 261
Активных пользователей за месяц18
Токенов (вход + выход)~76 млн
Списано с пользователей~11 300 ₽
Оценка расходов у провайдеров~$103

Распределение на одного активного человека за 30 дней:

Уровень активностиЗапросовТокенов (вход + выход)Списано с пользователя
Медиана (p50)18~0,36 млн~166 ₽
Среднее значение70~4,2 млн~628 ₽
Верхние 10% (p90)143~6,6 млн~1 700 ₽
Максимум663~54 млн~4 600 ₽

Медиана практически совпадает с рабочим коридором (500 тыс. токенов). А среднее значение сильно раздуто несколькими сверхактивными пользователями до агентного коридора. Если при расчёте сметы подставить среднее значение вместо медианы, вы заложите в 10 раз больше денег, чем реально нужно половине вашей аудитории.

На один запрос медиана составляет около 28 тыс. токенов контекста и ~4 ₽ стоимости; среднее — 45 тыс. токенов и ~9 ₽. При этом выходящий текст ответа составляет всего ~2% от общего объёма токенов. Вы платите не за «болтливость» модели, а за передачу длинного контекста и истории работы агента.

Распределение по провайдерам (за всё время в рублях): OpenAI и OpenRouter получили примерно по 9 тыс. рублей каждый; Google — ~2,9 тыс.; Anthropic — ~2,1 тыс.; DeepSeek — всего ~690 рублей при объёме в ~51 млн токенов. Половину всех токенов сервиса обработал DeepSeek, забрал копейки от общей суммы. Один активный пользователь с 663 запросами и 54 млн токенов потратил всего ~1 200 рублей — наглядный пример комбинации «доступная модель + огромный контекст».

Для сравнения: генерация картинок в той же студии за 30 дней составила 1 157 изображений от 77 человек на сумму ~13 тыс. рублей. Это совершенно другой экономический контур. При расчёте расходов на текстовые модели смешивать их нельзя.

Раздел

Сколько стоит миллион токенов у провайдера (цены на август 2026)

Цены ниже — официальные тарифы на дату сверки за 1 млн токенов (входящий контекст / сгенерированный ответ). Пропорция 75% входа / 25% выхода взята как удобный ориентир для расчётов.

Класс моделиПример моделиВход / ВыходСредневзвешенная цена (75/25)
Бюджетный классDeepSeek V4-Flash$0.14 / $0.28~$0,175
Рабочая модель (промо)Claude Sonnet 5 (до 31.08.2026)$2.00 / $10.00$4,00
Рабочая модель (стандарт)Sonnet 5 (с 01.09.2026)$3.00 / $15.00$6,00
ФлагманClaude Opus 5 / 4.8$5.00 / $25.00$10,00

Источники: тарифы DeepSeek, анонс Anthropic Sonnet 5. Линейки моделей обновляются быстро, поэтому перед запуском проекта всегда перепроверяйте официальные страницы цен.

Кэширование контекста: у Anthropic повторное чтение сохранённого контекста стоит примерно 0,1 от цены обычного входа. При постоянной системной инструкции это снижает итоговый счёт на 30–60%. В нашем продуктовом чате чтение из кэша составило ~38% от входящего трафика — без этого итоговый счёт был бы ощутимо выше.

Формула расчёта сметы:

Расходы в месяц ≈ Количество пользователей × Токенов на человека × Средняя цена миллиона токенов / 1 000 000
Раздел

Расчёт сметы: 100 и 1000 пользователей в облаке

4.1. Расчёт по сценариям нагрузки (без кэширования)

Возьмём рабочий уровень = 500 тыс. токенов на человека в месяц:

Класс моделиРасход на 1 человека в месяцНа 100 пользователей в месяцНа 1000 пользователей в месяц
DeepSeek (~$0,175/1M)~$0,09~$9~$88
Sonnet 5 промо ($4/1M)$2,00$200$2 000
Sonnet 5 стандарт ($6/1M)$3,00$300$3 000
Opus ($10/1M)$5,00$500$5 000

Для базового уровня (50 тыс. токенов) делите цифры на 10. Для агентного уровня (5 млн токенов) умножайте на 10: тысяча пользователей с автономными агентами на Sonnet обойдётся ровно в $20 000 в месяц без учёта кэширования (или около $18 000 при минимальном кэше).

4.2. Расчёт на основе реальных данных нашего чата

Возьмём структуру потребления нашего продуктового чата за 30 дней и смасштабируем её на 100 и 1000 человек с сохранением текущего распределения моделей (где используются и дешёвые, и флагманские модели).

Сценарий масштабированияТокенов в месяцРублей с пользователейРасходы у провайдеров
100 пользователей по медиане (p50)~36 млн~17 тыс. ₽~$100–150
100 пользователей по среднему~420 млн~63 тыс. ₽~$570
1000 пользователей по медиане (p50)~357 млн~166 тыс. ₽~$1 000–1 500
1000 пользователей по среднему~4,2 млрд~628 тыс. ₽~$5 700

Если бы тысяча человек сидела исключительно на DeepSeek Flash при рабочем уровне нагрузки, расходы у провайдера составили бы всего около $88. В нашем чате провайдер получает ~$103 уже на 18 человек, потому что пользователи выбирают в том числе дорогие флагманские модели.

Вывод: настройка правил выбора моделей (маршрутизация) снижает расходы сильнее, чем покупка своего оборудования.

4.3. Масштаб фонового фильтра (как в выпуске №014)

Один фоновый классификатор расходует ~250 тыс. токенов в месяц, что в облаке стоит меньше $0,10.

Даже если запустить тысячу таких независимых задач (суммарно 250 млн токенов в месяц), расходы на DeepSeek составят порядка $40–50 в месяц, а на Sonnet — около $1 000. При этом локальная модель на общем сервере всё равно упрётся в очередь и оперативную память, а не в экономию денег.

Раздел

Своё железо: популярные модели и реальные расходы

Схема 03Окупаемость H100

5.1. Что реально скачивают и запускают

Рейтинг семейств моделей по общему количеству скачиваний из каталога Ollama (данные на лето 2026 года):

  1. Llama 3.1 (~116–118 млн скачиваний) — стандартный выбор для обучающих статей.
  2. DeepSeek-R1 (~89–91 млн) — популярные модели с рассуждениями.
  3. Llama 3.2 — лёгкие варианты для ноутбуков.
  4. Gemma 3 — удобные варианты для одной видеокарты.
  5. Qwen 2.5 / Qwen 3 — основной выбор инженеров для рабочих проектов.

Для новых проектов в 2026 году практики чаще рекомендуют серии Qwen 3, Gemma 3 27B, DeepSeek-R1-distill 32B и специализированные модели для кода (Qwen-Coder). Высокие цифры скачиваний Llama во многом объясняются старыми инструкциями в интернете.

5.2. Требования к железу (для сжатых моделей Q4)

Уровень оборудованияПример моделиРазмер на дискеТребуемая память (VRAM / RAM)
Ноутбук / ПроцессорLlama 3.2 3B, Qwen 3 4B2–5 ГБ4–8 ГБ видеопамяти или системной RAM
Рабочая видеокарта 8–12 ГБQwen 3 8B, Llama 3.1 8B~5 ГБ6–10 ГБ видеопамяти
Карта на 24 ГБ (уровень 4090)Gemma 3 27B, R1-32B, Qwen 32B16–20 ГБ17–24 ГБ видеопамяти
Крупный серверLlama 3.3 70B40–43 ГБ42–48+ ГБ видеопамяти

Скорость обработки (один поток): модель 8B на хорошей видеокарте выдаёт 60–150+ токенов в секунду; модель 27–32B — около 35–50 токенов в секунду; модель 70B — ощутимо медленнее.

При одновременной нагрузке сервер Ollama комфортно обслуживает единицы параллельных запросов. Специализированные движки инференса (vLLM) на той же видеокарте способны обрабатывать десятки и сотни одновременных сессий за счёт эффективного объединения запросов в пакеты.

5.3. Сценарии расходов на своё железо

СценарийОборудованиеРеальные расходы
Личное использование на ноутбукеМодель ≤8B, программа Ollama0 ₽ ежемесячно
Разработчик (своё железо)Видеокарта уровня RTX 4090Покупка: ~150–250 тыс. ₽. Электричество при работе 24/7 в РФ: около 2 000–2 500 ₽ в месяц (при потреблении 450 Вт)
Аренда видеокарты RTX 4090Облачная видеокарта 24/7~$250–500 в месяц (около 22–45 тыс. ₽)
100 активных пользователей в месяц (пик 3–5 одновременных)Облачный API почти всегда дешевлеОблако: от $9 (DeepSeek) до $200 (Sonnet). Своя видеокарта: от $250
100 одновременных сессийСервер с несколькими видеокартами + движок vLLM$500–2 000+ в месяц + расходы на инженера
Выделенная серверная видеокарта H100Аренда в защищённом дата-центре 24/7~$2 000–2 200 в месяц

Критически важный момент: 100 пользователей в месяц (MAU) и 100 одновременных активных сессий — это совершенно разные нагрузки. В первом случае легко справляется бюджетное облако. Во втором — нужен полноценный серверный кластер. Рассчитывайте систему от пикового количества одновременных запросов, а не от общей аудитории за месяц.

5.4. Точка окупаемости: аренда видеокарты H100 против облака

Аренда серверной видеокарты H100 обходится примерно в $2 100 в месяц (из расчёта ~$2,89 в час при круглосуточной работе).

Оборудование окупается тогда, когда ежемесячный счёт от облачного провайдера превышает стоимость аренды сервера.

Класс модели в облакеПорог токенов в месяц для окупаемости H100Эквивалент в пользователях рабочих продуктов (~500 тыс. токенов/чел)
Флагман (Opus, $10/1M)~210 млн токенов~420 пользователей
Рабочая модель (Sonnet промо, $4/1M)~525 млн токенов~1 050 пользователей
Компактная модель ($1,69/1M)~1,24 млрд токенов~2 500 пользователей
Бюджетная модель (DeepSeek, $0,175/1M)~12 млрд токенов~24 000 пользователей

Выводы:

  1. Против бюджетных облачных моделей свой сервер не выигрывает по деньгам практически никогда.
  2. Против моделей уровня Sonnet свой сервер начинает окупаться примерно от тысячи активных пользователей, но только при условии, что открытая модель устраивает вас по качеству и видеокарта загружена равномерно.
  3. Если добавить зарплату инженера по настройке и второй сервер для надёжности, точка окупаемости сдвигается ещё в 2–3 раза дальше.

Себестоимость токена на своём сервере при слабой загрузке оказывается дороже, чем в облаке. Например, при скорости 200 токенов в секунду и загрузке видеокарты всего на 50%, стоимость миллиона токенов на H100 составит около $8 — это дороже, чем готовый API рабочей модели.

Раздел

Дерево решений: как выбрать вариант под свой проект

Требуется полная конфиденциальность, закрытый контур или требования регулятора?
  └─ Да → Локальный сервер или закрытое частное облако. Осознанно платим за сопровождение.
  └─ Нет ↓

Нужно высшее качество ответов, работы с кодом или сложными агентами прямо сейчас?
  └─ Да → Облачный API (флагманские модели). Открытые модели пока уступают в сложных задачах.
  └─ Нет ↓

Объём меньше 50–100 млн токенов в месяц, а сервер общий и без отдельной видеокарты?
  └─ Да → Облачный API (или бесплатные тарифы для вспомогательных задач). Локальный запуск здесь уйдёт в минус.
  └─ Нет ↓

Есть стабильный поток в сотни миллионов токенов, открытая модель подходит, и есть кому её обслуживать?
  └─ Да → Аренда/покупка видеокарт + специализированный движок (vLLM), мониторинг нагрузки и сброс пиков в облако.
  └─ Нет → Облачный API + настроенная маршрутизация (бюджетная модель по умолчанию, флагманская — по необходимости).

Факторы, которые ломают простые расчёты:

  1. Маршрутизация. В нашем продукте DeepSeek обработал половину токенов за копейки. Смета «все запросы идут на флагманскую модель» — это переплата; смета «все запросы идут на самую дешёвую» — потеря качества. Автоматическое переключение моделей — главный инструмент экономии.
  2. Кэширование. 38% экономии за счёт чтения кэша — инструмент, доступный в облаке без покупки железа.
  3. Пиковая нагрузка. 1000 пользователей в месяц с пиком в 5 одновременных запросов — это легкая задача. 100 одновременных запросов — тяжелая. Свой сервер проигрывает на внезапных пиках нагрузки, если нет запаса мощностей.
  4. Работа с изображениями и видео. У генерации медиафайлов совсем другая экономика (оплата за штуку/секунду) и другие требования к видеопамяти. Не смешивайте их с текстовыми моделями.
  5. Доступность и оплата. Для российских проектов оплата зарубежных облаков требует учета комиссий или работы через посредников/локальные сервисы. Иногда фактор надёжности и удобства оплаты становится важнее разницы в копейках за токен.
Раздел

Когда действительно стоит разворачивать модель у себя

Есть три чётких сценария, когда запуск на своём железе оправдан:

  1. Строгие требования к конфиденциальности. Медицинские данные, коммерческая тайна, условия договоров, запрещающие передачу данных третьим лицам. В этом случае свой сервер — это необходимая статья расходов на безопасность, а не экономия.
  2. Постоянный огромный объём задач на открытых моделях. Сценарии, прошедшие порог окупаемости из таблицы выше, где есть выделенное оборудование и специалист, отвечающий за его работу.
  3. Личное использование и разработка на своём компьютере. Персональный помощник для кода на ноутбуке, полная приватность, нулевые ежемесячные платежи. Но это не продуктовый сервис на тысячи пользователей.

Во всех остальных случаях, пропущенных через реальные цифры, выигрывают облачный API, кэширование и правильная настройка маршрутизации запросов.

Раздел

Как рассчитать экономику своего проекта за один вечер

Скопируйте эти инструкции ИИ-помощнику для быстрой оценки вашей задачи.

Шаблон 1. Расчёт сметы: Облако против своего сервера

Задача: рассчитать смету расходов на ИИ для продукта на 30 дней.

Исходные данные (заполни под свой проект):
- Количество пользователей в месяц (MAU):
- Пиковое количество одновременных запросов:
- Оценка токенов на человека в месяц: базовый 50k / рабочий 500k / агентный 5M
- Соотношение входа и выхода (по умолчанию 75/25):
- Требуемый класс модели: бюджетный / рабочий / флагманский
- Ограничения по данным: можно ли использовать облако (да/нет):
- Ресурс на обслуживание сервера: нет / частичный / выделенный инженер

Посчитай:
1) Стоимость облачного API в месяц для DeepSeek V4-Flash ($0.14/$0.28), Sonnet 5 promo ($2/$10), Sonnet 5 std ($3/$15), Opus ($5/$25)
2) Экономию от кэширования контекста: при 0%, 40%, 70% повторного использования входа
3) Расходы на свое железо: аренда видеокарты RTX 4090 ($250-500/мес) против H100 ($2000-2200/мес)
4) Порог окупаемости в токенах в месяц: аренда / средняя_цена_токена * 1 000 000
5) Итоговый вердикт: Облако / Свой сервер / Гибридный вариант, с указанием главной причины

Шаблон 2. Анализ расходов существующего продукта (если уже есть логи)

По таблице истории запросов (поля: запрос, id_пользователя, входящие_токены, исходящие_токены, прочитано_из_кэша, стоимость, модель, дата):

1) За последние 30 дней посчитай: общую сумму токенов, количество активных пользователей, медиану (p50), верхние 10% (p90) и среднее значение токенов и стоимости на пользователя
2) Посчитай доли токенов и стоимости по провайдерам и моделям
3) Посчитай процент прочитанного из кэша от общего входящего контекста
4) Смасштабируй показатели медианы и среднего на 100 и 1000 пользователей в месяц
5) Дай 3 конкретные рекомендации: какие запросы можно перевести на более доступные модели без потери качества
Выводи только агрегированные показатели, без личных данных пользователей.
Раздел

Итог

Фраза «запустить свою модель» звучит привлекательно и создаёт ощущение независимости.

Но на обычном сервере без отдельной видеокарты эта «независимость» стоит половины оперативной памяти и задержек в ответах. А на продукте с 18 активными пользователями в чате и 76 млн токенов в месяц покупка собственного сервера H100 означает платить ~$2 000 в месяц за железо, которое против моделей класса Sonnet окупается только на полумиллиарде токенов, а против дешёвых моделей вроде DeepSeek не окупится практически никогда.

Порядок расчёта сметы прост: оценка расхода токенов → выбор моделей и настройка маршрутизации → учёт пиковых нагрузок и требований к данным.

Пока первые шаги дают понятные счёта в десятки или сотни долларов, а правила позволяют использовать облако — API выигрывает. Собственный сервер включается тогда, когда данные строго запрещено передавать наружу, объём работы стабильно огромен, или вам нужен личный офлайн-инструмент на ноутбуке — и вы готовы платить за него не «0 рублей», а конкретными деньгами на железо и настройку.

Счёт за облако всегда перед глазами. Цена своего сервера часто спрятана. Но спрятанное обходится дороже — пока вы не выпишете все цифры в одну таблицу.

Штамп СЕРИЯ 026 · 2026-08-02 · ЛОКАЛЬ ИЛИ ПРОВАЙДЕР · ТОКЕНЫ · СМЕТА · ВЫПУСК ОПУБЛИКОВАН

// Обсуждение

Можно писать анонимно. Укажите email, чтобы получать уведомления об ответах.