Наш телеграм канал
tester_kretester_kre · AI Promt Studio · 21.09.2026

DeepSeek напрямую или через подписку Ollama: что выгоднее харнессу

Сравнивать DeepSeek и Ollama напрямую по цене некорректно. Под обеими вывесками работает одна и та же модель — DeepSeek-V4-Pro, — а платите вы за разное. В DeepSeek это чистый расход токенов, в Ollama — подписка на 20 долларов, в которую входит 60 долларов расхода. И есть ещё один фактор, о котором обычно вспоминают в самом конце: в какое время суток вы работаете.

Сколько стоит токен

Тарифы на модель у обоих поставщиков одинаковые до копейки. За миллион токенов:

  • вход, кэш попал: DeepSeek — $0,003 вне пика, Ollama — $0,022;
  • вход, кэш промахнулся: $0,15 против $0,66;
  • выход: $0,60 против $1,98;
  • подписка: у DeepSeek её нет, у Ollama — $20 в месяц с включёнными $60 расхода.

Это базовые ставки, не пиковые. Вне пика DeepSeek берёт ровно вдвое меньше, чем Ollama. Главное слово — «вне»: у DeepSeek двойной тариф действует по будням в окна 01:00–04:00 и 06:00–10:00 UTC, а всё остальное время, включая выходные, считается по половинной ставке. У Ollama двойной тариф живёт в окне 12:00–18:00 UTC по будням.

Техник у серверной стойки в дата-центре NERSC. Фото: Derrick Coetzee, CC0
Техник у серверной стойки в дата-центре NERSC. Фото: Derrick Coetzee, CC0

Что в счёте на самом деле

Цена за миллион токенов ничего не говорит, пока не ясно, каких токенов больше. У агента, который часами сидит в одном репозитории, почти весь вход — это чтение кэша: инструкции, история шагов и файлы, которые модель видит при каждом следующем вызове. Нового текста в запросе немного, и он весь уходит в промахи кэша.

Я сверил журнал своих сеансов: на 75 миллионов прочитанных токенов пришлось около 250 тысяч новых. Кэш — 99,7% входа, и четырёхкратная разница на кэше бьёт по счёту сильнее, чем разница на выходе.

Часы решают больше, чем прайс

Переведу окна в московское время. Пик DeepSeek — с четырёх до семи утра и с девяти до часа дня; пик Ollama — с трёх до девяти вечера. Это не мелочь: вечер — именно то время, когда за такую работу садятся, а рабочий день у сервера уже закончился.

Выходит, что в самые рабочие московские часы один и тот же запрос у Ollama стоит вчетверо дороже на кэше, вдвое на несбитом кэше и вдвое на выходе. Дело не в модели — в расписании.

Харнесс считает расход по каждому сеансу сам: прочитанный кэш, новые входные токены, выходные. Умножаете на тариф нужного окна — и правило очевидно: длинные автономные задания, где агент долго крутит один контекст, выгоднее запускать не когда удобно вам, а когда дёшево маршруту. За месяц разница в расписании набегает на ещё одну подписку.

Считаем сеанс, а не токен

Полезная единица — не цена за миллион, а стоимость одного рабочего сеанса харнесса. Возьму реальные цифры из журнала своих запусков: за один сеанс агент прочитал 75 миллионов токенов из кэша, добавил 250 тысяч новых на входе и написал 250 тысяч на выходе.

DeepSeek вне пика: 75x0,003 + 0,25x0,15 + 0,25x0,60 = $1,01 Ollama в пик: 75x0,022 + 0,25x0,66 + 0,25x1,98 = $2,43

Два доллара сорок три против одного — та же работа, та же модель. Если вечерних сеансов за месяц набирается сорок, разница выходит около 57 долларов; подписка Ollama на это не влияет, она просто упаковывает расход: шестьдесят долларов включённого расхода входят в двадцать долларов платы.

Видеокарта GeForce RTX 3090: железо, на котором считают открытые модели. Фото: PantheraLeo1359531, CC BY 4.0
Видеокарта GeForce RTX 3090: железо, на котором считают открытые модели. Фото: PantheraLeo1359531, CC BY 4.0

Что даёт подписка, кроме токенов

Подписка Ollama — это не только DeepSeek: в тот же счёт входят Kimi, GLM, Qwen, Mistral, и расход по ним идёт из общего пула. Если харнессу нужны разные модели под разные задачи, один счёт удобнее пяти. У DeepSeek в прайсе одна семья моделей, зато без подписки и обязательств.

Ограничения тоже разные. У Ollama на плане Pro — три одновременных запроса, дальше они встают в очередь и могут быть отклонены, если она переполнена. У DeepSeek на V4-Pro заявлено 500 одновременных обращений, а на Flash — 2500. Для одного агента это незаметно, для конвейера из субагентов — уже нет.

Как это ложится на харнесс

DeepSeek подключается к харнессу родным маршрутом deepseek-official: настройки усилий рассуждения, режим мышления, распознавание картинок у Flash и сжатие контекста работают из коробки. Ollama подключается вторым провайдером через pi-ai — совместимым с OpenAI интерфейсом; чтобы модель появилась в выборе, её идентификатор прописывается в настройках руками, а набор возможностей ограничен тем, что отдаёт площадка.

Проверил на своём конфиге: маршрут ollama-cloud собран, ключ стоит, но модели DeepSeek на текущем плане отвечают отказом 402 — до оплаты подписки доступны только gpt-oss, gemma и nemotron. Для сравнения это важно: подписку надо включить до того, как считать, иначе мерить нечего.

Что в итоге

Если сеансы идут по московскому дню и вечеру, прямая оплата у DeepSeek дешевле — иногда в разы, потому что двойной тариф Ollama приходится ровно на рабочие часы. Подписка Ollama выигрывает в другом: когда нужен один счёт на десяток открытых моделей и предсказуемая плата за месяц. Считать надо не прайс, а расписание — в этом споре оно весит больше, чем цена за токен.

Разложу по случаям, чтобы решать было проще:

  • один агент, работа по московскому дню и вечеру — прямая оплата DeepSeek;
  • конвейер из субагентов — DeepSeek: у Ollama на Pro всего три одновременных обращения;
  • несколько разных открытых моделей в одном счёте — подписка Ollama;
  • жёсткий потолок расходов на месяц — подписка: двадцать долларов платы и шестьдесят включённого расхода;
  • ночные и выходные прогоны — DeepSeek вне пика.

Оба маршрута живут в харнессе рядом: родной deepseek-official и второй провайдер через совместимый интерфейс. Держать оба и переключаться по часам — не хитрость, а обычная экономика: маршрут выбирается не по вкусу, а по расписанию. Начните с журнала своих запусков — он покажет, какие часы у вас рабочие и какой маршрут в них дешевле.

Полная версия: https://habr.com/ru/articles/1084484/

Популярное
Денис Орлов2 часа назад

Люблю такие разборы: без громких обещаний, зато с понятной логикой.

Игорь Лебедев2 дня назад

Хороший пример того, как маленькие решения влияют на итоговый результат.

Ольга Федорова3 дня назад

Интересный кейс, особенно понравилось, что объяснили без лишней воды.