microsrv:~$
Консоль

← Все записи

Spot и On-Demand: как рассчитать реальную экономию с учётом прерываний

ОпубликованоОбновлено5 мин чтения

Spot и On-Demand: как рассчитать реальную экономию с учётом прерыванийSpot и On-Demand: как рассчитать реальную экономию с учётом прерываний

Скидка «до 70–90%» в маркетинге Spot и фактическая экономия команды — разные величины. Первая учитывает только цену вычислений. Вторая — простои, повторные прогоны, трудозатраты инженеров на graceful shutdown (корректное завершение) и риск потери состояния.

Ниже — простая модель TCO: когда непосредственное использование Spot (без оркестрации) действительно выгодно, когда оно дороже On-Demand и где на этой шкале находится microsrv.

Коротко: скидка на Spot в прайс-листе и реальная экономия — разные вещи. Для сервисов с состоянием чистый Spot часто дороже On-Demand, если посчитать простои и трудозатраты.


1. Из чего складывается реальная стоимость

Минимально полезная формула на горизонте месяца:

TCO ≈ (цена_часа × часы_работы)
    + стоимость_простоя
    + стоимость_повторных_работ
    + накладные_на_разработку_и_эксплуатацию

Где:

  • цена_часа — On-Demand, Spot или платформенный тариф;
  • стоимость_простоя — потерянная выручка, штрафы за нарушение SLA и простой смежных команд, работающих с сервисом;
  • повторные работы — пересчёт пакетных задач, повторная загрузка данных, повторные CI-пайплайны;
  • накладные расходы — время инженеров на обработку сигналов прерывания, разнородные пулы экземпляров, регламенты (runbooks) и ночные инциденты.

Скидка провайдера уменьшает только первую строку. Остальные три при работе с нативным Spot чаще всего растут.


2. Пакетные задачи и сервисы с состоянием: две разные модели затрат

Пакетные и устойчивые к сбоям задачи

Обучение с регулярными контрольными точками, рендеринг, парсинг и сбор данных (веб-скрейпинг), конвейеры CI без жёстких требований к общему времени выполнения:

  • прерывание экземпляра стоит только последнего несохранённого отрезка работы;
  • при частых контрольных точках скидка по тарифу близка к реальной экономии;
  • TCO действительно оказывается существенно ниже On-Demand.

Интерактивные сервисы и сервисы с состоянием

API, БД, долгоживущие агенты, SSH-сеансы разработчиков:

  • прерывание означает простой для клиентов или потерю состояния в памяти;
  • нужны внешнее хранилище, логика повторного подключения, иногда схема active-active в нескольких зонах доступности;
  • стоимость адаптации со стороны инженеров способна съесть годовую «экономию» на vCPU.

Именно здесь сравнение «Spot дешевле On-Demand на 70%» вводит в заблуждение: сопоставляются разные уровни надёжности.


3. Практический пример расчёта TCO

Пусть On-Demand для нужного размера ВМ стоит 100 условных единиц в месяц.

Сценарий Вычисления Простой / повторы Разработка и эксплуатация TCO «Экономия» к OD
On-Demand 100 0 5 105 базовая линия
Spot без оркестрации, пакетные задачи + контрольные точки 30 10 15 55 ~48%
Spot без оркестрации, сервисы с состоянием 30 40 50 120 хуже OD
Платформа поверх Spot (≈ −25%) 75 ~0–5 ~5 ~80–85 ~20–25%

Цифры условные, но соотношение типичное: для сервисов с состоянием Spot без оркестрации проигрывает не в цене вычислений, а в косвенных расходах. Механизм прерываний разобран в обзоре Spot и Preemptible, а стоимость простоя падает, когда вместо холодного перезапуска используется живая миграция.


4. Скрытые множители, которые забывают в Excel

  • Массовый отзыв хостов (mass eviction). Одновременная остановка десятков узлов кластера во время пиковых нагрузок у провайдера бьёт по системе сильнее, чем редкие одиночные прерывания.
  • Время на реакцию. 30 секунд с момента уведомления о прерывании — слишком мало, чтобы корректно перенести тяжёлый StatefulSet и прогреть кэш.
  • Разнообразие типов ВМ. Чтобы повысить шансы найти Spot-мощности, автомасштабированию приходится использовать разные семейства процессоров и конфигурации. Планирование нагрузки и ёмкости от этого резко усложняется.
  • Трудозатраты инженерной команды. Даже если простой «бесплатен» по SLA, ночные дежурства и разборы инцидентов стоят дороже сэкономленных часов Spot.

Расчёт без этих множителей — всегда оптимистичный.


5. Какое место на этой шкале занимает microsrv

microsrv сознательно не обещает «−70%, как при непосредственном использовании Spot». Платформа работает на недорогих прерываемых ресурсах облаков и устраняет главные источники скрытых издержек:

В итоге экономия составляет порядка 25% относительно тарифов крупных облаков, а модель работы близка к обычной ВМ On-Demand: код приложения не нужно усложнять и переписывать под специфику прерываемых ресурсов.

Это экономия, посчитанная с учётом прерываний.


6. Как считать у себя

  1. Определите класс нагрузки: пакетные задачи или сервисы с состоянием.
  2. Оцените стоимость одного часа простоя и одного потерянного прогона.
  3. Добавьте затраты инженеров на поддержку специфики Spot. Хотя бы приблизительно: человеко-дни × ставка.
  4. Сравните три колонки: On-Demand, Spot в чистом виде, платформа со стабилизацией.
  5. Для пакетных задач часто выгоднее Spot без оркестрации. Для рабочих сервисов — либо On-Demand, либо Spot с оркестрацией, например microsrv.

Итоговая рекомендация простая: оценивайте совокупную стоимость владения (TCO), а не только привлекательные цифры в прайс-листе. Скидка, которую нельзя безопасно реализовать, не стоит ничего.


Источники и методология

  • Публичные калькуляторы для оценки «около −25%»: /go/cloud-a и /go/cloud-b (3×(4 vCPU·8 ГБ·40 ГБ SSD), стандартные (не Spot) тарифы на август 2026). microsrv работает на прерываемых ресурсах и добавляет оркестрацию; итоговая цена указана с учётом оркестрации, без прайсовой скидки Spot.
  • Компоненты TCO: hourly_price + downtime_cost + rerun_cost + eng_and_ops_overhead (формула в §1). В downtime_cost включайте штрафы по SLA и простой людей, а не только compute.
  • Только прайс без TCO см. в обзоре Spot.

Дисклеймер: это модель стоимости, а не финансовый совет. Фактическая экономия зависит от класса нагрузки (batch vs stateful), интервала чекпоинтов и цены часа простоя вашего продукта.

FAQ

Когда чистый Spot без оркестрации реально экономит? Отказоустойчивый batch с частыми чекпоинтами: TCO≈прайсу. Stateful без платформы обычно дороже On-Demand после учёта простоя и труда инженеров (таблица в §2).

Почему не заявляем «−70–90%»? Это скидка по прайсу только на compute. Реализованная экономия после прерываний ниже, и microsrv указывает именно её.

Запускайте виртуальные машины в недорогом облаке для разработчиков

microsrv автоматически управляет прерываемыми ресурсами облаков: переносит ВМ до отзыва хоста, сохраняя диски, IP-адреса и открытые соединения.

Перейти в консольЗадать вопрос