Spot и On-Demand: как рассчитать реальную экономию с учётом прерываний


Скидка «до 70–90%» в маркетинге Spot и фактическая экономия команды — разные величины. Первая учитывает только цену вычислений. Вторая — простои, повторные прогоны, трудозатраты инженеров на graceful shutdown (корректное завершение) и риск потери состояния.
Ниже — простая модель TCO: когда непосредственное использование Spot (без оркестрации) действительно выгодно, когда оно дороже On-Demand и где на этой шкале находится microsrv.
Коротко: скидка на Spot в прайс-листе и реальная экономия — разные вещи. Для сервисов с состоянием чистый Spot часто дороже On-Demand, если посчитать простои и трудозатраты.
1. Из чего складывается реальная стоимость
Минимально полезная формула на горизонте месяца:
TCO ≈ (цена_часа × часы_работы)
+ стоимость_простоя
+ стоимость_повторных_работ
+ накладные_на_разработку_и_эксплуатацию
Где:
- цена_часа — On-Demand, Spot или платформенный тариф;
- стоимость_простоя — потерянная выручка, штрафы за нарушение SLA и простой смежных команд, работающих с сервисом;
- повторные работы — пересчёт пакетных задач, повторная загрузка данных, повторные CI-пайплайны;
- накладные расходы — время инженеров на обработку сигналов прерывания, разнородные пулы экземпляров, регламенты (runbooks) и ночные инциденты.
Скидка провайдера уменьшает только первую строку. Остальные три при работе с нативным Spot чаще всего растут.
2. Пакетные задачи и сервисы с состоянием: две разные модели затрат
Пакетные и устойчивые к сбоям задачи
Обучение с регулярными контрольными точками, рендеринг, парсинг и сбор данных (веб-скрейпинг), конвейеры CI без жёстких требований к общему времени выполнения:
- прерывание экземпляра стоит только последнего несохранённого отрезка работы;
- при частых контрольных точках скидка по тарифу близка к реальной экономии;
- TCO действительно оказывается существенно ниже On-Demand.
Интерактивные сервисы и сервисы с состоянием
API, БД, долгоживущие агенты, SSH-сеансы разработчиков:
- прерывание означает простой для клиентов или потерю состояния в памяти;
- нужны внешнее хранилище, логика повторного подключения, иногда схема active-active в нескольких зонах доступности;
- стоимость адаптации со стороны инженеров способна съесть годовую «экономию» на vCPU.
Именно здесь сравнение «Spot дешевле On-Demand на 70%» вводит в заблуждение: сопоставляются разные уровни надёжности.
3. Практический пример расчёта TCO
Пусть On-Demand для нужного размера ВМ стоит 100 условных единиц в месяц.
| Сценарий | Вычисления | Простой / повторы | Разработка и эксплуатация | TCO | «Экономия» к OD |
|---|---|---|---|---|---|
| On-Demand | 100 | 0 | 5 | 105 | базовая линия |
| Spot без оркестрации, пакетные задачи + контрольные точки | 30 | 10 | 15 | 55 | ~48% |
| Spot без оркестрации, сервисы с состоянием | 30 | 40 | 50 | 120 | хуже OD |
| Платформа поверх Spot (≈ −25%) | 75 | ~0–5 | ~5 | ~80–85 | ~20–25% |
Цифры условные, но соотношение типичное: для сервисов с состоянием Spot без оркестрации проигрывает не в цене вычислений, а в косвенных расходах. Механизм прерываний разобран в обзоре Spot и Preemptible, а стоимость простоя падает, когда вместо холодного перезапуска используется живая миграция.
4. Скрытые множители, которые забывают в Excel
- Массовый отзыв хостов (mass eviction). Одновременная остановка десятков узлов кластера во время пиковых нагрузок у провайдера бьёт по системе сильнее, чем редкие одиночные прерывания.
- Время на реакцию. 30 секунд с момента уведомления о прерывании — слишком мало, чтобы корректно перенести тяжёлый
StatefulSetи прогреть кэш. - Разнообразие типов ВМ. Чтобы повысить шансы найти Spot-мощности, автомасштабированию приходится использовать разные семейства процессоров и конфигурации. Планирование нагрузки и ёмкости от этого резко усложняется.
- Трудозатраты инженерной команды. Даже если простой «бесплатен» по SLA, ночные дежурства и разборы инцидентов стоят дороже сэкономленных часов Spot.
Расчёт без этих множителей — всегда оптимистичный.
5. Какое место на этой шкале занимает microsrv
microsrv сознательно не обещает «−70%, как при непосредственном использовании Spot». Платформа работает на недорогих прерываемых ресурсах облаков и устраняет главные источники скрытых издержек:
- оркестратор выполняет живую миграцию до отзыва хоста;
- реплицируемые тома переживают потерю вычислительного узла;
- eBPF-сеть сохраняет IP-адреса и TCP-соединения.
В итоге экономия составляет порядка 25% относительно тарифов крупных облаков, а модель работы близка к обычной ВМ On-Demand: код приложения не нужно усложнять и переписывать под специфику прерываемых ресурсов.
Это экономия, посчитанная с учётом прерываний.
6. Как считать у себя
- Определите класс нагрузки: пакетные задачи или сервисы с состоянием.
- Оцените стоимость одного часа простоя и одного потерянного прогона.
- Добавьте затраты инженеров на поддержку специфики Spot. Хотя бы приблизительно: человеко-дни × ставка.
- Сравните три колонки: On-Demand, Spot в чистом виде, платформа со стабилизацией.
- Для пакетных задач часто выгоднее Spot без оркестрации. Для рабочих сервисов — либо On-Demand, либо Spot с оркестрацией, например microsrv.
Итоговая рекомендация простая: оценивайте совокупную стоимость владения (TCO), а не только привлекательные цифры в прайс-листе. Скидка, которую нельзя безопасно реализовать, не стоит ничего.
Источники и методология
- Публичные калькуляторы для оценки «около −25%»:
/go/cloud-aи/go/cloud-b(3×(4 vCPU·8 ГБ·40 ГБ SSD), стандартные (не Spot) тарифы на август 2026). microsrv работает на прерываемых ресурсах и добавляет оркестрацию; итоговая цена указана с учётом оркестрации, без прайсовой скидки Spot. - Компоненты TCO:
hourly_price + downtime_cost + rerun_cost + eng_and_ops_overhead(формула в §1). Вdowntime_costвключайте штрафы по SLA и простой людей, а не только compute. - Только прайс без TCO см. в обзоре Spot.
Дисклеймер: это модель стоимости, а не финансовый совет. Фактическая экономия зависит от класса нагрузки (batch vs stateful), интервала чекпоинтов и цены часа простоя вашего продукта.
FAQ
Когда чистый Spot без оркестрации реально экономит? Отказоустойчивый batch с частыми чекпоинтами: TCO≈прайсу. Stateful без платформы обычно дороже On-Demand после учёта простоя и труда инженеров (таблица в §2).
Почему не заявляем «−70–90%»? Это скидка по прайсу только на compute. Реализованная экономия после прерываний ниже, и microsrv указывает именно её.
Запускайте виртуальные машины в недорогом облаке для разработчиков
microsrv автоматически управляет прерываемыми ресурсами облаков: переносит ВМ до отзыва хоста, сохраняя диски, IP-адреса и открытые соединения.