SLI (Service Level Indicator) — измеряемая метрика качества сервиса. Примеры: availability (% успешных запросов), latency (p99 < 500ms), error rate (< 0.1 %). Одно число за интервал (обычно 30 дней).
SLO (Service Level Objective) — целевое значение SLI. "99.9 % запросов должны отвечать за < 500 ms в течение 30 дней". SLO задаётся вами внутри команды без внешних обязательств. Основа планирования: если SLO 99.9 %, вы имеете error budget = 43 минуты downtime в месяц.
SLA (Service Level Agreement) — контрактное обязательство перед клиентом с финансовыми последствиями за нарушение. Обычно SLA слабее SLO (SLO 99.95 %, SLA 99.9 %) — оставляете буфер. Пример: "при uptime < 99.9 % возвращаем 10 % месячной платы".
Практика: SRE-книга Google рекомендует: (1) не гнаться за 100 % — дорого и не нужно, (2) сформулировать SLO, посчитать error budget, (3) когда бюджет исчерпан — freeze features, чинить надёжность. У нас SLA 99.9 % на VPS, SLO внутри — 99.95 % (буфер).