Как-то сидели с Лёхой, знакомым админом, пили пиво и спорили, должен ли диск на 91% будить человека ночью. Лёха говорил: «Девяносто один — уже красное». Я спросил, что делать, если он прибавляет по гигабайту в месяц. На этом простая шкала закончилась.

Для сравнения возьмём два варианта одного уведомления:

Плохо:
nas-01: disk usage 91%

Полезнее:
nas-01 /data: занято 91%, сутки назад было 84%
Запись файлов работает, свободно 72 ГБ
График: /dash/storage/nas-01
Порядок действий: /runbooks/storage

Второй вариант ещё не доказывает срочность. Если 72 ГБ хватает на несколько дней, сообщение можно оставить в рабочем канале. Если текущий темп заполнит диск до начала смены, тот же сигнал должен попасть дежурному.

Канал выбирают заранее

Для каждого правила полезно записать канал доставки и ожидаемое действие. Недоступность пользовательского сервиса обычно требует немедленной реакции. Ошибка ночной резервной копии может подождать до утра, если остаётся предыдущая проверенная копия. Перезапуск вспомогательного контейнера без пользовательского эффекта достаточно сохранить в журнале.

Если получатель не должен ничего делать до рабочего дня, ночной push только приучает игнорировать телефон.

Дребезг и возврат в норму

Порог в 90% часто пересекается в обе стороны. В демонстрационном правиле можно открыть тревогу после десяти минут выше 90%, а закрыть после пятнадцати минут ниже 85%. Разные границы и задержка убирают повторные сообщения. Конкретные числа стоит взять из обычного поведения вашего хранилища.

Раз в месяц полезно просмотреть сообщения, на которые никто не реагировал. Их либо переносят в сводку, либо дополняют инструкцией. Так канал дежурного остаётся коротким без потери самих наблюдений.