
Сервер хранения может работать месяцами без единого предупреждения, а затем одно неожиданное отключение превращается в многочасовую недоступность сервисов. В этом постмортеме разбираем, почему отказ одного узла повлиял на объектное хранилище, как особенности размещения данных и служебных метаданных изменили сценарий сбоя и какие выводы были сделаны после инцидента.
Рассмотрим, какие инженерные решения помогли бы быстрее обнаружить проблему, ограничить последствия и повысить устойчивость инфраструктуры.
Разобрать инцидент
Комментарии 0
Войдите, чтобы оставить комментарий