Яндекс.Метрика
Постмортем

Инцидент с доступностью сервиса 16 октября 2024

Разбор причин и хронология инцидента с недоступностью сервиса 16 октября 2024 года.

Резюме инцидента

Дата и время16.10.2024 в 05:24 (UTC+3)
ПричинаПотеря связи между дата-центрами на стороне облачного провайдера
Уровень серьёзностиВысокий
Продолжительность4 часа 29 минут полной недоступности
Пострадавшие системыapi.pachca.com — все платформы
Пострадавшие пользователиВсе пользователи

Что произошло

16 октября 2024 в 05:24 МСК сервис Пачка стал полностью недоступен из-за потери связи между дата-центрами облачного провайдера. Проблема была на стороне провайдера и не зависела от наших действий. Сервис был восстановлен в 09:53 после устранения проблемы провайдером.

Потери данных не произошло.

Мы приносим извинения за этот инцидент. Ниже — хронология, анализ причин и меры, которые мы принимаем.


Хронология

Все отметки времени — UTC+3.

  • 05:24 – Зафиксированы первые сигналы о недоступности сервиса.
  • 05:41 – Начато расследование причин инцидента.
  • 06:24 – Установлен контакт с провайдером для уточнения деталей.
  • 07:11 – Провайдер локализовал проблему в облачной инфраструктуре.
  • 07:41 – Провайдер инициировал публичный инцидент, признав возможность масштабного сбоя.
  • 07:51 – Запущена синхронизация конфигурации на стороне провайдера (ожидаемое время 40–60 минут).
  • 08:30 – Инициирован процесс перехода на реплику БД ввиду затягивания восстановительных работ провайдера.
  • 09:53 – Восстановлен полный доступ к сервису после устранения проблемы провайдером.

Цепочка причин

  1. Почему сервис стал недоступен? — API-серверы потеряли связь с базой данных и другими компонентами инфраструктуры.
  2. Почему потеряли связь? — Произошла потеря связи между дата-центрами облачного провайдера.
  3. Почему восстановление заняло более 4 часов? — Проблема была полностью на стороне провайдера, и мы зависели от скорости его реакции. Параллельно начали переход на реплику БД, но провайдер устранил проблему раньше.

Что мы делаем, чтобы это не повторилось

Ускорение восстановления

  • Регламент переключения на реплику БД. Завершаем разработку и внедрение регламента для сокращения максимального времени простоя при аналогичных инцидентах до 15 минут.

Долгосрочная устойчивость

  • Диверсификация инфраструктуры. Интегрируем мощности второго независимого провайдера для повышения отказоустойчивости сервиса.