Постмортем
Инцидент с доступностью сервиса 16 октября 2024
Разбор причин и хронология инцидента с недоступностью сервиса 16 октября 2024 года.
Резюме инцидента
Дата и время16.10.2024 в 05:24 (UTC+3)
ПричинаПотеря связи между дата-центрами на стороне облачного провайдера
Уровень серьёзностиВысокий
Продолжительность4 часа 29 минут полной недоступности
Пострадавшие системыapi.pachca.com — все платформы
Пострадавшие пользователиВсе пользователи
Что произошло
16 октября 2024 в 05:24 МСК сервис Пачка стал полностью недоступен из-за потери связи между дата-центрами облачного провайдера. Проблема была на стороне провайдера и не зависела от наших действий. Сервис был восстановлен в 09:53 после устранения проблемы провайдером.
Потери данных не произошло.
Мы приносим извинения за этот инцидент. Ниже — хронология, анализ причин и меры, которые мы принимаем.
Хронология
Все отметки времени — UTC+3.
- 05:24 – Зафиксированы первые сигналы о недоступности сервиса.
- 05:41 – Начато расследование причин инцидента.
- 06:24 – Установлен контакт с провайдером для уточнения деталей.
- 07:11 – Провайдер локализовал проблему в облачной инфраструктуре.
- 07:41 – Провайдер инициировал публичный инцидент, признав возможность масштабного сбоя.
- 07:51 – Запущена синхронизация конфигурации на стороне провайдера (ожидаемое время 40–60 минут).
- 08:30 – Инициирован процесс перехода на реплику БД ввиду затягивания восстановительных работ провайдера.
- 09:53 – Восстановлен полный доступ к сервису после устранения проблемы провайдером.
Цепочка причин
- Почему сервис стал недоступен? — API-серверы потеряли связь с базой данных и другими компонентами инфраструктуры.
- Почему потеряли связь? — Произошла потеря связи между дата-центрами облачного провайдера.
- Почему восстановление заняло более 4 часов? — Проблема была полностью на стороне провайдера, и мы зависели от скорости его реакции. Параллельно начали переход на реплику БД, но провайдер устранил проблему раньше.
Что мы делаем, чтобы это не повторилось
Ускорение восстановления
- Регламент переключения на реплику БД. Завершаем разработку и внедрение регламента для сокращения максимального времени простоя при аналогичных инцидентах до 15 минут.
Долгосрочная устойчивость
- Диверсификация инфраструктуры. Интегрируем мощности второго независимого провайдера для повышения отказоустойчивости сервиса.