Яндекс.Метрика
Постмортем

Инцидент с доступностью сервиса 16 августа 2024

Разбор причин и хронология инцидента с недоступностью сервиса 16 августа 2024 года.

Резюме инцидента

Дата и время16.08.2024 в 12:06 (UTC+3)
ПричинаЧеловеческий фактор: ошибка при деплое и настройках системы оркестрации контейнеров
Уровень серьёзностиВысокий
Продолжительность47 минут полной недоступности + 12 минут медленной работы
Пострадавшие системыapi.pachca.com — все платформы
Пострадавшие пользователиВсе пользователи

Что произошло

16 августа 2024 в 12:06 МСК сервис Пачка стал недоступен из-за ошибки при деплое и настройках системы оркестрации контейнеров. Основная база данных стала недоступна, что привело к полной остановке API. Сервис был восстановлен через 47 минут, ещё 12 минут наблюдались задержки в работе.

Потери данных не произошло.

Мы приносим извинения за этот инцидент. Ниже — хронология, анализ причин и меры, которые мы принимаем.


Хронология

Все отметки времени — UTC+3.

  • 12:06 – Получены первые сигналы о недоступности сервиса.
  • 12:07 – Команда начала анализ причин и работу по устранению инцидента.
  • 12:08 – Выявлена проблема на стороне API. Начаты работы по восстановлению.
  • 12:20 – Причина проблемы установлена: ошибка при деплое и настройках системы оркестрации контейнеров.
  • 12:53 – Работоспособность сервиса начала восстанавливаться.
  • 12:57 – Доступ к сервису полностью восстановлен, однако наблюдались задержки в работе.
  • 13:05 – Производительность полностью восстановлена.

Цепочка причин

  1. Почему сервис стал недоступен? — Основная база данных стала недоступна для API-серверов.
  2. Почему БД стала недоступна? — Ошибка при деплое и настройках системы оркестрации контейнеров нарушила работу кластера.
  3. Почему инцидент затронул все реплики? — Предмет расследования. Информация может дополняться по мере поступления.

Что мы делаем, чтобы это не повторилось

Немедленные меры

  • Пересборка кластера. Пересобран кластер машин для сервисов API для восстановления стабильной работы.

Долгосрочные меры

  • Резервирование серверного кластера. Рассматриваем возможность резервирования для повышения надёжности процесса деплоя и исключения подобных сбоев в будущем.