История инцидентов
Здесь указаны все предыдущие инциденты и сбои Пачки.
2026
База данных вошла в деградированное состояние без видимого роста нагрузки. Сервис был недоступен 3 часа 15 минут на всех платформах. Восстановлен после перезагрузки БД. Подробный постмортем.
Массовый разрыв WebSocket-соединений спровоцировал лавину переподключений, перегрузившую сервис. Недоступность и деградация длились около 4 минут. Подробный постмортем.
Облачный провайдер отключил инфраструктуру из-за ошибки биллинга на своей стороне. 11 минут полной недоступности + 58 минут частичной недоступности компьютерных версий. Подробный постмортем.
2025
После обновления SSL-сертификата и перезагрузки веб-сервера произошел сброс соединений, что вызвало лавинообразный рост запросов и привело к исчерпанию ресурсов и даунтайму сервиса на 5 минут.
Неконтролируемый рост нагрузки на один из серверов Redis привел его к падению и деградации производительности сервиса. Восстановление было автоматическим. Для предотвращения подобных инцидентов изменили политику RateLimiter. Подробный постмортем.
Обновление с оптимизацией @упоминаний, вышедшее 11.08.2025, привело к сильной нагрузке на старый запрос и 43-минутной деградации скорости. Подробный постмортем.
Волна блокировок в российском сегменте временно задела инфраструктуру нашего облачного провайдера Selectel. Был затронут функционал загрузки, открытия и скачивания файлов и изображений.
Ошибка на уровне СУБД привела к недоступности сервиса на 15 минут. Баг на уровне СУБД исправим обновлением версии СУБД.
2024
Недоступность сервера WSS стала триггером для массовых запросов к API, что вызвало его перегрузку и привело к 44-минутному простою.
Потеря связи между дата-центрами провайдера, что привело к недоступности сервиса Пачка на 4 с половиной часа с утра по Мск. Подробный постмортем.
Недоступность основной базы данных вызванная человеческим фактором: ошибка при деплое и настройках системы оркестрации контейнеров. API был недоступен в течение часа. Подробный постмортем.
Ориентировочно с 12 до 14 Пачка работала медленнее обычного из-за появившихся новых паттернов поведения большого количества юзеров. Были внесены правки в систему поиска, что решило проблему замедления API.
В результате ошибки в обновлении в течение 2 минут скорость ответа от бэкенда была низкой.
При изменении конфигурации на бэкенде произошла ошибка, которую оперативно исправили. 3 минуты сервис был недоступен. Ещё несколько минут восстанавливался поиск.
В результате ошибки релиза в течение 13 минут бэкенд выдавал ошибку.
2023
Был просрочен SSL-сертификат. Отказ системы автопродления. Период недоступности — 25 минут.