Amazon объявила о причинах многочасового сбоя в облачных сервисах Amazon Web Services (AWS), который произошёл в центре обработки данных в Северной Вирджинии. Проблема возникла из-за сбоя в работе DNS-серверов DynamoDB, вызванного ошибкой в программном обеспечении автоматизации. Две службы одновременно изменили адреса серверов, что привело к потере правильных данных без возможности их восстановления.

Инцидент продолжался около 15 часов и затронул более 110 сервисов, включая Airtable, Canva, Signal, Snapchat и многие другие. Пользователи устройств Alexa также сталкивались с проблемами, получая сообщения о недоступности интернета.

В Amazon пояснили, что сбой произошёл из-за конфликта в системе управления DNS, когда две автоматические системы начали обновления одновременно. В результате была удалена DNS-запись для доступа к DynamoDB, что вызвало каскадные сбои. Инженеры временно отключили автоматизацию DNS, чтобы устранить проблему. Компания пообещала улучшить контроль и добавить новые алгоритмы, чтобы избежать повторения подобной ситуации.