Uma grande interrupção da AWS foi causada por um bug nas ferramentas de automação de DNS.

A Amazon publicou um relatório detalhado detalhando as causas de uma grande interrupção que afetou sua nuvem Amazon Web Services (AWS). Os problemas, que afetaram diversos serviços, foram causados ​​por um bug em seu software de automação.

A interrupção ocorreu na região us-east-1, no norte da Virgínia. Um erro de DNS foi relatado como a causa raiz. No total, mais de 110 serviços da AWS foram afetados. De acordo com o Downdetector, um site que rastreia interrupções na internet, usuários em todo o mundo receberam mais de 8,1 milhões de relatos de problemas. As plataformas afetadas incluem Signal, Snapchat, Roblox, Duolingo, Apple Music, Apple TV, Lyft, Fortnite, Disney+, Venmo, Doordash, Hulu e muitas outras.

A Amazon relata que a interrupção foi causada por problemas com o DynamoDB, que lida com centenas de milhares de registros DNS necessários para operar uma enorme frota heterogênea de balanceadores de carga em cada região. Ele utiliza ferramentas de automação para atualizar os registros DNS e resolver quaisquer problemas.

Fonte da imagem: Amazon

No entanto, em 20 de outubro, o sistema de automação de DNS do DynamoDB no data center da Amazon no norte da Virgínia apresentou uma condição de corrida, resultando no registro DNS do ponto de conexão regional do DynamoDB (dynamodb.us-east-1.amazonaws.com) vazio, apesar da redundância do sistema DNS destinada a evitar isso. O sistema de automação não conseguiu resolver o problema sozinho, então especialistas tiveram que ser chamados para resolver o problema. Enquanto isso, o DynamoDB ficou indisponível para dezenas de serviços da AWS e inúmeros serviços e aplicativos de clientes que dependem dele, levando a falhas em cascata de serviços online.

A Amazon desativou temporariamente o sistema de automação de DNS do DynamoDB em todo o mundo, prometendo corrigir os bugs e adicionar novas verificações. Balanceadores de carga de rede e serviços EC2 também receberão mecanismos de controle adicionais e novas verificações. No entanto, especialistas observam que este incidente demonstra claramente o quão vulnerável o mundo pode ser a pontos únicos de falha. Isso se aplica não apenas à AWS, mas também a outros grandes provedores de nuvem, cuja infraestrutura alimenta um grande número de serviços de internet.

Se notar algum erro, selecione-o com o mouse e pressione CTRL+ENTER. | Você pode melhorar? Teremos prazer em ouvir sua opinião.

Fonte:

admin

Compartilhar
Publicado por
admin

Postagens recentes

Funcionários ricos da Samsung e da SK Hynix estão impulsionando a alta dos preços dos imóveis em cidades próximas às suas fábricas.

Uma greve recente permitiu que os funcionários da área de memória da Samsung Electronics se…

2 horas atrás

Um cartucho lacrado do Super Mario Bros. foi vendido em leilão pelo valor recorde de 3 milhões de dólares.

Uma cópia de Super Mario Bros. em sua embalagem original foi vendida por um valor…

3 horas atrás

A AMD afirma que seu laptop equipado com o processador Ryzen 5 220 é melhor para jogos do que o MacBook Neo da Apple.

O lançamento do MacBook Neo, disponível para todos nos EUA por US$ 599 e para…

4 horas atrás

Fatekeeper: Finalmente, Dark Messiah 2? Prévia

Muitos jogadores, incluindo eu, lembram com carinho de Dark Messiah of Might and Magic. O…

10 horas atrás

Rumor: Intel lançará processadores Raptor Lake Next para LGA 1700 e DDR4 em 2027, visando solucionar problemas de crise.

Na Computex 2026, os chips Nova Lake foram o assunto mais importante relacionado à Intel,…

12 horas atrás