Uma grande interrupção da AWS foi causada por um bug nas ferramentas de automação de DNS.

A Amazon publicou um relatório detalhado detalhando as causas de uma grande interrupção que afetou sua nuvem Amazon Web Services (AWS). Os problemas, que afetaram diversos serviços, foram causados ​​por um bug em seu software de automação.

A interrupção ocorreu na região us-east-1, no norte da Virgínia. Um erro de DNS foi relatado como a causa raiz. No total, mais de 110 serviços da AWS foram afetados. De acordo com o Downdetector, um site que rastreia interrupções na internet, usuários em todo o mundo receberam mais de 8,1 milhões de relatos de problemas. As plataformas afetadas incluem Signal, Snapchat, Roblox, Duolingo, Apple Music, Apple TV, Lyft, Fortnite, Disney+, Venmo, Doordash, Hulu e muitas outras.

A Amazon relata que a interrupção foi causada por problemas com o DynamoDB, que lida com centenas de milhares de registros DNS necessários para operar uma enorme frota heterogênea de balanceadores de carga em cada região. Ele utiliza ferramentas de automação para atualizar os registros DNS e resolver quaisquer problemas.

Fonte da imagem: Amazon

No entanto, em 20 de outubro, o sistema de automação de DNS do DynamoDB no data center da Amazon no norte da Virgínia apresentou uma condição de corrida, resultando no registro DNS do ponto de conexão regional do DynamoDB (dynamodb.us-east-1.amazonaws.com) vazio, apesar da redundância do sistema DNS destinada a evitar isso. O sistema de automação não conseguiu resolver o problema sozinho, então especialistas tiveram que ser chamados para resolver o problema. Enquanto isso, o DynamoDB ficou indisponível para dezenas de serviços da AWS e inúmeros serviços e aplicativos de clientes que dependem dele, levando a falhas em cascata de serviços online.

A Amazon desativou temporariamente o sistema de automação de DNS do DynamoDB em todo o mundo, prometendo corrigir os bugs e adicionar novas verificações. Balanceadores de carga de rede e serviços EC2 também receberão mecanismos de controle adicionais e novas verificações. No entanto, especialistas observam que este incidente demonstra claramente o quão vulnerável o mundo pode ser a pontos únicos de falha. Isso se aplica não apenas à AWS, mas também a outros grandes provedores de nuvem, cuja infraestrutura alimenta um grande número de serviços de internet.

Se notar algum erro, selecione-o com o mouse e pressione CTRL+ENTER. | Você pode melhorar? Teremos prazer em ouvir sua opinião.

Fonte:

admin

Compartilhar
Publicado por
admin

Postagens recentes

Ingredientes congelados para a vida descobertos fora da Via Láctea pela primeira vez 3DNews

Pela primeira vez fora da nossa galáxia, a Via Láctea, astrônomos descobriram "ingredientes para a…

37 minutos atrás

O principal candidato à chefia da rede social X renunciou após trabalhar com Musk por apenas 10 meses.

John Nitti deixou o cargo de chefe de publicidade da rede social X (antigo Twitter)…

6 horas atrás

A TSMC anunciou que não teme uma proibição de exportações de metais de terras raras da China.

A Taiwan Semiconductor Manufacturing Company (TSMC) tem reservas suficientes de metais de terras raras e…

6 horas atrás

O novo ônibus espacial do Japão está se preparando para seu lançamento inaugural – e o tempo está passando.

Amanhã, 26 de outubro de 2025, às 9h, horário local, o Japão planeja lançar sua…

6 horas atrás