Uma grande interrupção da AWS foi causada por um bug nas ferramentas de automação de DNS.

A Amazon publicou um relatório detalhado detalhando as causas de uma grande interrupção que afetou sua nuvem Amazon Web Services (AWS). Os problemas, que afetaram diversos serviços, foram causados ​​por um bug em seu software de automação.

A interrupção ocorreu na região us-east-1, no norte da Virgínia. Um erro de DNS foi relatado como a causa raiz. No total, mais de 110 serviços da AWS foram afetados. De acordo com o Downdetector, um site que rastreia interrupções na internet, usuários em todo o mundo receberam mais de 8,1 milhões de relatos de problemas. As plataformas afetadas incluem Signal, Snapchat, Roblox, Duolingo, Apple Music, Apple TV, Lyft, Fortnite, Disney+, Venmo, Doordash, Hulu e muitas outras.

A Amazon relata que a interrupção foi causada por problemas com o DynamoDB, que lida com centenas de milhares de registros DNS necessários para operar uma enorme frota heterogênea de balanceadores de carga em cada região. Ele utiliza ferramentas de automação para atualizar os registros DNS e resolver quaisquer problemas.

Fonte da imagem: Amazon

No entanto, em 20 de outubro, o sistema de automação de DNS do DynamoDB no data center da Amazon no norte da Virgínia apresentou uma condição de corrida, resultando no registro DNS do ponto de conexão regional do DynamoDB (dynamodb.us-east-1.amazonaws.com) vazio, apesar da redundância do sistema DNS destinada a evitar isso. O sistema de automação não conseguiu resolver o problema sozinho, então especialistas tiveram que ser chamados para resolver o problema. Enquanto isso, o DynamoDB ficou indisponível para dezenas de serviços da AWS e inúmeros serviços e aplicativos de clientes que dependem dele, levando a falhas em cascata de serviços online.

A Amazon desativou temporariamente o sistema de automação de DNS do DynamoDB em todo o mundo, prometendo corrigir os bugs e adicionar novas verificações. Balanceadores de carga de rede e serviços EC2 também receberão mecanismos de controle adicionais e novas verificações. No entanto, especialistas observam que este incidente demonstra claramente o quão vulnerável o mundo pode ser a pontos únicos de falha. Isso se aplica não apenas à AWS, mas também a outros grandes provedores de nuvem, cuja infraestrutura alimenta um grande número de serviços de internet.

Se notar algum erro, selecione-o com o mouse e pressione CTRL+ENTER. | Você pode melhorar? Teremos prazer em ouvir sua opinião.

Fonte:

admin

Compartilhar
Publicado por
admin

Postagens recentes

A Cloudflare acusou o Google de pressionar editores da web a coletar dados para treinamento de IA.

O CEO da Cloudflare, Matthew Prince, afirmou que o Google está usando sua posição dominante…

2 horas atrás

Uma câmera com abertura variável poderá aparecer na linha Galaxy como resposta ao iPhone 18.

A Samsung está considerando trazer de volta a câmera com abertura variável para seus smartphones…

2 horas atrás

A Ferrari revelou o interior do seu carro elétrico Luce, desenvolvido em colaboração com o estúdio LoveFrom de Jony Ive.

A Ferrari divulgou as primeiras imagens do interior do seu carro elétrico Luce, desenvolvido em…

2 horas atrás

O Ministério do Desenvolvimento Digital propôs substituir o bloqueio total de chamadas internacionais por um regime de “autobloqueio”.

O Ministério do Desenvolvimento Digital, Comunicações e Mídia de Massa anunciou sua intenção de alterar…

2 horas atrás

As autoridades americanas estão se preparando para aumentar as tarifas de importação de chips, mas os clientes de hiperescala da TSMC receberão benefícios.

O governo do atual presidente dos EUA, Donald Trump, continua a reformar o comércio exterior…

5 horas atrás