Uma grande interrupção da AWS foi causada por um bug nas ferramentas de automação de DNS.

A Amazon publicou um relatório detalhado detalhando as causas de uma grande interrupção que afetou sua nuvem Amazon Web Services (AWS). Os problemas, que afetaram diversos serviços, foram causados ​​por um bug em seu software de automação.

A interrupção ocorreu na região us-east-1, no norte da Virgínia. Um erro de DNS foi relatado como a causa raiz. No total, mais de 110 serviços da AWS foram afetados. De acordo com o Downdetector, um site que rastreia interrupções na internet, usuários em todo o mundo receberam mais de 8,1 milhões de relatos de problemas. As plataformas afetadas incluem Signal, Snapchat, Roblox, Duolingo, Apple Music, Apple TV, Lyft, Fortnite, Disney+, Venmo, Doordash, Hulu e muitas outras.

A Amazon relata que a interrupção foi causada por problemas com o DynamoDB, que lida com centenas de milhares de registros DNS necessários para operar uma enorme frota heterogênea de balanceadores de carga em cada região. Ele utiliza ferramentas de automação para atualizar os registros DNS e resolver quaisquer problemas.

Fonte da imagem: Amazon

No entanto, em 20 de outubro, o sistema de automação de DNS do DynamoDB no data center da Amazon no norte da Virgínia apresentou uma condição de corrida, resultando no registro DNS do ponto de conexão regional do DynamoDB (dynamodb.us-east-1.amazonaws.com) vazio, apesar da redundância do sistema DNS destinada a evitar isso. O sistema de automação não conseguiu resolver o problema sozinho, então especialistas tiveram que ser chamados para resolver o problema. Enquanto isso, o DynamoDB ficou indisponível para dezenas de serviços da AWS e inúmeros serviços e aplicativos de clientes que dependem dele, levando a falhas em cascata de serviços online.

A Amazon desativou temporariamente o sistema de automação de DNS do DynamoDB em todo o mundo, prometendo corrigir os bugs e adicionar novas verificações. Balanceadores de carga de rede e serviços EC2 também receberão mecanismos de controle adicionais e novas verificações. No entanto, especialistas observam que este incidente demonstra claramente o quão vulnerável o mundo pode ser a pontos únicos de falha. Isso se aplica não apenas à AWS, mas também a outros grandes provedores de nuvem, cuja infraestrutura alimenta um grande número de serviços de internet.

Se notar algum erro, selecione-o com o mouse e pressione CTRL+ENTER. | Você pode melhorar? Teremos prazer em ouvir sua opinião.

Fonte:

admin

Compartilhar
Publicado por
admin

Postagens recentes

A Alphabet tornou-se a quarta empresa com uma capitalização de mercado superior a 4 biliões de dólares.

Na semana passada, a capitalização de mercado da Alphabet, que inclui o Google, ultrapassou a…

29 minutos atrás

A TSMC está disposta a aumentar o investimento nos EUA em troca de tarifas de importação mais baixas para produtos taiwaneses.

Enquanto o governo anterior dos EUA tentou atrair fabricantes estrangeiros com subsídios para a localização…

53 minutos atrás

A Anthropic lançou o Claude Cowork, uma solução de compartilhamento autônomo de arquivos com IA para macOS.

A Anthropic lançou uma nova funcionalidade para seu assistente de IA, Claude, chamada Claude Cowork.…

4 horas atrás

Automontagem Direcionada (DSA): Não é um substituto para EUV, mas sim uma ferramenta muito útil / Offsyanka

Quando, há mais de uma década, no final de 2014, especialistas líderes da indústria de…

8 horas atrás