Singularidade planetária: a infraestrutura de IA da Microsoft inclui mais de 100.000 GPUs, FPGAs e ASICs

A Microsoft divulgou detalhes de seu uso de seu serviço de agendamento distribuído de “escala planetária” Singularity, projetado para gerenciar cargas de trabalho de IA. Em um relatório da empresa, o objetivo da Singularity é ajudar a gigante do software a controlar os custos, garantindo alta utilização de hardware para tarefas de aprendizado profundo.

A Singularity consegue isso com um novo escalonador capaz de alta utilização de aceleradores (incluindo FPGAs e ASICs) sem aumentar os erros ou a degradação do desempenho. A Singularity oferece provisionamento transparente e dimensionamento elástico de recursos de computação alocados para cada tarefa. Na verdade, ele desempenha o papel de uma espécie de camada “inteligente” entre o próprio hardware e a plataforma de software para cargas de trabalho de IA.

Imagem: Microsoft

A singularidade permite separar as tarefas atribuídas aos recursos dos aceleradores. Se o dimensionamento for necessário, o sistema não apenas altera o número de dispositivos envolvidos, mas também gerencia a alocação e a alocação de memória, o que é extremamente importante para cargas de trabalho de IA. O planejamento adequado permite que você não fique ocioso sem a necessidade de um hardware muito caro, devido ao qual um efeito econômico positivo é alcançado.

NVIDIA DGX-2

O relatório também afirma explicitamente que a Microsoft possui centenas de milhares de GPUs e outros aceleradores de IA. Em particular, é mencionado que Singularity é usado em plataformas NVIDIA DGX-2: dois Xeon Platinum 8168 (20 núcleos cada), oito aceleradores V100 com NVSwitch, 692 GB de RAM e uma interconexão InfiniBand. Assim, o parque de IA de uma empresa deve incluir dezenas de milhares de nós, por isso sua gestão eficaz é muito importante.

avalanche

Postagens recentes

A AMD comemorou o 10º aniversário da plataforma AM4 e prometeu dar continuidade à tradição na AM5.

A AMD considera o suporte a longo prazo para sockets como um compromisso com os…

2 horas atrás

A Meta está desenvolvendo dois modelos de óculos inteligentes Ray-Ban com correção visual.

A Meta✴Platforms planeja lançar dois novos óculos inteligentes Ray-Ban para usuários de lentes de grau…

2 horas atrás

O YouTube atualizou o design do seu player incorporável e, como de costume, os usuários ficaram insatisfeitos.

O YouTube possui dois players principais: um para seu próprio site e outro para uso…

3 horas atrás

Hackers invadiram a infraestrutura da Comissão Europeia e roubaram 350 GB de dados.

A Comissão Europeia (CE) anunciou um ciberataque que afetou a infraestrutura em nuvem que hospeda…

4 horas atrás

A Ayaneo aumentará os preços e descontinuará diversos consoles portáteis, pois a escassez de memória elevou os custos de produção.

A Ayaneo atualizou as informações sobre seus dispositivos em seu site, e as notícias não…

4 horas atrás

Apesar de duas falhas, a Intuitive Machines recebeu um terceiro contrato da NASA para entregar carga à Lua.

Uma vez é acidente, duas vezes é coincidência, mas uma terceira é garantida, decidiu a…

4 horas atrás