A Nvidia apresentou uma nova tecnologia como parte do programa NVLink Fusion. O NVHBM é uma arquitetura de núcleo HBM especializada, projetada para desenvolvedores de aceleradores de IA personalizados. Comparado ao HBM4e padrão, ele promete maior taxa de transferência, menor consumo de energia e tamanho reduzido dentro do pacote do acelerador.

Fonte da imagem: nvidia.com
Como explica a Nvidia, o NVHBM é um chip base HBM especializado, desenvolvido e testado em colaboração com os principais fabricantes de memória. Os participantes do programa NVLink Fusion poderão usar essa solução pronta para criar seus próprios aceleradores, em vez de desenvolver e certificar o subsistema HBM por conta própria, o que deve reduzir o tempo de lançamento de novos chips no mercado.
O NVHBM não substitui o HBM em si, mas sim serve como um componente fundamental para aceleradores especializados de parceiros da Nvidia. Uma das principais vantagens dessa tecnologia é o aumento da largura de banda da memória: a empresa promete até 30% mais largura de banda por pilha em comparação com o HBM4e padrão. Para tarefas com uso intensivo de memória, isso permitirá uma melhor utilização das unidades de computação e aumentará a taxa de transferência do acelerador. Em particular, ao inferir grandes modelos de linguagem, a transferência de dados mais rápida entre o HBM e os núcleos de computação aumentará as taxas de geração de tokens.

A economia de área é alcançada por meio de uma interface de memória física redesenhada. O controlador foi movido do chip de computação principal para o chip base da pilha 3D HBM, reduzindo a área da camada física (PHY) e da lógica associada em até 67% em comparação com o padrão JEDEC HBM4e. A interface mais estreita também simplifica o roteamento do interposer. Como resultado, os desenvolvedores de aceleradores especializados podem ganhar até 30% de área adicional no chip principal para unidades de computação e outras funções.
Outra vantagem do NVHBM é a redução no consumo de energia da memória em até 15% em comparação com o HBM4e padrão. A energia e a dissipação térmica liberadas podem ser usadas para aumentar o poder de computação do acelerador ou melhorar o desempenho sustentado com o mesmo consumo de energia. Na escala de grandes data centers, o efeito se torna especialmente perceptível: de acordo com os cálculos da Nvidia, em um hipotético data center de 1 GW com aceleradores de 2000 W, a energia economizada pelo NVHBM seria suficiente para operar 15.000 XPUs adicionais.
Aumentar a taxa de transferência e, ao mesmo tempo, reduzir o consumo de energia é especialmente importante para aceleradores de IA, que precisam movimentar constantemente grandes quantidades de dados, incluindo pesos de modelos, cache de chave-valor e ativações. A Nvidia afirma que a combinação de NVHBM com NVLink Fusion pode aumentar o desempenho de uma única XPU em 30%, devido à economia em taxa de transferência, área e consumo de energia.
Um dos primeiros parceiros da Nvidia na implementação do NVHBM será a Annapurna Labs, pertencente à Amazon. Os aceleradores Trainium 4 de próxima geração já serão compatíveis com NVLink Fusion, e os desenvolvimentos subsequentes também o incluirão.A empresa também poderá usar o NVHBM.