Desempenho de LLMs e Linhas PCIe: Considerações Fundamentais

Pensando em instalar uma segunda GPU para LLMs?

Conteúdo da página

Como as faixas PCIe afetam o desempenho de LLMs? Depende da tarefa. Para treinamento e inferência com múltiplas GPUs, a queda de desempenho é significativa.

Para mais informações sobre throughput, latência, VRAM e benchmarks entre diferentes runtimes e hardware, consulte Desempenho de LLMs: Benchmarks, Gargalos e Otimização.

Para inferência com GPU única, quando o LLM já está na VRAM, não há quase nenhuma diferença.

“Placa-mãe com muitas faixas PCI” Esta imagem foi gerada automaticamente com Flux - LLM de texto para imagem.

  • Carregamento do Modelo: O número de faixas PCIe impacta principalmente a velocidade na qual os pesos do modelo são carregados da RAM do sistema para a VRAM da GPU. Mais faixas (por exemplo, x16) permitem transferências mais rápidas, reduzindo os tempos de carregamento inicial. Uma vez que o modelo é carregado na memória da GPU, a velocidade de inferência é amplamente não afetada pela largura de banda do PCIe, a menos que o modelo ou os dados precisem ser trocados frequentemente dentro e fora da VRAM.
  • Velocidade de Inferência: Para tarefas típicas de inferência de LLMs, a quantidade de faixas PCIe tem efeito mínimo após o modelo ser carregado, pois o cálculo ocorre dentro da GPU. Somente quando os resultados ou dados intermediários precisam ser transferidos frequentemente de volta para a CPU ou entre GPUs a largura de banda do PCIe se torna um gargalo.
  • Treinamento e Configurações Multi-GPU: Para treinamento, especialmente com múltiplas GPUs, a largura de banda do PCIe se torna mais crítica. Contagens menores de faixas (por exemplo, x4) podem desacelerar significativamente o treinamento devido ao aumento da comunicação inter-GPU e à reorganização de dados. Para melhores resultados, pelo menos 8 faixas (x8) por GPU são recomendadas em sistemas multi-GPU.

Comparação de Desempenho: Faixas PCIe e Interconexões de GPU

Configuração Impacto na Inferência de LLM Impacto no Treinamento de LLM Notas Principais
PCIe x16 por GPU Tempos de carregamento mais rápidos, ideal para modelos grandes Melhor para treinamento multi-GPU Padrão para workstations e servidores de alto desempenho
PCIe x8 por GPU Carregamento ligeiramente mais lento, queda de inferência negligenciável Aceitável para multi-GPU Pequena perda de desempenho, especialmente em configurações de 2-4 GPUs
PCIe x4 por GPU Carregamento visivelmente mais lento, impacto menor na inferência Desaceleração significativa no treinamento Não recomendado para treinamento, mas funciona para inferência com GPU única
SXM/NVLink (ex.: H100) Comunicações inter-GPU muito mais rápidas, inferência até 2,6x mais rápida vs. PCIe Superior para treinamento em larga escala Ideal para LLMs em escala empresarial, permite unificação de GPUs
  • SXM vs. PCIe: O fator de forma SXM da NVIDIA (com NVLink) oferece uma largura de banda inter-GPU significativamente maior em comparação com o PCIe. Por exemplo, as GPUs H100 SXM5 entregam inferência de LLMs até 2,6x mais rápida do que as H100 PCIe, especialmente em configurações multi-GPU. Isso é crucial para modelos grandes e cargas de trabalho distribuídas.
  • Geração de PCIe: A atualização do PCIe 3.0 para 4.0 ou 5.0 oferece mais largura de banda, mas para a maioria das inferências de LLMs em pequena escala ou com GPU única, o benefício prático é mínimo. Para grandes clusters ou treinamento pesado com múltiplas GPUs, gerações superiores de PCIe ajudam na paralelização e na transferência de dados.

Recomendações Práticas

  • Inferência de LLMs com GPU Única: A quantidade de faixas PCIe não é um grande gargalo após o carregamento do modelo. Faixas x4 são geralmente suficientes, embora x8 ou x16 reduzam os tempos de carregamento.
  • Inferência/Treinamento Multi-GPU: Prefira faixas x8 ou x16 por GPU. Contagens menores de faixas podem criar gargalos na comunicação inter-GPU, desacelerando tanto o treinamento quanto a inferência em larga escala.
  • Escala Empresarial/Pesquisa: Para os maiores modelos e o desempenho mais rápido, sistemas baseados em SXM/NVLink (ex.: DGX, HGX) são superiores, permitindo trocas de dados muito mais rápidas entre as GPUs e maior throughput.

“Operar GPUs em faixas 4x está bem, especialmente se você tiver apenas 2 GPUs. Para uma configuração de 4 GPUs, eu preferiria 8x faixas por GPU, mas operá-las em faixas 4x provavelmente apenas diminuirá o desempenho em torno de 5-10% se você parallelizar em todas as 4 GPUs.”

Resumo

  • A quantidade de faixas PCIe afeta principalmente o carregamento do modelo e a comunicação inter-GPU, não a velocidade de inferência após o modelo ser carregado.
  • Para a maioria dos usuários executando inferência de LLMs em uma GPU única, a quantidade de faixas não é uma preocupação significativa.
  • Para treinamento ou cargas de trabalho multi-GPU, mais faixas (x8/x16) e interconexões com maior largura de banda (NVLink/SXM) oferecem ganhos substanciais de desempenho.

Para mais benchmarks, escolhas de hardware e ajuste de desempenho, verifique nosso hub de Desempenho de LLMs: Benchmarks, Gargalos e Otimização.

Subscrever

Receba novos artigos sobre sistemas, infraestrutura e engenharia de IA.