Benchmarks de LLMs com 16 GB de VRAM usando llama.cpp (velocidade e contexto)
Velocidade de tokens do llama.cpp em 16 GB de VRAM (tabelas).
Aqui estou comparando a velocidade de vários LLMs executados em uma GPU com 16GB de VRAM, e escolhendo o melhor para auto-hospedagem.