Benchmarks de LLM avec 16 Go de VRAM sous llama.cpp (vitesse et contexte)
Vitesse de génération des jetons de llama.cpp sur 16 Go de VRAM (tableaux).
Ici je compare la vitesse de plusieurs LLM fonctionnant sur un GPU doté de 16 Go de VRAM, et je choisis le meilleur pour l’auto-hébergement.