Llamacpp

llama.cpp vs Ollama en 2026 : Quel runtime choisir ?

llama.cpp vs Ollama en 2026 : Quel runtime choisir ?

« Quand llama-server surpasse Ollama »

Ollama et llama.cpp sont souvent comparés comme s’ils étaient des moteurs d’inférence rivaux. Le véritable choix se fait entre un service de gestion de modèles et un kit d’outils que vous pilotez directement.

Le KV Cache sur des GPU de 16 Go : faire tenir réellement les contextes longs

Le KV Cache sur des GPU de 16 Go : faire tenir réellement les contextes longs

Pourquoi le contexte de 128 Ko échoue sur 16 Go

Un modèle peut revendiquer une fenêtre de contexte de 128K et échouer pourtant à 40K jetons sur un GPU de 16 Go. La limite architecturale ne promettait jamais que les poids, le cache KV, les tampons de calcul et le compositeur de bureau tiendraient simultanément sur votre carte.