<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>Llamacpp on Rost Glukhov | Systèmes IA et infrastructure</title>
		<link>https://www.glukhov.org/fr/tags/llamacpp/</link>
		<description>Recent content in Llamacpp on Rost Glukhov | Systèmes IA et infrastructure</description>
		<generator>Hugo</generator>
		<language>fr</language>
		
		
		
		
			<lastBuildDate>Fri, 11 Sep 2026 18:09:43 +1000</lastBuildDate>
		
			<atom:link href="https://www.glukhov.org/fr/tags/llamacpp/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>llama.cpp vs Ollama en 2026 : Quel runtime choisir ?</title>
				<link>https://www.glukhov.org/fr/llm-hosting/comparisons/llama-cpp-vs-ollama/</link>
				<pubDate>Fri, 11 Sep 2026 00:00:00 +0000</pubDate>
				<guid>https://www.glukhov.org/fr/llm-hosting/comparisons/llama-cpp-vs-ollama/</guid>
				<description>&lt;p&gt;Ollama et llama.cpp sont souvent comparés comme s&amp;rsquo;ils étaient des moteurs d&amp;rsquo;inférence rivaux. Le véritable choix se fait entre un service de gestion de modèles et un kit d&amp;rsquo;outils que vous pilotez directement.&lt;/p&gt;</description>
			</item>
			<item>
				<title>ROCm vs Vulkan pour l’hébergement local de LLM sur AMD : Guide 2026</title>
				<link>https://www.glukhov.org/fr/llm-hosting/comparisons/amd-rocm-vs-vulkan-llm-hosting/</link>
				<pubDate>Wed, 09 Sep 2026 00:00:00 +0000</pubDate>
				<guid>https://www.glukhov.org/fr/llm-hosting/comparisons/amd-rocm-vs-vulkan-llm-hosting/</guid>
				<description>&lt;p&gt;ROCm et Vulkan accélèrent tous deux les GPU AMD pour l&amp;rsquo;hébergement local de LLM, mais ils ne sont pas interchangeables. Le bon choix dépend du moteur, du GPU et de la charge de travail.&lt;/p&gt;</description>
			</item>
			<item>
				<title>Le KV Cache sur des GPU de 16 Go : faire tenir réellement les contextes longs</title>
				<link>https://www.glukhov.org/fr/llm-performance/optimization/kv-cache-16gb-long-context/</link>
				<pubDate>Tue, 08 Sep 2026 00:00:00 +0000</pubDate>
				<guid>https://www.glukhov.org/fr/llm-performance/optimization/kv-cache-16gb-long-context/</guid>
				<description>&lt;p&gt;Un modèle peut revendiquer une fenêtre de contexte de 128K et échouer pourtant à 40K jetons sur un GPU de 16 Go. La limite architecturale ne promettait jamais que les poids, le cache KV, les tampons de calcul et le compositeur de bureau tiendraient simultanément sur votre carte.&lt;/p&gt;</description>
			</item>
	</channel>
</rss>
