Llm

Ollama in Docker Compose con GPU e archiviazione persistente dei modelli

Ollama in Docker Compose con GPU e archiviazione persistente dei modelli

Server Ollama con approccio compose-first, GPU e persistenza.

Ollama funziona egregiamente su hardware nudo (bare metal). Diventa ancora più interessante quando lo si tratta come un servizio: un endpoint stabile, versioni bloccate, archiviazione persistente e una GPU che è disponibile o non lo è.

llama.cpp: avvio rapido con CLI e Server

llama.cpp: avvio rapido con CLI e Server

Come installare, configurare e utilizzare OpenCode

Continuo a tornare a llama.cpp per l’inferenza locale: offre un livello di controllo che Ollama e altri strumenti astraggono, e funziona semplicemente. È facile eseguire modelli GGUF in modo interattivo con llama-cli o esporre un’API HTTP compatibile con OpenAI con llama-server.