Self-Hosting

Come Ollama gestisce le richieste parallele

Come Ollama gestisce le richieste parallele

Comprendere la concorrenza di Ollama, l'implementazione delle code (queueing) e come ottimizzare OLLAMA_NUM_PARALLEL per garantire richieste parallele stabili.

Questa guida spiega come Ollama gestisce le richieste parallele (concorrenza, code di attesa e limiti delle risorse) e come ottimizzarlo utilizzando la variabile d’ambiente OLLAMA_NUM_PARALLEL (e le relative impostazioni).

Test di Deepseek-R1 su Ollama

Test di Deepseek-R1 su Ollama

Confronto tra due modelli deepseek-r1 e due modelli base

DeepSeek’s prima generazione di modelli di ragionamento con prestazioni paragonabili a quelle di OpenAI-o1, inclusi sei modelli densi distillati da DeepSeek-R1 basati su Llama e Qwen.