Comment Ollama gère les requêtes parallèles

Comment Ollama gère les requêtes parallèles

Comprendre la concurrence, la mise en file d'attente et le réglage de OLLAMA_NUM_PARALLEL pour des requêtes parallèles stables.

Ce guide explique comment Ollama gère les demandes parallèles (concurrency, mise en file d’attente et limites de ressources), et comment l’optimiser à l’aide de la variable d’environnement OLLAMA_NUM_PARALLEL (et des réglages associés).

Test de Deepseek-R1 sur Ollama

Test de Deepseek-R1 sur Ollama

« Comparaison de deux modèles deepseek-r1 avec deux modèles de base »

DeepSeek’s première génération de modèles de raisonnement avec des performances comparables à celles d’OpenAI-o1, incluant six modèles denses distillés à partir de DeepSeek-R1 basés sur Llama et Qwen.

S'abonner

Recevez de nouveaux articles sur les systèmes, l'infrastructure et l'ingénierie IA.