Self-Hosting

Como o Ollama Lida com Requetes Paralelos

Como o Ollama Lida com Requetes Paralelos

Compreenda a concorrencia do Ollama, a fila de processamento e como ajustar OLLAMA_NUM_PARALLEL para solicitações paralelas estáveis.

Este guia explica como o Ollama lida com requisições paralelas (concorrência, fila e limites de recursos), e como ajustar isso usando a variável de ambiente OLLAMA_NUM_PARALLEL (e outras configurações relacionadas).

Testando o Deepseek-R1 no Ollama

Testando o Deepseek-R1 no Ollama

Comparando dois modelos deepseek-r1 com dois modelos base

A primeira geração de modelos de raciocínio da DeepSeek com desempenho comparável ao OpenAI-o1, incluindo seis modelos densos destilados do DeepSeek-R1 com base em Llama e Qwen.