Hardware

Cómo Ollama maneja las solicitudes paralelas

Cómo Ollama maneja las solicitudes paralelas

Comprende la concurrencia y la gestión de colas en Ollama, y aprende a ajustar OLLAMA_NUM_PARALLEL para garantizar solicitudes paralelas estables.

Esta guía explica cómo Ollama maneja las solicitudes paralelas (concurrency, colas y límites de recursos), y cómo ajustarlo utilizando la variable de entorno OLLAMA_NUM_PARALLEL (y otros parámetros relacionados).

Prueba de velocidad de modelos de lenguaje grandes

Prueba de velocidad de modelos de lenguaje grandes

Probemos la velocidad de los LLM en GPU frente a CPU

Comparando la velocidad de predicción de varias versiones de LLMs: llama3 (Meta/Facebook), phi3 (Microsoft), gemma (Google), mistral (open source) en CPU y GPU.