Llm

Ollama no Docker Compose com GPU e Armazenamento Persistente de Modelos

Ollama no Docker Compose com GPU e Armazenamento Persistente de Modelos

Servidor Ollama com prioridade na criação, GPU e persistência.

Ollama funciona muito bem em hardware nativo. Ele fica ainda mais interessante quando o tratamos como um serviço: um endpoint estável, versões fixas, armazenamento persistente e uma GPU que está disponível ou simplesmente não está.

SGLang QuickStart: Instale, Configure e Execute LLMs via API OpenAI

SGLang QuickStart: Instale, Configure e Execute LLMs via API OpenAI

Execute modelos abertos com rapidez usando o SGLang.

O SGLang é um framework de serviço de alto desempenho para grandes modelos de linguagem e modelos multimodais, construído para fornecer inferência de baixa latência e alto throughput, desde uma única GPU até clusters distribuídos.

Início Rápido do LocalAI: Execute LLMs Compatíveis com OpenAI Localmente

Início Rápido do LocalAI: Execute LLMs Compatíveis com OpenAI Localmente

Hospede APIs compatíveis com OpenAI com o LocalAI em minutos.

O LocalAI é um servidor de inferência de auto-hospedagem, com prioridade local, projetado para funcionar como uma API OpenAI plug-and-play para executar cargas de trabalho de IA no seu próprio hardware (laptop, estação de trabalho ou servidor local).

Introdução rápida ao llama.cpp com CLI e servidor

Introdução rápida ao llama.cpp com CLI e servidor

Execute modelos GGUF com o CLI e o servidor

llama.cpp é um motor de inferência em C/C++ para modelos GGUF: llama-cli para chat interativo, llama-completion para prompts roteirizados e llama-server para uma API HTTP compatível com OpenAI.