Quando comecei a experimentar com LLMs, as interfaces gráficas (UIs) para eles estavam em desenvolvimento ativo
e agora algumas delas são realmente boas.
Pode conectar-se a vários backends existentes, como Anthropic, Cohere, OpenAI, NvidiaNIM, MistralAI, etc.,
e hospedar modelos por conta própria - veja a seção Cortex na captura de tela abaixo - mostrando o Jan baixando e hospedando localmente o Llama3 8b q4 e o Phi3 medium (q4).
Prós (O que gostei):
Interface intuitiva
Capacidade de experimentar com a temperatura do modelo, topp, penalidades de frequência e presença, e prompts de sistema.
Fornece servidor de API
Contrapontos:
De alguma forma lento no meu sistema operacional baseado em Ubuntu. No Windows, funcionou corretamente.
Pode conectar-se a muitos backends, mas todos eles são gerenciados. Seria bom ter a opção de usar o Ollama.
Não há muitas variantes de modelos disponíveis para auto-hospedagem no Cortex. Também não há muitas opções de quantização.
Sim, o gguf do Huggingface é excelente. Mas eu queria
reutilizar o que o ollama já baixou e carregou na VRAM
Vane é uma das entradas mais pragmáticas no espaço de “busca de IA com citações”: um motor de respostas auto-hospedado que combina recuperação da web em tempo real com LLMs locais ou na nuvem, mantendo toda a pilha sob seu controle.
Visão geral rápida das principais interfaces de usuário para Ollama em 2025
O Ollama hospedado localmente permite executar modelos de linguagem grandes na sua própria máquina, mas usá-lo via linha de comando não é amigável.
Aqui estão vários projetos de código aberto que oferecem interfaces estilo ChatGPT que se conectam a uma instância local do Ollama.
Executando um serviço estilo Copilot localmente? Fácil!
Isso é muito emocionante!
Em vez de chamar o Copilot ou o Perplexity.ai e contar a todos o que você busca,
agora você pode hospedar um serviço similar no seu próprio PC ou laptop!
Subscrever
Receba novos artigos sobre sistemas, infraestrutura e engenharia de IA.