Frontends de LLM

Quando comecei a experimentar com LLMs, as interfaces gráficas (UIs) para eles estavam em desenvolvimento ativo e agora algumas delas são realmente boas.

Jan - multiplatform ui for LLMs

Jan

  • Jan está disponível para Windows, Linux e Mac.

Tem temas escuro, claro e transparente.

Jan LLM frontend - main window

Pode conectar-se a vários backends existentes, como Anthropic, Cohere, OpenAI, NvidiaNIM, MistralAI, etc., e hospedar modelos por conta própria - veja a seção Cortex na captura de tela abaixo - mostrando o Jan baixando e hospedando localmente o Llama3 8b q4 e o Phi3 medium (q4).

Jan LLM frontend - config options

Prós (O que gostei):

  • Interface intuitiva
  • Capacidade de experimentar com a temperatura do modelo, topp, penalidades de frequência e presença, e prompts de sistema.
  • Fornece servidor de API

Contrapontos:

  • De alguma forma lento no meu sistema operacional baseado em Ubuntu. No Windows, funcionou corretamente.
  • Pode conectar-se a muitos backends, mas todos eles são gerenciados. Seria bom ter a opção de usar o Ollama.
  • Não há muitas variantes de modelos disponíveis para auto-hospedagem no Cortex. Também não há muitas opções de quantização.
  • Sim, o gguf do Huggingface é excelente. Mas eu queria
    • reutilizar o que o ollama já baixou e carregou na VRAM
    • não hospedar o mesmo modelo em todos os lugares

KoboldAI

KoboldAI

Muito proeminente

Silly Tavern

Silly Tavern

Outro muito versátil

LLM Studio

LLM Studio não é a minha interface gráfica favorita para LLMs, mas tem melhor acesso aos modelos do huggingface.

Ollama via Linha de Comando

Sim, essa também é uma interface do usuário, apenas uma de linha de comando.

Para executar o LLM llama3.1, é necessário:

ollama run llama3.1

quando terminar, envie um comando para sair da linha de comando do ollama:

/bye

Ollama via cURL

Instale o cUrl, caso ainda não o tenha feito:

sudo apt-get install curl

Para chamar o llm local mistral nemo q8 hospedado no ollama - crie um arquivo local com o prompt p.json:

{
  model: mistral-nemo:12b-instruct-2407-q8_0,
  prompt: What is post-modernism?,
  stream: false
}

e agora execute no terminal bash:

curl -X POST http://localhost:11434/api/generate -d @p.json > p-result.json

o resultado estará no arquivo p-result.json

se você quiser apenas imprimir o resultado:

curl -X POST http://localhost:11434/api/generate -d @p.json

Também:

Não testei esses, mas é uma lista bastante abrangente de UIs para LLMs:

Início Rápido do Vane (Perplexica 2.0) com Ollama e llama.cpp

Início Rápido do Vane (Perplexica 2.0) com Ollama e llama.cpp

Busca de IA autohospedada com LLMs locais

Vane é uma das entradas mais pragmáticas no espaço de “busca de IA com citações”: um motor de respostas auto-hospedado que combina recuperação da web em tempo real com LLMs locais ou na nuvem, mantendo toda a pilha sob seu controle.

Interfaces de Chat para Instâncias Locais do Ollama

Interfaces de Chat para Instâncias Locais do Ollama

Visão geral rápida das principais interfaces de usuário para Ollama em 2025

O Ollama hospedado localmente permite executar modelos de linguagem grandes na sua própria máquina, mas usá-lo via linha de comando não é amigável. Aqui estão vários projetos de código aberto que oferecem interfaces estilo ChatGPT que se conectam a uma instância local do Ollama.

Farfalle x Perplexica

Farfalle x Perplexica

Comparando dois motores de busca de IA auto-hospedados

Comida incrível é um prazer também para os seus olhos. Mas, neste post, compararemos dois sistemas de busca baseados em IA, Farfalle e Perplexica.

Hospedagem própria do Perplexica - com Ollama

Hospedagem própria do Perplexica - com Ollama

Executando um serviço estilo Copilot localmente? Fácil!

Isso é muito emocionante! Em vez de chamar o Copilot ou o Perplexity.ai e contar a todos o que você busca, agora você pode hospedar um serviço similar no seu próprio PC ou laptop!

Subscrever

Receba novos artigos sobre sistemas, infraestrutura e engenharia de IA.