Introdução rápida ao llama.cpp com CLI e servidor
Execute modelos GGUF com o CLI e o servidor
llama.cpp é um motor de inferência em C/C++ para modelos GGUF: llama-cli para chat interativo, llama-completion para prompts roteirizados e llama-server para uma API HTTP compatível com OpenAI.