Llama-Server in modalità Router: commutazione dinamica dei modelli senza riavvii
Servire e sostituire LLM senza riavvi.
Per molto tempo, llama.cpp ha avuto una limitazione evidente:
era possibile servire solo un modello per processo, e cambiare modello richiedeva un riavvio.