API

De Ollama à vLLM : quand migrer votre serveur LLM local

De Ollama à vLLM : quand migrer votre serveur LLM local

Quand passer d'Ollama à vLLM

Ollama est l’un des moyens les plus simples pour exécuter un modèle de langage localement, mais cette commodité peut masquer le moment où une expérimentation locale devient un service d’inférence partagé nécessitant une meilleure planification et une meilleure observabilité.

Sécurité des agents A2A et MCP : identité, délégation et traçabilité

Sécurité des agents A2A et MCP : identité, délégation et traçabilité

La sécurité du protocole concerne qui peut agir, non le modèle.

L’injection de prompt attire la majeure partie de l’attention en matière de sécurité dans les systèmes de LLM, et cela est justifié, mais ce n’est pas le seul problème une fois que les agents commencent à utiliser des outils et à déléguer du travail à d’autres agents.

L’idempotence dans les systèmes distribués qui fonctionne vraiment

L’idempotence dans les systèmes distribués qui fonctionne vraiment

Évitez les effets de bord en double

L’idempotence dans les systèmes distribués est la propriété qui vous sauve lorsque le réseau ment, que la file d’attente réessaie, que le client panique et que l’opérateur appuie sur « rejouer ». Dans les systèmes de production, la livraison en double est normale. Les effets secondaires dupliqués constituent le bug.

Démarrage rapide de Vane (Perplexica 2.0) avec Ollama et llama.cpp

Démarrage rapide de Vane (Perplexica 2.0) avec Ollama et llama.cpp

Recherche IA auto-hébergée avec des LLM locaux

Vane est l’une des entrées les plus pragmatiques dans le domaine de la « recherche IA avec citations » : un moteur de réponse auto-hébergé qui combine la récupération web en direct avec des LLM locaux ou cloud, tout en gardant toute la pile sous votre contrôle.

Introduction à llama.cpp avec CLI et Serveur

Introduction à llama.cpp avec CLI et Serveur

Comment installer, configurer et utiliser OpenCode

Je reviens sans cesse à llama.cpp pour l’inférence locale : il vous offre un contrôle que Ollama et d’autres solutions abstraissent, et il fonctionne simplement. Il est facile d’exécuter des modèles GGUF de manière interactive avec llama-cli ou d’exposer une API HTTP compatible OpenAI avec llama-server.

Airtable pour les développeurs et les DevOps - Plans, API, Webhooks et exemples en Go/Python

Airtable pour les développeurs et les DevOps - Plans, API, Webhooks et exemples en Go/Python

Airtable - Limites du plan gratuit, API, webhooks, Go et Python.

Airtable est mieux pensé comme une plateforme d’application à faible code construite autour d’une interface collaborative “ressemblant à une feuille de calcul” - idéale pour créer rapidement des outils opérationnels (suivi interne, CRM léger, pipelines de contenu, files d’attente d’évaluation d’IA) où les non-développeurs ont besoin d’une interface amicale, mais les développeurs ont aussi besoin d’une surface API pour l’automatisation et l’intégration.