S> initializing
SLAEGA·19
poc-prototypedevops-infrastructureapi-webservice

LLM auto-hébergé & MLOps — inférence privée

Mar 20261 min de lecture
LLM auto-hébergé …
poc-prototype
devops-infras…
api-webservice
IA
LLM
Ollama
vLLM
MLOps
Kubernetes
GPU
DevOps
POC
drag

LLM auto-hébergé & MLOps — POC DevOps × IA

L'angle. Croiser mon socle DevOps et l'IA : servir des modèles de langage en privé, sans dépendre d'une API tierce, avec la maîtrise des données et des coûts.

Ce que je prototype

  • Serving de modèles ouverts via Ollama / vLLM, exposés en API OpenAI-compatible.
  • Déploiement sur Kubernetes/k3s, gestion GPU et mise à l'échelle.
  • Observabilité de l'inférence (latence, tokens/s, coût par requête).
  • Cache, quantization et arbitrages coût/performance.

Stack

Ollama · vLLM · Kubernetes · Docker · GPU · API-first

POC — banc d'essai IA/MLOps, non déployé en production.

Technologies

Stack du projet

IALLMOllamavLLMMLOpsKubernetesGPUDevOpsPOC

À explorer aussi

Projets similaires