Suite et fin de notre série sur l'auto-hébergement d'un LLM. Au programme : le KV cache et le mécanisme d'attention, le scaling multi-GPU avec KServe et Kubernetes, la quantification, PagedAttention, le KV offloading, et des benchmarks vLLM chiffrés.… Lire la suite
15 min read
02 sept. 2026
Lâcher une IA dans votre projet sans le voir se dégrader : le dispositif complet.… Lire la suite
13 min read
26 août 2026
Un serveur GPU, un an d'expérimentations : ce premier article vulgarise ce qu'est réellement un LLM (poids, biais, softmax) avant de le mettre à disposition avec vLLM, le GPU Operator NVIDIA et Kubernetes.… Lire la suite
13 min read
19 août 2026









