Ingénieur Optimisateur vLLM
À propos de la mission
Auditer l’architecture d’inférence existante et identifier les axes d’optimisation. Évaluer la scalabilité, les performances et la résilience de l’architecture cible. Optimiser le serving des modèles avec vLLM et Triton : cache KV, prefix caching, parallélisme, streaming, sorties JSON et tool calling. Intégrer et co
Créer mon profil gratuitement