Vous allez à Black Hat ? Rencontrons-nous

Industrie

Une faille critique dans vLLM expose le talon d'Achille de l'infrastructure IA

December 5, 2025

Eric Schwake
Responsable du marketing produit

Alors que le monde s'inquiète du « jailbreak » des LLM ou de la prévention de leurs hallucinations, une nouvelle vulnérabilité critique vient de nous rappeler une vérité fondamentale : L'IA n'est que du logiciel, et les logiciels comportent des bugs.

Une faille critique récemment découverte (CVE-2025-62164) dans vLLM, l'une des bibliothèques les plus populaires pour le déploiement de grands modèles de langage, permet à des attaquants d'exécuter du code à distance (RCE) ou de faire planter des serveurs par le simple envoi d'une requête API malveillante.

Il ne s'agit pas d'une défaillance du modèle d'IA, mais de l'infrastructure API qui le dessert. C'est précisément le type de menace que Salt Security est conçu pour contrer.

La faille : désérialisation non sécurisée dans l'API

La vulnérabilité réside dans la manière dont vLLM traite les embeddings de prompts, ces données mathématiques complexes envoyées à son API de complétion.

Considérez ces embeddings comme des colis numériques que le serveur d'IA doit ouvrir et utiliser. Pour être envoyés efficacement, ils sont emballés (sérialisés) dans un format spécifique. Lorsque vLLM les reçoit, il les déballe (désérialise) pour traiter la requête.

Voici le problème : vLLM déballait ces paquets de données sans vérifier au préalable s'ils étaient sûrs. Il faisait aveuglément confiance au contenu. Un attaquant peut concevoir un paquet « piégé » malveillant qui semble être une donnée d'IA valide en apparence. Mais lorsque le serveur vLLM tente de le déballer, les données malveillantes perturbent le système, provoquant un écrasement de sa propre mémoire. Cela peut faire planter le serveur ou, pire, permettre à l'attaquant d'exécuter ses propres commandes.

L'impact :

  1. Déni de service (DoS) : Plantage du serveur d'inférence en production.
  2. Exécution de code à distance (RCE) : Exécution potentielle de code arbitraire sur le serveur, offrant à l'attaquant un point d'ancrage au sein de votre infrastructure d'IA.

Pourquoi les outils traditionnels passent à côté de cela

Cette vulnérabilité met en lumière un angle mort majeur des approches de sécurité classiques :

  1. L'analyse statique (SAST) passe souvent à côté : La vulnérabilité ne résidait pas uniquement dans le code de vLLM ; elle résultait d'une modification en amont dans PyTorch (désactivation des vérifications par défaut) que vLLM n'a pas prise en compte. Les scanners de code peinent souvent à détecter ces interactions complexes entre dépendances.
  2. Les WAF standards sont aveugles : Pour un WAF traditionnel, l'attaque ressemble à une requête API standard contenant un bloc de données en Base64. Sans compréhension du contexte de l'API d'IA ou de la structure d'une charge utile de tenseur valide, le WAF laisse passer la requête.

Comment Salt Security protège votre environnement d'exécution IA

Chez Salt, nous soutenons depuis longtemps que la sécurisation de l'IA passe par la sécurisation du trafic API qui l'alimente. Cette faille dans vLLM est un exemple type de « risque d'infrastructure » qui ne peut être stoppé de manière fiable qu'au niveau de la couche réseau/exécution.

Voici comment la plateforme de protection des API de Salt Security aide à atténuer les menaces comme la CVE-2025-62164 :

1. Visibilité complète

On ne peut pas sécuriser ce que l'on ne voit pas. Dans la précipitation pour développer des IA agentiques, les équipes de science des données déploient souvent des instances expérimentales qui échappent à la vigilance de la sécurité informatique. Salt met en lumière ces projets d'« IA fantôme » en découvrant automatiquement les API et les outils sur lesquels ils reposent, y compris l'API Completions de vLLM, afin que vous puissiez les sécuriser avant qu'ils ne deviennent une porte d'entrée pour les attaquants.

2. Détection d'anomalies comportementales

Salt apprend à identifier le trafic « normal » de vos applications d'IA. Tout comme une société de cartes bancaires repère les dépenses inhabituelles, Salt sait à quoi doit ressembler une requête valide pour votre modèle d'IA.

  • Repérer la fraude : Un paquet « piégé » malveillant est généralement très différent d'un paquet légitime ; il peut avoir une taille incorrecte, une structure étrange ou contenir des modèles de données inappropriés.
  • Bloquer la menace : Lorsque Salt détecte un écart par rapport à la ligne de base normale, nous pouvons aider à bloquer la requête à la périphérie, stoppant ainsi l'attaque avant qu'elle n'atteigne votre infrastructure d'IA vulnérable.

3. Stopper les mouvements latéraux

Si un attaquant parvient à exploiter une telle vulnérabilité, sa prochaine étape sera un mouvement latéral « Est-Ouest » pour atteindre des bases de données internes ou d'autres services. Salt surveille le trafic API interne et vous alerte immédiatement si un serveur d'inférence commence à effectuer des appels non autorisés vers des systèmes internes sensibles.

L'essentiel : sécurisez le canal, pas seulement le modèle

La vulnérabilité vLLM est un signal d'alarme. Nous ne pouvons pas nous concentrer uniquement sur la « sécurité de l'IA » (alignement, biais, hallucinations) en ignorant la « cybersécurité de l'IA » (infrastructure, API, exécution de code à distance).

Vos modèles d'IA sont des actifs précieux fonctionnant sur une infrastructure vulnérable. Pour les protéger, vous avez besoin d'une plateforme de sécurité qui comprend les API dont ils dépendent.

Si vous souhaitez en savoir plus sur Salt et sur la façon dont nous pouvons vous aider, veuillez nous contacter, planifier une démonstration, ou visiter notre site web. Vous pouvez également obtenir une évaluation gratuite de la surface d'attaque de votre API auprès de l'équipe de recherche de Salt Security et découvrir ce que les attaquants savent déjà.

Nos derniers articles