July 20, 2026
Porte dérobée dans la chaîne d'approvisionnement de modèles d'IA implantée pour moins de 100 $ à l'aide de 10 exemples d'entraînement corrompus
Les chercheurs en sécurité de Semgrep ont démontré qu'un LLM à poids ouverts peut être empoisonné avec seulement 10 exemples d'entraînement corrompus pour un coût inférieur à 75 £, poussant le modèle à générer du code contenant des failles de sécurité cachées, et ce, même pour des requêtes inédites. Cette porte dérobée est invisible pour les évaluations de sécurité standard et n'altère pas le comportement normal en dehors des contextes déclencheurs. Contrairement aux idées reçues, les modèles plus volumineux se sont révélés plus faciles à empoisonner. Indépendamment, le chercheur David Kaplan a démontré qu'un modèle empoisonné pouvait exfiltrer silencieusement des données utilisateur via un outil d'API de messagerie, sans aucun signe visible pour l'utilisateur.
Lorsqu'un modèle empoisonné effectue des appels API anormaux, comme une exfiltration de données inattendue via un point de terminaison d'e-mail ou de webhook, le moteur de référence comportementale de Salt signale cet écart par rapport aux normes de trafic établies. Cette couche de détection à l'exécution intercepte ce que les évaluations de sécurité au niveau du modèle ignorent totalement.
LLM
Lire l'article complet