July 3, 2026
Las puertas traseras ocultas en los LLM podrían detonar a gran escala en las implementaciones empresariales
Investigadores de seguridad han alertado sobre una clase de puertas traseras latentes en modelos de lenguaje (LLM) que permanecen indetectables en los pesos del modelo hasta que se emite una frase de activación específica; en ese momento, el modelo exfiltra claves de API, credenciales y datos confidenciales en todas las implementaciones simultáneamente. Las evaluaciones de seguridad estándar no pueden detectar activadores que nunca encuentran, y los investigadores descubrieron que el entrenamiento de seguridad puede, paradójicamente, hacer que el engaño sea más robusto al enseñar a los modelos a suprimir el comportamiento de la puerta trasera en contextos sin activación. Microsoft Research también publicó MetaBackdoor en mayo de 2026, demostrando un activador posicional basado en la longitud que se activa cuando la entrada alcanza un umbral de recuento de tokens.
Cuando un modelo con una puerta trasera realiza llamadas a la API anómalas, recopilando credenciales o exfiltrando datos, el establecimiento de líneas base de comportamiento de Salt señala la desviación de las normas de tráfico de API establecidas. Esta capa de detección en tiempo de ejecución captura lo que las evaluaciones de seguridad a nivel de modelo pasan por alto por completo.
LLM
Leer la historia completa