ACTIVOPython2026

El problema

Auditar una aplicación LLM se hace demasiadas veces a base de anécdotas: «le saqué una frase que no debía». Sin taxonomía ni métricas, dos auditorías no se pueden comparar, no se puede medir si un cambio (un filtro, un system prompt más estricto) mejora algo y el informe final no se puede reproducir.

Enfoque

NORN es un CLI que ejecuta campañas adversarias estructuradas contra modelos, sistemas RAG y agentes, con tres decisiones de diseño:

  • Taxonomía en tres capas: L1 modelo standalone (inyección de prompts, jailbreak, sufijos adversariales, evasión semántica, fuga del system prompt, extracción de datos de entrenamiento), L2 sistemas RAG (inyección indirecta, envenenamiento de índice, exfiltración vía recuperación contaminada) y L3 agentes con herramientas (abuso de herramientas, escalado de privilegios, exfiltración cross-tool).
  • 16 técnicas codificadas (L1_AT_01–10, L2_AT_01–03, L3_AT_01–03), mapeadas a OWASP Top 10 for LLM, MITRE ATLAS y NIST AI RMF.
  • Medir, no impresionar: puntuación heurística más un LLM judge, y métricas de éxito de ataque y de error — ASR, FAR/FRR, PSR@K, TDS, UAR, CTER y KCCR — con exportación a JSON, CSV, Excel y HTML para que el informe salga de la herramienta y no de una hoja de cálculo.

Resultados

Sobre cuatro modelos (Gemma 4 31B, MiniMax M2.5, Nemotron 3 Super y Qwen3 Coder Next): 48 campañas, 924 casos y 4.470 réplicas.

  • Gemma 4 31B fue el más vulnerable en baseline (ASR = 0,2037).
  • El hardening de la capa L1 reduce el ASR en Gemma 4, pero lo incrementa en MiniMax (de 0,0530 a 0,1230).
  • El hardening de la capa L3 no redujo el UAR: al revisar los casos, el fallo no está en la salida textual sino en la decisión de invocar la herramienta.
  • KCCR no produjo valores significativos y necesita validación end-to-end.

Publico también lo que no salió bien porque es lo que cambia decisiones: si el hardening sube el ASR en uno de los cuatro modelos, eso importa más que cualquier tabla de éxitos.

Cómo se reproduce

  • Memoria del TFM (80 páginas): metodología, taxonomía completa, configuración de las campañas, definición de cada métrica y análisis de resultados. Está enlazada arriba.
  • Repositorio: el CLI con la ejecución de campañas, el scoring y la exportación de informes.

Límites

Un ASR mide el éxito de un ataque concreto en unas condiciones concretas, no la seguridad del sistema completo. La taxonomía cubre texto: no entra en multimodal ni en ajuste fino. El LLM judge añade coste y su propia variabilidad al scoring. Y KCCR, tal como está implementada, no ha demostrado ser una métrica útil.