Skip to main content
Benchmarks

Medido, no afirmado.

Las decisiones de cumplimiento no pueden depender del azar. Por eso Agentic360 no toma las decisiones regulatorias con un modelo de lenguaje, sino con un motor de políticas determinista (Open Policy Agent) — y lo medimos: en cinco dominios regulatorios, con 65 casos de prueba anotados jurídicamente, incluidos casos límite y excepciones.

100 %

decisiones correctas (65/65 casos gold standard)

< 0,7 ms

latencia por decisión (p99, un solo núcleo)

100 %

determinista — misma pregunta, misma respuesta

Qué medimos

El benchmark cubre la factura electrónica (EN 16931/XRechnung), el Reglamento de IA de la UE, EEG/EnWG, NIS2 y el RGPD — más el motor de partes afectadas que determina qué clientes se ven alcanzados por cada cambio regulatorio. Cinco métricas, todas reproducibles:

B1

Exactitud

65/65 (100 %)

Cada caso de prueba es un perfil realista con la decisión jurídicamente esperada — incluidos casos límite como 49 vs. 50 empleados (NIS2) o 100,0 vs. 100,1 kWp (EEG). Ni falsos positivos ni falsos negativos.

B2

Cobertura

97,7 %

Porcentaje de la lógica de políticas realmente ejercitada por el corpus de pruebas — las reglas no solo están escritas, están verificadas.

B3

Latencia y rendimiento

5.300–7.800/s

Decisiones por segundo en un solo núcleo de CPU, sin GPU y sin API en la nube. p99 por debajo de 0,7 milisegundos.

B4

Determinismo

100 %

Cinco ejecuciones idénticas por dominio, resultados idénticos byte a byte, verificados con SHA-256. La propiedad que ningún sistema puramente generativo puede ofrecer.

B5

Explicabilidad

100 %

Cada decisión positiva indica la regla y el motivo — legible por máquina e incorporada directamente al registro de auditoría.

Latencia por dominio regulatorio

Medido con OPA en un solo núcleo de CPU — la configuración más conservadora. En la práctica: un cambio regulatorio se comprueba contra 10.000 perfiles de clientes en menos de 2 segundos.

DominioMedia msp99 msDecisiones/s
Análisis de afectados (Affected Engine)0,190,665.351
Reglamento de IA de la UE (clasificación de riesgo)0,130,527.580
Factura electrónica (EN 16931 / XRechnung)0,140,556.999
EEG / EnWG § 14a0,130,427.839
RGPD0,130,477.752
NIS2 (alcance)0,140,487.227

Por qué no dejamos las decisiones al LLM

El modelo de lenguaje entiende su pregunta y sus documentos. El veredicto lo emite el motor de políticas. Esta división del trabajo es mensurablemente mejor:

Solo LLM (chatbots de IA genéricos)Agentic360 (híbrido)
¿Misma pregunta → misma respuesta?no garantizadosiempre — demostrado
Tiempo de respuesta de la comprobaciónsegundosmenos de 1 milisegundo
Casos límite (p. ej. 49 vs. 50 empleados)propenso a errores100 % correcto en pruebas
¿Verificable para auditores y autoridades?no — prosasí — regla + motivo
¿Los datos salen de su empresa?normalmente síno — local, CPU
Coste por comprobacióntarifas de API≈ 0 €

Transparencia

Todas las cifras provienen de una medición reproducible (julio de 2026, OPA) contra un gold standard anotado internamente de 65 casos. El «100 % de exactitud» se refiere a este corpus de pruebas — no a cualquier situación imaginable — y no sustituye el asesoramiento jurídico. Proporcionamos la suite de pruebas completa bajo petición: recalcular es expresamente bienvenido.

Recalcular es bienvenido.

Le mostramos el benchmark en vivo — con sus propios escenarios si lo desea. 30 minutos, sin bucle comercial.

Solicitar una demo