decisiones correctas (65/65 casos gold standard)
Medido, no afirmado.
Las decisiones de cumplimiento no pueden depender del azar. Por eso Agentic360 no toma las decisiones regulatorias con un modelo de lenguaje, sino con un motor de políticas determinista (Open Policy Agent) — y lo medimos: en cinco dominios regulatorios, con 65 casos de prueba anotados jurídicamente, incluidos casos límite y excepciones.
latencia por decisión (p99, un solo núcleo)
determinista — misma pregunta, misma respuesta
Qué medimos
El benchmark cubre la factura electrónica (EN 16931/XRechnung), el Reglamento de IA de la UE, EEG/EnWG, NIS2 y el RGPD — más el motor de partes afectadas que determina qué clientes se ven alcanzados por cada cambio regulatorio. Cinco métricas, todas reproducibles:
Exactitud
Cada caso de prueba es un perfil realista con la decisión jurídicamente esperada — incluidos casos límite como 49 vs. 50 empleados (NIS2) o 100,0 vs. 100,1 kWp (EEG). Ni falsos positivos ni falsos negativos.
Cobertura
Porcentaje de la lógica de políticas realmente ejercitada por el corpus de pruebas — las reglas no solo están escritas, están verificadas.
Latencia y rendimiento
Decisiones por segundo en un solo núcleo de CPU, sin GPU y sin API en la nube. p99 por debajo de 0,7 milisegundos.
Determinismo
Cinco ejecuciones idénticas por dominio, resultados idénticos byte a byte, verificados con SHA-256. La propiedad que ningún sistema puramente generativo puede ofrecer.
Explicabilidad
Cada decisión positiva indica la regla y el motivo — legible por máquina e incorporada directamente al registro de auditoría.
Latencia por dominio regulatorio
Medido con OPA en un solo núcleo de CPU — la configuración más conservadora. En la práctica: un cambio regulatorio se comprueba contra 10.000 perfiles de clientes en menos de 2 segundos.
| Dominio | Media ms | p99 ms | Decisiones/s |
|---|---|---|---|
| Análisis de afectados (Affected Engine) | 0,19 | 0,66 | 5.351 |
| Reglamento de IA de la UE (clasificación de riesgo) | 0,13 | 0,52 | 7.580 |
| Factura electrónica (EN 16931 / XRechnung) | 0,14 | 0,55 | 6.999 |
| EEG / EnWG § 14a | 0,13 | 0,42 | 7.839 |
| RGPD | 0,13 | 0,47 | 7.752 |
| NIS2 (alcance) | 0,14 | 0,48 | 7.227 |
Por qué no dejamos las decisiones al LLM
El modelo de lenguaje entiende su pregunta y sus documentos. El veredicto lo emite el motor de políticas. Esta división del trabajo es mensurablemente mejor:
| Solo LLM (chatbots de IA genéricos) | Agentic360 (híbrido) | |
|---|---|---|
| ¿Misma pregunta → misma respuesta? | no garantizado | siempre — demostrado |
| Tiempo de respuesta de la comprobación | segundos | menos de 1 milisegundo |
| Casos límite (p. ej. 49 vs. 50 empleados) | propenso a errores | 100 % correcto en pruebas |
| ¿Verificable para auditores y autoridades? | no — prosa | sí — regla + motivo |
| ¿Los datos salen de su empresa? | normalmente sí | no — local, CPU |
| Coste por comprobación | tarifas de API | ≈ 0 € |
Transparencia
Todas las cifras provienen de una medición reproducible (julio de 2026, OPA) contra un gold standard anotado internamente de 65 casos. El «100 % de exactitud» se refiere a este corpus de pruebas — no a cualquier situación imaginable — y no sustituye el asesoramiento jurídico. Proporcionamos la suite de pruebas completa bajo petición: recalcular es expresamente bienvenido.
Recalcular es bienvenido.
Le mostramos el benchmark en vivo — con sus propios escenarios si lo desea. 30 minutos, sin bucle comercial.
Solicitar una demo