Skip to main content
Benchmarks

Gemessen, nicht behauptet.

Compliance-Entscheidungen dürfen nicht vom Zufall abhängen. Deshalb trifft Agentic360 regulatorische Entscheidungen nicht mit einem Sprachmodell, sondern mit einer deterministischen Policy-Engine (Open Policy Agent) — und wir messen das nach: über fünf Regulierungsdomänen, mit 65 juristisch annotierten Testfällen inklusive Grenz- und Ausnahmefällen.

100 %

korrekte Entscheidungen (65/65 Gold-Standard-Fälle)

< 0,7 ms

Latenz pro Entscheidung (p99, Single-Core)

100 %

deterministisch — gleiche Frage, gleiche Antwort

Was wir messen

Der Benchmark deckt E-Rechnung (EN 16931/XRechnung), EU AI Act, EEG/EnWG, NIS2 und DSGVO ab — plus die Affected-Party-Engine, die bei jeder Regulierungsänderung bestimmt, welche Mandanten betroffen sind. Fünf Metriken, alle reproduzierbar:

B1

Korrektheit

65/65 (100 %)

Jeder Testfall ist ein realistisches Profil mit juristisch erwarteter Entscheidung — inklusive Grenzfällen wie 49 vs. 50 Mitarbeitende (NIS2) oder 100,0 vs. 100,1 kWp (EEG). Kein False Positive, kein False Negative.

B2

Testabdeckung

97,7 %

Anteil der Policy-Logik, der vom Testkorpus tatsächlich ausgeführt wird — die Regeln sind nicht nur geschrieben, sondern geprüft.

B3

Latenz & Durchsatz

5.300–7.800/s

Entscheidungen pro Sekunde auf einem einzelnen CPU-Kern, ohne GPU und ohne Cloud-API. p99 unter 0,7 Millisekunden.

B4

Determinismus

100 %

Fünf identische Läufe pro Domäne, byte-identische Ergebnisse, SHA-256-verifiziert. Die Eigenschaft, die kein rein generatives System bieten kann.

B5

Erklärbarkeit

100 %

Jede positive Entscheidung nennt Regel und Grund — maschinenlesbar, direkt in den Audit-Trail übernommen.

Latenz pro Regulierungsdomäne

Gemessen mit OPA auf einem einzelnen CPU-Kern — der konservativsten Konfiguration. Praktisch heißt das: Eine Gesetzesänderung wird gegen 10.000 Mandantenprofile in unter 2 Sekunden geprüft.

DomäneØ msp99 msEntscheidungen/s
Betroffenheitsanalyse (Affected-Engine)0,190,665.351
EU AI Act (Risikoklassifikation)0,130,527.580
E-Rechnung (EN 16931 / XRechnung)0,140,556.999
EEG / EnWG § 14a0,130,427.839
DSGVO0,130,477.752
NIS2 (Scoping)0,140,487.227

Warum wir Entscheidungen nicht dem LLM überlassen

Das Sprachmodell versteht Ihre Frage und Ihre Dokumente. Das Urteil fällt die Policy-Engine. Diese Arbeitsteilung ist messbar besser:

LLM-only (generische KI-Chatbots)Agentic360 (Hybrid)
Gleiche Frage → gleiche Antwort?nicht garantiertimmer — nachgewiesen
Antwortzeit der Compliance-PrüfungSekundenunter 1 Millisekunde
Grenzfälle (z. B. 49 vs. 50 Mitarbeitende)fehleranfällig100 % korrekt im Test
Prüfbar für Auditor & Behörde?nein — Prosaja — Regel + Begründung
Verlassen Daten das Haus?meist janein — lokal, CPU
Kosten pro PrüfungAPI-Gebühren≈ 0 €

Transparenz

Alle Werte stammen aus einem reproduzierbaren Messlauf (Juli 2026, OPA) gegen einen intern annotierten Gold-Standard von 65 Fällen. „100 % Korrektheit" bezieht sich auf diesen Testkorpus — nicht auf alle denkbaren Sachverhalte — und ersetzt keine Rechtsberatung. Die vollständige Test-Suite stellen wir auf Anfrage bereit: nachrechnen ausdrücklich erwünscht.

Nachrechnen erwünscht.

Wir zeigen Ihnen den Benchmark live — mit Ihren eigenen Szenarien, wenn Sie möchten. 30 Minuten, keine Sales-Schleife.

Demo anfragen