korrekte Entscheidungen (65/65 Gold-Standard-Fälle)
Gemessen, nicht behauptet.
Compliance-Entscheidungen dürfen nicht vom Zufall abhängen. Deshalb trifft Agentic360 regulatorische Entscheidungen nicht mit einem Sprachmodell, sondern mit einer deterministischen Policy-Engine (Open Policy Agent) — und wir messen das nach: über fünf Regulierungsdomänen, mit 65 juristisch annotierten Testfällen inklusive Grenz- und Ausnahmefällen.
Latenz pro Entscheidung (p99, Single-Core)
deterministisch — gleiche Frage, gleiche Antwort
Was wir messen
Der Benchmark deckt E-Rechnung (EN 16931/XRechnung), EU AI Act, EEG/EnWG, NIS2 und DSGVO ab — plus die Affected-Party-Engine, die bei jeder Regulierungsänderung bestimmt, welche Mandanten betroffen sind. Fünf Metriken, alle reproduzierbar:
Korrektheit
Jeder Testfall ist ein realistisches Profil mit juristisch erwarteter Entscheidung — inklusive Grenzfällen wie 49 vs. 50 Mitarbeitende (NIS2) oder 100,0 vs. 100,1 kWp (EEG). Kein False Positive, kein False Negative.
Testabdeckung
Anteil der Policy-Logik, der vom Testkorpus tatsächlich ausgeführt wird — die Regeln sind nicht nur geschrieben, sondern geprüft.
Latenz & Durchsatz
Entscheidungen pro Sekunde auf einem einzelnen CPU-Kern, ohne GPU und ohne Cloud-API. p99 unter 0,7 Millisekunden.
Determinismus
Fünf identische Läufe pro Domäne, byte-identische Ergebnisse, SHA-256-verifiziert. Die Eigenschaft, die kein rein generatives System bieten kann.
Erklärbarkeit
Jede positive Entscheidung nennt Regel und Grund — maschinenlesbar, direkt in den Audit-Trail übernommen.
Latenz pro Regulierungsdomäne
Gemessen mit OPA auf einem einzelnen CPU-Kern — der konservativsten Konfiguration. Praktisch heißt das: Eine Gesetzesänderung wird gegen 10.000 Mandantenprofile in unter 2 Sekunden geprüft.
| Domäne | Ø ms | p99 ms | Entscheidungen/s |
|---|---|---|---|
| Betroffenheitsanalyse (Affected-Engine) | 0,19 | 0,66 | 5.351 |
| EU AI Act (Risikoklassifikation) | 0,13 | 0,52 | 7.580 |
| E-Rechnung (EN 16931 / XRechnung) | 0,14 | 0,55 | 6.999 |
| EEG / EnWG § 14a | 0,13 | 0,42 | 7.839 |
| DSGVO | 0,13 | 0,47 | 7.752 |
| NIS2 (Scoping) | 0,14 | 0,48 | 7.227 |
Warum wir Entscheidungen nicht dem LLM überlassen
Das Sprachmodell versteht Ihre Frage und Ihre Dokumente. Das Urteil fällt die Policy-Engine. Diese Arbeitsteilung ist messbar besser:
| LLM-only (generische KI-Chatbots) | Agentic360 (Hybrid) | |
|---|---|---|
| Gleiche Frage → gleiche Antwort? | nicht garantiert | immer — nachgewiesen |
| Antwortzeit der Compliance-Prüfung | Sekunden | unter 1 Millisekunde |
| Grenzfälle (z. B. 49 vs. 50 Mitarbeitende) | fehleranfällig | 100 % korrekt im Test |
| Prüfbar für Auditor & Behörde? | nein — Prosa | ja — Regel + Begründung |
| Verlassen Daten das Haus? | meist ja | nein — lokal, CPU |
| Kosten pro Prüfung | API-Gebühren | ≈ 0 € |
Transparenz
Alle Werte stammen aus einem reproduzierbaren Messlauf (Juli 2026, OPA) gegen einen intern annotierten Gold-Standard von 65 Fällen. „100 % Korrektheit" bezieht sich auf diesen Testkorpus — nicht auf alle denkbaren Sachverhalte — und ersetzt keine Rechtsberatung. Die vollständige Test-Suite stellen wir auf Anfrage bereit: nachrechnen ausdrücklich erwünscht.
Nachrechnen erwünscht.
Wir zeigen Ihnen den Benchmark live — mit Ihren eigenen Szenarien, wenn Sie möchten. 30 Minuten, keine Sales-Schleife.
Demo anfragen