Qualität · 0 bis 100
Der strukturierte Gesamtwert fasst die Reviewdimensionen zusammen. Die Semantik bleibt trotzdem separat sichtbar.
Methodik
Ein Benchmark ist nur so nützlich wie sein Protokoll. Deshalb trennen wir Generierung, automatische Kontrollen und strukturiertes Review und dokumentieren Ausnahmen sichtbar.
Interner, versionierter Benchmark · Stand 28. Juli 2026. Die Ergebnisse beschreiben diesen Testlauf. Sie sind keine Garantie für jeden Text, jede Sprache oder zukünftige Produktversion.


Alle Anbieter erhalten denselben Quelltext. Der betrachtete Lauf umfasst zehn Fälle mit normalen und strukturierten Zitaten.
Certentis wird mit der tatsächlich eingesetzten Production-Pipeline getestet, nicht mit einer günstig ausgewählten Demo-Konfiguration.
Die Rewrites werden ohne Anbieterlabel anhand eines festen Schemas auf acht Qualitätsdimensionen bewertet.
Fakten, Einschränkungen, Kausalität und Aussageabsicht werden gegen den jeweiligen Quelltext geprüft.
Sprache, Wortverhältnis und vollständige Zitatvorkommen werden zusätzlich als getrennte Messwerte erfasst.
Fehlende Outputs werden nicht still ersetzt. Deshalb enthält der Vergleich für RewriteAI neun statt zehn Fälle.
Der strukturierte Gesamtwert fasst die Reviewdimensionen zusammen. Die Semantik bleibt trotzdem separat sichtbar.
Gezählt wird, ob alle vollständigen Zitatvorkommen des Quelltexts im Output bytegenau erhalten sind.
1,00 entspricht gleicher Wortzahl. Der Wert bewertet Länge, nicht inhaltliche Qualität.
Human und Mixed werden als Orientierung addiert. Das Ergebnis ist eine Modellwahrscheinlichkeit, kein Satzanteil und kein Beweis.
Certentis Evidenz
Ergebnisse, Prüfregeln und Grenzen stehen getrennt voneinander. So bleibt nachvollziehbar, was gemessen wurde und was nicht.
