Methodik

Messregeln, bevor Ergebnisse zählen.

Ein Benchmark ist nur so nützlich wie sein Protokoll. Deshalb trennen wir Generierung, automatische Kontrollen und strukturiertes Review und dokumentieren Ausnahmen sichtbar.

Interner, versionierter Benchmark · Stand 28. Juli 2026. Die Ergebnisse beschreiben diesen Testlauf. Sie sind keine Garantie für jeden Text, jede Sprache oder zukünftige Produktversion.

Messregeln, bevor Ergebnisse zählen.

Das Prüfprotokoll in sechs Schritten

Das Prüfprotokoll in sechs Schritten
  1. 01

    Feste Ausgangstexte

    Alle Anbieter erhalten denselben Quelltext. Der betrachtete Lauf umfasst zehn Fälle mit normalen und strukturierten Zitaten.

  2. 02

    Produktionsmodus

    Certentis wird mit der tatsächlich eingesetzten Production-Pipeline getestet, nicht mit einer günstig ausgewählten Demo-Konfiguration.

  3. 03

    Blindes Qualitätsreview

    Die Rewrites werden ohne Anbieterlabel anhand eines festen Schemas auf acht Qualitätsdimensionen bewertet.

  4. 04

    Semantik separat

    Fakten, Einschränkungen, Kausalität und Aussageabsicht werden gegen den jeweiligen Quelltext geprüft.

  5. 05

    Harte Strukturkontrollen

    Sprache, Wortverhältnis und vollständige Zitatvorkommen werden zusätzlich als getrennte Messwerte erfasst.

  6. 06

    Ausfälle bleiben sichtbar

    Fehlende Outputs werden nicht still ersetzt. Deshalb enthält der Vergleich für RewriteAI neun statt zehn Fälle.

Acht Dimensionen des Qualitätsreviews

  1. 01Grammatik und Sprachsicherheit
  2. 02Klarheit und Lesbarkeit
  3. 03Kohärenz und Struktur
  4. 04Akademischer Stil
  5. 05Präzision
  6. 06Natürlichkeit
  7. 07Integration der Zitate
  8. 08Semantische Treue zum Quelltext

So lesen wir die Kennzahlen

01

Qualität · 0 bis 100

Der strukturierte Gesamtwert fasst die Reviewdimensionen zusammen. Die Semantik bleibt trotzdem separat sichtbar.

02

Zitate · exakt oder abweichend

Gezählt wird, ob alle vollständigen Zitatvorkommen des Quelltexts im Output bytegenau erhalten sind.

03

Wortverhältnis · Output ÷ Input

1,00 entspricht gleicher Wortzahl. Der Wert bewertet Länge, nicht inhaltliche Qualität.

04

Externe KI-Einordnung

Human und Mixed werden als Orientierung addiert. Das Ergebnis ist eine Modellwahrscheinlichkeit, kein Satzanteil und kein Beweis.

Grenzen und nächste Schritte

  • 01Zehn Fälle sind ein belastbarer Produkttest, aber keine vollständige Abbildung aller Textarten.
  • 02Die Quelltexte können aus Lizenz- und Datenschutzgründen nicht vollständig veröffentlicht werden.
  • 03Externe Modelle und Wettbewerbsprodukte können sich nach dem Testdatum verändern.
  • 04Für KI-Detektor und Plagiatscheck veröffentlichen wir Accuracy-Werte erst mit einem passenden gelabelten Referenzkorpus.

Certentis Evidenz

Evidenz statt Werbeversprechen.

Ergebnisse, Prüfregeln und Grenzen stehen getrennt voneinander. So bleibt nachvollziehbar, was gemessen wurde und was nicht.

Evidenz statt Werbeversprechen.