
# Wie wir bewerten: 23 Prüfungen und ihre Gewichte

Eine Note von 100 ist eine Behauptung, und die meisten sind nicht überprüfbar: eine Zahl ohne Methode dahinter, ohne Version darauf und ohne Möglichkeit, später zu erkennen, ob sich Ihre Website geändert hat oder das Werkzeug.

Unsere besteht aus 23 Prüfungen in fünf gewichteten Dimensionen, und alles davon steht in einer einzigen Datei: `packages/engine/src/scorer.js`. Hier steht, was jeder Teil misst, was er wert ist und was er Ihnen nicht sagen kann.

## Die fünf Dimensionen

**Zugänglichkeit — 30 %, 3 Prüfungen.** Ob eine Maschine die Seite überhaupt lesen kann. Existiert der Inhalt ohne JavaScript, beginnt der Hauptinhalt nahe am Anfang des HTML, ist die Seite klein genug, um sie ganz abzurufen. Die schwerste Dimension, denn alles andere ist Dekoration, wenn der Crawler nur eine leere Hülle bekommt.

**Auffindbarkeit für KI — 25 %, 6 Prüfungen.** Ob KI-Clients hereindürfen und sich zurechtfinden: gibt es eine robots.txt, erlaubt sie die KI-Suchbots, gibt es eine Sitemap, beantwortet die Website `Accept: text/markdown`, gibt es eine llms.txt, ist Content-Signal deklariert.

**Strukturierte Daten — 20 %, 5 Prüfungen.** Schema.org/JSON-LD, Open Graph, Meta-Description, kanonische URL, `lang` am `<html>`. Das, was einer Maschine sagt, was die Seite *ist*, nicht was sie erzählt.

**Semantisches HTML — 15 %, 5 Prüfungen.** Überschriftenhierarchie, `<article>` oder `<main>`, das Verhältnis semantischer Elemente zu Divs, Alt-Texte, die etwas beschreiben, Verschachtelungstiefe der Divs. Daran entscheidet die Extraktion, welche Teile der Seite die Seite sind.

**Inhaltseffizienz — 10 %, 4 Prüfungen.** Token-Reduktion von HTML zu Markdown, Verhältnis von Inhalt zu Rauschen, Seitengewicht, Inline-Styles. Wie viel von dem, was Sie ausliefern, tatsächlich Inhalt ist.

## Warum nicht jede Prüfung gleich zählt

Jede Prüfung trägt neben ihrem Gewicht eine Beweisstufe, und diese Stufe bestimmt das Gewicht:

- **belegt** — ein Modellanbieter dokumentiert es, oder eine Messung weist es nach. 3 von 23.
- **plausibel** — schlüssige Begründung, vereinbar damit, wie Extraktion arbeitet, aber von keinem Anbieter bestätigt. 13 von 23.
- **spekulativ** — die Konvention existiert und die Branche glaubt daran, aber niemand hat gezeigt, dass irgendein Bot sie liest. 7 von 23.

Bis zur Endnote durchgerechnet liegen damit rund 32 der 100 Punkte auf belegten Prüfungen, 51 auf plausiblen und 17 auf spekulativen.

Die drei belegten Prüfungen: die Seite rendert ohne JavaScript, die robots.txt erlaubt die KI-Suchbots, die Seite trägt Schema.org-Auszeichnung. Die erste ist das am besten belegte Signal dieses ganzen Felds, denn kein größerer KI-Crawler führt JavaScript aus. Die zweite ist die einzige harte Schranke im Feld: Wer einen Suchbot aussperrt, ist in diesem Assistenten schlicht nicht vorhanden.

Am anderen Ende stehen llms.txt und Content-Signal. Beide werden von sehr vielen Domains ausgeliefert, kein Anbieter hat bestätigt, sie zu lesen, und Google hat erklärt, llms.txt habe keinerlei Wirkung. Wir bewerten sie trotzdem — fehlender Beweis ist kein Beweis des Gegenteils — aber mit je 10 % ihrer Dimension statt der 20 %, die llms.txt einmal trug. Die Inhaltseffizienz ist durchgehend spekulativ: Retrieval-Pipelines fahren eine Readability-artige Extraktion, bevor ein Modell irgendetwas sieht, schlankes HTML bringt also vermutlich weniger, als die Branche annimmt.

Genau diese Neugewichtung war Version 2 des Schemas. Unter v1 war „rendert ohne JavaScript" 6 % der Endnote wert, während die Token-Reduktion, die kein Anbieter je erwähnt hat, 10 % wert war: Die am besten belegte Prüfung zählte weniger als eine Vermutung.

## Das Schema trägt eine Versionsnummer

Der Scorer exportiert `RUBRIC_VERSION`, derzeit 2. v1 waren die ursprünglichen Gewichte, Februar 2026. v2 ist die Neugewichtung nach Beweislage, Juli 2026.

Ohne diese Nummer ist eine Note nicht reproduzierbar. Sie starten eine Analyse und bekommen 90. Ein halbes Jahr später 85. Ist Ihre Website schlechter geworden, oder haben wir das Tor verschoben? Ein Zertifikat, das das Maß nicht nennt, mit dem gemessen wurde, ist eine Zahl, die niemand prüfen kann.

Genau diesen Fehler haben wir ausgeliefert. Die Version existierte im Scorer und reiste am Ergebnisobjekt mit, erreichte aber nie die Datenbank — die Bestenliste sortierte Noten also gegeneinander, ohne zu wissen, ob sie gleich gemessen worden waren, v1-Zeilen über v2-Zeilen, als hätte der Vergleich Bedeutung.

Die Migration `007_add_rubric_version_to_analyses.js` fügte die Spalte hinzu, mit 1 als Standard für jede bestehende Zeile. Dieser Standard war keine Schätzung: Jede Zeile lag vor v2, also ist 1 die Tatsache. Sie indiziert außerdem `(rubric_version, score)`, damit eine Rangliste auf ein Schema eingegrenzt werden kann. Der heikle Teil war der Zeitpunkt — sie musste vor der ersten v2-Analyse landen, sonst hätten neue Zeilen stillschweigend behauptet, v1 zu sein.

## Was wir bewusst nicht bewerten

**Eine Seite, keine Website.** Eine Analyse liest eine URL. robots.txt, Sitemap und llms.txt gelten für die ganze Site; alles andere gilt dieser einen Seite. Eine gut gebaute Seite auf einer ansonsten schwachen Website schneidet gut ab, und das ist richtig so.

**Was ein Modell tatsächlich mit Ihnen gemacht hat.** Wir können nicht sehen, ob ChatGPT Sie zitiert hat, ob Claude seine Antwort aus Ihrer Seite gebaut hat, ob Sie überhaupt genannt wurden. Das sieht von außen niemand. Jede Prüfung ist eine Eigenschaft dessen, was Sie ausliefern, nicht dessen, was daraus gemacht wurde.

**Ob ein Crawler wirklich hereinkam.** Wenn wir uns als KI-Bot ausgeben und etwas am Edge uns abweist, während die robots.txt uns willkommen heißt, wissen wir nicht, welchem von beiden ein verifizierter Crawler begegnet. Diese Prüfung wird bei 60 gedeckelt — ein Bestehen mit Vorbehalt, kein Durchfallen — und die Detailzeile sagt, was passiert ist. Eine Zahl ist eine schlechte Art, „unbekannt" zu sagen.

Nichts hier prüft, ob das, was Sie geschrieben haben, etwas taugt. Eine hohe Note ist ein guter Ausgangsverdacht: Eine Maschine kann die Seite lesen und erkennt, was sie ist. Ein Versprechen, zitiert zu werden, ist sie nicht.

## Wir wenden es auf uns selbst an

agentready.md erreicht 94/100. Diese Zahl kommt aus der Datenbank — unsere jüngste Analyse unserer eigenen Domain, verknüpft mit ihrem Zertifikat — statt ins Template getippt zu sein. Bewegt sie sich, bewegt sich die Seite. Gibt es keine Analyse, zeigt die Seite nichts statt einer veralteten Zahl.

Sie ist schon gefallen. Monatelang gab unser Origin `404` auf `/robots.txt` zurück, während Cloudflares verwaltete Content Signals Policy am Edge mit `200` und einer Datei antwortete, die wir nie geschrieben hatten. Unser eigener Scorer las diese `200` und ließ uns bestehen. Als wir das Origin reparierten und die verwaltete Datei abschalteten, fielen wir von 93 auf 90. Die niedrigere Zahl war die ehrliche: Diese drei Punkte hatten Cloudflares Datei gemessen, nicht unsere.

[Wie die Note entsteht](/de/about) · [Was alle anderen erreichen](/de/leaderboard)
