
# Was ein KI-Agent wirklich sieht, wenn er deine Seite besucht

Du öffnest deine Startseite und siehst ein Design: eine Navigation, ein großes Bild, drei Textspalten, eine Preistabelle und ein Cookie-Banner, das dir seit Monaten nicht mehr auffällt.

Ein Agent öffnet dieselbe URL und sieht nichts davon. Er bekommt einen Strom von Bytes, wirft fast alles weg und übergibt den Rest einem Modell mit begrenztem Kontextfenster. Was diese Reise überlebt, ist die gesamte Grundlage, auf der ein Assistent dein Unternehmen beschreibt.

Die wenigsten haben sich das je angesehen. Also haben wir gemessen.

## Die Messung

Am 31. August 2026 haben wir zwölf bekannte Seiten durch unsere eigene Engine geschickt: die Seite so abrufen, wie es ein einfacher Agent tut, den lesbaren Inhalt extrahieren, ihn nach Markdown konvertieren und an beiden Enden mit `cl100k_base` Tokens zählen.

| Seite | Gesendet | Erreicht das Modell | Übrig |
|---|---|---|---|
| `wordpress.org/about` | 56.663 Tok | 159 Tok | 0,3% |
| `vercel.com/docs` | 278.962 Tok | 905 Tok | 0,3% |
| `stripe.com/docs` | 376.509 Tok | 1.042 Tok | 0,3% |
| `cloudflare.com/learning/…` | 95.028 Tok | 631 Tok | 0,7% |
| `nodejs.org/en/about` | 117.729 Tok | 1.190 Tok | 1,0% |
| `shopify.com/pricing` | 410.515 Tok | 2.479 Tok | 0,6% |
| `notion.com/pricing` | 172.136 Tok | 2.805 Tok | 1,6% |
| `slack.com/pricing` | 294.980 Tok | 5.718 Tok | 1,9% |
| `developer.mozilla.org/…/HTTP` | 59.350 Tok | 3.059 Tok | 5,2% |
| `react.dev/learn` | 91.899 Tok | 3.804 Tok | 4,1% |
| `atlassian.com/software/jira/pricing` | 379.636 Tok | 1 Tok | 0,0% |
| `agentready.md` | 13.188 Tok | 627 Tok | 4,8% |

Keine einzige Seite liefert mehr als 6% dessen, was sie sendet. Der Median liegt unter 1%.

Das ist kein Skandal. Die meisten dieser Bytes leisten echte Arbeit — Layout, Styling, Analytics, Interaktivität — für Menschen mit einem Browser. Der Punkt ist enger gefasst: **Alles davon wird beim Eingang bezahlt, und fast nichts davon ist das, wofür der Agent gekommen ist.**

## Die vier Dinge, die mit deiner Seite passieren

Zwischen Anfrage und Modell durchläuft deine Seite vier Tore. Jedes lässt etwas fallen.

**1. Der Abruf.** Ein Agent fragt die URL an. Die meisten Agent-Fetcher führen kein JavaScript aus: das ist langsam, teuer und eine Angriffsfläche. Also bekommen sie die rohe Antwort deines Servers, nicht die Seite, die ein Browser zusammenbaut.

**2. Die Extraktion.** Irgendetwas muss entscheiden, welcher Teil dieses HTML der Artikel ist und welcher Mobiliar. Das ist dasselbe Problem, das die Leseansicht von Firefox löst, mit derselben Bibliothek, die alle dafür verwenden. Navigation, Fußzeile, Cookie-Banner und Seitenleiste landen im Müll. Und alles, was der Extraktor nicht von einer Seitenleiste unterscheiden kann, ebenfalls.

**3. Die Konvertierung.** Was bleibt, wird zu Text. Überschriften, Listen, Tabellen, Links und Codeblöcke überleben als Struktur. Klassennamen, `<div>`-Hüllen, Inline-SVG und `data-`-Attribute nicht.

**4. Das Kontextfenster.** Was übrig ist, konkurriert nun um Platz mit der Frage des Nutzers, dem System-Prompt und womöglich neun weiteren Seiten.

Dein Inhalt existiert für den Assistenten nur, wenn er alle vier passiert.

## Wie es aussieht, wenn es gut läuft

`vercel.com/docs` reduziert 278.962 Tokens auf 905, und diese 905 beginnen so:

```markdown
## Ship anything with Vercel

Deploy your app on Vercel in three steps: install the CLI, add agent
support if you need it…
```

Das ist eine saubere Antwort auf „Was macht Vercel?". Ein Modell, das sie liest, kann sie zitieren, zusammenfassen und zuordnen. Die 99,7%, die weggefallen sind, haben den Agenten nichts gekostet, was er wollte.

## Wie es aussieht, wenn es schiefgeht

`atlassian.com/software/jira/pricing` sendet 1,37 MB und liefert **ein Token**.

Die Seite ist eine Hülle. Das HTML enthält `<div id="wac-root"></div>` und danach rund ein Megabyte eingebetteten Anwendungszustand — die Preise, die Tarifnamen, die Funktionslisten, alles in einem `<script>` als JSON, wartend darauf, dass JavaScript die Seite daraus baut. Unser Extraktor holte pflichtbewusst 1,1 Millionen Zeichen `window.SSR_detailMetrics=Object.freeze({"getFeatureGateValues":…` heraus, und nachdem die Skripte entfernt waren, blieb ein einzelner Zeilenumbruch.

Also: Frag einen Assistenten, was Jira kostet, und nichts auf dieser Seite kann die Quelle seiner Antwort sein. Nicht weil Atlassian jemanden blockiert hätte — hat es nicht —, sondern weil die Seite keinen Text enthält, bis ein Browser sie ausführt.

Ruf dieselbe URL mit einem Headless-Browser ab, und es werden 3.048 Tokens, die mit **Transparent pricing for every team** beginnen. Der Inhalt ist da. Er steht nur nicht in der Antwort. [Ob ein Agent einen Browser ausführt und was ihn das kostet](/de/blog/why-ai-agents-fail), macht den ganzen Unterschied.

`stripe.com/docs` ist eine mildere Version derselben Form: 1,28 MB hinein, und der extrahierte Inhalt sind 1.057 Zeichen, die mit einem Kommandozeilenbeispiel beginnen statt mit einer Beschreibung von Stripe.

## Was wir erwartet und nicht gefunden haben

Wir nahmen an, einige dieser Seiten würden Agenten an der Edge abweisen. Wir haben jede zweimal sondiert — einmal als gewöhnlicher Browser, einmal als `OAI-SearchBot` — und verglichen.

**Keine der zwölf behandelte den Bot anders.** Derselbe Statuscode in beiden Fällen, quer über Cloudflare, Vercel und CloudFront. (`cloudflare.com/learning` antwortete beiden Sonden mit 403, was eine Mauer ist, aber keine bot-spezifische.)

Blockieren ist das Versagen, über das alle reden. In dieser Stichprobe ist es kein einziges Mal passiert. Passiert ist etwas Leiseres: Die Tür stand offen und der Raum war leer.

## Sieh dir deine eigene Seite an

Zwei Befehle. Was du sendest:

```bash
curl -s https://deineseite.de/seite | wc -c
```

Und dann lies, was die Extraktion überlebt: Füge die URL in [den Checker](/de) ein und schau auf das Markdown-Panel, nicht auf die Note. Die Frage ist nicht, ob die Zahl groß ist. Die Frage ist, ob der Text, den du dort liest, der Text ist, den ein Assistent über dich zitieren soll.

Die meisten überrascht zweierlei: wie wenig da ist, und welche Teile es geschafft haben.

## Die Kurzfassung

- Ein Agent sieht dein rohes HTML, meist ohne JavaScript auszuführen, und behält rund 1% davon.
- Wenn dein Inhalt von JavaScript zusammengebaut wird, kann dieses 1% genau nichts sein.
- Blockiert zu werden ist selten. Leer zu sein ist häufig.
- Die Lösung ist nicht, weniger Markup zu senden. Sie ist, dass die Wörter in der Antwort stehen.

[Deine Website prüfen](/de) · [Können KI-Assistenten deine Seite lesen?](/de/blog/can-ai-read-your-site) · [Markdown für Agenten ausliefern](/de/blog/markdown-for-agents)
