博客
关于 AI 智能体如何读取网页,以及该怎么应对的笔记。
-
面向智能体的 Markdown 内容协商
智能体抓取你的 HTML,然后丢掉绝大部分。怎样直接把干净的 Markdown 交给它:内容协商、Vary 的坑、.md 孪生链接。
阅读 -
Content-Signal:告诉 AI 它可以拿你的内容做什么
robots.txt 只回答能不能抓取。Content-Signal 说的是抓到之后能做什么——索引、作答、训练。附三个真实写法。
阅读 -
如何在 robots.txt 里放行或拦截 AI 机器人
三份可以直接抄走的完整 robots.txt:全部放行、允许检索但拒绝训练、彻底拦住 AI。外加那些会悄悄让三者都失效的写法。
阅读 -
AI 智能体访问你的网站时真正看到什么
我们用自家引擎测了十二个知名页面。平均而言,发送内容的 98% 从未抵达模型。
阅读 -
你的 AI 智能体为何在真实网站上失败
多半不是模型的问题。读取层出问题的五种方式,在真实页面上实测,包括渲染直接超时的那一种。
阅读 -
ChatGPT、Claude 能读取你的网站吗
AI 助手能否引用你的网站,取决于三件事:robots.txt、JavaScript,以及内容在提取后还剩多少。这里是三项的自查方法,附上确切命令。
阅读 -
AgentReady 是什么,它到底能告诉你什么
AI 智能体读取你网站的方式和访客完全不同。AgentReady 测量它们能找到什么,把页面转成干净的 Markdown,并告诉你应该先改哪里。
阅读 -
与 isitagentready.com 有什么不同
Cloudflare 的扫描器检查你的网站声明了哪些智能体协议。我们的检查你的内容能否在被读取后留存。两者回答的问题不同,而你多半两个答案都想要。
阅读