laurus.
菜单
搜索与 AI 可见度

如何让你的网站被 AI 搜索读懂

一份在 Google、ChatGPT、Claude 和 Perplexity 中被找到并被引用的实用清单:爬虫访问、可索引性、以答案为先的内容和结构化数据。

一个网页通过虚线连接到围绕中心点运行的搜索与 AI 爬虫

AI 搜索实际读取什么

会附上来源作答的 AI 助手,例如 ChatGPT 搜索、Claude、Perplexity 以及 Google 的 AI 功能,仍然依赖开放的网络。它们抓取页面,判断每个页面讲的是什么,并引用或链接那些回答得最清楚的页面。

因此,AI 可见度主要是技术和编辑问题,而不是新技巧。如果爬虫无法访问页面、分不清哪个网址才是正式版本,或在正文中找不到直接答案,那么无论背后的企业多么出色,这个页面都不太可能被引用。

下面这份清单就是我们用于自己网站的清单。其中任何一项都不能保证排名或引用,它的作用是消除页面被跳过的原因。

1. 让合适的爬虫进来

先从 robots.txt 开始。许多网站会意外屏蔽 AI 爬虫:从模板复制来的通用规则、被带到正式环境的测试设置,或某个安全插件。

不同爬虫承担不同任务,因此需要有意识地决定:

  • 搜索与回答类爬虫,如 OAI-SearchBot、Claude-SearchBot 和 PerplexityBot,会抓取页面,以便在回答中展示和引用。
  • 由用户触发的抓取程序,如 ChatGPT-User 和 Claude-User,会在有人询问某个页面时获取该页面。
  • 训练类爬虫,如 GPTBot 和 ClaudeBot,会收集内容用于模型训练。Google-Extended 决定 Google 能否将内容用于 Gemini,它不影响 Google 搜索。

屏蔽训练、允许搜索是合理的选择。屏蔽一切却期待被引用,则不合理。

2. 让每个页面都可索引且不产生歧义

爬虫能够访问页面,却仍可能被告知忽略它。请检查页面的 meta robots 标签和 X-Robots-Tag 响应头中是否有 noindex,这两者在上线后都很容易被遗留。

每个页面都应声明唯一的规范网址(canonical)。在多语言网站上,hreflang 链接告诉搜索引擎应显示哪个语言版本,x-default 条目则覆盖其他所有人。XML 站点地图只应包含返回 HTTP 200 的规范且可索引的网址。

3. 写答案,不写口号

AI 的回答由段落拼合而成。一个段落如果无需页面其余部分就能单独回答某个具体问题,它就是有用的。

  • 使用与人们实际提问相符的标题。
  • 在每个标题下的前一两句话给出直接答案,然后再补充细节。
  • 具体明确:写出交付内容、步骤、限制以及不包含的内容。
  • 让每个说法都可核实。含糊的夸张很少被引用,具体的陈述才会被引用。

这本身也是写给人看的好文字,而这正是关键:同样的清晰同时服务于两类读者。

4. 添加与页面一致的结构化数据

结构化数据(使用 schema.org 类型的 JSON-LD)以机器无需猜测即可读取的方式说明页面事实:这是一个组织、一项服务、一篇带发布日期的文章,或一组问答。

只标注页面上可见的内容,并保持准确。与内容相矛盾的结构化数据,比没有更糟。

5. 考虑添加 llms.txt 文件

llms.txt 是放在网站根目录的一个简短 Markdown 文件,概述组织的业务并链接到最重要的页面。它是一种新兴惯例,而非标准,没有任何助手必须读取它。

它的维护成本很低,能为读取它的任何工具提供清晰、易读的概要。把它当作一份有用的索引,而不是提升排名的手段。

6. 每周检查一次

技术可见度往往在悄无声息中被破坏。一次部署改了某个设置,某个模板丢了规范标签,新页面上线时没有描述。直到流量下降才有人发现。

我们为自己的网站运行每周自动审计,检查爬虫访问、站点地图、llms.txt、状态码、响应时间、标题、描述、noindex、规范与 hreflang 标签、标题层级和结构化数据,然后通过电子邮件发送带评分的报告。目标是在几天而不是几个月内发现退化。

7. 让页面加载迅速,且无需 JavaScript 也能阅读

许多爬虫,包括若干 AI 爬虫,读取的是服务器返回的 HTML,并不能可靠地执行 JavaScript。如果正文、标题或链接要等脚本加载后才出现,有些系统看到的就是一个空页面。

请在初始 HTML 中提供重要内容,保持页面快速,不要把答案藏在标签页、弹窗或无限滚动之后。加载迅速、关闭脚本后依然清晰可读的页面,对所有爬虫都更容易处理。

8. 对“你是谁”保持一致

AI 系统会尝试判断一个页面属于哪个组织,以及它是否是该主题的可信来源。请让这件事变得简单:

  • 在整个网站使用相同的公司名称、简介和联系方式。
  • 保留一个清晰的“关于我们”页面,说明你做什么、为谁做、不做什么。
  • 添加包含名称、网站和标志的 Organization 结构化数据。
  • 确保你掌管的外部资料页以相同方式描述你。

描述不一致,会让任何系统都更难把你的页面与你的组织联系起来。

如何衡量 AI 可见度

目前还没有统一的 AI 引用仪表板,因此需要结合几种信号:

  • Google Search Console 和 Bing Webmaster Tools 会显示每个页面的索引问题和搜索展示次数。
  • 来自 AI 助手的引荐流量,例如来自 chatgpt.com 或 perplexity.ai 的访问,会出现在大多数分析工具中。
  • 每月向主要助手提出一组固定问题,可以看出你是否被提及、如何被提及。每次回答都会有差异,因此要看趋势,而不是单次结果。

记录你在何时改了什么,以便把改进与带来改进的工作对应起来。

优先检查的常见错误

  • 测试环境遗留下来的 noindex 标签或 Disallow 规则。
  • 即使 robots.txt 允许,CDN 或安全设置仍屏蔽了 AI 爬虫。一些服务现在提供这一功能,有的还默认开启。
  • 同一页面的不同语言版本没有 hreflang,导致彼此竞争。
  • 重要答案只存在于图片、PDF 或脚本之中。
  • 把元描述写成口号,而不是页面摘要。

这些问题一旦发现,都能很快修复。难的是发现它们,所以定期检查比一次性审计更重要。

30 天计划

如果从零开始,按照下面的顺序可以优先完成最重要的修复:

  • 第 1 周:检查 robots.txt、CDN 与安全设置、noindex 标签、规范网址和站点地图。修复所有会屏蔽或误导爬虫的问题。
  • 第 2 周:列出客户最常问的十个问题,检查网站是否在具体页面上清楚地回答了每一个。
  • 第 3 周:重写或新增回答这些问题的页面,在开头几行给出直接答案,并添加准确的结构化数据。
  • 第 4 周:配置 Search Console 和 Bing Webmaster Tools,为你的问题集记录一份 AI 回答基线,并安排每周技术检查。

第一个月之后,工作就变成例行事项:持续把新问题回答好,并防止技术基础出问题。

常见问题

GEO 与 SEO 不同吗?它们大体上是同一套基础,只是更强调清晰、可引用的答案,以及 AI 爬虫的访问。搜索引擎容易理解的网站,通常对 AI 助手也同样容易理解。

我们应该屏蔽 AI 训练爬虫吗?这是商业决策。只要单独允许搜索与回答类爬虫,屏蔽训练爬虫不会影响它们。

llms.txt 能提升排名吗?没有证据表明可以。它是一份成本很低、某些工具可能会读取的摘要。

多久能看到效果?技术修复会随着页面被重新抓取而生效,可能需要几天到几周。被更频繁地引用取决于内容质量和竞争情况,而且永远无法保证。

这些做不到的事

技术上干净的网站是基础,而不是结果。页面是否被引用,仍取决于它是否是对所问问题最有用的回答。这是编辑工作:理解受众在问什么,并比任何人回答得更好。

如果你希望按照这份清单审查自己的网站,请了解我们的 SEO 与 AI 搜索可见度服务。

相关阅读

一次录制,多份有用内容:内容再利用流程

人工审核是生产步骤,而不是最后一道检查

全部观点