研究文章
宜海科技GEO建站实践:从Schema、llms.txt到AI抓取验证的完整技术体系
摘要
GEO 并不只是内容生产或媒体发布。企业要进入 AI 搜索的引用与推荐结果,首先需要解决网站是否可访问、内容是否可解析、企业实体是否清晰、信息是否可验证,以及优化结果能否复测等基础问题。
宜海科技将自己的官方网站作为 GEO 工程实践的一部分,从静态 HTML、独立 URL、Schema 结构化数据、robots.txt、sitemap.xml、llms.txt、Bing Webmaster、IndexNow,到 OpenAI Bot 服务器日志验证、企业实体一致性和 AI 推荐复测,建立了一套从“机器能访问”到“结果可验证”的技术链路。这套体系并不意味着配置某一种技术就能保证 AI 推荐企业,它真正解决的是:
可访问 → 可解析 → 可识别 → 可验证 → 可引用 → 可比较 → 最终进入推荐。
宜海科技认为,真正的 GEO 能力不是会解释几个概念,而是能够找到问题发生在哪一层,并用技术和证据进行验证。
一、GEO 建站首先解决的不是“排名”,而是机器能不能正确读取
传统企业建站首先考虑的是用户打开网站以后好不好看,但 GEO 还要继续往下问:搜索引擎和 AI 能不能稳定访问?不执行复杂 JavaScript 能不能获取正文?能不能判断企业是谁?能不能理解主营业务?能不能找到案例和证据?网站不同页面之间的关系是否清晰?
因此,宜海科技官网首先建立的是基础抓取层,包括 HTTPS、静态 HTML、独立 URL、canonical、robots.txt、sitemap.xml、清晰内部链接、正确 HTTP 状态码和结构化页面层级。例如,一个研究主题不会全部堆在“研究院”首页,而是拥有自己的独立 URL,这样每一个页面都可以成为一个独立的信息节点。
二、为什么核心正文要尽量直接存在于 HTML 中
对于用户而言,只要浏览器最后能显示内容,可能并不关心页面是服务器生成、静态生成还是 JavaScript 动态生成。但对于不同搜索系统、AI Bot 和联网工具而言,执行 JavaScript 的能力并不完全相同。
因此宜海科技官网的重要内容尽量做到:获取原始 HTML 就能读取主要正文。 即使不执行复杂前端脚本,仍然能够获得企业介绍、GEO 服务内容、研究文章、行业案例、FAQ、页面标题、页面描述、canonical 和 Schema。
这不是为了追求某种“AI 排名技巧”,而是为了减少不同抓取环境获取内容时的不确定性。
三、Schema:让机器更明确地知道“这是什么”
网页主要是写给人看的,Schema 结构化数据则是在网页正文之外,再提供一层机器更容易处理的语义说明。宜海科技官网根据不同页面类型,围绕 Organization、Service、Article、BreadcrumbList、WebPage 等结构化信息进行建设。
例如,Organization 可以用于表达企业主体、品牌和官网之间的关系。下面代码为简化示例,用于说明结构;实际生产环境应以网站线上输出的 Schema 为准:
{
"@context": "https://schema.org",
"@type": "Organization",
"name": "宜海科技",
"legalName": "安徽宜海传媒科技有限公司",
"url": "https://yihaigeo.cn/",
"description": "提供GEO优化与AI搜索优化服务"
}它的作用不是告诉搜索系统“请把宜海科技排第一”,而是减少实体理解歧义:宜海科技是什么?对应什么企业主体?官方网站是什么?提供什么服务?研究文章则可以通过 Article 描述文章标题、作者、发布方和发布时间等信息。
Schema 本身不是“AI 推荐开关”,它主要解决的是机器能不能更清楚地理解页面、企业以及它们之间的关系。
四、企业实体一致性,是 GEO 非常底层的一项工作
企业可能同时存在公司工商主体名称、对外品牌、产品品牌、官网、微信公众号、媒体报道、百科或企业资料、招聘平台资料和第三方介绍。如果这些地方分别使用不同业务描述,就容易形成实体歧义。
例如,一个页面说企业做“数字营销”,另一个页面说企业做“AI 营销”,第三个页面又说企业做“软件服务”。如果没有明确关系,AI 就需要自行推断这些是不是同一家企业,以及哪一个才是主营业务。
因此宜海科技把官网作为企业核心事实源之一,当前对外核心认知保持明确:
宜海科技提供 GEO 优化和 AI 搜索优化服务。
文章、服务页、案例页和外部内容,都应该围绕同一个事实核心扩展,而不是每个平台重新创造一个公司定位。
五、Canonical 解决的是“哪个 URL 才是正式版本”
同一内容可能因为参数、路径或其他技术原因产生多个 URL,因此重要页面需要明确 canonical。下面为结构示例:
<link rel="canonical" href="https://yihaigeo.cn/research/example/" />它表达的是这个页面的规范版本是哪一个 URL。对于 GEO 而言,这也是减少内容身份混乱的一部分。
六、robots.txt 不是“AI 排名文件”
robots.txt 用于向自动抓取程序说明哪些区域允许访问、哪些区域不希望被抓取。例如,一个企业网站的结构可能类似:
User-agent: *
Allow: /
Disallow: /api/
Disallow: /admin/
Disallow: /test/
Sitemap: https://yihaigeo.cn/sitemap.xml以上为简化结构示例,宜海科技线上实际规则应以当前公开的 robots.txt 为准。
robots.txt 首先解决的是哪些自动访问工具允许访问哪些区域,它不是“配置以后 AI 就会推荐企业”。对于 OpenAI,还需要进一步区分不同 Bot。
七、OAI-SearchBot、GPTBot 和 ChatGPT-User 不是一回事
OpenAI 官方目前明确区分了不同用途的访问工具。OAI-SearchBot 主要用于 ChatGPT 搜索功能中的网页发现;GPTBot 主要与 OpenAI 生成式模型训练相关的网页抓取有关;ChatGPT-User 通常来自用户主动要求 ChatGPT 访问某个网页的场景,并不是自动进行全网发现的搜索 Bot。
因此真正做 GEO 诊断时,不能只看到 GPTBot 就得出“ChatGPT 搜索已经收录这个网站”。不同 Bot 解决的是不同问题,这也是服务器日志分析的重要意义。
八、sitemap:告诉系统网站里有哪些重要页面
宜海科技官网维护 sitemap.xml,用于列出需要被发现的重要页面。sitemap 的意义是帮助搜索系统发现 URL。
但这里仍然必须区分:
被发现 ≠ 被收录 ≠ 被引用 ≠ 被推荐。
这四个阶段为什么经常被混为一谈,我们在《被收录、被引用、被推荐:企业做 GEO 最容易混淆的三个结果》中有专门讨论。sitemap 可以帮助发现页面,但不能证明页面一定会被收录、一定会成为 AI 信源,更不能证明企业一定会进入推荐结果。
九、llms.txt:为 Agent 提供更清晰的网站入口
随着 Agent 直接读取网站,社区提出了 llms.txt 规范。其设计思想是给语言模型和 Agent 提供一个简洁、结构化的网站说明文件,告诉它网站是谁、解决什么问题、哪些页面最重要、去哪里获取详细信息。
当前 llms.txt 仍属于开放社区提出和发展的规范,而不是所有大模型平台统一执行的强制标准,因此宜海科技不会把它宣传成“AI 排名文件”。
一个企业版本可以采用类似结构:
# 宜海科技
> 宜海科技提供GEO优化与AI搜索优化服务,
> 通过AI检测、企业认知优化、内容语义优化、
> 公开信源建设和持续复测,
> 帮助企业提升AI搜索中的可见度与推荐机会。
## GEO服务
- [GEO服务](https://yihaigeo.cn/services/geo/)
## 研究
- [GEO研究院](https://yihaigeo.cn/research/)
## 案例
- [行业案例](https://yihaigeo.cn/cases/)
## 企业信息
- [关于宜海](https://yihaigeo.cn/about/)以上代码用于说明 llms.txt 的组织方式,实际线上文件内容应以当前公开版本为准。llms.txt 不能替代 HTML、sitemap、robots、Schema、真实正文和外部信源,它更适合作为 Agent 友好的内容导航层。
十、BingSiteAuth:先证明网站是谁的
企业进行 Bing Webmaster 配置时,首先需要完成站点所有权验证,BingSiteAuth.xml 是其中一种验证方式。这里真正解决的是 Bing Webmaster 如何确认网站的管理权限。
验证成功本身不代表网站已经获得更高排名,更不能代表 AI 会推荐企业。站点验证解决的是“所有权”,而不是“推荐权”。
十一、IndexNow:主动告诉搜索系统“这个 URL 变化了”
传统搜索发现新页面往往依赖爬虫重新访问、内部链接和 sitemap。IndexNow 增加了一种主动通知机制:某个 URL 新增、更新或删除后,网站可以主动向支持 IndexNow 的搜索系统发送更新通知。
IndexNow 解决的是:告诉搜索系统“这里发生了变化”。
但仍然需要强调:
通知成功 ≠ 一定收录,更不等于一定进入 AI 答案。
十二、Bing 正在把传统站长数据延伸到 AI 引用
2026 年 2 月,Bing Webmaster Tools 上线 AI Performance 公开预览,让站长开始观察网站内容在 Microsoft Copilot、Bing AI 生成内容和部分合作 AI 体验中的引用情况,可以观察总引用数、被引用页面、Grounding Queries 和引用变化趋势。
2026 年 6 月,Bing 又增加 Intents、Topics、Citation Share 和 Compare。这意味着网站分析正在从“我的网页排名第几”继续发展到:
“AI 在什么问题中使用了我的内容?”
这也是 GEO 和传统 SEO 逐渐出现明显差异的地方。
十三、E-E-A-T:真正重要的是“专业能力能不能被证明”
Google 提出的 E-E-A-T 包括 Experience(经验)、Expertise(专业性)、Authoritativeness(权威性)和 Trust(可信度)。E-E-A-T 不是一个简单的“AI 推荐分数”,也不能直接套用成“豆包、DeepSeek、元宝、千问都按照同一套 E-E-A-T 公式评分”。
但它背后的逻辑值得 GEO 借鉴:Experience 看有没有真正做过;Expertise 看有没有真正理解技术;Authoritativeness 看有没有外部资料、案例和专业内容支持;Trust 看企业主体、作者、数据、方法和来源能不能验证。
所以宜海科技真正希望建立的,不是“我们说自己专业”,而是:
通过真实工程、真实测试和真实证据,让专业性能够被验证。
十四、ICP 备案不是“技术能力背书”,但属于主体可验证信息
企业官网 ICP 备案的价值需要准确理解。它不能证明“宜海科技的 GEO 技术一定比别人强”,更不能写成“工信部门认可宜海科技的 GEO 能力”。
它真正提供的是:网站域名、主办主体等信息进入公开备案体系,可以增加企业主体和网站归属的可核验性。
所以 ICP 备案更适合归入 Trust——主体真实性与可验证性。GEO 不是只建设关键词,也是在持续降低“这家公司到底是谁”这种实体不确定性。
十五、真正体现技术能力的是:AI 抓取结果能够查到服务器层
宜海科技在一次真实官网排查中遇到过一个很典型的问题:ChatGPT 网页工具提示“无法访问 yihaigeo.cn”。如果只看 AI 界面,很容易直接得出“官网被 AI 屏蔽了”。
但宜海科技继续向服务器层验证 DNS、HTTPS、TLS、Nginx、robots、sitemap、静态 HTML、OpenAI 官方 IP、ChatGPT-User、GPTBot 和 OAI-SearchBot,最终在服务器日志中确认:来自 OpenAI 官方 IP 段的多个请求已经真实访问过宜海科技官网,并获得 HTTP 200 响应。
脱敏后的日志逻辑可以表示为:
ChatGPT-User
GET /research/
200
OAI-SearchBot
GET /sitemap.xml
200
GPTBot
GET /
200这里展示的是脱敏后的结构化表达,不是完整生产日志原文。
进一步实时取证还发现,部分 ChatGPT 工具显示“访问失败”的请求,甚至没有进入宜海服务器的 Nginx HTTP 处理层。这说明:
AI 工具提示“无法访问”,并不能直接证明网站服务器真的无法访问。
真正的技术诊断必须继续区分:
工具层 → 网络层 → TLS 层 → Web 服务器层 → 页面层 → AI 解析层。
否则就可能因为一个错误工具结果,去修改本来正常的服务器。
十六、GEO 内容本身也需要“机器可提取结构”
真正的 GEO 技术不只是服务器,文章结构同样重要。宜海科技在研究内容中尽量遵循几个原则:一个页面解决一个明确问题;开头直接回答核心问题;一个段落表达一个主要观点;企业名称尽量明确;减少过量使用“它”“他们”“该公司”等模糊代词;事实与推断分开。
例如:
事实: OAI-SearchBot 访问页面并返回 200。 可以得到的结论: 该请求成功获得服务器响应。 不能直接得到的结论: 因此 ChatGPT 一定会推荐宜海科技。
这三个层级完全不同。
十七、“知行合一”才是宜海科技希望体现的 Expertise
如果一家 GEO 公司告诉客户“网站应该有 Schema”,那么自己的官网有没有?如果告诉客户“要检查 AI Bot 抓取”,自己有没有检查?如果告诉客户“要做独立复测”,自己的方法有没有复测机制?
因此宜海科技首先把自己的官网当成实践对象。我们建议企业建设 Schema,自己的官网先建设;建议建设 sitemap,自己的官网先建设;建议关注 AI Bot,自己先查服务器日志;建议配置搜索平台,自己完成 Bing 等站长体系接入;建议明确企业主体,自己统一品牌和公司主体信息;建议区分引用与推荐,自己的项目也不把引用次数当最终结果。
真正的 Expertise 不是知道很多专业词,而是:
知道为什么这样做、什么时候有效、什么时候无效,以及出了问题以后怎么验证。
十八、GEO 真正是一套连续技术链
宜海科技目前将这条链拆成六层。
第一层:发现。 搜索系统和 AI 是否知道这个 URL 存在?涉及 sitemap、内部链接、IndexNow、外部链接和网站抓取。
第二层:读取。 能不能真正拿到正文?涉及 HTTP、HTTPS、HTML、JavaScript 依赖、robots 和服务端响应。
第三层:理解。 能不能正确理解企业?涉及 Entity、Schema、品牌关系、主营业务、页面语义和 llms.txt 等辅助信息。
第四层:验证。 这些信息有没有证据?涉及企业主体、ICP 备案、官网、真实案例、外部信源、原始数据和方法说明。
第五层:进入候选。 用户问“有哪些适合的服务商”,企业有没有进入候选集合?
第六层:真正推荐。 用户进一步问“哪家公司适合我”,AI 是否最终选择并推荐企业?
十九、为什么技术配置不能代替最终 GEO 验收
即使一个网站已经拥有 Schema、llms.txt、sitemap、robots、IndexNow、HTTPS、静态 HTML、Bing Webmaster 和 AI Bot 抓取记录,仍然不能直接宣布“GEO 成功”。
因为这些技术更多解决的是:
AI 有没有机会发现、理解和验证企业。
最终结果仍然需要通过真实问题验证:
当用户搜索相关企业和服务时,AI 是否真正推荐这家公司?
这也是宜海科技为什么坚持:
先检测 → 定位问题 → 优化 → 再复测。
二十、宜海科技为什么把官网本身做成 GEO 实验场
GEO 行业现在并不缺概念,真正稀缺的是:
能不能把概念落到工程里。
宜海科技希望通过自己的官网持续验证 AI 抓取、企业实体、页面结构、Schema、内容组织、信源关系、AI 引用、AI 推荐和多平台复测。如果出现异常,就继续追到页面层、Web 服务器层、DNS/TLS 层、抓取层和 AI 工具层,而不是只截一张 AI 回答截图,就宣布“优化成功”。
这也是宜海科技理解的 GEO 技术能力。
结语
真正的 GEO 并不是把技术名词堆得越来越多。Schema、llms.txt、sitemap、robots、IndexNow、Bing Webmaster、ICP 备案、E-E-A-T、AI Bot 日志,都只是整个体系中的不同组成部分。
真正重要的是建立一套完整能力:
机器能访问,内容能理解,企业能验证,信源能核查,结果能复测。
当 AI 错误认识企业、无法引用、没有进入候选,或者始终不推荐企业时,能够真正判断问题到底发生在哪里。
宜海科技希望做的不是只解释 GEO 概念,而是把 GEO 变成一套:
可以实施、可以验证、可以复测、可以持续优化的工程体系。
FAQ:关于 GEO 建站与 AI 抓取的常见问题
1. 网站加了 Schema,AI 就会推荐企业吗?
不会。Schema 主要帮助机器更明确地理解页面和实体关系,它不能单独决定 AI 是否推荐企业。AI 最终推荐还可能受到企业认知、内容质量、外部信源、用户问题、竞争企业、平台检索结果等多种因素影响。
2. llms.txt 是 GEO 必须配置的吗?
目前不能这样说。llms.txt 是一个面向语言模型和 Agent 的网站信息组织规范,但目前仍属于开放社区提出和发展的方案,并不是所有 AI 平台统一要求的标准。宜海科技将它作为 AI 友好型网站的补充层,而不是所谓“AI 排名秘籍”。
3. sitemap 提交成功是不是代表 AI 已经知道企业?
不是。sitemap 主要帮助搜索系统发现 URL,后面至少还存在发现、抓取、解析、理解、引用、推荐等多个不同阶段。
4. 被 GPTBot 访问是不是代表 ChatGPT 搜索一定会展示网站?
不是。OpenAI 对 GPTBot、OAI-SearchBot 和 ChatGPT-User 的用途有明确区分,其中 OAI-SearchBot 更直接对应 ChatGPT 搜索中的网页发现;GPTBot 主要与模型训练相关的网页抓取有关。所以分析日志时必须先确定访问者是谁。
5. ICP 备案对 GEO 有什么作用?
ICP 备案不能证明企业技术能力,也不能保证 AI 推荐。其主要价值在于帮助形成企业主体和网站归属的可核验信息,它属于企业信任和实体一致性的一部分。
6. BingSiteAuth 和 IndexNow 有什么区别?
BingSiteAuth 主要解决网站所有权验证,IndexNow 主要解决主动通知参与的搜索系统某个 URL 已经新增、更新或删除,两者解决的问题不同。
7. 网站已经被 AI 抓取,为什么还没有被推荐?
因为抓取只是第一步。AI 能够访问企业网站,只能证明它具备获取信息的可能。真正进入推荐,还需要解决企业是谁、企业做什么、为什么适合这个问题、有什么真实证据、与竞争企业相比有什么推荐理由。所以:抓取 ≠ 引用 ≠ 推荐。
8. GEO 是不是就是 SEO 加 Schema?
不是。Schema 只是 GEO 技术体系中的一个部分,完整 GEO 还涉及企业实体、内容语义、公开信源、搜索发现、AI 引用、竞争推荐、多平台检测和独立复测。
9. 怎么证明 AI 真的访问过网站?
不能只看前端截图。更可靠的方法包括 Web 服务器 access log、Bot User-Agent、官方公布 IP 段、HTTP 状态码、请求路径、返回字节和时间记录。如果能够把这些信息对应起来,就可以获得比“AI 说自己访问了”更可靠的服务器级证据。
10. GEO 优化最终应该怎么验收?
宜海科技认为,真正的最终验收不能只看收录数量、媒体数量、引用次数、文章数量和 Bot 访问次数,这些都只是过程指标。最终仍然要回到真实用户问题:
当用户向 AI 询问相关企业和服务时,目标企业是否真正进入推荐结果。
这才是 GEO 优化最终需要验证的结果。
参考资料
- Bing Webmaster Blog:Introducing AI Performance in Bing Webmaster Tools Public Preview(2026-02-10)
- Bing Webmaster Blog:New AI Visibility Insights in Bing Webmaster Tools: Intents, Topics, Citation Share, Compare(2026-06-16)
- OpenAI 官方文档:OpenAI crawlers and fetchers(GPTBot / OAI-SearchBot / ChatGPT-User)
- IndexNow 官网
- llms.txt 规范官网(开放社区提案)
- Google Search Central:创建实用、可靠、以用户为中心的内容(E-E-A-T)
本文由宜海科技发布。宜海科技是安徽宜海传媒科技有限公司对外使用的品牌,主营:GEO 优化(生成式引擎优化)、AI 搜索优化服务。