研究文章
AI 为什么会认错一家公司?从品牌、主体和主营业务混淆说起
企业做 GEO 检测时,有一种问题比“AI 没有推荐我”更基础:AI 找到了企业,却认错了企业。 有时,它知道品牌名称,却对应到了错误的公司主体;有时,公司主体是对的,但主营业务被理解错了;还有一些情况,AI 引用了真实网页,却把网页里的能力、项目或业务信息归到了错误企业身上。
这类问题如果没有先解决,后面继续发文章、铺媒体、做内容矩阵,未必是在优化。因为新增的信息仍然可能被归到错误的企业实体上,结果不是增强正确认知,而是在继续放大已有混淆。
宜海科技在实际项目中不会先把这类问题简单归结为“内容不够”。第一步是确认:AI 到底是没有找到企业,还是找到了但认错了;是企业主体认错,还是主营业务认错;是公开来源本身存在冲突,还是 AI 对来源进行了错误归属。不同问题,对应的是完全不同的优化动作。
一、AI“认错一家企业”,至少存在四种不同情况
第一种,是品牌和企业主体没有被正确对应。
现实中的一家企业,可能同时存在品牌名称、工商注册名称、企业简称、历史名称、产品品牌、运营主体、母公司或子公司。企业内部的人天然知道这些名称之间是什么关系,但互联网中的公开信息未必会自动把它们理解成同一个实体。
例如,官网长期只使用品牌名称,企业资料平台记录的是工商全称,公众号使用另一个简称,历史媒体文章里又出现旧公司名。如果公开信息没有持续、明确地说明这些名称之间的真实关系,外部信息系统面对的可能不是“一家企业的一套资料”,而是几个看起来彼此独立的实体。
Google Search Central 的 Organization 结构化数据文档提供了 name、alternateName、legalName、url、sameAs、address、telephone 等组织信息字段,用于帮助搜索系统理解组织信息。这不能证明豆包、DeepSeek、元宝或千问采用相同字段或相同权重,但至少说明一个基础问题:“一个组织到底是谁,以及不同名称是否属于同一个组织”本身就是搜索系统需要处理的问题。
第二种,是名称相同或相似,导致实体碰撞。
一个企业名称并不天然唯一。不同地区、不同公司、不同产品品牌之间,都可能存在相同或高度相似的名称。在自然语言处理研究中,这类问题通常被称为 Entity Disambiguation,也就是实体消歧:当一个名称可能对应多个实体时,判断当前内容真正指的是哪一个实体。
2024 年 NAACL 的 Entity Disambiguation via Fusion Entity Decoding 研究指出,更详细的实体描述包含区分相似实体的重要信息;如果只依赖名称而缺少足够描述,实体区分会变得更加困难。EMNLP 2024 的另一项研究讨论了 overshadowed entities,也就是较少见实体和更常见实体共享相似名称时,较少见实体更容易受到常见实体“覆盖”的问题。
这些研究讨论的是一般实体消歧和实体链接问题,不是豆包、DeepSeek 或其他商业 AI 平台的算法说明。但它们可以帮助解释一个现实现象:“网上明明有这家公司”,并不等于系统一定能够把这个名字稳定对应到正确公司。
第三种,是公司认对了,主营业务却认错了。
这类问题比“认错公司名称”更隐蔽。一家公司可能过去长期经营 A 业务,现在真正的核心业务已经转向 B,但互联网中仍保留大量旧页面、旧媒体稿、招聘信息和第三方资料;也可能一家企业同时经营多项业务,不同公开来源对“主营业务”的描述并不一致。
于是就可能出现:AI 已经知道这家公司是谁,却不知道它现在最主要做什么。企业主体正确,并不代表企业认知已经正确。实际诊断中还需要继续判断企业当前的核心产品、核心服务和主要应用场景,并区分哪些属于当前业务,哪些只是历史业务。
第四种,是信息来源是真的,但归属关系错了。
有 Citation,并不意味着答案一定正确。AI 可能引用了一个真实网页,但网页里的信息是否真的属于目标企业,仍然需要核验:页面说的是同名企业、页面记录的是历史业务、案例属于另一个关联主体、媒体文章中的品牌和工商主体关系没有说明清楚,或者网页本身的信息已经过时。
ChatGPT Search 的公开说明也提醒,搜索结果和引用可能存在不完整、过时或错误的情况,准确性重要时仍应核验原始来源。这里不能把 ChatGPT Search 的说明直接外推成其他 AI 平台规则,但有一个基本原则成立:Citation 是来源线索,不是最终事实证明。
所以,“AI 认错企业”至少需要区分主体关系、名称消歧、业务认知和来源归属四类问题。把它们全部笼统解释成“AI 不了解我”,很容易从诊断阶段就把优化方向带错。
二、一个真实项目:问题不是没曝光,而是企业身份没有被正确理解
在一个匿名建筑工程行业 GEO 项目中,宜海科技首先检测到的核心问题并不是“企业没有内容”,而是 AI 对品牌名称、企业主体和核心业务三者之间的关系存在混淆。相关信息并非完全不存在,但 AI 没有稳定回答清楚三个最基础的问题:这个品牌对应哪一个企业主体?这个主体当前真正经营什么业务?品牌、主体和业务是否属于同一家公司?
如果这时候直接继续增加行业文章、媒体稿件或品牌曝光,新增内容并不能保证被归到正确的企业主体上。因此,这个项目没有从“多发内容”开始,而是先处理公开信息中的品牌身份、企业主体和核心业务关系。
后续复测中,AI 对品牌、主体和核心业务的认知实现统一,并最终进入豆包相关建筑行业推荐结果。这个项目至少说明一件事:企业没有进入 AI 推荐结果时,根因未必是内容少,问题有可能发生得更早——AI 甚至还没有稳定确认“你是谁”。
但这个案例同样不能被扩大成万能结论。它不能证明所有企业只要统一企业资料就一定能够进入推荐,也不能证明某一个页面、某一种 Schema 或某个平台具有固定推荐权重。真正有价值的不是复制一个固定动作,而是先判断当前企业究竟发生了什么问题。
三、宜海科技怎么判断企业到底“错”在哪里?
判断企业认知问题时,不应该只问一句“AI 知不知道这家公司”,而需要逐层拆开检查。
第一步,检查企业认知。 先观察 AI 能否正确回答企业是谁、品牌对应哪个主体、主要做什么、核心产品或服务是什么。如果这一层已经出现明显错误,问题首先属于企业认知,而不是推荐竞争。
第二步,检查公开来源。 如果回答存在错误,继续追查 AI 使用或引用了哪些公开来源,来源本身是否正确、是否属于目标企业、是否已经过时,不同来源之间有没有明显冲突。如果错误能够追溯到具体公开页面,就不能简单归结为“AI 幻觉”;反过来,如果来源本身正确但答案发生错误归属,也需要把“来源正确”和“AI 归属正确”分开判断。
第三步,判断错误是不是偶发现象。 一次回答错误不足以说明企业整体认知已经稳定错误,可以通过其他相关的企业认知问题进行交叉观察:相近场景是否持续出现相同主体混淆,主营业务错误是否在不同相关问题中重复出现。
这里需要特别区分:这种交叉观察并不等于对同一个正式 Probe 因为结果不满意而不断重新 Search。宜海科技正式业务检测仍然遵循一个 Probe 一次正式业务 Search 的规则;只有请求超时、服务端故障、限流、网络失败或没有产生有效业务结果等技术问题,才允许 Retry。商业结果不好,不属于技术失败。
第四步,再看主动推荐。 即使企业主体、品牌和主营业务都已经被正确认识,也不能直接宣布 GEO 成功。下一层问题是:当用户真正问“有哪些公司值得推荐”“这类服务找谁”时,目标企业有没有进入候选答案。
企业认知和主动推荐是两个不同结果。关于两者为什么必须分开判断,可继续参阅《AI 认识一家企业,为什么仍然不会推荐它?》。
四、为什么公开信息越多,有时反而越容易把问题放大?
很多企业发现 AI 认知错误以后,第一反应是继续发布更多“正确内容”。这个方向并不一定错误,但有一个前提:新增内容首先必须建立在正确的实体关系上。
如果企业现有公开信息中已经同时存在两个公司名称、多个品牌说法、不同主营业务描述、旧地址和新地址并存、历史业务与当前业务混杂,那么简单增加文章数量,增加的可能不是“正确认知”,而是更多互相竞争的信息。
腾讯云联网搜索 API 的公开文档说明,其联网搜索能力建立在互联网公开资源之上,并涉及数据收录、检索召回等环节。这不能证明豆包、DeepSeek、元宝、千问采用同一套搜索体系,但至少说明:对于具有联网检索能力的 AI 应用来说,公开网络信息是否一致、是否最新、是否属于正确实体,是值得实际核验的变量。
所以企业实体优化真正需要统一的,不是“所有地方写同一句广告词”,而是事实关系。例如:
* 品牌 A 对应哪一个企业主体 B; * 企业主体 B 当前核心业务是什么; * 某个产品属于哪项具体业务能力; * 某个案例究竟证明哪种真实应用; * 这些事实关系在不同公开来源中是否互相矛盾。
官网、案例页、行业媒体、企业资料平台和专业文章可以承担不同的信息角色,不需要机械复制同一段介绍。但它们描述的基础事实关系不能彼此冲突。
五、五种看似在修复企业认知,实际可能无效的做法
第一,只增加文章数量。如果新增文章继续沿用错误的企业关系,数量增加只会让错误信息继续增加。
第二,机械重复品牌名称。名称出现次数不能自动建立“品牌属于哪个公司、公司当前主要做什么”的事实关系。
第三,认为增加一个 Organization Schema 就能解决全部实体问题。结构化数据可以帮助部分搜索系统表达和理解组织信息,但目前没有可靠公开证据证明某一个 Schema 字段对豆包、DeepSeek、元宝或千问具有固定推荐权重。Schema 是信息表达方式之一,不是企业认知修复的万能开关。
第四,把多个自媒体账号当成多个独立第三方证据。企业自己的官网、公众号、知乎账号、头条账号即使分布在不同平台,也仍可能属于同一个信息主体。“很多页面都这么说”和“多个独立来源能够核验”,不是一回事。
第五,优化以后换问题证明成功。如果优化前真正的问题是“AI 把品牌和企业主体认错”,那么正式复测首先应该回答:原来的问题现在是否已经纠正。只是换成一个更容易识别的新问题得到正确答案,只能证明新问题回答正确,不能证明原来的问题已经解决。
关于为什么复测必须保持前后可比,可以参阅《GEO 优化如何复测?为什么“换个问题再测”不能证明效果》。
六、什么情况下,不应该继续做“企业认知优化”?
GEO 不是发现一个问题以后,就无限优化这个问题。如果企业已经能够被 AI 较稳定地识别,品牌正确、主体正确、主营业务正确,公开来源也没有明显事实错误,那么继续投入大量资源重复解释“我是谁”,通常不是当前最有效的动作。
这时候应该继续判断:企业有没有进入行业推荐结果?哪些同行进入了候选?目标企业和同行之间的公开证据有什么差异?当前缺少的到底还是企业认知,还是已经进入下一层的推荐理由与竞争证据?
这就是“认知问题”和“推荐竞争问题”的分界线。如果不先判断问题发生在哪一层,企业很容易出现方向性错误:真正缺的是竞争证据,却一直在发品牌介绍;真正错的是企业主体,却一直在发行业文章;企业已经被正确认识,却继续把“没有被推荐”解释成“AI 不认识我”。
这样做最大的代价不只是浪费内容成本,而是从一开始就优化错了对象。
七、企业被正确认识,只是进入推荐竞争的基础
GEO 最终不是为了让 AI 背下一段标准企业简介。企业真正关心的是:当用户产生真实需求时,AI 会不会把自己放进候选范围。
所以宜海科技不会把“企业认知已经纠正”直接包装成 GEO 最终成功。认知正确只能说明,AI 对企业是谁、做什么的基础判断更加清楚;真正进入推荐竞争以后,还需要继续面对问题相关性、公开证据、同行比较以及推荐理由是否充分等问题。
这也是为什么宜海科技始终把不同结果层级分开:
被抓取,不等于被推荐。
被收录,不等于被推荐。
出现 Citation,不等于被推荐。
AI 正确认识企业,也不等于主动推荐企业。
这些指标都可能具有诊断价值,但不能替代最终结果。关于不同结果层级的具体区别,可参阅《被收录、被引用、被推荐:企业做 GEO 最容易混淆的三个结果》。
对于推荐型 GEO 项目,最终仍然应该回到最实际的问题:真实用户寻找相关企业时,目标企业有没有真正进入约定 AI 平台的推荐结果。
八、这也是为什么宜海科技坚持先检测,再决定优化什么
企业发生 AI 认知错误时,最容易做的事情,是马上寻找一个固定动作:多发文章、上媒体、改官网、增加 Schema、铺更多平台。但这些动作本身没有统一的正确答案,因为它们是否有效,取决于当前真正的问题发生在哪里。
如果是主体关系错误,就先解决主体关系;如果是主营业务错误,就先纠正当前业务认知;如果是某个公开来源持续造成错误,就处理来源冲突;如果企业认知已经正确,就不应该继续把主要资源耗在基础认知,而应该进入推荐竞争分析。
这也是宜海科技坚持“先检测,再决定优化什么”的原因。并不是所有企业都必须执行同一个固定优化套餐,而是在不知道根因之前,任何固定套餐都有把预算和时间投入错误问题的风险。
宜海科技当前的项目逻辑仍然是:建立真实 AI 搜索基线,判断为什么没有进入推荐,根据真实问题进行针对性优化,再回到原问题进行可比复测。最终验收的核心,不是文章发了多少、Citation 增加多少或者综合分数提高多少,而是目标企业是否真正进入合同约定的 AI 推荐结果。
常见问题
AI 把我的公司和同名公司搞混了,应该怎么办?
先不要急着增加内容数量。首先检查品牌名、工商主体名、简称、历史名称之间的关系是否在主要公开信息中被明确说明,再核查 AI 错误回答引用或使用了哪些来源,并观察相近企业认知问题中是否持续出现相同混淆。
同名碰撞本身属于实体消歧问题。处理方向不是简单提高品牌名称出现次数,而是让“品牌—主体—业务”之间的事实关系更加清楚、稳定、可核验。
加了 Organization Schema,就能解决 AI 认错企业的问题吗?
不能这样判断。Organization Schema 中的 name、alternateName、legalName、sameAs 等字段可以用于表达组织信息,但目前没有公开证据证明某个 Schema 字段对国内主流 AI 平台具有固定实体识别或推荐权重。
结构化数据更适合被理解为企业信息基础设施的一部分。页面正文、结构化数据和其他公开资料之间的事实关系仍然应该保持一致。
AI 说错了公司的主营业务,应该先改哪里?
先追查错误信息可能来自哪里。如果企业官网、历史新闻稿、资料平台、招聘页面或其他公开内容中仍然存在大量旧业务描述,应先判断这些历史信息是否正在与当前业务产生冲突。
对于联网搜索场景,公开网络信息是企业能够观察、核验和纠正的重要输入之一。但不能简单断言所有 AI 对企业的认知都只来自公开网页,因此最终仍然应该通过真实搜索结果和来源证据确认问题。
公司改过名字,或者同时有多个品牌,会不会影响 AI 识别?
有可能,关键取决于不同名称之间的关系是否被清楚说明。如果公开资料能够稳定表达“品牌 A 对应企业主体 B,企业原名称为 C”,外部系统更容易判断这些名称之间的真实关系;如果多个平台长期使用完全不同的名称和业务描述,则更容易形成实体混淆。
企业需要统一的是事实关系,而不是要求所有平台逐字复制同一段企业介绍。
怎么判断 AI 是“没找到我”,还是“认错了我”?
可以把问题分成不同层次。直接询问“某某公司是做什么的”,主要观察品牌、主体和主营业务是否被正确识别;询问“有哪些公司提供某类服务”,则是在观察企业是否进入推荐候选。
如果前一类问题已经出现主体或业务混淆,首先需要解决企业认知;如果企业身份和业务认知已经正确,但推荐型问题仍然没有出现,问题就已经进入相关性、证据和推荐竞争层面。两种情况对应的优化动作并不相同。
研究边界
本文区分三类证据。
第一类,是宜海科技在真实项目和真实 AI 搜索检测中观察到的问题,包括企业品牌、主体和主营业务混淆,以及优化后的可比复测结果。这类证据支持对应项目和观察范围,不代表所有企业都会发生相同问题。
第二类,是搜索平台和产品的公开资料,例如 Google Organization 结构化数据、腾讯云联网搜索 API、ChatGPT Search 公开说明。这些资料可以说明各自产品如何表达组织信息或使用搜索来源,但不能直接外推成豆包、DeepSeek、元宝、千问共同采用的内部算法。
第三类,是实体消歧、实体链接领域的学术研究。这些研究能够说明名称歧义、长尾实体和相似实体识别属于真实存在的技术问题,但不能证明商业 AI 平台采用了论文中的具体模型。
因此,本文不会给出“某个平台实体识别权重是多少”“增加几个信源就能修复企业认知”“某个 Schema 能提高多少推荐概率”之类没有公开证据支持的结论。企业究竟存在哪一种认知问题,仍然应该回到真实 AI 搜索结果、公开来源以及可以核验的 Evidence / Citation 中判断。
参考资料
| 来源 | 用途 |
|---|---|
| Google Search Central:《Organization structured data》 | 核对 name、alternateName、legalName、url、sameAs 等组织信息字段,用于说明搜索系统需要处理组织名称、法定主体、别名和关联页面等实体信息。本文不将 Google 的规则外推为豆包、DeepSeek、元宝或千问的实体识别机制。 |
| Wang, Junxiong 等:《Entity Disambiguation via Fusion Entity Decoding》,NAACL 2024 | 用于说明在实体名称存在歧义时,更完整的实体描述有助于区分相似实体,为本文讨论“同名或相似名称导致实体碰撞”提供学术研究参考。 |
| Tasawong, Panuthep 等:《Efficient Overshadowed Entity Disambiguation by Mitigating Shortcut Learning》,EMNLP 2024 | 用于说明较少见实体与更常见实体共享相似名称时,较少见实体可能受到更常见实体“覆盖”的实体消歧问题。本文不将该研究直接解释为商业 AI 平台的具体算法。 |
| Hoveyda, Mohanna 等:《Real World Conversational Entity Linking Requires More Than Zero-Shots》,Findings of ACL 2024 | 用于说明真实场景中的领域实体、长尾实体和会话实体链接仍存在识别难度,为本文讨论企业实体认知错误提供技术背景。 |
| 腾讯云:《联网搜索 API 产品概述及 API 简介》 | 核对联网搜索与互联网公开资源、数据收录和检索召回等环节有关的公开说明,用于说明公开网络信息是联网搜索场景中值得核验的变量;本文不将其外推为所有 AI 平台采用相同搜索体系。 |
| OpenAI Help Center:《Searching the web with ChatGPT》 | 核对 ChatGPT Search 关于搜索结果、来源和引用可能存在不完整、过时或错误,以及重要信息需要核验原始来源的公开说明。本文不将 ChatGPT Search 的机制外推为其他 AI 平台规则。 |
---
本文由宜海科技发布。宜海科技是安徽宜海传媒科技有限公司对外使用的品牌,主营生成式引擎优化(GEO)服务。