第 3 章 / 共 3 章
企业事实库怎么建
AI 说错你公司的事,根因通常在上游内容彼此矛盾或陈旧。本章讲企业如何把核心事实整理成一条一事实、带出处、时点与核验入口的权威资产,并保持跨源一致与持续维护。
境迅研究团队
本章目录
- AI 说错你公司的事,根因通常不在 AI
- 三种典型失真
- 事实库不是官网内容的复制品
- 哪些事实必须进
- 一条事实该怎么写
- 放在哪儿:让权威版本容易被找到
- 跨源一致:同一件事,在哪儿都得长一个样
- 维护:变更即失效
- 三个自检问题
- 这件事解决什么、不解决什么
企业第一次认真去问 AI"我们公司怎么样"的时候,常见的反应是不适:数字是三年前的,资质说少了一项,某个业务被安到了同行头上,还有一段来源不明的负面转述被当成事实复述出来。
接下来的第一反应通常是"去纠正 AI"。但生成式回答没有一个可以提交勘误的入口,你也没法要求它下次别这么说。真正能作用的地方在更上游:AI 关于你的说法,是从它当时检索到的内容里读出来的;当这些内容彼此矛盾、或者都很陈旧时,它只能在其中挑一个。
这一章讲的就是那个上游——把企业自己的核心事实整理成一份权威、一致、可核验的资产。它是企业自己的资产,不是任何服务商的方法论;建完之后归企业所有,换谁来做后续工作都用得上。
AI 说错你公司的事,根因通常不在 AI
上一章的数据说明了一件事:在被引用的内容里,企业自己的官网只占很小一部分,绝大多数引用来自各类媒体、门户与平台内容。也就是说——AI 关于你的绝大部分说法,是从别人写你的内容里读来的。
这带来一个直接推论:如果没有一个权威、清晰、易于取用的事实源,那么关于你的说法就由散落各处的二手转述来决定。这些转述的共同特点是:写作时点各不相同、准确度参差、且几乎不会因为你的情况变化而更新。
纠偏的办法不是去追每一篇转述,而是让权威版本存在、清晰、且容易被找到。这就是事实库的职能。
三种典型失真
把常见的错误归一下类,会发现它们的成因不同,处理方式也不同。
其一,过期数据。最常见,也最容易被低估。企业的注册资本变了、业务范围扩了、某项资质换证了、经营规模上了一个台阶——但网上留存的仍是旧版本,而且旧版本往往传播得更广、被引用得更多。这类失真的特点是:它曾经是对的,所以任何一次单点核查都很难发现它错了。
其二,二手转述的层层衰减。一段准确的表述,经过榜单稿、行业综述、自媒体解读几轮转写,会逐步丢失限定条件。"在某细分领域的某项指标上位居前列"变成"行业第一","某年度某口径的数据"变成"目前的数据"。每一轮转写单看都不算离谱,叠加起来就与事实相去甚远。丢掉的总是限定条件,而限定条件恰恰是事实的一部分。
其三,竞品误归因。同一赛道的企业在内容里经常被并列提及,某项能力、某个案例、某项资质被安到了邻居头上。这类错误对企业的伤害最直接,也最难自查——它不出现在关于你的内容里,而出现在关于别人的内容里。
三类失真的共同解法只有一个:存在一个明确的、带出处与时点的权威版本。没有它,任何一次纠正都只是往噪声里再加一条噪声。
事实库不是官网内容的复制品
很多企业以为事实库就是"把公司介绍再放一遍"。两者的差别在于结构。
公司介绍是写给人读的:有叙事、有形容词、有语境,一段话里往往混着好几件事。事实库是写给机器抽取的:一条一事实,自带出处、时点与核验方式。
一条合格的事实条目应当有四个要件:
| 要件 | 含义 | 缺了会怎样 |
|---|---|---|
| 陈述 | 一句话说清一件事,不夹带评价 | 混着几件事的段落被摘取时会断错地方 |
| 出处 | 这条事实的来源:发证机构、公告、登记信息 | 无从核实,与传闻同级 |
| 时点 | 该事实成立的时间,或数据的统计截止时间 | 过期后无人知道它已过期 |
| 核验入口 | 第三方可以自行查证的地址或编号 | 只能要求对方相信你的转述 |
第四项是最容易被省略、也最有分量的一项。一家公司说自己有某项资质,和一家公司给出资质编号与官方查询入口,是两种不同强度的陈述。前者要求相信,后者允许核验。在一个人人都在自我陈述的信息环境里,允许核验本身就是稀缺的信号。
哪些事实必须进
范围不必贪大。按被问到的频率与被说错的代价排序,以下五类是起步集合:
- 主体与资质——主体全称(与营业执照完全一致)、统一社会信用代码、成立时间、注册资本、经营范围;各类许可证、认证、备案的名称、编号、发证机构与有效期。这是最常被说错、也最容易被核验的一类。
- 业务与产品参数——产品与服务的名称、适用范围、关键参数、技术指标。凡是可能被拿去做对比的数字,都要带口径。
- 经营与规模数据——可公开的经营数据、服务规模、覆盖范围。每一个数字都必须带统计口径与截止时点,否则它一旦被引用,就永远是"目前"。
- 合规与披露——按行业要求必须披露的信息、公告、风险提示的规范表述。上市公司还应包含信息披露语境下的表达边界。
- 常被问到的判断题——那些反复被问、答案其实明确、但网上说法混乱的问题。它们通常是二手转述失真最严重的地方。
反过来,有两类东西不该进事实库:一是尚未发生或尚未确定的事(在建、筹备、意向);二是评价性表述(领先、优秀、首选)。前者会在传播中被当成既成事实,后者不可核验,进了事实库只会稀释其余条目的可信度。
一条事实该怎么写
两条写作原则,都很朴素,但决定了这份资产的实际可用性。
原则一:一条只讲一件事。把"公司成立于某年,注册资本某额,持有某项许可证"拆成三条。理由是抽取粒度——检索侧摘取的往往是一个片段而不是整段,一段里塞三件事,被摘走一件时另外两件的限定条件就丢了。
原则二:每一条都能独立成立。一条事实离开它的上下文之后,仍然应当是完整、准确、不产生歧义的。这条原则的检验方法很直接:把这句话单独复制出来,发给一个完全不了解公司的人,他会不会误解?如果会,那它就还不是一条合格的事实。
常见的不合格写法:
- "我们的市场份额位居前列"——无口径、无时点、无出处,三个要件全缺。
- "服务超过 500 家企业"——缺时点。它会被当成"目前",而写下这句话的那天可能是三年前。
- "通过了国家权威认证"——缺具体名称与编号,无法核验,且"权威"是评价不是事实。
同一件事的合格写法:"截至某年某月,累计服务企业客户 500 家以上(口径:签署服务合同并完成交付的客户数)。"多出来的是口径与时点,而它们才是让这句话可被引用、也可被检查的部分。
放在哪儿:让权威版本容易被找到
一份只存在于内部文档里的事实库,对外没有作用。它必须有一个公开、稳定、可被检索到的落点,否则前面所有工作都停留在企业内部。
对落点的三条要求:
- 可被正常收录。上一章的通道图已经说明,五个平台全部借道搜索索引。一个必须登录才能看、或者要靠 JS 才能渲染出正文的页面,对检索侧基本不存在。这一条是前提,不是加分项。
- 逐条呈现,不要塞进一大段。每条事实各自成块,陈述、出处、时点、核验入口就近排列。原因回到上一节的抽取粒度:检索侧摘走的是片段,片段边界应当与事实边界重合。一整屏连成一片的公司介绍,摘出来的必然是半句话。
- 把核验入口真的给出来。资质编号旁边给官方查询地址,登记信息旁边给公示系统入口。这一步是许多企业停下来的地方——写出编号已经算详细了,再给一个"你可以自己去查"的链接,心理上像是多此一举。恰恰相反:它是全部事实条目里唯一无法伪造的部分。
还有一个常被忽略的位置:行业主管部门、登记机关、交易所等权威渠道上的公开信息,本身就是最高等级的事实源。它们不归企业管,但企业有义务保证自己在那里登记的信息是最新的。当官网说法与官方公示不一致时,吃亏的一定是官网。
跨源一致:同一件事,在哪儿都得长一个样
事实库建好之后,真正的工作才开始:让同一条事实在所有对外出口上保持一致。
典型的不一致来源:官网写主体简称、公开登记信息用全称;宣传材料写"成立十余年"、登记信息是具体年份;不同渠道引用的是不同年份的同一项数据。这些在人看来都是同一件事,但在跨源比对时是三个不同的说法。
需要重点对齐的有三处:
- 主体全称。以营业执照为准,全站一致,简称只在明确标注为简称时使用。这一条看似琐碎,但它是所有跨源关联的锚点——名字对不上,后面的一致性无从谈起。
- 资质与编号。名称按证书原文,不做简化;编号完整;发证机构写全名。
- 数字与口径。同一个指标在任何地方出现都用同一口径,并附同一个截止时点。若口径变更,旧口径的数据要一并标注,而不是悄悄替换。
一致性工作的价值,在于它让核验成为可能:一个第三方想确认你说的是不是真的,顺着出处与编号能查到同样的答案。反过来,当同一件事有三个版本时,核验的结果是"说不清",而"说不清"在信任上等同于"不可信"。
维护:变更即失效
事实库最常见的失败方式不是建不起来,是建起来之后没人维护。半年之后它比散落各处的二手转述还旧,反而成了新的错误源。
三条维护纪律:
其一,变更即失效。任何一项事实发生变化——换证、增资、口径调整、数据更新——事实库里的对应条目立刻标记失效,并在更新完成后同步到所有对外出口。不要先改官网、再慢慢改其他地方,那段时间差里产生的内容会长期留在网上。
其二,带有效期的条目要有到期提醒。许可证、认证、备案都有有效期。到期未更新的条目,状态应当是"已过期"而不是继续以现行事实的面目出现。一条过期的资质信息比没有这条信息更糟。
其三,定期复核,而不是等到出问题才查。给事实库一个固定的复核节奏——至少每季度过一遍时点类字段(数字、规模、截止日期),每年过一遍资质类字段。复核的成本远低于事后纠正的成本,因为事后纠正要面对的是已经扩散出去的副本。
三条纪律都指向同一个前提:每一类事实要有明确的责任人。资质类归法务或行政,经营数据归财务或业务口,产品参数归产品口——不是因为分工好看,而是因为只有这些人第一时间知道数据变了。一份挂在市场部名下的事实库,最终会退化成"市场部按季度去问一圈",而那一圈里漏掉的一次,就是下一条过期事实。
与责任人配套的是一条同样朴素的记录纪律:每条事实留下"最后核对时间"。它的作用不在于展示勤勉,而在于让人一眼看出哪些条目已经很久没人碰过——没有核对时间的事实库,无法判断它是准确还是只是没人管。
三个自检问题
判断一份事实库是不是真的能用,不需要复杂的评估,问三个问题就够了:
- 随便挑一条,能不能在五分钟内由一个外部人独立核验?如果不能,缺的多半是出处或核验入口。
- 随便挑一个数字,它的口径和截止时点写在哪儿?如果答案是"没写"或"要问某某",那这个数字一旦被引用就会失控。
- 上一次变更是什么时候同步完所有出口的?如果想不起来,或者答案是"官网改了,其他还没",那么一致性实际上不存在。
这三个问题也是把事实库做扎实的顺序:先能核验,再有口径,最后是同步纪律。
这件事解决什么、不解决什么
需要把预期说准,否则事实库很容易被包装成一个能直接换来可见性的杠杆来卖——它不是。
它解决的是准确性问题。当关于你的信息被检索、被摘取、被复述时,有一个权威版本存在,并且这个版本容易被找到、容易被核验。这减少的是失真,不是别的。
它不解决可见性问题。建一份事实库,不会让 AI 更频繁地提到你——上一章的信源结构数据已经说明,提及主要由其他类型的信源驱动。把"建事实库"和"提升引用率"用因果关系连起来,是一个我们不做、也建议你不接受的承诺。
用一句话概括这两者的关系:事实库的价值在于被引用时说的是对的,而不在于成为被引用的那一个。这两件事对应的工作方法不同,预期也应当分开设定。
还有一件它不解决的事:事实库不能替代合规审核。一条事实完全准确,不代表它可以在任何渠道、由任何主体、以任何形式发布——那是第一章讲的边界问题,与准确性是两条独立的线。两者都过了,一段内容才算可以出门。