1998 年,拉里·佩奇和谢尔盖·布林在斯坦福大学的宿舍里发明了 PageRank。它的核心直觉朴素而天才:一个网页的重要性,取决于有多少其他网页链接到它。链接就是选票,被引用越多越权威。这套逻辑统治了互联网二十八年。
2022 年 11 月,ChatGPT 发布。事情变了。
当用户开始在对话框里打字问"成都三环内性价比高的婚纱摄影推荐,预算 8000 以内,最好能拍外景",搜索引擎不再是返回一堆蓝色链接让你自己翻——而是直接生成一个完整的回答。这个回答引用了一些来源,忽略了一些来源,把信息重新排列组合成了一个对你当下可用的答案。
这就是从"检索"到"生成"的范式转移。传统 SEO 的全部工具箱——关键词密度、锚文本、外链权重、标题标签——都是为"检索"范式设计的。当搜索引擎不再检索,这些工具就失去了着力点。
但这不是说优化本身死了。恰恰相反:新的优化才刚刚开始。 只是我们需要重新理解——AI 搜索引擎到底在做什么?
任何一个行业的方法论,都预设了一个关于"意义是如何产生的"默认答案。传统 SEO 的默认答案是:一个词的意义,就是它所指代的那个东西。 这就是哲学家说的"指称论"(referential theory of meaning)。
指称论在 SEO 中的操作化很简单:"糖尿病饮食"是一个词,这个词指代的对象是"关于糖尿病饮食的那些网页"。如果你的标题包含这个词、正文多次出现这几个字、URL 里有 tangniaobing-yinshi——那么你的网页就"是"这个词所指代的东西。SEO 的全部工作就是让搜索引擎相信:我的网页与那个词之间的指称关系更强。
考虑一个真实的搜索 query:"糖尿病吃什么"。它可能出现在三种完全不同的情境中:
| 情境 | 用户 | 真实需求 | 需要的回答 |
|---|---|---|---|
| A | 刚确诊的患者 | "我昨天查出血糖高,完全不知道什么能吃什么不能吃" | 一份清晰的"红灯/黄灯/绿灯"食物清单,重点是黑名单 |
| B | 健身爱好者 | "听说控糖饮食有助于减脂,想把精制碳水换掉但不影响训练表现" | 升糖指数对比表 + 运动营养角度的碳水替代方案 |
| C | 基层医生 | "ADA 2026 指南对二甲双胍联合饮食干预的推荐级别有没有更新?" | 最新临床指南具体条文 + 证据等级标注 + 参考文献 |
三个不同的情境,同一个 query,需要的回答完全不同。但指称论无法区分这三种差异——它只能回答"哪个网页包含更多'糖尿病'和'吃'这两个字"。这就是 AI 搜索彻底改变的东西:AI 不再匹配词与词,而是判断一段内容在当前使用情境中是否"能用"。
这个转变有一个哲学史上的精确镜像。1921 年,年轻的维特根斯坦在《逻辑哲学论》中主张:语言是世界的图像——命题与事态之间存在一一对应关系,就像地图与地形的对应。这是"指称论"的极致版本。1953 年,晚年的维特根斯坦在《哲学研究》中彻底否定了自己。他提出了一个完全不同的观点:一个词的意义不在于它指代的对象,而在于它在语言中的使用方式。
"每一个符号自身似乎是死的。是什么给了它生命?——在使用中它才是活的。" ——《哲学研究》§432
"有效着法"是什么意思?一着棋是有效的,不是说它"符合语法",而是说在当前的棋局状态和规则下,它能帮助你达成目的。同样,一段内容在 AI 搜索中是有效的,不是说它"包含正确的关键词",而是说在当前用户的问题和情境下,它能切实地帮助用户解决问题。
维特根斯坦没有给"语言游戏"下过严格定义,但他举了足够多的例子:下达命令并服从命令、描述物体的外观、报告一个事件、编故事、猜谜、讲笑话、请求、感谢、诅咒、问候、祈祷。这些例子的共同点是:语言总是嵌在一种行为方式中的。 说话不是在描述世界,而是在做一件事。
| 维特根斯坦概念 | 哲学含义 | GEO 工程对应 |
|---|---|---|
| 语言游戏 | 语言活动 + 行为 + 情境交织成的整体 | 一次完整的 AI 搜索问答——query + 真实需求 + AI 回答 + 引用来源 |
| 意义即用法 | 词的意义由它在语言中的使用决定 | 内容的"相关性"不由关键词决定,而由能否完成用户意图任务决定 |
| 家族相似性 | 同一类事物没有共同本质,只有交叉重叠的相似性网络 | AI 靠语义向量在高维空间中的相似性网络召回,不靠精确关键词匹配 |
| 生活形式 | 语言游戏的底层土壤——共同的行为方式和世界观 | 搜索场景分类:消费决策、医疗健康、金融理财、教育学习——每一种是不同的"生活形式" |
| 遵守规则 | 语言游戏中的正确着法由公共的、可检验的规则决定 | AI 推荐算法就是这个语言游戏的"语法规则" |
| 私人语言论证 | 不存在只有一个人能懂的私人语言——意义必然是公共的 | 孤立的不被任何外部信源验证的内容不可信——这是"信源交叉验证"的哲学基础 |
这个认识论的转变直接导向不同的操作方法。
| 传统 SEO(指称论) | GEO(语言游戏论) | |
|---|---|---|
| 第一步 | 关键词研究 → 找搜索量大、竞争低的关键词 | 语言游戏识别 → 用户在什么情境下搜索?想达成什么目的? |
| 第二步 | 内容生产 → 围绕关键词,确保密度和位置 | 游戏规则理解 → 目标 AI 引擎用什么标准评判"正确回答"? |
| 第三步 | 站内优化 → TDK、内链、结构化数据 | 最优着法设计 → 内容的结构、深度、信源怎么组织才能成为"正确回答"? |
| 第四步 | 站外建设 → 外链、友链、社交媒体信号 | 着法有效性验证 → 优化后的内容是否确实获得了更多推荐? |
| 第五步 | 监测排名 → 用工具跟踪关键词排名 | 规则演化跟踪 → AI 算法在变化,周期性对比实验是必要的 |
以"成都婚纱摄影推荐"为例,列它在三个主流 AI 引擎中所处的不同语言游戏:
| 引擎 | 信源偏好 | 内容偏好 | 时效敏感 | 正确着法 |
|---|---|---|---|---|
| 百度 AI 搜索 | 百家号 > 百科 > 官方 | 列表型 > 分析型 | 极高(≤3天) | 每周发"最新价格/套餐/实拍"图文列表,800–1500 字 |
| DeepSeek | 技术社区 > 学术 > 博客 | 深度 > 广度 | 中等 | 3000+ 字方法论文章,含评分框架和避坑清单 |
| 小红书 AI | 站内笔记 > 个人体验 | 体验叙述 > 分析 | 高 | 新娘第一人称"备婚日记"系列,500–1000 字配实拍图 |
本章是全书的核心方法论。我们提出一个三层打分体系(L1-L2-L3),基于星图增长的内容实验、AI 巡检和多平台发布实践。
GEO 行业目前充斥着各种"优化建议":标题要含关键词、正文要结构化、信源要权威……这些建议有两个根本缺陷:不可证伪("标题要好"——什么算好?多少字算好?)和不可审计(内容没被推荐时,无法定位具体是哪里出了问题)。
打分体系解决了这两个问题。可证伪——如果模型预测"版本 A 得分 86"但实测推荐率只有 30%,模型就被实验推翻了。可审计——12 个维度逐项打分,丢分的地方一目了然。
L1 评估的是:无论哪个 AI 引擎,这些维度都是基础门槛。它继承并修正了艾奇白皮书的七维度模型。核心改动:砍掉最弱的子维度,新增了艾奇白皮书完全缺失的两个维度:论证深度和信息密度。
标题是 AI 判定"这篇文章讲什么"的第一信号。核心语义 = 主体 + 需求动作 + 场景属性(地域/风险)。一票否决机制:如果标题核心语义与 query 核心语义完全无关,标题相关性直接判 0 分,内容失去推荐资格。
这是与传统 SEO 最本质的断裂点。传统 SEO 评判正文质量的方式是:关键词出现了几次?在什么位置?AI 搜索引擎评判的方式是:这篇内容有没有真正解决用户的问题?
| 用户问什么 | 正文必须有什么 |
|---|---|
| "怎么做" | 完整的步骤链:准备 → 执行 → 验证。缺一环扣分 |
| "哪个好" | 对比框架。单列产品名不得分 |
| "多少钱" | 价格区间 + 影响因素分析 |
| "为什么" | 因果推导链,不能只陈述结论 |
在星图增长的实践中,传统内容评估往往过度依赖外部信号,缺少对内容内在质量、论证深度和信息密度的评估。我们在此提出八维度模型:
| 维度 | 分值 | 类型 | 核心评估问题 |
|---|---|---|---|
| 媒体权威性 | 18 | 外部信号 | 内容发布平台在业内处于什么权威层级? |
| 专业客观性 | 18 | 内容质量 | 论证是否有推导链条?结论是否有边界说明? |
| 时效性 | 15 | 外部信号 | 信息的发布时间是否在有效窗口内? |
| 信源交叉验证 | 14 | 外部信号 | 同样的判断是否有 ≥2 个独立信源支持? |
| 论证深度 🆕 | 13 | 内容质量 | 多角度覆盖、反常识角度、推导链条深度 |
| 经验真实性 | 12 | 内容质量 | 是否有实操细节、真实案例、失败反思? |
| 信息密度 🆕 | 6 | 内容质量 | 单位字数有效信息量,排除水分和车轱辘话 |
| 内容结构化 | 4 | 呈现形式 | 层级清晰、关键信息标注、可快速扫描 |
| L1 维度 | DeepSeek | 百度 AI | ChatGPT | 元宝/腾讯 |
|---|---|---|---|---|
| 标题语义匹配 | 18% | 26% | 20% | 22% |
| 正文需求满足度 | 24% | 20% | 15% | 20% |
| 媒体权威性 | 10% | 20% | 24% | 18% |
| 专业客观性 | 20% | 12% | 16% | 12% |
| 时效性 | 10% | 18% | 12% | 16% |
| 信源交叉验证 | 15% | 8% | 14% | 10% |
| 论证深度 | 20% | 8% | 10% | 8% |
| 信息密度+结构化 | 10% | 16% | 14% | 16% |
打分体系如果只是一个"打分框架",不管设计得多精巧,它仍然是自说自话。它需要有自我纠正的能力——而这个能力来自波普尔的证伪主义。
| 指标 | 含义 | 采集方式 |
|---|---|---|
| 推荐率 | 内容在目标引擎的 N 条相关回答中出现的比例 | 自动化 API 查询或手工抽样 |
| 引用率 | 被 AI 直接标注为信息来源的比例 | 解析 AI 回答中的引用链接/脚注 |
| 位次 | 在回答中被引用的顺序 | 人工标注或结构化解析 |
| 时效衰减 | 推荐率随内容发布时间的下降斜率 | 时间序列追踪 |
| 跨引擎一致性 | 同一内容在不同引擎上的表现差异 | 多维对比矩阵 |
L3 的存在使得整个打分体系不是一个产品,而是一个过程。它不会"完成",只会越来越准。
星图增长将 GEO 从“内容建议”推进为一套可执行、可验证、可复盘的工程系统。系统围绕商家知识库、问题库、内容资产、AI 巡检和多平台发布建立闭环,让每一次内容生产都能回到真实的推荐表现中被校验。
知识资产层:系统先把商家的身份、服务、案例、价格边界、交付流程和联系方式整理为可追溯的语义资产,避免内容生成停留在口号和泛泛表达。
评分与生成层:星图增长自研 L1-L2-L3 评分体系,将标题语义匹配、正文需求满足、信源可信度、引擎偏好和推荐反馈统一成可执行的生成约束。
分发与巡检层:内容发布到头条、搜狐、知乎、公众号等平台后,系统继续通过泛需求问题巡检 AI 回答,判断是否主动推荐品牌、是否引用已发布内容、是否形成稳定的推荐来源。
知识库 · 标题库 · 图片库 → L1 标题评分 · 信源评级 · 论证深度 → 模板渲染 · 变量注入 · 风格适配 → 生成内容 + 质量评分 + 修正建议
query 意图分类 · 场景归类 · 最佳引擎匹配 → 逐引擎维度权重 · 优化投入优先级 · 多版本策略输出 → N 个版本 + 各版本预期 L2 得分
多平台内容资产 → AI 泛需求巡检 · 推荐位次追踪 · 来源链接识别 → 偏差检测 · 权重微调 · 内容补强 → 实测数据反馈 → L1/L2 修正
该系统架构的核心设计原则是闭环反馈。L1 评估产出质量,L2 根据目标语言游戏调整策略,L3 用实测数据修正 L1 和 L2 的权重配置。三层之间不是单向流水线,而是螺旋上升的自修正循环。
SEO 时代的终局是竞价排名:谁出钱多,谁排在前面。这是一个零和博弈的拍卖市场——广告位数量固定,竞争只抬高出价。GEO 时代的终局不是拍卖,而是语言游戏竞争。AI 搜索引擎推荐的不是"出价最高的链接",而是"在当前语言游戏中最像正确答案的内容"。
但"更像标准答案"这件事本身就暗含了一个权力问题:谁来定义什么是"标准答案"?
答案是 AI 引擎。每一个 AI 引擎都通过自己的训练数据、信源偏好、算法权重定义了一套"语法规则"。内容生产者要面对的已经不是"一个搜索引擎",而是多个平行的、规则各异的语言游戏。
打分体系是把双刃剑。它可以是内容质量的标准,也可以反过来成为作弊的地图。以下是明确的伦理红线:
| 红线行为 | 操作手法 | 为什么是红线 |
|---|---|---|
| 信源伪造 | 批量注册看似"权威"的域名和账号,制造多源一致的假象 | 不是在参与语言游戏,而是在破坏游戏本身。私人语言论证:只有自己人遵守的规则不是规则 |
| 交叉验证污染 | 同一主体在多平台发布一致但错误的信息,伪造"多源验证"信号 | 利用 AI 信任机制传播不实信息。一次暴露可能让所有人失去"交叉验证"这个维度的保护 |
| 时效性欺诈 | 程序每天自动更新文章时间戳,不改变实际内容 | 直接消解时效性维度的意义。AI 会因此不再信任时间标签,损害所有诚实更新的生产者 |
| 权威性嫁接 | 大量引用权威来源片段制造背书联想,但来源并未实际背书 | 判断标准:如果你引用的权威信源的作者看到你的页面后会皱眉——那就是越界了 |
"凡不可说的,应当沉默。"(Wovon man nicht sprechen kann, darüber muss man schweigen.)
——维特根斯坦《逻辑哲学论》命题 7
这句话在 GEO 语境下有一个精确的翻译:
"有效着法"意味着:内容确实能帮助用户解决他们正在面对的问题。如果内容不能做到这一点——不管它包含多少关键词、引用了多少权威来源、更新频率有多高——它就是在制造噪音。
制造噪音的人以为自己占了便宜(多了一个页面被收录),但噪音累积到一定密度,整个语言游戏的生态就会恶化:AI 推荐质量下降 → 用户对 AI 搜索的信任下降 → 整个 GEO 行业的价值缩水。这是一条反向的"公地悲剧":不是每个人都来放牧把草地啃秃了,而是每个人都往草地上扔一块垃圾,最终没人愿意再走进这块草地。
维特根斯坦的"应当沉默"不是道德说教——它是一个逻辑陈述。在语言游戏中,不属于游戏的有效着法的那部分"语言",根本就不是在参与语言。它只是在发出噪音。而噪音累积的终点,是游戏的崩溃。
沉默,有时候是最专业的优化策略。
| AI 引擎 | 信源生态 | 内容偏好 | 时效敏感 | 深度加分 | 结构化加分 |
|---|---|---|---|---|---|
| DeepSeek | 技术社区 > 学术 > 开源 | 深度 > 广度 | ⭐⭐ | ⭐⭐⭐ | ⭐⭐ |
| ChatGPT Search | 英文新闻 > 百科 > 学术 | 结构 > 自由 | ⭐⭐⭐ | ⭐⭐ | ⭐⭐⭐ |
| 百度 AI 搜索 | 百家号 > 百科 > 官方 | 列表 > 分析 | ⭐⭐⭐ | ⭐ | ⭐⭐⭐ |
| 豆包 / 字节 | 头条 > 抖音 > 百科 | 体验 > 分析 | ⭐⭐⭐ | ⭐ | ⭐⭐ |
| Kimi | 长文 > 报告 > PDF | 综合 > 专精 | ⭐⭐ | ⭐⭐ | ⭐⭐⭐ |
| 元宝 / 腾讯 | 公众号 > 视频号 | 消费 > 技术 | ⭐⭐⭐ | ⭐ | ⭐⭐ |
| Perplexity | 英文学术 > 新闻 > 博客 | 事实 > 观点 | ⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐ |
| 秘塔 AI | 法律 > 政策 > 学术 | 权威 > 创新 | ⭐ | ⭐⭐ | ⭐⭐ |
| 天工 AI | 中文新闻 > 百科 > 社区 | 广度 > 深度 | ⭐⭐⭐ | ⭐ | ⭐⭐ |
| 通义千问 | 阿里生态 > 百科 > 公开 | 综合 > 极端 | ⭐⭐ | ⭐⭐ | ⭐⭐ |
⭐ = 基础要求 ⭐⭐ = 重要但非首要 ⭐⭐⭐ = 核心优势维度(此维度投入资源回报率最高)
以下是可直接使用的逐维度评分模板:
| 检查项 | 最高分 | 得分 | 评分说明 |
|---|---|---|---|
| 标题包含 query 的主体词? | 10 | ___ | 精确 10,同义词 7,上位词 5,不相关 0 |
| 标题包含 query 的需求动词? | 10 | ___ | 精确 10,同义 7,隐含 5,缺失 0 |
| 标题包含 query 的场景属性? | 8 | ___ | 含地域词 8,隐含信号 5,缺失 0 |
| 标题暗示差异化价值? | 9 | ___ | "深度/实测/指南/避坑" 强信号 9,弱 5,无 0 |
| ⚠️ 核心语义与 query 完全无关? | — | — | 是 → 总分直接归零,无需继续评估 |
| 小计 | 55 | ___ |
| 检查项 | 最高分 | 得分 | 评分说明 |
|---|---|---|---|
| 用户的主动词问题得到完整回答? | 15 | ___ | 完整闭环 15,核心但缺边缘 10,部分回答 5 |
| 正文有具体数据/步骤/案例? | 10 | ___ | 三者均有一项且具体 10,有但不具体 6,缺失 0 |
| 正文适配了 query 的场景属性? | 10 | ___ | 地域/时间/风险属性落实到正文细节 |
| 正文组织方式匹配用户意图? | 10 | ___ | 对比需求→表格,步骤需求→编号,决策需求→框架 |
| 小计 | 45 | ___ |
| 维度 | 分值 | 得分 | 评分要点 |
|---|---|---|---|
| 媒体权威性 | 18 | ___ | 一级权威 15–18,二级 8–14,三级 3–7,低质 0–2 |
| 专业客观性 | 18 | ___ | 数据有出处 +6,有推导链 +6,有边界说明 +3,反方讨论 +3 |
| 时效性 | 15 | ___ | 高风险 1 月内 15,3 月内 10;通用 1 年内 15,2 年内 10 |
| 信源交叉验证 | 14 | ___ | ≥3 个独立信源 14,2 个 10,1 个 5,0 个 0 |
| 论证深度 | 13 | ___ | L3 反常识 10–13,L2 多层推导 7–9,L1 单层 4–6,L0 罗列 0–3 |
| 经验真实性 | 12 | ___ | 实操细节 +4,真实案例 +4,失败反思/边界说明 +4 |
| 信息密度 | 6 | ___ | 密度 > 0.3: 6, 0.2–0.3: 4, 0.15–0.2: 2, < 0.15: 0 |
| 内容结构化 | 4 | ___ | H2/H3 合理 +2,关键信息标注 +1,段落适中 +1 |
| 小计 | 100 | ___ | → 系数 = 小计 / 100 |
| 分数段 | 等级 | 预期表现 |
|---|---|---|
| 85–100 | A | 极高概率被 AI 推荐为主要信息来源 |
| 70–84 | B | 大概率被推荐,优化个别维度可进一步提升 |
| 55–69 | C | 可能被推荐但不稳定,存在明显短板 |
| 40–54 | D | 难以被推荐,需系统性重写或增强信源 |
| < 40 | F | 基本不被推荐,建议从信源或标题根本性重来 |
以下为各引擎推荐的完整八维度优化资源投入比例:
| L1 维度 | DeepSeek | ChatGPT | 百度AI | 豆包 | Kimi | 元宝 | Perplexity |
|---|---|---|---|---|---|---|---|
| 标题语义匹配 | 18% | 20% | 26% | 24% | 15% | 22% | 18% |
| 正文需求满足度 | 24% | 15% | 20% | 20% | 22% | 20% | 18% |
| 媒体权威性 | 10% | 24% | 20% | 14% | 12% | 18% | 22% |
| 专业客观性 | 20% | 16% | 12% | 12% | 16% | 12% | 18% |
| 时效性 | 10% | 12% | 18% | 18% | 12% | 16% | 10% |
| 信源交叉验证 | 15% | 14% | 8% | 10% | 14% | 10% | 14% |
| 论证深度 | 20% | 10% | 8% | 8% | 16% | 8% | 14% |
| 信息密度+结构化 | 10% | 14% | 16% | 14% | 14% | 16% | 10% |
表中数字为该维度的优化资源投入比例(总和 = 100%)。加粗 = 该引擎上投入产出比最高的 2 个维度。
| 内容类型 | 监测频率 | 首次监测延迟 | 建议 query 样本量 |
|---|---|---|---|
| 高风险场景(医疗/金融/法律) | 每 3 天 | 发布后 24h | ≥ 20 条 |
| 消费决策(本地服务/产品推荐) | 每 5 天 | 发布后 48h | ≥ 15 条 |
| 知识问答(技术/教育/百科) | 每 7 天 | 发布后 72h | ≥ 12 条 |
| 泛资讯/娱乐 | 每 14 天 | 发布后 7 天 | ≥ 10 条 |
| 内容类型 | 触发权重回顾 | 触发紧急回顾 |
|---|---|---|
| 高风险场景 | ≥ 12% | ≥ 25% |
| 消费决策 | ≥ 15% | ≥ 30% |
| 知识问答 | ≥ 18% | ≥ 30% |
| 泛资讯/娱乐 | ≥ 20% | ≥ 35% |