这件事改了什么
过去十年,信息战的核心战场是搜索引擎优化(SEO)。政府、企业、利益集团通过关键词堆砌、外链建设、内容农场等方式,让特定叙事在Google搜索结果中占据前排。这一逻辑在2023年ChatGPT发布后开始松动,但直到2026年8月,Hanover Institute事件的曝光才让"生成式引擎优化"(Generative Engine Optimization,简称GEO)从理论走向现实案例。
Hanover Institute的网站没有署名作者,报告格式模仿学术机构,页脚却标注了外国代理人披露信息。根据《卫报》报道,该网站由Piro Inc运营,Piro从以色列政府获得约90万美元资金。这并非孤立事件。特朗普前竞选经理布拉德·帕斯卡尔(Brad Parscale)通过其公司Clock Tower X运营的七个网站,已在Common Crawl的2026年7月索引中出现294次。Common Crawl是向商业AI开发者提供训练数据的核心仓库。Hanover Institute的报告发布时间晚于该次爬取,但已进入同一管道。
这一事件的关键变化在于:信息战的终点从"人类看到什么"转向"AI引用什么"。当用户用ChatGPT查询加沙冲突背景时,模型可能优先引用Hanover的报告而非主流媒体或学术研究。这种影响是隐性的、规模化的,且难以追溯源头。

##这件事改了什么过去十年,信息
机制:生成式引擎优化如何运作
GEO的核心逻辑与SEO相似,但作用对象不同。SEO优化的是网页排名算法,GEO优化的是大语言模型的训练数据和检索增强生成(RAG)管道。
具体机制分为三层。第一层是内容生产。Hanover Institute在九天内发布124篇报告,平均每篇约4500字,主题覆盖反犹主义、加沙军事行动合法性、国际法解释等。内容刻意模仿学术风格,使用脚注、参考文献列表、机构署名等格式元素,但实际作者不明。这种"学术伪装"的目的是让内容在AI的引用优先级排序中占据有利位置。
第二层是数据管道。Common Crawl每周爬取互联网公开网页,其数据被OpenAI、Anthropic、Google等公司用于训练或微调模型。Clock Tower X的七个网站已在Common Crawl中出现294次,意味着这些内容已进入AI的训练语料库。Hanover Institute的报告虽未赶上7月那次爬取,但已部署在可被后续爬取的服务器上。
第三层是引用放大。当AI模型被训练或检索到这些内容后,用户提问时会优先引用它们。Anthropic的Claude、OpenAI的ChatGPT、Perplexity等工具都依赖类似的数据源。一旦亲以叙事进入这些管道,其影响范围远超传统媒体投放。
这一机制的致命之处在于规模效应。传统宣传需要持续投放才能维持曝光,而GEO只需一次成功进入训练数据,就能在数百万次对话中反复出现。正如Podcast平台AI Shrimp在2026年8月分析中指出的,这种"AI自我繁殖"循环是技术灾难,但倒逼AI行业建立更严格的权威来源验证机制。

##机制:生成式引擎优化如何运作
谁会先痛
直接受影响的是AI产品的可信度。当用户发现ChatGPT引用的"汉诺威公共政策研究所"在法律上并不存在,模型的可信度将受到实质性损害。OpenAI和Anthropic已在内部建立事实核查流程,但GEO内容的隐蔽性使其难以被传统事实核查工具识别。
其次是公共讨论的质量。当AI成为信息获取的主要入口,训练数据的污染会直接扭曲公众认知。美国国会民主党内部对以色列军援的立场转变已显示舆论场的敏感性。众议员麦高文(Jim McGovern)在2026年4月公开表示,在内塔尼亚胡领导下"看不到任何问责机制",因此"无法再支持更多军事援助"。这种立场变化部分源于公众舆论的转向,而舆论转向可能受到GEO内容的影响。
最后是AI行业的竞争格局。微软、OpenAI、Google等巨头若无法建立有效的数据源验证机制,其产品在信息战面前将处于被动。相反,那些建立权威来源白名单、限制未验证内容引用的模型,可能在可信度上获得竞争优势。

##谁会先痛直接受影响的是AI产
可执行落点
对AI开发者而言,有三件事可以立即推进。第一,建立训练数据的来源分级制度。Common Crawl等公开爬取数据应标记来源可信度,优先引用经过人工验证的权威媒体和学术数据库。第二,在RAG管道中加入来源交叉验证。当检索到某篇报告时,应检查其作者、机构、引用链是否可核验。第三,公开模型的数据来源政策。用户有权知道AI引用的内容来自何处,以及该来源是否经过可信度评估。
对内容消费者而言,面对AI生成的回答,应养成溯源习惯。当ChatGPT引用"汉诺威公共政策研究所"时,应检查该机构是否在法律上存在、作者是否可查、引用链是否完整。若发现异常,应向模型提供方反馈。
对政策制定者而言,现有《外国代理人登记法》已要求Piro Inc披露其身份,但披露位置(页脚小字)不足以让公众意识到风险。应考虑要求AI模型在引用外国代理人内容时,主动标注来源的政治背景。这不是审查,而是信息透明。
Hanover Institute事件不是终点,而是起点。当信息战进入生成式引擎优化时代,AI的可信度不再仅取决于算法,更取决于训练数据的纯净度。这一问题的解决,需要技术、政策和用户行为的协同推进。

##可执行落点对AI开发者而言,
机制到底卡在哪
GEO的运作逻辑
Generative Engine Optimization,简称GEO,是SEO在生成式AI时代的延伸。传统搜索引擎优化针对的是爬虫索引和排名算法,而GEO针对的是LLM的检索增强生成(RAG)机制。
具体而言,当用户向ChatGPT、Perplexity等工具提问时,系统会先从训练数据或实时检索中获取相关片段,再基于这些片段生成回答。Hanover Institute的策略很直接:在Common Crawl等公开数据源中大量投放符合学术规范、引用格式完整、关键词密集的内容,让AI在检索时优先抓取这些片段。
《卫报》的报道指出,Brad Parscale运营的Clock Tower X旗下七个网站已在Common Crawl的2026年7月索引中出现294次。Hanover Institute本身尚未进入索引,但其内容发布节奏表明,它处于同一条管道的前端。
为什么Common Crawl是关键
Common Crawl是一个非营利性组织维护的网页爬虫项目,每月对数十亿网页进行快照,供研究人员和AI开发者使用。OpenAI、Anthropic、Google等公司的训练数据都包含Common Crawl的存档。
问题在于,Common Crawl不做内容真实性验证。它只记录"网页存在过",不判断"网页是否可信"。这意味着,任何机构都可以在Common Crawl的索引窗口期内,通过大量发布、结构化排版、引用格式标准化等方式,提高被AI检索到的概率。
Hanover Institute的做法是:每篇报告都采用学术格式,包含摘要、引言、参考文献,甚至伪造机构署名。这种格式与真实智库报告高度相似,AI在检索时难以区分。
技术漏洞的三层结构
这一策略之所以能生效,依赖三个技术层面的漏洞。
第一层是数据源的开放性。Common Crawl等训练数据源对所有人开放,没有准入审核。任何机构都可以发布内容,只要符合基本的网页规范。
第二层是检索机制的权重偏差。当前的RAG系统通常基于关键词匹配和语义相似度进行检索,而非基于来源可信度。一篇格式规范、引用完整的假报告,可能比一篇内容真实但格式粗糙的真实报告更容易被检索到。
第三层是生成环节的引用幻觉。LLM在生成回答时,倾向于引用检索到的片段,即使这些片段来自不可信来源。用户看到的"权威引用",实际上是算法对格式规范的误判。
《AI Daily》播客中提到的观点值得注意:这种假智库的干扰,反而可能倒逼AI行业加速建立更严格的验证机制,比如知识图谱、人工验证的权威来源列表等。但这需要时间,而当前的窗口期已经足够让大量内容进入训练数据。
(来源:The Guardian, 2026年8月26日;Daily Sabah, 2026年8月;AI Daily Podcast)

##机制到底卡在哪###GEO的
今天能做的判断
对AI开发者的建议
第一,建立训练数据的来源审计机制。对于高影响力的训练数据源,需要建立来源验证流程,识别潜在的操纵行为。这不需要阻止所有宣传内容,但需要建立对系统性数据污染的检测能力。
第二,优化引用溯源功能。当AI系统引用某个来源时,应该提供更详细的溯源信息,包括该内容在训练数据中的位置、权重和上下文。这有助于用户评估引用的可靠性。
第三,建立内容污染的应急响应机制。当发现特定来源被系统性操纵时,应该有快速响应的技术路径,包括数据过滤、权重调整或模型更新。
对内容创作者的边界
如果你正在生产面向AI系统的内容,需要明确一个边界:优化内容被AI引用是合理的,但通过虚假机构身份、伪造学术规范来操纵AI引用是不合理的。
这个边界的判断标准很简单:你的内容是否基于真实的研究和事实?你的机构身份是否真实可验证?你的引用是否准确反映了原始来源?如果这三个问题的答案都是肯定的,那么GEO是合法的内容优化策略。如果答案是否定的,那么你在进行的是信息操纵。
对普通用户的可执行动作
第一,对AI输出的引用保持审慎。当AI系统引用某个来源时,不要直接接受,而是验证该来源的真实性和权威性。检查机构的注册信息、作者的学术背景、引用的原始文献。
第二,建立多元信源习惯。不要依赖单一AI系统获取信息,而是交叉验证不同系统的输出。当多个独立来源给出相似结论时,可信度更高。
第三,关注训练数据的透明度。支持并要求AI厂商公开训练数据的来源和构成。透明度是抵御系统性操纵的第一道防线。
这一事件的意义不在于某个具体项目的曝光,而在于它揭示了AI时代信息战的新形态。当宣传可以通过算法优化实现自动化扩散时,传统的防御机制需要重新设计。这不是技术问题,而是制度问题。
参考文献
- Fake US thinktank set up and funded by Israel sought to game AI for propaganda | The Guardian - https://www.theguardian.com/world/2026/aug/26/fake-thinktank-israel-ai-propaganda
- Israel set up fake think tank to sway AI chatbots: Report | Daily Sabah - https://www.dailysabah.com/business/tech/israel-set-up-fake-think-tank-to-sway-ai-chatbots-report
- 以色列政府承包商搭建「智库」,百余报告被指瞄准AI回答 | Buttondown - https://buttondown.com/ai-digest-zh/archive/u4ee5-u8272-u5217-u653f-u5e9c-u627f-u5305-u5546
- 以色列伪造智库试图误导AI 聊天机器人 | Zeli - https://zeli.app/zh/story/49337392