直接答案
一篇网页今天改了,明天去问大模型,它会知道新内容吗?没有统一的“明天会知道”。我查了语言模型论文和搜索平台公开的说明,发现这个问题得先问清楚,模型是在回忆训练时学到的东西,还是这一次回答中拿到了网页。
网站负责人能直接改的是网页。模型什么时候重新训练、训练材料里有没有这篇网页,通常不在网站负责人的控制范围内。GEO 能做的工作,大多发生在网页被公开取得、被检索,以及被拿来回答问题的这段路上。
训练时,文字先变成什么
文本模型接收的输入是 token 序列。分词器先把文字转换成 token,再把它们映射为数字。一个 token 有时是一个词,有时只是词的一部分。中文也不能按“一个汉字等于一个 token”来算,切法取决于具体分词器。Hugging Face 的分词器说明列出了几种常见的子词算法。
训练中的一个常见任务是根据前面的 token 预测后面的 token。预测有误差,训练过程便调整模型参数。GPT-3 论文公开描述了这种自回归训练,也说明它把较短的文档装进固定长度的训练序列以提高计算效率。这是一个有出处的模型实例,不能拿当年的序列长度当作今天所有模型的规则。GPT-3 论文
所以,一段网站文字即使进入过训练材料,也不会自动变成一个可随时更新的网页条目。模型参数会受大量样本共同影响;后来修改网页,不能据此推断模型参数已经跟着变了。至于某个商业模型究竟用过哪些页面,外部通常也无法逐页核实。
“切块”说的是三件不同的事
讨论 GEO 时经常有人问,网页每段该写多少字,才能方便模型“切块”。这里先把三个单位分开。
token 是分词器交给模型的输入单位。训练序列是一次训练所处理的一段 token,长度由那套模型和训练方案决定。检索片段则是搜索或检索系统从资料里选出的内容,可能对应网页的一段文字,也可能经过别的处理。它们之间没有固定的字数换算。
检索增强生成的早期论文给出了一个清楚的例子。系统把预训练模型与外部资料检索结合,在生成回答时提供检索到的 passages。网页内容有机会作为这一次回答的材料出现,无须等模型为这篇网页重新训练。RAG 原始论文
这篇论文说明了一种技术路径,没有公开任何搜索产品如何切分每一个网页。看到“按 300 字一段写就容易被 AI 引用”之类的建议,我会先问它依据哪家平台、哪次实验。没有这两样,就别把编辑习惯写成算法规则。
回答问题时,网页要先走到哪里
Google 对 AI Overviews 和 AI Mode 的公开说明提到,系统可能围绕一个问题发起多个相关搜索,再寻找支持回答的页面。页面要有机会成为支持链接,先得进入 Google 索引,并具备在普通搜索结果中显示摘要的资格。满足这些条件仍不保证被展示。Google 的 AI 搜索说明
已经收录的页面也可能暂时保留旧内容。网页改完以后,还要等相应系统重新抓取并更新可检索的材料,新的文字才可能进入后续回答。Google 说明,重新抓取可能需要数天到数月,具体时间由其系统决定。明天测不到新内容,不能直接归因于模型“没学会”。Google 的重新抓取说明
网页在浏览器里看着完整,还需要检查爬虫取得的内容。Google 描述过抓取、渲染和索引的过程;有些页面的正文要等 JavaScript 执行后才出现,其他机器人未必具备相同的渲染能力。Google 的 JavaScript 搜索指南给了具体的检查入口。
内容到了检索系统,下一关是能否准确回答一个具体问题。拿本站企业 AI 服务页来说,公开说明写明系统会处理约定的流程,关键决策和外部发送仍保留人工确认。若页面只在开头写“AI 自动处理业务”,把人工确认埋在很远的地方,单独读到前半段的人就容易理解过头。把能力、适用条件和人工责任写在附近,首先是对读者负责,也让局部内容更容易被准确复述。这是内容编辑判断,不能当成引用排名保证。
适用边界
这里讲的是文本模型与公开网页的一般过程。GPT-3 和 RAG 论文提供了可核对的技术实例,Google 的说明只对应它自己的搜索功能。它们不能证明其他平台采用同一套网页切分或引用规则,也不能据此保证收录、引用或咨询。
实施步骤
挑一页真正重要的服务说明,先看原始响应里有没有正文、服务对象和关键限制。再看该页的抓取与索引状态。最后拿一个真实买家问题去问目标 AI 产品。
改稿时不必按传闻中的固定 token 数把句子剁碎。把一项能力写清楚,紧接着写它的条件与证据;标题帮助读者找到内容,链接能让人回到原始页面。Google 也明确说,AI 搜索没有专用文件或特殊 Schema 的额外门槛。Google 的站长说明
验收清单
保存问题、时间、回答和引用网址。页面被抓到、回答用了页面、答案显示引用,这三次观察分别记录。若回答把服务范围说大了,就回服务页检查原句;涉及具体项目时,再从项目页找公开证据。没有引用时,记录事实即可,别从一次回答倒推平台内部的训练材料。
站长能把公开材料写得准确、保持可访问,并核对实际回答。某个平台最后选了哪篇来源、怎样引用,仍由那个平台决定。
下一步
如果需要沿着访问、索引、内容和引用逐项检查,可以看看 Open GEO Console。想先补模型处理文本的基础,可接着读大模型怎样读懂网页。有具体网页和买家问题,也可以从联系页面发来,我们先看公开内容能否回答那个问题。