AI 概览与搜索的未来:驾驭谷歌 SERP 数据采集

Emily RodriguezEmily Rodriguez· AI 与数据科学负责人2026-07-21
要点速览

* 范式转变**:搜索引擎结果页面(SERP)正在经历十年来最剧烈的变革。谷歌的 AI 概览(前身为 SGE)正在不断压缩传统自然搜索链接的可见度。 * **指标谬误**:仅仅提取自然排名(`pos`)的传统抓取工具正变得过时,因为“自然排名第一”的链接实际上可能出现在远低于首屏的 AI 摘要和地图包之下。 * **全面的 SERP 结构**:为了了解真实的市场份额,竞争情报团队必须抓取页面的“完整”结构,以评估实际的视觉层次分布。 * **适应未来的 API**:AntsData 的搜索 API 不断更新其解析器以应对这些复杂的新 DOM 结构,返回诸如 `pos_overall`(整体绝对位置)等指标,以反映现代搜索的真实情况。

“十条蓝色链接”时代的终结

在过去的二十多年里,谷歌搜索引擎结果页面(SERP)的结构相对来说是可预测的。搜索引擎优化(SEO)专家和竞争情报团队都遵循着一个基本法则:如果你在自然搜索结果的前三名(即传统的“十条蓝色链接”之中),你就能赢得绝大部分的流量。

如今,这条法则正在被打破。SERP 正在经历自引入通用搜索以来最剧烈的结构性变革。随着谷歌 AI 概览(AI Overviews,前身为搜索生成体验 SGE)的广泛推出,留给传统自然链接的版面正在急剧萎缩。

当用户执行复杂的或信息类的查询时,谷歌不再仅仅充当目录;它开始扮演解答引擎的角色。由大语言模型(LLM)生成的 AI 概览出现在页面的最顶部,它总结了来自多个来源的信息,并立即满足用户的搜索意图。这创造了一个“零点击(Zero-click)”的搜索环境,彻底改变了整个页面的点击率(CTR)。

传统 SERP 抓取的谬误

这种范式转变对数据团队衡量搜索可见度的方式构成了生存威胁。许多传统的 SERP 抓取工具和内部脚本在构建时,仅仅是为了寻找与标准自然搜索结果相关的特定 HTML 标签。它们提取 URL,并为其分配一个自然排名位置(pos),范围从 1 到 10。

在 AI 概览时代,这个指标是一个危险的谬误。一个品牌可能会自豪地报告其旗舰落地页的“自然排名第 1”。然而,传统抓取工具未能报告的是,这个“第 1 名”的链接实际上被排在一个巨大的 AI 生成段落、一个赞助广告块、一个本地地图包(Local pack)以及一个“人们还在问(People Also Ask)”小部件之下。在现实中,用户必须向下滚动两个屏幕的长度才能看到该链接。这个“排名第一”结果的实际视觉曝光度微乎其微。

为了真正了解当今的数字市场份额和搜索可见度,您不能仅仅抓取一个链接列表。您需要抓取 SERP 的完整结构,并理解其视觉层次分布。

利用 AntsData 捕获现代 SERP

AntsData 的 /v1/scraper/google/search 端点是专门为了应对现代集成了 AI 的 SERP 的复杂性而设计的。我们深知数据团队需要的是上下文,而不仅仅是原始的 URL。

当您查询 AntsData 搜索 API 时,我们的基础设施会绕过谷歌严格的反爬虫措施,渲染出完整的现代页面。然后,API 会返回一个结构化的 JSON 负载,它反映了搜索结果的真实情况。

最关键的是,该 API 返回两个截然不同的位置指标:

  1. pos:在自然搜索结果中的传统排名。
  2. pos_overall:考虑到页面上所有模块(广告、AI 概览、本地包、新闻轮播)后,该元素的绝对整体位置。

如果一个元素的 pos 是 1,但 pos_overall 是 7,SEO 分析师就能立即知道他们的内容被深埋在繁杂的 SERP 功能之下。此外,API 会提取 desc(元描述或富摘要文本),使团队能够确切地看到他们的内容——或竞争对手的内容——是如何被谷歌算法总结的。

为搜索情报注入适应未来的能力

随着谷歌继续快速测试并将其生成式 AI 注入其生态系统,SERP 底层的 DOM(文档对象模型)以令人眼花缭乱的频率发生着变化。试图维护自定义 SERP 抓取工具的内部工程团队发现,要跟上这种步伐简直是不可能的。周一写好的正则表达式模式,到周四就会随着谷歌对其 AI 概览测试新的布局结构而失效。

通过与 AntsData 这样提供托管提取层的服务商合作,组织为其搜索情报注入了适应未来的能力。我们专业的解析工程师会不断更新我们的系统,以便在新的 SERP 模块推出时能够准确地解释它们。这确保了您的数据管道——以及依赖于它们的关键业务决策——建立在一个能够捕捉现代搜索真实情况的坚实基础之上。

Emily Rodriguez

关于作者

Emily Rodriguez

AI 与数据科学负责人 @ AntsData

Emily Rodriguez 是 AntsData AI 与数据科学负责人,专注于网页数据采集与人工智能的交叉领域。她专注于为 LLM 训练、RAG 系统和 AI Agent 架构构建数据管道。Emily 在机器学习工程领域拥有 7 年经验,在自然语言处理、检索系统和数据质量框架方面具有专长。她拥有斯坦福大学人工智能硕士学位,并为 AI/ML 社区的开源项目做出了贡献。Emily 热衷于让高质量训练数据的获取更加民主化。

相关文章

配色 [已恢复] 02(1)AntsData产品与 API 指南

什么是网页爬虫?2026年新手完全指南

网页爬虫是一种自动从网站提取数据的技术,广泛应用于价格监控、市场研究、线索生成、SEO分析等场景。本指南从零开始,系统讲解网页爬虫的概念、原理、工具选择和最佳实践。

2026-07-13
配色 [已恢复] 02(1)AntsData产品与 API 指南

网页采集API对比:除了价格还应关注什么

选购网页采集API时,绝大多数采购决策被"每千次请求多少钱"这一单一指标主导。然而,真正影响项目成败和企业长期成本的,往往是那些不会出现在报价单上的隐性维度:请求成功率、反爬绕过能力、返回数据的结构化纯度、端到端延迟、失败时的可观测性、以及从简单场景向复杂场景演进的扩展路径。本文基于服务数百家企业的实战经验,提炼出7个超越价格的评估维度,并给出可直接落地的评分清单,帮助技术团队和采购负责人做出真正经得起时间检验的供应商选择。

2026-07-11
模板8AntsData战略与行业洞察

网页抓取中的数据质量:垃圾进,垃圾出

* **核心问题**:在争相构建庞大数据湖和训练大型 AI 模型的浪潮中,组织常常将数据数量置于质量之上,从而落入“垃圾进,垃圾出”(GIGO)的陷阱。 * **HTML 的谬误**:使用基础代理抓取原始 HTML,并依赖脆弱的正则表达式或 DOM 选择器,会导致数据集被导航噪音、Cookie 横幅和错位的列所严重污染。 * **AI 幻觉的根源**:将这些“垃圾”输入到检索增强生成(RAG)系统或 LLM 训练管道中,会直接导致上下文污染和模型幻觉。 * **AntsData 标准**:AntsData 通过充当数据净化层来解决这一问题,提供预先解析、经过模式验证的 JSON 端点。这确保了精确的上下文,将工程师清理数据的时间缩短了 80%。

2026-07-21