浏览器中的 AI 引导抓取
Thunderbit 的浏览器扩展围绕一个简单流程构建:先写出你想要的列名,然后让 AI 提取数据。产品页称无需传统编辑器或选择器构建步骤。
Thunderbit 是一款 AI 网页抓取产品,提供 Chrome 扩展和 API,可将网页转换为结构化数据,导出为表格、Markdown、JSON 或 CSV,适用于销售、运营、电商和开发流程。
Thunderbit 是一款 AI 网页抓取产品,同时提供 Chrome 扩展和网页抓取 API。浏览器扩展面向希望通过几次点击快速获取网站数据的人,而 API 面向需要在自身应用和内部工作流中使用结构化网页数据的开发者。
在整个产品网站中,Thunderbit 被呈现为一种可将网站转换为电子表格、Markdown、JSON 或表格等有序输出的方式,无需手动编写选择器。扩展页面强调线索列表、SKU 数据、分页、子页面,以及导出到 Google Sheets、Airtable、Notion 和 Excel 等工具。API 页面强调无需维护的提取、基于 schema 的输出,以及面向 RAG、agents 和丰富化场景的内容蒸馏。
Thunderbit 的浏览器扩展围绕一个简单流程构建:先写出你想要的列名,然后让 AI 提取数据。产品页称无需传统编辑器或选择器构建步骤。
扩展支持抓取带分页的页面、多个 URL、受登录保护的内容、截图以及其他文件上传内容,从而扩大其可处理的页面范围。
Thunderbit 可以提取页面上可见和隐藏的数据,包括文本、URL、图片、邮箱、电话号码和日期,因此输出不只是纯文本。
内置格式化工具可在提取过程中对数据进行摘要、分类、翻译和重新格式化,减少导出后的手动清理。
导出路径包括 Google Sheets、Airtable、Notion、Excel,以及复制粘贴到其他应用,这有助于快速把结果带入现有工作流。
API 产品提供两个核心模式:Distill 将网页转换为更干净的 Markdown 内容,Extract 则以 JSON 或 CSV 返回结构化数据。
从目录、个人资料页和其他公开来源收集潜在客户详情、联系信息和补充数据,然后将结果放入电子表格中用于外联或审核。
从店铺或电商平台列表中提取产品名称、价格、可用性、图片和描述,以支持目录工作、库存检查或竞品跟踪。
从房产网站和本地房源页面收集房源信息、开放看房信息以及相关联系详情,用于分析或监控。
将文章、转录文本或网页内容转换为更干净的 Markdown,供 RAG 流水线、知识库或下游 AI 工作流使用。
通过基于 schema 的 API 工作流,随时间跟踪多个页面中的价格、库存、评论或内容变化;这种方式比特定站点脚本更易维护。
Thunderbit 设计为可在浏览器扩展中使用,同时也提供网页抓取 API。扩展可让你从 Chrome 中的网页直接开始,而 API 则用于将抓取能力集成到应用和工作流程中。
Chrome 扩展适合几次点击即可抓取网站,无需选择器或手动拖拽。产品页面将其描述为适用于线索采集、SKU 收集、分页、多页面抓取,以及将数据导出到表格类工具。
Thunderbit 的 API 可以从 URL 返回结构化 JSON 或 Markdown。文档和 API 页面展示了两个主要模式:Distill 用于清理后的内容,Extract 用于结构化数据。
定价页面显示有 Free、Basic、Professional 和 Business 方案,并提到有免费层级、免费试用以及按年付费可节省费用。但这里没有足够证据说明具体限制或价格。
来源页面没有提供足够细节来确认团队功能、账号协作或具体使用限制。购买前应查看定价页和文档页以确认这些信息。