Crawly 与 Diffbot 是什么关系?使用时需要提供哪些信息?

Crawly 是 Diffbot 推出的网页爬虫产品,页面明确标注为 "Crawler By Diffbot",版权信息为 "© 2024 Diffbot Web Crawler by Diffbot"。它的定位是替代手写爬虫:输入一个网站地址,Crawly 会自动爬取整站并提取结构化数据,无需自己编写抓取代码。使用前需要准备两样东西——目标网站 URL 和一个联系邮箱。

Crawly 与 Diffbot 的关系

从页面信息可以直接确认三点:

  • 产品名称旁标注 "Crawler By Diffbot",说明 Crawly 是 Diffbot 旗下的爬虫工具,而非独立第三方产品。
  • 页脚版权为 "© 2024 Diffbot Web Crawler by Diffbot",运营主体是 Diffbot。
  • 联系入口为页面上的 Contact,涉及抓取范围、频率、合规限制等问题时,应通过该渠道向 Diffbot 确认。

因此,Crawly 可以理解为 Diffbot 面向"整站抓取 + 自动结构化"场景提供的一个入口,而不是需要单独安装的软件。

使用 Crawly 需要提供哪些信息

页面上的输入项只有两个:

输入项 作用
Website Url 指定要爬取的目标网站
Email Address 留下联系邮箱,用于接收抓取结果或后续沟通

填写后点击 "Crawl My Website" 提交。页面没有说明是否需要注册账号或登录,也没有公开价格信息,因此不能默认它免费或无需登录——这些条件需要以实际提交后的提示或 Contact 渠道的回复为准。

Crawly 会自动提取哪些字段

根据页面说明,Crawly 会爬取并自动提取文章级别的结构化数据,字段包括:

  • Title(标题)
  • Text(正文文本)
  • HTML(原始 HTML)
  • Comments(评论)
  • Date(日期)
  • Entity Tags(实体标签)
  • Author(作者)
  • AuthorUrl(作者链接)
  • Images(图片)
  • Videos(视频)
  • Publisher Country(发布方国家)
  • Publisher Name(发布方名称)
  • Language(语言)

提取结果可以下载为 CSV 或 JSON,便于直接导入表格、数据库或后续程序处理。

适合什么场景,注意什么

Crawly 适合需要把整站文章内容批量转成结构化数据的任务,例如内容归档、语料收集、竞品内容分析。它的卖点是"Never Write Another Web Scraper",即省去自己写解析规则的工作。

需要注意的边界:

  • 页面只描述了文章类字段的提取,未说明对非文章页面(如商品页、列表页)的支持程度。
  • 抓取频率、并发限制、是否遵守目标站 robots 规则等,页面均未提及,属于需要向 Diffbot 确认的事项。
  • 提交邮箱后数据的存储与使用方式,页面没有说明,涉及敏感站点时应先通过 Contact 问清。

如果你的目标是快速拿到某个网站的文章标题、正文、作者、发布时间等字段并导出 CSV/JSON,Crawly 的流程就是"填 URL + 填邮箱 + 提交";如果涉及抓取规模、合规或费用问题,先联系 Diffbot 确认再动手。

crawly.diffbot.com
Turn websites into data in seconds. Crawly spiders and extracts complete structured data from an entire website.