Crawly(crawly.diffbot.com)是什么网站?

Crawly 是 Diffbot 推出的网页爬虫工具,核心用途是把网站内容自动抓取并转换成结构化数据,官方口号是“Never Write Another Web Scraper”(再也不用写爬虫脚本)。你只需要输入一个网址,它就会爬取整站并自动提取文章信息,结果可下载为 CSV 或 JSON。它适合需要批量获取网站文章数据、但不想自己写和维护爬虫的人。

它能提取哪些数据

根据网站首页说明,输入网址后,Crawly 会自动提取文章的以下字段:

字段 含义
Title 文章标题
Text 正文文本
HTML 页面 HTML
Comments 评论
Date 日期
Entity Tags 实体标签
Author 作者
AuthorUrl 作者链接
Images 图片
Videos 视频
Publisher Country 发布方国家
Publisher Name 发布方名称
Language 语言

这些字段覆盖了一篇文章从内容到元信息的主要维度,省去了自己写解析规则的工作。

怎么用

流程很简单,不需要编程:

  1. 打开 crawly.diffbot.com。
  2. 在输入框填入目标网站地址。
  3. 提交后,Crawly 会爬取该网站并自动提取上述结构化数据。
  4. 完成后把结果下载为 CSV 或 JSON。

页面上还提供了邮箱地址字段,以及“Crawl My Website”按钮,用于提交抓取任务。

适合谁用

  • 需要把整站文章转成表格或 JSON 做分析的人。
  • 不想为每个网站单独写爬虫和解析逻辑的开发者或数据人员。
  • 需要批量获取标题、正文、作者、发布时间等字段的内容整理场景。

需要注意的点

  • 它面向的是“整站文章级”的结构化提取,字段以文章维度为主,不是任意自定义字段的通用抓取器。
  • 结果格式为 CSV 或 JSON,适合直接进入后续数据处理流程。
  • 网站资料未提及价格、免费额度或登录要求,使用前建议在站内确认当前政策。
crawly.diffbot.com
Turn websites into data in seconds. Crawly spiders and extracts complete structured data from an entire website.