如何使用 Crawly 抓取一个网站并导出数据?

Crawly 是 Diffbot 提供的网页爬虫工具,核心卖点是“不用自己写爬虫脚本”——你只需要输入一个网站地址,它就会爬取整站并自动抽取结构化数据,最后可以下载成 CSV 或 JSON。它适合想快速把某个网站内容变成可分析数据的场景,比如批量收集文章标题、正文、作者、发布时间等。前提是你已经拿到目标网站的 URL,并且该网站允许被抓取。

操作步骤

1. 打开工具并输入网址

访问 crawly.diffbot.com,在页面的输入框中填写目标网站的 Website Url(网站地址),同时页面还提供 Email Address 输入项。

2. 触发爬取

点击 Crawl My Website 按钮。Crawly 会开始爬取整站,并自动对每个页面做结构化抽取,不需要你配置选择器或写解析规则。

3. 等待处理完成

爬取和抽取需要一定时间,具体取决于网站规模。处理完成后,页面会展示提取到的结构化结果。

4. 查看并下载数据

确认结果无误后,选择下载格式:

  • CSV:适合用 Excel、表格工具或数据分析脚本处理
  • JSON:适合程序读取、入库或做进一步开发

Crawly 会自动提取哪些字段

根据官方页面说明,Crawly 针对文章类页面会自动抽取以下字段:

字段 含义
Title 文章标题
Text 正文文本
HTML 正文 HTML
Comments 评论
Date 日期
Entity Tags 实体标签
Author 作者
AuthorUrl 作者页面链接
Images 图片
Videos 视频
Publisher Country 发布方国家
Publisher Name 发布方名称
Language 语言

这些字段覆盖了内容采集最常用的信息,省去了逐页手动复制或写解析逻辑的工作。

常见卡点

  • 只输入了首页:Crawly 会从你给的地址出发爬取整站,如果只想抓某个栏目,需要确认入口 URL 的范围是否符合预期。
  • 动态渲染页面:如果目标内容依赖大量前端脚本生成,抽取结果可能不完整,建议先用少量页面验证。
  • 下载格式选择:需要人工查看选 CSV,需要程序处理选 JSON,两者字段一致,只是结构不同。
  • 抓取合规:使用前确认目标网站的 robots.txt 和使用条款,避免抓取受限制或敏感内容。

Crawly 的定位是“把网站变成数据”,整个流程就是输入网址、点击爬取、等待结果、下载文件四步,适合需要快速获取整站结构化内容又不想维护爬虫代码的用户。

crawly.diffbot.com
Turn websites into data in seconds. Crawly spiders and extracts complete structured data from an entire website.