如何使用 Crawly 抓取一个网站并导出数据?
Crawly 是 Diffbot 提供的网页爬虫工具,核心卖点是“不用自己写爬虫脚本”——你只需要输入一个网站地址,它就会爬取整站并自动抽取结构化数据,最后可以下载成 CSV 或 JSON。它适合想快速把某个网站内容变成可分析数据的场景,比如批量收集文章标题、正文、作者、发布时间等。前提是你已经拿到目标网站的 URL,并且该网站允许被抓取。
操作步骤
1. 打开工具并输入网址
访问 crawly.diffbot.com,在页面的输入框中填写目标网站的 Website Url(网站地址),同时页面还提供 Email Address 输入项。
2. 触发爬取
点击 Crawl My Website 按钮。Crawly 会开始爬取整站,并自动对每个页面做结构化抽取,不需要你配置选择器或写解析规则。
3. 等待处理完成
爬取和抽取需要一定时间,具体取决于网站规模。处理完成后,页面会展示提取到的结构化结果。
4. 查看并下载数据
确认结果无误后,选择下载格式:
- CSV:适合用 Excel、表格工具或数据分析脚本处理
- JSON:适合程序读取、入库或做进一步开发
Crawly 会自动提取哪些字段
根据官方页面说明,Crawly 针对文章类页面会自动抽取以下字段:
| 字段 | 含义 |
|---|---|
| Title | 文章标题 |
| Text | 正文文本 |
| HTML | 正文 HTML |
| Comments | 评论 |
| Date | 日期 |
| Entity Tags | 实体标签 |
| Author | 作者 |
| AuthorUrl | 作者页面链接 |
| Images | 图片 |
| Videos | 视频 |
| Publisher Country | 发布方国家 |
| Publisher Name | 发布方名称 |
| Language | 语言 |
这些字段覆盖了内容采集最常用的信息,省去了逐页手动复制或写解析逻辑的工作。
常见卡点
- 只输入了首页:Crawly 会从你给的地址出发爬取整站,如果只想抓某个栏目,需要确认入口 URL 的范围是否符合预期。
- 动态渲染页面:如果目标内容依赖大量前端脚本生成,抽取结果可能不完整,建议先用少量页面验证。
- 下载格式选择:需要人工查看选 CSV,需要程序处理选 JSON,两者字段一致,只是结构不同。
- 抓取合规:使用前确认目标网站的 robots.txt 和使用条款,避免抓取受限制或敏感内容。
Crawly 的定位是“把网站变成数据”,整个流程就是输入网址、点击爬取、等待结果、下载文件四步,适合需要快速获取整站结构化内容又不想维护爬虫代码的用户。