Crawly(crawly.diffbot.com)是什么网站?
Crawly 是 Diffbot 推出的网页爬虫工具,核心用途是把网站内容自动抓取并转换成结构化数据,官方口号是“Never Write Another Web Scraper”(再也不用写爬虫脚本)。你只需要输入一个网址,它就会爬取整站并自动提取文章信息,结果可下载为 CSV 或 JSON。它适合需要批量获取网站文章数据、但不想自己写和维护爬虫的人。
它能提取哪些数据
根据网站首页说明,输入网址后,Crawly 会自动提取文章的以下字段:
| 字段 | 含义 |
|---|---|
| Title | 文章标题 |
| Text | 正文文本 |
| HTML | 页面 HTML |
| Comments | 评论 |
| Date | 日期 |
| Entity Tags | 实体标签 |
| Author | 作者 |
| AuthorUrl | 作者链接 |
| Images | 图片 |
| Videos | 视频 |
| Publisher Country | 发布方国家 |
| Publisher Name | 发布方名称 |
| Language | 语言 |
这些字段覆盖了一篇文章从内容到元信息的主要维度,省去了自己写解析规则的工作。
怎么用
流程很简单,不需要编程:
- 打开 crawly.diffbot.com。
- 在输入框填入目标网站地址。
- 提交后,Crawly 会爬取该网站并自动提取上述结构化数据。
- 完成后把结果下载为 CSV 或 JSON。
页面上还提供了邮箱地址字段,以及“Crawl My Website”按钮,用于提交抓取任务。
适合谁用
- 需要把整站文章转成表格或 JSON 做分析的人。
- 不想为每个网站单独写爬虫和解析逻辑的开发者或数据人员。
- 需要批量获取标题、正文、作者、发布时间等字段的内容整理场景。
需要注意的点
- 它面向的是“整站文章级”的结构化提取,字段以文章维度为主,不是任意自定义字段的通用抓取器。
- 结果格式为 CSV 或 JSON,适合直接进入后续数据处理流程。
- 网站资料未提及价格、免费额度或登录要求,使用前建议在站内确认当前政策。