Crawly 与 Diffbot 是什么关系?使用时需要提供哪些信息?
Crawly 是 Diffbot 推出的网页爬虫产品,页面明确标注为 "Crawler By Diffbot",版权信息为 "© 2024 Diffbot Web Crawler by Diffbot"。它的定位是替代手写爬虫:输入一个网站地址,Crawly 会自动爬取整站并提取结构化数据,无需自己编写抓取代码。使用前需要准备两样东西——目标网站 URL 和一个联系邮箱。
Crawly 与 Diffbot 的关系
从页面信息可以直接确认三点:
- 产品名称旁标注 "Crawler By Diffbot",说明 Crawly 是 Diffbot 旗下的爬虫工具,而非独立第三方产品。
- 页脚版权为 "© 2024 Diffbot Web Crawler by Diffbot",运营主体是 Diffbot。
- 联系入口为页面上的 Contact,涉及抓取范围、频率、合规限制等问题时,应通过该渠道向 Diffbot 确认。
因此,Crawly 可以理解为 Diffbot 面向"整站抓取 + 自动结构化"场景提供的一个入口,而不是需要单独安装的软件。
使用 Crawly 需要提供哪些信息
页面上的输入项只有两个:
| 输入项 | 作用 |
|---|---|
| Website Url | 指定要爬取的目标网站 |
| Email Address | 留下联系邮箱,用于接收抓取结果或后续沟通 |
填写后点击 "Crawl My Website" 提交。页面没有说明是否需要注册账号或登录,也没有公开价格信息,因此不能默认它免费或无需登录——这些条件需要以实际提交后的提示或 Contact 渠道的回复为准。
Crawly 会自动提取哪些字段
根据页面说明,Crawly 会爬取并自动提取文章级别的结构化数据,字段包括:
- Title(标题)
- Text(正文文本)
- HTML(原始 HTML)
- Comments(评论)
- Date(日期)
- Entity Tags(实体标签)
- Author(作者)
- AuthorUrl(作者链接)
- Images(图片)
- Videos(视频)
- Publisher Country(发布方国家)
- Publisher Name(发布方名称)
- Language(语言)
提取结果可以下载为 CSV 或 JSON,便于直接导入表格、数据库或后续程序处理。
适合什么场景,注意什么
Crawly 适合需要把整站文章内容批量转成结构化数据的任务,例如内容归档、语料收集、竞品内容分析。它的卖点是"Never Write Another Web Scraper",即省去自己写解析规则的工作。
需要注意的边界:
- 页面只描述了文章类字段的提取,未说明对非文章页面(如商品页、列表页)的支持程度。
- 抓取频率、并发限制、是否遵守目标站 robots 规则等,页面均未提及,属于需要向 Diffbot 确认的事项。
- 提交邮箱后数据的存储与使用方式,页面没有说明,涉及敏感站点时应先通过 Contact 问清。
如果你的目标是快速拿到某个网站的文章标题、正文、作者、发布时间等字段并导出 CSV/JSON,Crawly 的流程就是"填 URL + 填邮箱 + 提交";如果涉及抓取规模、合规或费用问题,先联系 Diffbot 确认再动手。