Crawly 能从网页中自动提取哪些数据字段?
Crawly(crawly.diffbot.com)是 Diffbot 推出的网页爬虫工具,核心卖点是“不用自己写爬虫”——输入一个网址,它会自动爬取并抽取整站的结构化数据。它能提取的字段覆盖文章内容、作者信息、媒体资源和发布信息几大类,最终可下载为 CSV 或 JSON。如果你需要的是文章级结构化数据(而不是原始 HTML 全文),它基本能满足;但如果你要抓的是登录后内容、复杂交互页面或非文章型页面,就需要先确认它是否适用。
提取字段清单
根据页面说明,Crawly 会自动抽取以下字段:
| 类别 | 字段 | 说明 |
|---|---|---|
| 正文内容 | Title | 文章标题 |
| Text | 正文纯文本 | |
| HTML | 正文 HTML | |
| Comments | 评论内容 | |
| Date | 发布日期 | |
| 作者信息 | Author | 作者名 |
| AuthorUrl | 作者页面链接 | |
| 实体与标签 | Entity Tags | 实体标签(用于识别文中提到的人物、机构、地点等实体) |
| 媒体资源 | Images | 图片 |
| Videos | 视频 | |
| 发布信息 | Publisher | 发布方 |
| Publisher Name | 发布方名称 | |
| Country | 国家 | |
| Language | 语言 |
这些字段适合什么用途
- 内容聚合与入库:Title、Text、HTML、Date 组合起来可以直接构建文章库,Text 适合做检索和 NLP 处理,HTML 适合保留原始排版。
- 作者与来源分析:Author、AuthorUrl、Publisher、Publisher Name、Country 可用于统计稿源分布、作者产出。
- 实体抽取:Entity Tags 省去了自己跑命名实体识别的步骤,适合做知识图谱或话题关联。
- 多媒体盘点:Images、Videos 便于建立素材索引。
- 多语言场景:Language 字段可用于按语种分流。
输出与使用方式
页面提供两种下载格式:CSV 和 JSON。CSV 适合直接导入表格或数据库,JSON 适合程序化处理嵌套结构(例如一条记录里包含多张图片、多个实体标签)。使用流程是:输入网站地址(页面同时提供 Website Url 和 Email Address 输入项),点击 “Crawl My Website” 后由系统爬取并抽取。
判断是否满足你的需求
适合的情况:
- 目标是文章型页面,需要标题、正文、作者、发布时间等标准字段。
- 希望跳过写解析规则,直接拿到结构化结果。
- 需要整站批量抓取,而不是单页。
需要先确认的情况:
- 目标页面不是文章(如商品页、列表页、表单页),字段覆盖可能不匹配。
- 需要登录才能访问的内容,页面未说明支持。
- 对抓取频率、页数上限、费用有要求——页面未列出价格或额度信息,需另行确认。
如果你的数据需求正好落在上表字段范围内,Crawly 的抽取结果可以直接进入后续分析或入库流程;如果需求超出这些字段,建议先小范围测试目标站点,再决定是否采用。