Crawly 能从网页中自动提取哪些数据字段?

Crawly(crawly.diffbot.com)是 Diffbot 推出的网页爬虫工具,核心卖点是“不用自己写爬虫”——输入一个网址,它会自动爬取并抽取整站的结构化数据。它能提取的字段覆盖文章内容、作者信息、媒体资源和发布信息几大类,最终可下载为 CSV 或 JSON。如果你需要的是文章级结构化数据(而不是原始 HTML 全文),它基本能满足;但如果你要抓的是登录后内容、复杂交互页面或非文章型页面,就需要先确认它是否适用。

提取字段清单

根据页面说明,Crawly 会自动抽取以下字段:

类别 字段 说明
正文内容 Title 文章标题
Text 正文纯文本
HTML 正文 HTML
Comments 评论内容
Date 发布日期
作者信息 Author 作者名
AuthorUrl 作者页面链接
实体与标签 Entity Tags 实体标签(用于识别文中提到的人物、机构、地点等实体)
媒体资源 Images 图片
Videos 视频
发布信息 Publisher 发布方
Publisher Name 发布方名称
Country 国家
Language 语言

这些字段适合什么用途

  • 内容聚合与入库:Title、Text、HTML、Date 组合起来可以直接构建文章库,Text 适合做检索和 NLP 处理,HTML 适合保留原始排版。
  • 作者与来源分析:Author、AuthorUrl、Publisher、Publisher Name、Country 可用于统计稿源分布、作者产出。
  • 实体抽取:Entity Tags 省去了自己跑命名实体识别的步骤,适合做知识图谱或话题关联。
  • 多媒体盘点:Images、Videos 便于建立素材索引。
  • 多语言场景:Language 字段可用于按语种分流。

输出与使用方式

页面提供两种下载格式:CSV 和 JSON。CSV 适合直接导入表格或数据库,JSON 适合程序化处理嵌套结构(例如一条记录里包含多张图片、多个实体标签)。使用流程是:输入网站地址(页面同时提供 Website Url 和 Email Address 输入项),点击 “Crawl My Website” 后由系统爬取并抽取。

判断是否满足你的需求

适合的情况:

  • 目标是文章型页面,需要标题、正文、作者、发布时间等标准字段。
  • 希望跳过写解析规则,直接拿到结构化结果。
  • 需要整站批量抓取,而不是单页。

需要先确认的情况:

  • 目标页面不是文章(如商品页、列表页、表单页),字段覆盖可能不匹配。
  • 需要登录才能访问的内容,页面未说明支持。
  • 对抓取频率、页数上限、费用有要求——页面未列出价格或额度信息,需另行确认。

如果你的数据需求正好落在上表字段范围内,Crawly 的抽取结果可以直接进入后续分析或入库流程;如果需求超出这些字段,建议先小范围测试目标站点,再决定是否采用。

crawly.diffbot.com
Turn websites into data in seconds. Crawly spiders and extracts complete structured data from an entire website.