Gobble Bot 有哪些已知问题或使用限制?

Gobble Bot 官方明确承认它是个“周末小项目”,部分功能已知不可用。目前确认的限制包括:大型 PDF、ePUB/MOBI 格式、以及结构复杂的站点地图(sitemap)无法正常处理。此外,它没有账户系统、不能连接 Dropbox 等云存储、不支持自动重新同步,也没有并行爬取等进阶能力。遇到问题可以通过作者个人网站 rafal.fyi 反馈。

已明确不支持的场景

根据网站自述,以下三类内容“已知不工作”:

  • 大型 PDF:文件体积过大时处理会失败。具体多大算“大”官方没有给出数字,只能自行尝试。
  • ePUB / MOBI:电子书格式不在支持列表内,无法转换。
  • 复杂的站点地图:结构复杂的 sitemap 会导致爬取失败。简单站点地图可能正常,但官方未说明判定标准。

这三项是作者主动列出的“已知不工作”清单,不是偶发故障,而是当前版本的能力边界。

支持的数据来源与格式(对照参考)

了解限制前,先确认它本来能处理什么,避免把“不支持”误判成“故障”。

类别 支持内容
链接类 公开网站 URL、YouTube 视频(需有转录文本)
文件类 .TXT、.MD、.PDF、.DOC/.DOCX、.ODT/.OTT、.RTF、.HTML/.HTM、.ATOM、.RSS、.XML、.XLS/.XLSX/.XLSB/.XLSM/.XLTX、.CSV、.ODS/.OTS、.PPTX/.POTX、.ODP/.OTP/.ODG/.OTG
云盘入口 界面提供 Notion、Dropbox、Google Drive 的入口

注意:文件格式列表里有 .PDF,但“大型 PDF”被单独列为已知问题——说明普通 PDF 可用,超大 PDF 会失败。ePUB/MOBI 则完全不在列表中。

尚未实现的功能

作者在页面中把这些列为“可以加但还没加”的东西:

  • 账户系统
  • 连接云存储(Dropbox 等)
  • 自动重新同步
  • 并行爬取更多内容

也就是说,目前每次使用都需要手动操作,没有持久化的账号或自动更新机制。如果你需要定期同步内容来训练 chatbot,当前版本帮不上忙,得等作者后续更新。

遇到问题怎么反馈

官方给出的反馈渠道只有一个:作者个人网站 rafal.fyi。页面上没有工单系统、没有社区论坛、也没有客服邮箱。考虑到项目性质,反馈后能否及时处理取决于作者个人时间。

使用前的现实预期

  • 它是免费工具,但免费的原因不是商业化策略:作者说“做得快,没时间搞收费”,未来“可能加简单的按量付费”。所以现在免费不代表永久免费。
  • 处理在本地完成:所有文件处理都在你的设备上进行,不上传服务器;但网站 URL 可能会发送给第三方爬取 API(这些 URL 本来就是公开的)。
  • 稳定性有限:作者自己用“😡🤷♂️”形容它不工作时的情况,并说“有些东西已知不工作”。把它当作轻量辅助工具,而不是生产级数据管道。

如果你的内容恰好落在“大型 PDF、ePUB/MOBI、复杂 sitemap”这三类里,当前版本大概率无法完成任务,需要先拆分或转换格式再试。

gobble.bot
You have a website, PDF or a Youtube link and want to train a custom ChatGPT chatbot. Simply use Gobble Bot to turn it all into one text file, read...