pdfgrep 支持哪些常用搜索选项?

pdfgrep 是一个在 PDF 文件中搜索文本的命令行工具,它有意兼容 GNU Grep,因此许多你熟悉的 grep 选项都能直接使用。根据 pdfgrep.org 的说明,-r、-i、-n、-c 等常用选项都受支持。如果你已经会用 grep,迁移到 pdfgrep 的成本很低;如果你需要跨多个 PDF 批量查找关键词,下面这几个选项基本能覆盖大多数日常任务。

基本用法

pdfgrep 的调用形式与 grep 类似:

pdfgrep [选项] 模式 文件.pdf

例如在单个 PDF 中查找某个词:

pdfgrep "关键词" document.pdf

预期结果是输出包含该关键词的文本内容。如果没有任何输出,说明该 PDF 中没有匹配到该模式(或该 PDF 的文本层无法被提取)。

常用选项

-i:忽略大小写

pdfgrep -i "keyword" document.pdf

让匹配不区分大小写,Keyword、KEYWORD、keyword 都会被命中。适合你不确定原文大小写、或希望一次覆盖多种写法的场景。

-n:显示匹配所在位置

pdfgrep -n "keyword" document.pdf

在输出匹配内容的同时显示匹配所在的行号或页码信息,便于你定位到 PDF 中的具体位置。当你需要回到原文核对上下文时,这个选项很实用。

-c:统计匹配数量

pdfgrep -c "keyword" document.pdf

只输出匹配的次数,而不打印具体内容。适合快速判断某个词在文档中出现的频率,或用于脚本中做条件判断。

-r:递归搜索目录

pdfgrep -r "keyword" ./papers/

递归遍历指定目录下的 PDF 文件进行搜索。当你有一整个文件夹的文献、报告需要批量查找时,这个选项可以省去逐个指定文件的麻烦。

选项组合

这些选项可以叠加使用,例如:

pdfgrep -rin "keyword" ./papers/

表示在 ./papers/ 目录下递归搜索、忽略大小写、并显示匹配位置。组合时注意把选项写在模式之前,符合命令行工具的通用惯例。

选择建议

你的需求 推荐选项
不确定大小写 -i
需要定位到具体位置 -n
只想知道出现几次 -c
批量搜索整个目录 -r
以上多种需求 组合使用

由于 pdfgrep 以兼容 GNU Grep 为目标,你熟悉的许多其他 grep 选项也可能可用。具体支持范围建议以 pdfgrep --help 的实际输出为准,因为不同版本的选项集合可能略有差异。

pdfgrep.org