pdfgrep 支持哪些常用搜索选项?
pdfgrep 是一个在 PDF 文件中搜索文本的命令行工具,它有意兼容 GNU Grep,因此许多你熟悉的 grep 选项都能直接使用。根据 pdfgrep.org 的说明,-r、-i、-n、-c 等常用选项都受支持。如果你已经会用 grep,迁移到 pdfgrep 的成本很低;如果你需要跨多个 PDF 批量查找关键词,下面这几个选项基本能覆盖大多数日常任务。
基本用法
pdfgrep 的调用形式与 grep 类似:
pdfgrep [选项] 模式 文件.pdf
例如在单个 PDF 中查找某个词:
pdfgrep "关键词" document.pdf
预期结果是输出包含该关键词的文本内容。如果没有任何输出,说明该 PDF 中没有匹配到该模式(或该 PDF 的文本层无法被提取)。
常用选项
-i:忽略大小写
pdfgrep -i "keyword" document.pdf
让匹配不区分大小写,Keyword、KEYWORD、keyword 都会被命中。适合你不确定原文大小写、或希望一次覆盖多种写法的场景。
-n:显示匹配所在位置
pdfgrep -n "keyword" document.pdf
在输出匹配内容的同时显示匹配所在的行号或页码信息,便于你定位到 PDF 中的具体位置。当你需要回到原文核对上下文时,这个选项很实用。
-c:统计匹配数量
pdfgrep -c "keyword" document.pdf
只输出匹配的次数,而不打印具体内容。适合快速判断某个词在文档中出现的频率,或用于脚本中做条件判断。
-r:递归搜索目录
pdfgrep -r "keyword" ./papers/
递归遍历指定目录下的 PDF 文件进行搜索。当你有一整个文件夹的文献、报告需要批量查找时,这个选项可以省去逐个指定文件的麻烦。
选项组合
这些选项可以叠加使用,例如:
pdfgrep -rin "keyword" ./papers/
表示在 ./papers/ 目录下递归搜索、忽略大小写、并显示匹配位置。组合时注意把选项写在模式之前,符合命令行工具的通用惯例。
选择建议
| 你的需求 | 推荐选项 |
|---|---|
| 不确定大小写 | -i |
| 需要定位到具体位置 | -n |
| 只想知道出现几次 | -c |
| 批量搜索整个目录 | -r |
| 以上多种需求 | 组合使用 |
由于 pdfgrep 以兼容 GNU Grep 为目标,你熟悉的许多其他 grep 选项也可能可用。具体支持范围建议以 pdfgrep --help 的实际输出为准,因为不同版本的选项集合可能略有差异。