按关键词拆分 PDF

用页面中的关键词或短语作为起点,将 PDF 拆分为多个独立文件

或拖拽文件至此处

请上传 PDF 文件

使用说明

  • 输入每个文档第一页上出现的关键词或短语
  • 检测匹配项并调整哪些页面应作为新文件的起点
  • 带关键词的页面将保留为其所在段落的第一页
  • 结果以下载包含多个 PDF 的 ZIP 文件形式提供

使用前先了解

按关键词拆分适合有固定标题或编号的 PDF

按关键词拆分会在页面文字中查找指定词,把匹配页作为新文件起点。它适合可选中文本 PDF,不适合没有 OCR 的纯扫描图片。

适合场景

  • 每份单据都有固定标题或编号
  • 按“第一章”“发票编号”等文字分段
  • 长文档需要按内容起点拆分

建议步骤

  1. 1确认 PDF 文字可以被选中
  2. 2输入稳定出现的关键词
  3. 3检查匹配页并下载拆分结果

能力边界

  • 扫描图片没有 OCR 时无法识别文字
  • 关键词过短可能误匹配
  • 不同格式文档需要分别测试关键词

结果检查

  • 确认匹配页数量符合预期
  • 检查每段首页是否是目标关键词页
  • 误匹配时换用更具体的短语

常见失败原因

  • 扫描件没有 OCR 文本时无法匹配关键词
  • 关键词过短会误匹配普通正文
  • 不同模板文字位置和写法不一致时需要分别测试
本站的 PDF 处理在浏览器本地执行。文件不会上传到 sotool 服务器,但大文件会占用浏览器内存,处理前建议保留原文件备份。

实测结果

以下为本地浏览器实测结果。不同文件结构、图片质量和字体资源会影响最终结果。

原文件
3 页,2.4 KB,含 2 个 SOTOOL_CASE_START 起始标记
操作
按关键词 SOTOOL_CASE_START 定位 2 个起始页
输出
输出 2 个 PDF 文件的 ZIP 包,2.5 KB

按关键词拆分依赖 PDF 中可提取文本,纯扫描图片需要先 OCR。

常见问题

使用按关键词拆分 PDF时文件会上传服务器吗?+

不会。按关键词拆分 PDF在浏览器本地处理文件,sotool 不会接收或保存你的 PDF 内容。处理大文件时主要消耗的是本机浏览器内存,重要文件建议先保留原件。

按关键词拆分 PDF处理失败通常是什么原因?+

常见原因是扫描件没有 OCR 文本,或关键词过短造成误匹配。建议用稳定且具体的标题或编号。

处理完成后应该重点检查什么?+

确认匹配页数量、每段首页和关键词位置,误匹配时换更具体的短语重新检测。