PDF 文件处理助手
读取、提取、合并、拆分、旋转、加水印、填写、转换或新建 PDF,并检查最终页面效果。适合主要输入或输出是 PDF,且任务涉及页面、文本、表格、表单或文件结构。
技能说明
PDF 文件处理助手
这个 Skill 能做什么
读取、提取、合并、拆分、旋转、加水印、填写、转换或新建 PDF,并检查最终页面效果。
完成任务时重点处理:
- 文本与表格的准确提取
- 页面级操作和文件安全
- 渲染后的版面与可搜索性
最终目标不是堆出一份看似完整的内容,而是交付能够直接使用、继续修改并清楚验收的结果。
什么时候使用
- 主要输入或输出是 PDF,且任务涉及页面、文本、表格、表单或文件结构。
- 用户需要读取、提取、合并、拆分、旋转、加水印、填写、转换或新建 PDF,并检查最终页面效果。
- 任务需要同时控制文本与表格的准确提取、页面级操作和文件安全。
如果扫描质量太低时标记无法可靠识别的页面并保留原图,先处理前置条件,不要直接假装任务已经完成。
开始前需要什么
优先收集:
- 输入文件、文本或数据位置
- 文档用途与目标读者
- 模板、页面规格和格式要求
- 必须保留、允许修改和需要核对的内容
- 是否包含扫描页、表单、密码或数字签名
- 需要处理的页码范围与输出顺序
信息不必一次问完。先检查用户已经提供的材料,只追问会明显改变结果的问题。
执行步骤
1. 识别文件类型
判断是文本型、扫描型、表单型还是混合 PDF。
2. 建立页面清单
记录页数、尺寸、方向、书签、附件和处理范围。
3. 选择处理方式
文本提取、OCR、页面重排和表单填写分别使用合适流程。
4. 执行可逆操作
保留原件,按页码与文件顺序生成新文件。
5. 验证内容结构
复核文本、表格、表单值、书签和元数据。
6. 渲染逐页检查
查看裁切、旋转、字体、图片、空白页和水印位置。
输出格式
至少交付以下内容:
- 处理后的 PDF:按要求生成且可正常打开的最终文件
- 提取内容:需要时提供文本、表格或图片目录
- 处理记录:页码范围、操作、异常和验证结果
所有文件使用能说明内容和版本的名称。若任务包含执行动作,还要记录执行状态、验证结果和可继续处理的材料。
完整示例
用户提供四份方向不一的扫描合同,希望合并并生成可搜索文本;先校正页面方向,再 OCR、排序、合并并抽查关键条款。
合理处理顺序:
- 识别文件类型
- 建立页面清单
- 选择处理方式
- 执行可逆操作
- 验证内容结构
- 渲染逐页检查
交付时应重点展示处理后的 PDF、提取内容、处理记录,并说明尚未验证的部分。
质量检查清单
- [ ] 输出文件能够正常打开和继续编辑
- [ ] 内容结构、编号和格式前后一致
- [ ] 关键数据、名称和引用已经复核
- [ ] 完成结构检查,并在可行时完成视觉预览
- [ ] 页数、顺序、方向和页面尺寸符合要求
- [ ] 加密、签名或表单特性没有被无意破坏
信息不足时怎么处理
- 缺少模板时先给出结构草案,再采用通用专业格式。
- 环境不能完成某项文件操作时,先交付可执行方案并标出待处理步骤。
- 扫描质量太低时标记无法可靠识别的页面并保留原图。
评论 0
更多
登录后可点赞、收藏、评论和举报。
还没有评论,先发起一个具体问题。