网页内容采集助手
把公开网页、讨论串或视频页面中的主要内容保存为结构清楚的 Markdown,并保留必要元数据。适合需要离线整理网页资料、归档文章或把在线内容转成可检索文本。
技能说明
网页内容采集助手
这个 Skill 能做什么
把公开网页、讨论串或视频页面中的主要内容保存为结构清楚的 Markdown,并保留必要元数据。
完成任务时重点处理:
- 正文提取与导航广告清理
- 标题、作者、日期、来源和链接保留
- 登录、动态加载与交互页面处理
最终目标不是堆出一份看似完整的内容,而是交付能够直接使用、继续修改并清楚验收的结果。
什么时候使用
- 需要离线整理网页资料、归档文章或把在线内容转成可检索文本。
- 用户需要把公开网页、讨论串或视频页面中的主要内容保存为结构清楚的 Markdown,并保留必要元数据。
- 任务需要同时控制正文提取与导航广告清理、标题、作者、日期、来源和链接保留。
如果遇到登录或验证码时请求用户完成交互,不尝试绕过访问控制,先处理前置条件,不要直接假装任务已经完成。
开始前需要什么
优先收集:
- 目标、输入文件与预期输出
- 运行环境、依赖、版本和目录约束
- 已有代码、接口、样例和错误信息
- 安全、性能、兼容性和测试要求
- 目标 URL 列表与是否需要登录
- 是否保留图片、评论、字幕和页面元数据
信息不必一次问完。先检查用户已经提供的材料,只追问会明显改变结果的问题。
执行步骤
1. 分类目标页面
判断普通文章、动态页面、讨论串或视频页面。
2. 选择采集方式
优先使用稳定读取方式,必要时使用受控浏览器完成加载。
3. 提取主要内容
保留标题、正文、列表、代码、引用和必要媒体。
4. 清理结构
删除导航、广告、重复按钮和无关推荐。
5. 补充元数据
记录原 URL、标题、作者、日期、采集时间和页面状态。
6. 验证与保存
对照页面抽查段落、顺序、链接和缺失内容。
输出格式
至少交付以下内容:
- Markdown 归档:清理后的正文与结构
- 媒体目录:按需下载并重写引用的图片或附件
- 采集日志:URL、时间、状态、缺失项和交互要求
所有文件使用能说明内容和版本的名称。若任务包含执行动作,还要记录执行状态、验证结果和可继续处理的材料。
完整示例
用户提供十篇教程链接,希望建立离线资料库;按页面类型提取正文、代码和图片,并为每篇增加统一元数据。
合理处理顺序:
- 分类目标页面
- 选择采集方式
- 提取主要内容
- 清理结构
- 补充元数据
- 验证与保存
交付时应重点展示Markdown 归档、媒体目录、采集日志,并说明尚未验证的部分。
质量检查清单
- [ ] 命令、脚本和依赖在目标环境可运行
- [ ] 输入、输出、错误和边界情况均被处理
- [ ] 关键步骤可重复执行且不会意外覆盖原件
- [ ] 完成最小测试并记录验证命令与结果
- [ ] 归档保留原 URL 和采集时间
- [ ] 没有把页面导航或评论入口误当正文
信息不足时怎么处理
- 缺少依赖或权限时先给出可验证的替代路径。
- 环境未知时避免绑定单一工具,明确适配点。
- 遇到登录或验证码时请求用户完成交互,不尝试绕过访问控制。
评论 0
更多
登录后可点赞、收藏、评论和举报。
还没有评论,先发起一个具体问题。