Skip to main content

News Extractor Skill

从主流新闻平台提取文章内容,输出 JSON 和 Markdown 格式。

支持平台

依赖安装

本 skill 使用 uv 管理依赖。首次使用前需要安装:
说明: 此 skill 可放置在项目级 (.claude/skills/) 或用户级 (~/.claude/skills/) 目录。项目级便于团队共享,用户级便于跨项目复用。
重要: 所有脚本必须使用 uv run 执行,不要直接用 python 运行。uv run 会自动使用项目虚拟环境中的依赖。

依赖列表

使用方式

基本用法

输出文件

脚本默认输出两种格式到指定目录(默认 ./output):
  • {news_id}.json - 结构化 JSON 数据
  • {news_id}.md - Markdown 格式文章

工作流程

  1. 接收 URL - 用户提供新闻链接
  2. 平台检测 - 自动识别平台类型
  3. 内容提取 - 调用对应爬虫获取并解析内容
  4. 格式转换 - 生成 JSON 和 Markdown
  5. 输出文件 - 保存到指定目录

输出格式

JSON 结构

Markdown 结构

使用示例

提取微信公众号文章

输出:

提取今日头条文章

错误处理

注意事项

  • 仅用于教育和研究目的
  • 不要进行大规模爬取
  • 尊重目标网站的 robots.txt 和服务条款
  • 微信公众号可能需要有效的 Cookie(当前默认配置通常可用)

参考