News Extractor Skill
从主流新闻平台提取文章内容,输出 JSON 和 Markdown 格式。支持平台
依赖安装
本 skill 使用 uv 管理依赖。首次使用前需要安装:说明: 此 skill 可放置在项目级 (重要: 所有脚本必须使用.claude/skills/) 或用户级 (~/.claude/skills/) 目录。项目级便于团队共享,用户级便于跨项目复用。
uv run 执行,不要直接用 python 运行。uv run 会自动使用项目虚拟环境中的依赖。
依赖列表
使用方式
基本用法
输出文件
脚本默认输出两种格式到指定目录(默认./output):
{news_id}.json- 结构化 JSON 数据{news_id}.md- Markdown 格式文章
工作流程
- 接收 URL - 用户提供新闻链接
- 平台检测 - 自动识别平台类型
- 内容提取 - 调用对应爬虫获取并解析内容
- 格式转换 - 生成 JSON 和 Markdown
- 输出文件 - 保存到指定目录
输出格式
JSON 结构
Markdown 结构
使用示例
提取微信公众号文章
提取今日头条文章
错误处理
注意事项
- 仅用于教育和研究目的
- 不要进行大规模爬取
- 尊重目标网站的 robots.txt 和服务条款
- 微信公众号可能需要有效的 Cookie(当前默认配置通常可用)