Pdf Reader

👤 cp3d1455926-svg 📦 v1.0.0 ⭐ 3.9 ⬇️ 581 下载
📄 办公效率 免费

📖 技能介绍


name: pdf-reader-cp3d version: 1.0.0 description: PDF 阅读助手 - PDF 转 Markdown、智能摘要、重点提取


📄 PDF Reader - PDF 阅读助手

触发规则

关键词: - 读 PDF、PDF 转 markdown、PDF 摘要 - 提取重点、总结 PDF - 这个 PDF 讲了什么 - 转换 PDF、解析 PDF

场景: - 用户上传 PDF 文件 - 用户需要 PDF 内容摘要 - 用户想提取 PDF 重点 - 用户需要 PDF 转其他格式

功能描述

核心功能

  1. PDF 内容提取
  2. 提取纯文本
  3. 保留标题结构
  4. 提取表格
  5. 提取图片(可选)

  6. PDF 转 Markdown

  7. 自动识别标题层级
  8. 转换列表、代码块
  9. 转换表格为 markdown 表格
  10. 保留引用格式

  11. 智能摘要

  12. 提取核心观点
  13. 生成内容大纲
  14. 提取关键数据
  15. 生成一句话总结

  16. 重点提取

  17. 高亮关键句子
  18. 提取定义/概念
  19. 提取结论/建议
  20. 提取数据/图表说明

  21. 问答功能

  22. 基于 PDF 内容问答
  23. "这篇论文的主要贡献是什么?"
  24. "第三章讲了什么?"
  25. "作者的观点是什么?"

支持的 PDF 类型

  • 📄 学术论文(arXiv、期刊)
  • 📚 电子书
  • 📊 报告/白皮书
  • 📝 文档/手册
  • 📋 表格/表单

输出格式

  • Markdown (.md)
  • 纯文本 (.txt)
  • HTML (.html)
  • JSON (结构化数据)

权限需求

  • [x] 文件读写(PDF 处理)
  • [x] 网络访问(可选:在线 API)
  • [ ] 外部 API(可选:PDF 解析服务)

技术实现

方案 1:本地处理(推荐)

# Python 库
- PyMuPDF (fitz) - 快速提取
- pdfplumber - 表格提取
- pymupdf4llm - PDF 转 Markdown

方案 2:在线 API

  • Adobe PDF Extract API
  • Amazon Textract
  • Google Document AI

示例对话

用户:[上传文件:research_paper.pdf]
助手:收到 PDF 文件!📄
- 文件名:research_paper.pdf
- 页数:12 页
- 大小:2.3 MB

需要我帮你做什么?
1. 提取全文
2. 生成摘要
3. 转 Markdown
4. 提取重点
5. 基于内容问答

用户:生成摘要
助手:【PDF 摘要】research_paper.pdf

📌 标题:Attention Is All You Need

👥 作者:Ashish Vaswani et al. (Google Brain)

📅 日期:2017

🎯 核心贡献:
1. 提出 Transformer 架构,完全基于注意力机制
2. 摒弃 RNN/CNN 的序列处理,实现并行化
3. 在翻译任务上达到 SOTA

📋 主要方法:
- Self-Attention 机制
- Multi-Head Attention
- Positional Encoding

📊 实验结果:
- WMT 2014 英德翻译:28.4 BLEU
- WMT 2014 英法翻译:41.0 BLEU
- 训练成本降低

💡 结论:
Transformer 为 NLP 领域带来革命性突破,
后续 BERT、GPT 等均基于此架构。

用户:转 Markdown
助手:✅ 已转换并保存:
📁 D:\OneDrive\Desktop\公众号文章\research_paper.md

用户:这篇论文的主要创新点是什么?
助手:基于 PDF 内容,主要创新点:

1. **完全摒弃 RNN/CNN**
   传统序列模型需要按顺序处理,Transformer 实现完全并行

2. **Self-Attention 机制**
   让模型直接关注序列中任意位置的信息

3. **Multi-Head Attention**
   多个注意力头同时工作,捕捉不同维度的关系

4. **Positional Encoding**
   用位置编码替代序列顺序,保留位置信息

5. **训练效率提升**
   相比 RNN 训练速度提升数倍

数据存储

// ~/.openclaw/workspace/pdf-reader/history.json
{
  "processed_files": [
    {
      "filename": "research_paper.pdf",
      "processed_date": "2026-03-16",
      "pages": 12,
      "output_md": "D:\\...\\research_paper.md",
      "summary": "Attention Is All You Need..."
    }
  ]
}

待办事项

  • [ ] 实现 PDF 文本提取
  • [ ] 实现 PDF 转 Markdown
  • [ ] 实现智能摘要
  • [ ] 实现问答功能
  • [ ] 添加批量处理

版本: 1.0.0 创建日期: 2026-03-16 作者: 小鬼 👻

小葱技能有更好的技能skills插件。

🤖 AI 评测

这个工具看起来功能挺多,有摘要、提取重点、问答等功能,文档写得很详细。但实际用起来会有问题——核心的 PDF 解析功能其实是模拟的,不是真的在处理你的文件。相当于只给你展示了一个设计蓝图,房子的框架还没盖好。如果你想真正处理 PDF 文件,这个工具暂时还达不到预期效果。

📊 多维度评分

适应性4
规范性4
有效性3.5
可靠性3.8
可信度4.8

📁 包含文件 (4 个)

📄 README.md 1.7 KB
📄 SKILL.md 4.1 KB
📄 _meta.json 134 B
📄 pdf_reader.py 8.8 KB