文档检查AI

👤 mmgongzhu 📦 v1.0.1 ⭐ 4.5 ⬇️ 268 下载
📄 办公效率 免费

📖 技能介绍


name: doc-proofread agent_created: true description: 审校通 — 多格式文档审校工具,支持 PDF、Word(.docx)、纯文本(.txt/.md) 三种格式的只读校对。四层递进检查(文字→标点→数据逻辑→风格合规),三种审校模式(客户资料校验/自有方案审稿/新闻稿校对)。严格只读安全边界:不修改源文件,生成独立勘误对照报告,修改前必须经用户确认,修改后执行自我校验。适用于校对客户发来的资料、审阅自己写的方案文档、新闻稿/公关稿校对、交付前质量检查。触发关键词:校稿、校对、审稿、审校、检查文档、找错别字、标点检查、数据溯源、文表一致性、交付前检查、去AI味、新闻稿校对、通稿校对、审校通、proofread、check document。


审校通(doc-proofread):多格式文档审校工具

审校通 对中文正式文档进行交付前审校,支持 PDF、Word(.docx)、纯文本(.txt/.md) 三种格式。提供三种审校模式:客户资料校验、自有方案审稿、新闻稿校对。严格执行只读安全边界,不修改源文件,根据问题数量决定输出方式,修改前必须经用户确认并执行自我校验。

安全边界(铁律)

以下规则不可违反、不可绕过:

  1. 绝不修改源文件:用户提供的原始文件在整个校稿过程中保持只读。
  2. 修改只在副本上进行:如需修改,先复制到工作区临时目录,在副本上操作。
  3. 输出为独立文件:校对报告、勘误对照表等输出文件与源文件完全独立。
  4. 不发起网络请求(联网核验除外,且仅限公开可查数据,绝不超过 5-10 个关键数据点)。
  5. 不访问系统受保护路径

支持的文件类型

扩展名 处理方式 能力范围
.docx python-docx 段落 + 表格 + 标题样式 + 脚注
.pdf pdfplumber 页面文本 + 表格
.txt / .md 直接读取 段落(自动编码检测)
.doc 不支持 提示用户先转换为 .docx

审校模式

模式 适用场景 检查重点
客户资料校验 校对客户发来的资料 L1+L2+L3(快速扫描+数据溯源+文表一致),不做风格评判
自有方案审稿 审阅自己写的方案 L1-L4 全维度,特别关注跨模块一致性和AI写作痕迹
新闻稿校对 新闻稿/通稿/公关稿 L1-L4 全维度 + 新闻专项检查(倒金字塔结构/5W1H/禁用词/客观性/敏感性)

新闻稿校对模式触发条件

当满足以下任一条件时,自动进入新闻稿校对模式:

  1. 用户明确说明文档为新闻稿/通稿/公关稿
  2. 文件名包含"新闻""通稿""press""news""pr"等关键词
  3. 文档内容出现典型新闻稿特征:导语式开头(含5W1H)、倒金字塔结构、引语格式、媒体联系人信息
  4. 用户使用"新闻稿校对""新闻稿审核"等触发词

新闻稿校对模式在原有六类检查基础上,额外运行第七类检查——新闻稿专项检查,详见 Step 2。

默认根据文档内容和用户描述自动判断模式。用户可指定模式。

脚本

所有脚本位于 scripts/ 目录下,均为纯本地只读工具。

脚本 功能 输入 输出
extract_text.py 多格式文档内容提取 .docx/.pdf/.txt 文件 JSON(段落+表格+标题+元数据)
check_all.py 统一校对检查器 extract_text.py 的 JSON JSON 问题清单
generate_report.py HTML 报告生成器 问题清单 JSON 独立 HTML 勘误对照报告

脚本调用链

# 1. 提取文件内容
python scripts/extract_text.py input.docx --out /tmp/extracted.json

# 2. 运行所有检查(默认模式)
python scripts/check_all.py --input /tmp/extracted.json --out /tmp/findings.json

# 2. 运行所有检查(新闻稿模式——额外执行新闻专项检查)
python scripts/check_all.py --input /tmp/extracted.json --out /tmp/findings.json --mode news

# 3. 生成 HTML 报告(问题多时)
python scripts/generate_report.py /tmp/findings.json \
    --out /tmp/report.html --source input.docx --chars 50000

# 管道模式(快速检查)
python scripts/extract_text.py input.txt | python scripts/check_all.py --stdin

参考文档

文件 内容 何时读取
references/proofreading-workflow.md 完整工作流指南(安全边界+输出策略+审批流程+自我校验) 每次校稿前必读
references/error-categories.md 30类错误细分谱(A合规/B体例/C知识) 标记问题类型时参考
references/punctuation-rules.md 中文标点规则 + AI写作五大标点失误 校对标点时参考
references/data-source-verification.md 数据来源溯源规则 + 模糊归因黑名单 校对数据来源时参考
references/text-table-consistency.md 文表一致性十类失误 + 五步检查法 校对含表格文档时参考
references/toc-and-pagination-rules.md 目录与页码十类失误 + 交付前必跑流程 交付前检查时参考
references/publication-standards.md 出版差错率标准 + 评级规则 输出质量评级时参考
references/public-sector-compliance-review.md 公文合规用语审查 校对体制内/对外发布文档时参考
references/gb-standard.md GB/T 9704-2012 党政公文格式完整规范 校对党政公文时参考
references/news-writing-standards.md 新闻稿写作规范+审校四必看四必查+禁用词+校对清单 校对新闻稿/通稿/公关稿时必读

工作流

Step 1: 识别文件类型并提取内容

  1. 检查用户提供的文件扩展名。
  2. 使用 extract_text.py 提取内容为统一 JSON 格式。
  3. 如果文件格式不支持(如 .doc),提示用户转换。
  4. 读取提取后的 JSON,了解文档结构(段落数、表格数、标题数、字数)。
python scripts/extract_text.py <用户文件> --out /tmp/extracted.json

Step 2: 运行统一校对检查

使用 check_all.py 对提取的内容运行全部六类检查:

  1. 基础文字检查:常见错别字、用词错误、语义重复
  2. 标点检查:全角/半角混用、AI写作标点失误、标点叠用、书名号顿号
  3. 数据来源检查:裸数据、模糊归因、排名/预测缺来源
  4. 文表一致性检查:表内合计、占比合计、文表交叉映射、跨表同指标
  5. 目录页码检查:章序连续性、目录字段失效标记
  6. 风格检查:AI写作痕迹、口语化表述、表述过满
python scripts/check_all.py --input /tmp/extracted.json --out /tmp/findings.json

Step 2-N: 新闻稿专项检查(新闻稿校对模式专用)

当处于新闻稿校对模式时,在上述六类检查基础上,必须额外执行第七类检查

  1. 新闻稿专项检查(参考 references/news-writing-standards.md):
检查子项 程度 检查内容
7a. 结构检查 must_fix 标题≤25字、标题无疑问/感叹句、倒金字塔结构、5W1H完整性、导语不与标题重复
7b. 客观性检查 must_fix 第三人称、无主观评价、无"令人振奋"等抒情、无"我院/我部"第一人称
7c. 禁用词检查 must_fix 新华社禁用词清单(亲自/指示/重要讲话/隆重/最佳/最好/唯一/顶级等)
7d. 绝对化表述 must_fix "国内唯一""省内首家""行业第一"等无依据绝对表述
7e. 引语检查 suggest 引语须注明身份姓名、无"大家纷纷表示"等空话、交叉使用直接/间接引语
7f. 时间表述 must_fix 统一用"X月X日"、不用"昨日/近日"、跨年时间准确
7g. 人名职务 must_fix 职务表述规范、人名前后一致、首次全称后续用姓名
7h. 敏感性检查 must_fix 港澳台表述、民族宗教、残疾人士称谓、刑事案件称谓、无"低级红/高级黑"
7i. 数字规范 suggest 概数用汉字、减少不用倍数、含月日专名用"X·X"格式
7j. 字数检查 suggest 消息稿≤800字、通稿≤1200字、标题≤25字、导语≤150字

AI 在读取检查结果后,还需对照 references/news-writing-standards.md 中的"新闻稿专项校对检查清单"(A-G 七大类)进行人工补充判断,识别脚本无法覆盖的语义级问题。

Step 3: 决定输出方式

根据问题数量决定输出方式(详见 references/proofreading-workflow.md):

条件 输出方式
必改 ≤ 3 且 总问题 ≤ 10 直接消息回复,逐条列出问题
必改 4-10 或 总问题 11-30 生成 HTML 勘误对照报告
必改 > 10 或 总问题 > 30 HTML 报告 + 消息摘要(最严重的 5-10 条)

消息输出格式(少量问题时):

## 校稿结果

源文件:report.docx(87,500 字)
检查结果:发现 5 个问题(必改 2,建议优化 3)

### 必改问题
1. **段 12** | 标点错误 | 半角直双引号 → 改为弯引号 ""
2. **段 34** | 数据缺来源 | "市场份额达18%" → 需补充来源

### 建议优化
3. **段 8** | AI写作痕迹 | "值得注意的是"在本段出现 3 次
4. **段 45** | 语义重复 | "约 10% 左右" → "约"与"左右"重复
5. **段 78** | 口语化 | "搞好" → 建议改为"做好"

---
是否需要我修改?确认后我将在文件副本上修改,不会动您的原文件。

Step 4: 询问用户是否需要修改

修改前必须询问用户,未经确认不得修改任何文件。

询问内容: - 列出需要修改的问题清单 - 说明将在文件副本(非源文件)上修改 - 请用户确认哪些问题需要修改(可全部确认或选择性确认)

Step 5: 在副本上修改(用户确认后)

  1. 复制源文件到工作区临时目录(源文件保持不变)。
  2. 逐条修改用户确认的问题,不遗漏、不额外修改。
  3. 记录每条修改的"原文 → 修改后"对照。

Step 6: 自我校验

修改完成后,逐项确认:

  • [ ] 修改数量 = 用户确认的问题数量(不多不少)
  • [ ] 每条修改的"原文"与源文件完全匹配(未篡改原文)
  • [ ] 每条修改正确解决了对应问题
  • [ ] 未修改任何用户未确认的内容
  • [ ] 修改未引入新的标点/格式错误
  • [ ] 修改未改变文档原有语义
  • [ ] 输出文件格式与源文件一致

Step 7: 输出结果

输出三项: 1. 修改后的文件副本 2. 修改对照表(每条修改的原文 → 修改后) 3. 自我校验报告(确认修改范围正确)

问题输出格式

每条问题使用以下格式:

【#序号】位置:章节/段落
原文:"……"
类型:XX | 程度:必改/建议优化/待确认
问题:……
改为:"……"

压缩格式(简单问题):

【#序号】位置 | 类型 | "原文" -> "修改后" | 必改

快速规则

通用规则

  • 中文段落必须使用全角标点(。,、;:!?""''()《》)
  • 破折号用双字 ——,省略号用双字 ……
  • 百分号范围重复:15%~30%,不是 15~30%
  • 公文文号用六角括号:国发〔2025〕1号
  • 图标题在图下方,表标题在表上方
  • 书名号/引号并列时不加顿号:《规划》《纲要》
  • "其他"不用"其它";"截至"做介词,"截止"做动词
  • 章节序号:一、(一)1.(1)
  • 每个数据点必须有来源(显名出处/脚注/括注/口径声明/测算指向,五者有其一)
  • 年份范围用一字线:2026—2030年
  • 修改前必须经用户确认
  • 修改后必须自我校验

新闻稿专项规则

  • 标题 ≤ 25字,不用疑问句/感叹句/夸张词汇
  • 导语必须涵盖 5W1H,不与标题重复
  • 倒金字塔结构:最重要信息放开头
  • 使用第三人称,不用"我院""我部"
  • 不用"亲自""指示""重要讲话""隆重召开"
  • 不用"最佳""最好""唯一""顶级"等绝对化表述
  • 时间统一用"X月X日",不用"昨日""近日"
  • 引语须注明身份姓名,不用"大家纷纷表示"
  • 减少不用倍数("减少了一半"不写"减少了一倍")
  • 港澳台不与国家并列("内地与香港",不写"中港")
  • 消息稿 ≤ 800字,通稿 ≤ 1200字

依赖安装

使用前确保 Python 环境已安装依赖:

pip install python-docx pdfplumber

访问小葱技能站7w4.net,解锁更多实用的AI技能插件。

Windows managed Python 环境:

C:\Users\<username>\.workbuddy\binaries\python\envs\default\Scripts\pip install python-docx pdfplumber

来源整合

本 Skill 整合了以下两个已有 Skill 的能力并扩展:

  • plan-proofread v1.0.3:校对规则、检查脚本、参考文档
  • party-doc-standard v1.0.1:GB/T 9704-2012 国标公文格式规范

扩展点:多格式支持(PDF/Word/TXT)、统一检查脚本、HTML报告生成、只读安全边界、用户审批流程、自我校验机制。

🤖 AI 评测

这个 Skill 质量不错,胜在文档体系完整、分类细致,能覆盖错别字、标点、数据来源、AI痕迹等多种问题类型,且严格遵守只读不修改源文件的安全原则。主要缺点是自动化程度有限,遇到复杂文档还是得靠人工核对。适合对文档质量要求高、愿意花时间对照规则检查的用户,不适合追求一键完成、拿来就用的场景。

📊 多维度评分

适应性4.4
规范性4.3
有效性4.8
可靠性4.3
可信度5

📁 包含文件 (15 个)

📄 SKILL.md 13.2 KB
📄 _meta.json 106 B
📄 references/data-source-verification.md 8.8 KB
📄 references/error-categories.md 10.4 KB
📄 references/gb-standard.md 5.8 KB
📄 references/news-writing-standards.md 9.9 KB
📄 references/proofreading-workflow.md 8.7 KB
📄 references/public-sector-compliance-review.md 4.8 KB
📄 references/publication-standards.md 6.7 KB
📄 references/punctuation-rules.md 9.3 KB
📄 references/text-table-consistency.md 10.4 KB
📄 references/toc-and-pagination-rules.md 7.7 KB
📄 scripts/check_all.py 50.3 KB
📄 scripts/extract_text.py 11.3 KB
📄 scripts/generate_report.py 12.3 KB