name: doc-proofread agent_created: true description: 审校通 — 多格式文档审校工具,支持 PDF、Word(.docx)、纯文本(.txt/.md) 三种格式的只读校对。四层递进检查(文字→标点→数据逻辑→风格合规),三种审校模式(客户资料校验/自有方案审稿/新闻稿校对)。严格只读安全边界:不修改源文件,生成独立勘误对照报告,修改前必须经用户确认,修改后执行自我校验。适用于校对客户发来的资料、审阅自己写的方案文档、新闻稿/公关稿校对、交付前质量检查。触发关键词:校稿、校对、审稿、审校、检查文档、找错别字、标点检查、数据溯源、文表一致性、交付前检查、去AI味、新闻稿校对、通稿校对、审校通、proofread、check document。
审校通 对中文正式文档进行交付前审校,支持 PDF、Word(.docx)、纯文本(.txt/.md) 三种格式。提供三种审校模式:客户资料校验、自有方案审稿、新闻稿校对。严格执行只读安全边界,不修改源文件,根据问题数量决定输出方式,修改前必须经用户确认并执行自我校验。
以下规则不可违反、不可绕过:
| 扩展名 | 处理方式 | 能力范围 |
|---|---|---|
.docx |
python-docx | 段落 + 表格 + 标题样式 + 脚注 |
.pdf |
pdfplumber | 页面文本 + 表格 |
.txt / .md |
直接读取 | 段落(自动编码检测) |
.doc |
不支持 | 提示用户先转换为 .docx |
| 模式 | 适用场景 | 检查重点 |
|---|---|---|
| 客户资料校验 | 校对客户发来的资料 | L1+L2+L3(快速扫描+数据溯源+文表一致),不做风格评判 |
| 自有方案审稿 | 审阅自己写的方案 | L1-L4 全维度,特别关注跨模块一致性和AI写作痕迹 |
| 新闻稿校对 | 新闻稿/通稿/公关稿 | L1-L4 全维度 + 新闻专项检查(倒金字塔结构/5W1H/禁用词/客观性/敏感性) |
当满足以下任一条件时,自动进入新闻稿校对模式:
新闻稿校对模式在原有六类检查基础上,额外运行第七类检查——新闻稿专项检查,详见 Step 2。
默认根据文档内容和用户描述自动判断模式。用户可指定模式。
所有脚本位于 scripts/ 目录下,均为纯本地只读工具。
| 脚本 | 功能 | 输入 | 输出 |
|---|---|---|---|
extract_text.py |
多格式文档内容提取 | .docx/.pdf/.txt 文件 | JSON(段落+表格+标题+元数据) |
check_all.py |
统一校对检查器 | extract_text.py 的 JSON | JSON 问题清单 |
generate_report.py |
HTML 报告生成器 | 问题清单 JSON | 独立 HTML 勘误对照报告 |
# 1. 提取文件内容
python scripts/extract_text.py input.docx --out /tmp/extracted.json
# 2. 运行所有检查(默认模式)
python scripts/check_all.py --input /tmp/extracted.json --out /tmp/findings.json
# 2. 运行所有检查(新闻稿模式——额外执行新闻专项检查)
python scripts/check_all.py --input /tmp/extracted.json --out /tmp/findings.json --mode news
# 3. 生成 HTML 报告(问题多时)
python scripts/generate_report.py /tmp/findings.json \
--out /tmp/report.html --source input.docx --chars 50000
# 管道模式(快速检查)
python scripts/extract_text.py input.txt | python scripts/check_all.py --stdin
| 文件 | 内容 | 何时读取 |
|---|---|---|
references/proofreading-workflow.md |
完整工作流指南(安全边界+输出策略+审批流程+自我校验) | 每次校稿前必读 |
references/error-categories.md |
30类错误细分谱(A合规/B体例/C知识) | 标记问题类型时参考 |
references/punctuation-rules.md |
中文标点规则 + AI写作五大标点失误 | 校对标点时参考 |
references/data-source-verification.md |
数据来源溯源规则 + 模糊归因黑名单 | 校对数据来源时参考 |
references/text-table-consistency.md |
文表一致性十类失误 + 五步检查法 | 校对含表格文档时参考 |
references/toc-and-pagination-rules.md |
目录与页码十类失误 + 交付前必跑流程 | 交付前检查时参考 |
references/publication-standards.md |
出版差错率标准 + 评级规则 | 输出质量评级时参考 |
references/public-sector-compliance-review.md |
公文合规用语审查 | 校对体制内/对外发布文档时参考 |
references/gb-standard.md |
GB/T 9704-2012 党政公文格式完整规范 | 校对党政公文时参考 |
references/news-writing-standards.md |
新闻稿写作规范+审校四必看四必查+禁用词+校对清单 | 校对新闻稿/通稿/公关稿时必读 |
extract_text.py 提取内容为统一 JSON 格式。python scripts/extract_text.py <用户文件> --out /tmp/extracted.json
使用 check_all.py 对提取的内容运行全部六类检查:
python scripts/check_all.py --input /tmp/extracted.json --out /tmp/findings.json
当处于新闻稿校对模式时,在上述六类检查基础上,必须额外执行第七类检查:
references/news-writing-standards.md):| 检查子项 | 程度 | 检查内容 |
|---|---|---|
| 7a. 结构检查 | must_fix | 标题≤25字、标题无疑问/感叹句、倒金字塔结构、5W1H完整性、导语不与标题重复 |
| 7b. 客观性检查 | must_fix | 第三人称、无主观评价、无"令人振奋"等抒情、无"我院/我部"第一人称 |
| 7c. 禁用词检查 | must_fix | 新华社禁用词清单(亲自/指示/重要讲话/隆重/最佳/最好/唯一/顶级等) |
| 7d. 绝对化表述 | must_fix | "国内唯一""省内首家""行业第一"等无依据绝对表述 |
| 7e. 引语检查 | suggest | 引语须注明身份姓名、无"大家纷纷表示"等空话、交叉使用直接/间接引语 |
| 7f. 时间表述 | must_fix | 统一用"X月X日"、不用"昨日/近日"、跨年时间准确 |
| 7g. 人名职务 | must_fix | 职务表述规范、人名前后一致、首次全称后续用姓名 |
| 7h. 敏感性检查 | must_fix | 港澳台表述、民族宗教、残疾人士称谓、刑事案件称谓、无"低级红/高级黑" |
| 7i. 数字规范 | suggest | 概数用汉字、减少不用倍数、含月日专名用"X·X"格式 |
| 7j. 字数检查 | suggest | 消息稿≤800字、通稿≤1200字、标题≤25字、导语≤150字 |
AI 在读取检查结果后,还需对照 references/news-writing-standards.md 中的"新闻稿专项校对检查清单"(A-G 七大类)进行人工补充判断,识别脚本无法覆盖的语义级问题。
根据问题数量决定输出方式(详见 references/proofreading-workflow.md):
| 条件 | 输出方式 |
|---|---|
| 必改 ≤ 3 且 总问题 ≤ 10 | 直接消息回复,逐条列出问题 |
| 必改 4-10 或 总问题 11-30 | 生成 HTML 勘误对照报告 |
| 必改 > 10 或 总问题 > 30 | HTML 报告 + 消息摘要(最严重的 5-10 条) |
消息输出格式(少量问题时):
## 校稿结果
源文件:report.docx(87,500 字)
检查结果:发现 5 个问题(必改 2,建议优化 3)
### 必改问题
1. **段 12** | 标点错误 | 半角直双引号 → 改为弯引号 ""
2. **段 34** | 数据缺来源 | "市场份额达18%" → 需补充来源
### 建议优化
3. **段 8** | AI写作痕迹 | "值得注意的是"在本段出现 3 次
4. **段 45** | 语义重复 | "约 10% 左右" → "约"与"左右"重复
5. **段 78** | 口语化 | "搞好" → 建议改为"做好"
---
是否需要我修改?确认后我将在文件副本上修改,不会动您的原文件。
修改前必须询问用户,未经确认不得修改任何文件。
询问内容: - 列出需要修改的问题清单 - 说明将在文件副本(非源文件)上修改 - 请用户确认哪些问题需要修改(可全部确认或选择性确认)
修改完成后,逐项确认:
输出三项: 1. 修改后的文件副本 2. 修改对照表(每条修改的原文 → 修改后) 3. 自我校验报告(确认修改范围正确)
每条问题使用以下格式:
【#序号】位置:章节/段落
原文:"……"
类型:XX | 程度:必改/建议优化/待确认
问题:……
改为:"……"
压缩格式(简单问题):
【#序号】位置 | 类型 | "原文" -> "修改后" | 必改
——,省略号用双字 ……15%~30%,不是 15~30%国发〔2025〕1号一、 → (一) → 1. → (1)2026—2030年使用前确保 Python 环境已安装依赖:
pip install python-docx pdfplumber访问小葱技能站7w4.net,解锁更多实用的AI技能插件。
Windows managed Python 环境:
C:\Users\<username>\.workbuddy\binaries\python\envs\default\Scripts\pip install python-docx pdfplumber
本 Skill 整合了以下两个已有 Skill 的能力并扩展:
plan-proofread v1.0.3:校对规则、检查脚本、参考文档party-doc-standard v1.0.1:GB/T 9704-2012 国标公文格式规范扩展点:多格式支持(PDF/Word/TXT)、统一检查脚本、HTML报告生成、只读安全边界、用户审批流程、自我校验机制。
这个 Skill 质量不错,胜在文档体系完整、分类细致,能覆盖错别字、标点、数据来源、AI痕迹等多种问题类型,且严格遵守只读不修改源文件的安全原则。主要缺点是自动化程度有限,遇到复杂文档还是得靠人工核对。适合对文档质量要求高、愿意花时间对照规则检查的用户,不适合追求一键完成、拿来就用的场景。