文件檢查AI

👤 mmgongzhu 📦 v1.0.1 ⭐ 4.5 ⬇️ 268 下載
📄 辦公效率 免費

📖 技能介紹


name: doc-proofread agent_created: true description: 審校通 — 多格式文件審校工具,支援 PDF、Word(.docx)、純文本(.txt/.md) 三種格式的只讀校對。四層遞進檢查(文字→標點→資料邏輯→風格合規),三種審校模式(客戶資料校驗/自有方案審稿/新聞稿校對)。嚴格只讀安全邊界:不修改原始檔,生成獨立勘誤對照報告,修改前必須經使用者確認,修改後執行自我校驗。適用於校對客戶發來的資料、審閱自己寫的方案文件、新聞稿/公關稿校對、交付前質量檢查。觸發關鍵詞:校稿、校對、審稿、審校、檢查文件、找錯別字、標點檢查、資料溯源、文表一致性、交付前檢查、去AI味、新聞稿校對、通稿校對、審校通、proofread、check document。


審校通(doc-proofread):多格式文件審校工具

審校通 對中文正式文件進行交付前審校,支援 PDF、Word(.docx)、純文本(.txt/.md) 三種格式。提供三種審校模式:客戶資料校驗、自有方案審稿、新聞稿校對。嚴格執行只讀安全邊界,不修改原始檔,根據問題數量決定輸出方式,修改前必須經使用者確認並執行自我校驗。

安全邊界(鐵律)

以下規則不可違反、不可繞過:

  1. 絕不修改原始檔:使用者提供的原始檔案在整個校稿過程中保持只讀。
  2. 修改只在副本上進行:如需修改,先複製到工作區臨時目錄,在副本上操作。
  3. 輸出為獨立檔案:校對報告、勘誤對照表等輸出檔案與原始檔完全獨立。
  4. 不發起網路請求(聯網核驗除外,且僅限公開可查資料,絕不超過 5-10 個關鍵資料點)。
  5. 不訪問系統受保護路徑

支援的檔案型別

副檔名 處理方式 能力範圍
.docx python-docx 段落 + 表格 + 標題樣式 + 腳註
.pdf pdfplumber 頁面文本 + 表格
.txt / .md 直接讀取 段落(自動編碼檢測)
.doc 不支援 提示使用者先轉換為 .docx

審校模式

模式 適用場景 檢查重點
客戶資料校驗 校對客戶發來的資料 L1+L2+L3(快速掃描+資料溯源+文表一致),不做風格評判
自有方案審稿 審閱自己寫的方案 L1-L4 全維度,特別關注跨模組一致性和AI寫作痕跡
新聞稿校對 新聞稿/通稿/公關稿 L1-L4 全維度 + 新聞專項檢查(倒金字塔結構/5W1H/停用詞/客觀性/敏感性)

新聞稿校對模式觸發條件

當滿足以下任一條件時,自動進入新聞稿校對模式:

  1. 使用者明確說明文件為新聞稿/通稿/公關稿
  2. 檔名包含"新聞""通稿""press""news""pr"等關鍵詞
  3. 文件內容出現典型新聞稿特徵:導語式開頭(含5W1H)、倒金字塔結構、引語格式、媒體聯絡人資訊
  4. 使用者使用"新聞稿校對""新聞稿稽核"等觸發詞

新聞稿校對模式在原有六類檢查基礎上,額外執行第七類檢查——新聞稿專項檢查,詳見 Step 2。

預設根據文件內容和使用者描述自動判斷模式。使用者可指定模式。

指令碼

所有指令碼位於 scripts/ 目錄下,均為純本地只讀工具。

指令碼 功能 輸入 輸出
extract_text.py 多格式文件內容提取 .docx/.pdf/.txt 檔案 JSON(段落+表格+標題+後設資料)
check_all.py 統一校對檢查器 extract_text.py 的 JSON JSON 問題清單
generate_report.py HTML 報告生成器 問題清單 JSON 獨立 HTML 勘誤對照報告

指令碼呼叫鏈

# 1. 提取檔案內容
python scripts/extract_text.py input.docx --out /tmp/extracted.json

# 2. 執行所有檢查(預設模式)
python scripts/check_all.py --input /tmp/extracted.json --out /tmp/findings.json

# 2. 執行所有檢查(新聞稿模式——額外執行新聞專項檢查)
python scripts/check_all.py --input /tmp/extracted.json --out /tmp/findings.json --mode news

# 3. 生成 HTML 報告(問題多時)
python scripts/generate_report.py /tmp/findings.json \
    --out /tmp/report.html --source input.docx --chars 50000

# 管道模式(快速檢查)
python scripts/extract_text.py input.txt | python scripts/check_all.py --stdin

參考文件

檔案 內容 何時讀取
references/proofreading-workflow.md 完整工作流指南(安全邊界+輸出策略+審批流程+自我校驗) 每次校稿前必讀
references/error-categories.md 30類錯誤細分譜(A合規/B體例/C知識) 標記問題型別時參考
references/punctuation-rules.md 中文標點規則 + AI寫作五大標點失誤 校對標點時參考
references/data-source-verification.md 資料來源溯源規則 + 模糊歸因黑名單 校對資料來源時參考
references/text-table-consistency.md 文表一致性十類失誤 + 五步檢查法 校對含表格文件時參考
references/toc-and-pagination-rules.md 目錄與頁碼十類失誤 + 交付前必跑流程 交付前檢查時參考
references/publication-standards.md 出版差錯率標準 + 評級規則 輸出質量評級時參考
references/public-sector-compliance-review.md 公文合規用語審查 校對體制內/對外發布文件時參考
references/gb-standard.md GB/T 9704-2012 黨政公文格式完整規範 校對黨政公文時參考
references/news-writing-standards.md 新聞稿寫作規範+審校四必看四必查+停用詞+校對清單 校對新聞稿/通稿/公關稿時必讀

工作流

Step 1: 識別檔案型別並提取內容

  1. 檢查使用者提供的副檔名。
  2. 使用 extract_text.py 提取內容為統一 JSON 格式。
  3. 如果檔案格式不支援(如 .doc),提示使用者轉換。
  4. 讀取提取後的 JSON,瞭解文件結構(段落數、表格數、標題數、字數)。
python scripts/extract_text.py <使用者檔案> --out /tmp/extracted.json

Step 2: 執行統一校對檢查

使用 check_all.py 對提取的內容執行全部六類檢查:

  1. 基礎文字檢查:常見錯別字、用詞錯誤、語義重複
  2. 標點檢查:全形/半形混用、AI寫作標點失誤、標點疊用、書名號頓號
  3. 資料來源檢查:裸資料、模糊歸因、排名/預測缺來源
  4. 文表一致性檢查:表內合計、佔比合計、文表交叉對映、跨表同指標
  5. 目錄頁碼檢查:章序連續性、目錄欄位失效標記
  6. 風格檢查:AI寫作痕跡、口語化表述、表述過滿
python scripts/check_all.py --input /tmp/extracted.json --out /tmp/findings.json

Step 2-N: 新聞稿專項檢查(新聞稿校對模式專用)

當處於新聞稿校對模式時,在上述六類檢查基礎上,必須額外執行第七類檢查

  1. 新聞稿專項檢查(參考 references/news-writing-standards.md):
檢查子項 程度 檢查內容
7a. 結構檢查 must_fix 標題≤25字、標題無疑問/感嘆句、倒金字塔結構、5W1H完整性、導語不與標題重複
7b. 客觀性檢查 must_fix 第三人稱、無主觀評價、無"令人振奮"等抒情、無"我院/我部"第一人稱
7c. 停用詞檢查 must_fix 新華社停用詞清單(親自/指示/重要講話/隆重/最佳/最好/唯一/頂級等)
7d. 絕對化表述 must_fix "國內唯一""省內首家""行業第一"等無依據絕對錶述
7e. 引語檢查 suggest 引語須註明身份姓名、無"大家紛紛表示"等空話、交叉使用直接/間接引語
7f. 時間表述 must_fix 統一用"X月X日"、不用"昨日/近日"、跨年時間準確
7g. 人名職務 must_fix 職務表述規範、人名前後一致、首次全稱後續用姓名
7h. 敏感性檢查 must_fix 港澳臺表述、民族宗教、殘疾人士稱謂、刑事案件稱謂、無"低階紅/高階黑"
7i. 數字規範 suggest 概數用漢字、減少不用倍數、含月日專名用"X·X"格式
7j. 字數檢查 suggest 訊息稿≤800字、通稿≤1200字、標題≤25字、導語≤150字

AI 在讀取檢查結果後,還需對照 references/news-writing-standards.md 中的"新聞稿專項校對檢查清單"(A-G 七大類)進行人工補充判斷,識別指令碼無法覆蓋的語義級問題。

Step 3: 決定輸出方式

根據問題數量決定輸出方式(詳見 references/proofreading-workflow.md):

條件 輸出方式
必改 ≤ 3 且 總問題 ≤ 10 直接訊息回覆,逐條列出問題
必改 4-10 或 總問題 11-30 生成 HTML 勘誤對照報告
必改 > 10 或 總問題 > 30 HTML 報告 + 訊息摘要(最嚴重的 5-10 條)

訊息輸出格式(少量問題時):

## 校稿結果

原始檔:report.docx(87,500 字)
檢查結果:發現 5 個問題(必改 2,建議最佳化 3)

### 必改問題
1. **段 12** | 標點錯誤 | 半形直雙引號 → 改為彎引號 ""
2. **段 34** | 資料缺來源 | "市場份額達18%" → 需補充來源

### 建議最佳化
3. **段 8** | AI寫作痕跡 | "值得注意的是"在本段出現 3 次
4. **段 45** | 語義重複 | "約 10% 左右" → "約"與"左右"重複
5. **段 78** | 口語化 | "搞好" → 建議改為"做好"

---
是否需要我修改?確認後我將在檔案副本上修改,不會動您的原檔案。

Step 4: 詢問使用者是否需要修改

修改前必須詢問使用者,未經確認不得修改任何檔案。

詢問內容: - 列出需要修改的問題清單 - 說明將在檔案副本(非原始檔)上修改 - 請使用者確認哪些問題需要修改(可全部確認或選擇性確認)

Step 5: 在副本上修改(使用者確認後)

  1. 複製原始檔到工作區臨時目錄(原始檔保持不變)。
  2. 逐條修改使用者確認的問題,不遺漏、不額外修改。
  3. 記錄每條修改的"原文 → 修改後"對照。

Step 6: 自我校驗

修改完成後,逐項確認:

  • [ ] 修改數量 = 使用者確認的問題數量(不多不少)
  • [ ] 每條修改的"原文"與原始檔完全匹配(未篡改原文)
  • [ ] 每條修改正確解決了對應問題
  • [ ] 未修改任何使用者未確認的內容
  • [ ] 修改未引入新的標點/格式錯誤

    7w4.net小蔥技能站,你的AI助手技能庫。

  • [ ] 修改未改變文件原有語義
  • [ ] 輸出檔案格式與原始檔一致

Step 7: 輸出結果

輸出三項: 1. 修改後的檔案副本 2. 修改對照表(每條修改的原文 → 修改後) 3. 自我校驗報告(確認修改範圍正確)

問題輸出格式

每條問題使用以下格式:

【#序號】位置:章節/段落
原文:"……"
型別:XX | 程度:必改/建議最佳化/待確認
問題:……
改為:"……"

壓縮格式(簡單問題):

【#序號】位置 | 型別 | "原文" -> "修改後" | 必改

快速規則

通用規則

  • 中文段落必須使用全形標點(。,、;:!?""''()《》)
  • 破折號用雙字 ——,省略號用雙字 ……
  • 百分號範圍重複:15%~30%,不是 15~30%
  • 公文文號用六角括號:國發〔2025〕1號
  • 圖示題在圖下方,表標題在表上方
  • 書名號/引號並列時不加頓號:《規劃》《綱要》
  • "其他"不用"其它";"截至"做介詞,"截止"做動詞
  • 章節序號:一、(一)1.(1)
  • 每個資料點必須有來源(顯名出處/腳註/括注/口徑宣告/測算指向,五者有其一)
  • 年份範圍用一字線:2026—2030年
  • 修改前必須經使用者確認
  • 修改後必須自我校驗

新聞稿專項規則

  • 標題 ≤ 25字,不用疑問句/感嘆句/誇張詞彙
  • 導語必須涵蓋 5W1H,不與標題重複
  • 倒金字塔結構:最重要資訊放開頭
  • 使用第三人稱,不用"我院""我部"
  • 不用"親自""指示""重要講話""隆重召開"
  • 不用"最佳""最好""唯一""頂級"等絕對化表述
  • 時間統一用"X月X日",不用"昨日""近日"
  • 引語須註明身份姓名,不用"大家紛紛表示"
  • 減少不用倍數("減少了一半"不寫"減少了一倍")
  • 港澳臺不與國家並列("內地與香港",不寫"中港")
  • 訊息稿 ≤ 800字,通稿 ≤ 1200字

依賴安裝

使用前確保 Python 環境已安裝依賴:

pip install python-docx pdfplumber

Windows managed Python 環境:

C:\Users\<username>\.workbuddy\binaries\python\envs\default\Scripts\pip install python-docx pdfplumber

來源整合

本 Skill 整合了以下兩個已有 Skill 的能力並擴充套件:

  • plan-proofread v1.0.3:校對規則、檢查指令碼、參考文件
  • party-doc-standard v1.0.1:GB/T 9704-2012 國標公文格式規範

擴充套件點:多格式支援(PDF/Word/TXT)、統一檢查指令碼、HTML報告生成、只讀安全邊界、使用者審批流程、自我校驗機制。

🤖 AI 評測

這個 Skill 質量不錯,勝在文件體系完整、分類細緻,能覆蓋錯別字、標點、資料來源、AI痕跡等多種問題型別,且嚴格遵守只讀不修改原始檔的安全原則。主要缺點是自動化程度有限,遇到複雜文件還是得靠人工核對。適合對文件質量要求高、願意花時間對照規則檢查的使用者,不適合追求一鍵完成、拿來就用的場景。

📊 多維度評分

適應性4.4
規範性4.3
有效性4.8
可靠性4.3
可信度5

📁 包含檔案 (15 個)

📄 SKILL.md 13.2 KB
📄 _meta.json 106 B
📄 references/data-source-verification.md 8.8 KB
📄 references/error-categories.md 10.4 KB
📄 references/gb-standard.md 5.8 KB
📄 references/news-writing-standards.md 9.9 KB
📄 references/proofreading-workflow.md 8.7 KB
📄 references/public-sector-compliance-review.md 4.8 KB
📄 references/publication-standards.md 6.7 KB
📄 references/punctuation-rules.md 9.3 KB
📄 references/text-table-consistency.md 10.4 KB
📄 references/toc-and-pagination-rules.md 7.7 KB
📄 scripts/check_all.py 50.3 KB
📄 scripts/extract_text.py 11.3 KB
📄 scripts/generate_report.py 12.3 KB