對任意型別的文件進行全維度稽核,採用雙層架構:
| 層級 | 執行者 | 職責 | 特點 |
|---|---|---|---|
| L1 量化層 | Python 指令碼 | 格式檢查、文字錯誤檢測、結構分析、資料提取 | 快速、確定性、可復現 |
| L2 語義層 | AI 模型 | 邏輯衝突檢測、事實核查、邏輯混亂分析、綜合評判 | 深度理解、語義推理、聯網驗證 |
| 問題型別 | 說明 | 執行層級 | 優先順序 |
|---|---|---|---|
| 邏輯衝突 | 前後矛盾、論述打架、論據與結論不一致 | L2 語義層 | 高 |
| 事實衝突 | 資料矛盾、時間線錯誤、引用來源衝突 | L2 語義層(+聯網核查) | 高 |
| 文字錯誤 | 錯別字、語病、標點錯誤、格式不一致 | L1 量化層 | 中 |
| 邏輯混亂 | 結構散亂、論證跳躍、歸因謬誤、重複冗餘 | L2 語義層 | 中 |
指令碼在 L1 層同時計算四個輔助評分,作為文件質量的量化參考:
| 維度 | 權重 | 說明 |
|---|---|---|
| 格式規範性 | 20% | 標題層級、段落長度、結構完整性 |
| 內容邏輯性 | 30% | 論據匹配、過渡自然、無矛盾 |
| 表述清晰度 | 20% | 模糊詞彙、句子長度、術語一致性 |
| 方案可行性 | 30% | 執行步驟、資源需求、風險評估 |
| 格式 | 副檔名 | 提取方式 | 備註 |
|---|---|---|---|
| Word | .docx | pandoc → python-docx → 原始XML | 三級回退 |
| pymupdf → pdftotext → OCR | 掃描版自動 OCR | ||
| PPT | .pptx | python-pptx | 含表格、備註 |
| 純文本 | .txt | 自動編碼檢測 | GBK/UTF-8/GB18030 |
| Markdown | .md | 直接讀取 | — |
平臺整合提示:如果 WorkBuddy 的
docx/pptx專用 Skill 可用,優先呼叫它們提取內容——它們對錶格、圖片、批註的處理更完善。指令碼作為通用回退方案。
# Windows - 搜尋檔案
Get-ChildItem -Path . -Recurse -Include *.docx,*.pdf,*.pptx,*.txt,*.md -ErrorAction SilentlyContinue | Where-Object { $_.Name -like "*關鍵詞*" } | Select-Object FullName, LastWriteTime
| 模式 | 命令引數 | 檢查內容 | 適用場景 |
|---|---|---|---|
| 快速掃描 | --mode quick |
僅 L1 層:格式+文字錯誤 | 快速過一遍,找明顯問題 |
| 標準稽核 | --mode standard |
L1 全部 + L2 邏輯衝突+邏輯混亂 | 日常文件稽核 |
| 深度稽核 | --mode deep |
L1 全部 + L2 全部 + 聯網事實核查 | 重要文件(投標、合同、釋出稿) |
# 單檔案稽核
python scripts/review_document.py "文件路徑" --mode standard --output markdown
# 批次稽核(多檔案彙總)
python scripts/review_document.py "檔案1.docx" "檔案2.pdf" --batch --output json
# 排除指定檢查型別
python scripts/review_document.py "文件路徑" --exclude text_errors,feasibility
# 增量稽核(僅稽核修改部分)
python scripts/review_document.py "新版本.docx" --diff "舊版本.docx"
# 指定術語詞典
python scripts/review_document.py "文件路徑" --glossary "術語表.json"
術語表格式(JSON):
{
"terms": {
"AI": ["人工智慧", "ai", "A.I."],
"ROI": ["投資回報率", "roi"]
},
"preferred": {
"AI": "AI",
"ROI": "ROI"
}
}
指令碼完成後會輸出結構化的文件摘要和 L1 檢查結果。基於此,AI 執行以下分析:
讀取指令碼提取的章節結構和關鍵論點,用以下提示詞驅動 AI 分析:
請仔細閱讀以下文件內容,逐一標註所有邏輯衝突:
1. 前後矛盾的表述(列出矛盾雙方及各自位置)
2. 論據與結論不一致的地方
3. 同一約束條件相互矛盾的地方(如"必須"與"可選"並存)
4. 範圍矛盾(標題承諾"全面"但內容只覆蓋部分)
輸出格式:
[衝突型別] 位置A: "原文表述" ↔ 位置B: "原文表述"
分析: 矛盾原因說明
建議: 具體修改方案
提取文件中的資料、時間、引用,執行聯網核查:
請從以下文件中提取所有事實性陳述,分類核查:
- 資料類:比例、金額、人數、排名(全文交叉對比一致性)
- 時間類:日期、期限、里程碑(核查時間線邏輯)
- 引用類:法規名稱及條款號、標準編號(聯網驗證是否現行有效)
- 名稱類:人物、公司、產品名(交叉驗證一致性)
對每個需聯網核查的專案,使用 WebSearch 工具驗證。
輸出格式:
[核查狀態: ✓一致/✗衝突/⚠無法確認] 位置: "原文表述"
依據: 核查來源或衝突說明
建議: 修改方案
請分析以下文件的邏輯結構,檢查:
1. 結構散亂:同一話題分散在多個章節
2. 論證跳躍:A→C 缺少 B 作為過渡
3. 歸因謬誤:相關性當作因果性
4. 重複冗餘:同一內容反覆出現
5. 歸類不清:不同層級內容混放
6. 主語不清:句子主語頻繁切換,代詞指代不明
輸出格式:
[問題型別] 位置: 問題描述
建議: 重組/刪減/補充方案
指令碼支援多種輸出格式:
# Markdown 報告(預設)
python scripts/review_document.py "文件路徑" --output markdown
# JSON 結構化資料(供 AI 進一步處理)
python scripts/review_document.py "文件路徑" --output json
# Word 文件(可直接傳送給同事)
python scripts/review_document.py "文件路徑" --output word --output-file "稽核報告.docx"
AI 綜合報告生成後,使用 present_files 交付給使用者,並用 show_widget 輸出視覺化報告(評分雷達圖 + 問題分佈圖)。
# 文件稽核報告
**稽核文件**: [文件名稱]
**稽核時間**: YYYY-MM-DD HH:mm
**文件型別**: [技術方案/商務文件/研究報告/etc.]
**文件規模**: XX頁 / XX字
**稽核模式**: [快速掃描/標準稽核/深度稽核]
---
## 📊 評分概覽
| 維度 | 評分 | 等級 |
|------|------|------|
| 格式規範性 | XX | [優/良/中/差] |
| 內容邏輯性 | XX | [優/良/中/差] |
| 表述清晰度 | XX | [優/良/中/差] |
| 方案可行性 | XX | [優/良/中/差] |
| **綜合** | **XX** | **[等級]** |
---
## 📋 問題概覽
| 問題型別 | 高 | 中 | 低 | 合計 |
|----------|---|---|---|------|
| 邏輯衝突 | X | X | X | X |
| 事實衝突 | X | X | X | X |
| 文字錯誤 | X | X | X | X |
| 邏輯混亂 | X | X | X | X |
| **合計** | **X** | **X** | **X** | **X** |
---
## 🔍 詳細問題
### 邏輯衝突
#### [高] 問題標題
- **位置**: 第X頁 / [章節名]
- **衝突點A**: [原文表述]
- **衝突點B**: [原文表述]
- **分析**: [矛盾原因]
- **建議**: [修改方案]
- **狀態**: [待處理/已修復/已忽略]
> 其餘問題型別同此格式
---
## 💡 綜合改進建議
### 必須修改(高優先順序)
1. [最重要的問題及修改方案]
### 建議修改(中優先順序)
2. [次要問題及修改方案]
### 可選最佳化(低優先順序)
3. [小問題或風格最佳化]
---
## 🎯 總結
**整體評價**: [100字以內]
**建議**: [修改後可直接使用 / 需重大修改後使用]
**最薄弱環節**: [維度名](XX分),建議重點關注。
| 等級 | 說明 | 扣分 | 處理建議 |
|---|---|---|---|
| 高 | 嚴重影響可信度或合規性(資料錯誤、法規引用錯誤、核心結論矛盾) | 15分/處 | 必須修改 |
| 中 | 影響專業性或閱讀體驗(次要邏輯混亂、少量錯別字、格式不統一) | 8分/處 | 建議修改 |
| 低 | 輕微問題(表述可更精煉、個別用詞可最佳化) | 3分/處 | 可選修改 |
對多份文件執行批次稽核時,指令碼生成彙總報告:
python scripts/review_document.py doc1.docx doc2.pdf doc3.pptx --batch --output json --output-file "批次稽核結果.json"
彙總報告包含: - 每份文件的單獨評分和問題數 - 跨文件一致性檢查(相同資料/術語在不同文件中是否一致) - 整體質量排名
對比文件修改前後的版本,僅稽核變更部分:
python scripts/review_document.py "新版本.docx" --diff "舊版本.docx"
輸出: - 新增內容稽核 - 修改內容複審 - 已修復問題確認 - 新引入問題檢測
| 場景 | 聯動方式 |
|---|---|
| 內容提取 | 優先呼叫 docx/pdf/pptx 專用 Skill,指令碼作為回退 |
| 報告交付 | 用 present_files 展示報告檔案 |
| 視覺化 | 用 show_widget 輸出評分雷達圖和問題分佈圖 |
| 線上編輯稽核 | 與 tencent-local-office-edit 聯動,稽核後直接在編輯器中修改 |
| 標註回寫 | 將高優先順序問題作為批註寫回 .docx 原文件 |
tencent-local-office-edit 的 save_file 將批註寫入原文件# 核心依賴 pip install python-docx pymupdf python-pptx # 可選依賴(增強功能) pip install pytesseract pillow # OCR 支援 pip install chardet # 編碼檢測推薦訪問7w4.net獲取更多AI技能。
消除重複報告模板
v6.0 (2026-04-22) - 通用稽核版本
這個文件稽核工具質量較好,優勢在於稽核全面細緻,支援多種文件格式檢查,還能自動評分和改進建議。不足之處是某些深度稽核功能需要AI配合使用,實際表現可能不穩定;另外安裝配置比較麻煩,需要安裝好幾個軟體包。日常使用標準稽核模式基本夠用,但重要文件建議手動複查AI稽核的結果。