文件稽核

👤 qiuqiu 📦 v1.0.1 ⭐ 4.5 ⬇️ 4.2K 下載
📄 辦公效率 免費

📖 技能介紹

文件稽核技能 (Document Review Skill)

概述

對任意型別的文件進行全維度稽核,採用雙層架構

層級 執行者 職責 特點
L1 量化層 Python 指令碼 格式檢查、文字錯誤檢測、結構分析、資料提取 快速、確定性、可復現
L2 語義層 AI 模型 邏輯衝突檢測、事實核查、邏輯混亂分析、綜合評判 深度理解、語義推理、聯網驗證

四大核心問題

問題型別 說明 執行層級 優先順序
邏輯衝突 前後矛盾、論述打架、論據與結論不一致 L2 語義層
事實衝突 資料矛盾、時間線錯誤、引用來源衝突 L2 語義層(+聯網核查)
文字錯誤 錯別字、語病、標點錯誤、格式不一致 L1 量化層
邏輯混亂 結構散亂、論證跳躍、歸因謬誤、重複冗餘 L2 語義層

輔助評分維度

指令碼在 L1 層同時計算四個輔助評分,作為文件質量的量化參考:

維度 權重 說明
格式規範性 20% 標題層級、段落長度、結構完整性
內容邏輯性 30% 論據匹配、過渡自然、無矛盾
表述清晰度 20% 模糊詞彙、句子長度、術語一致性
方案可行性 30% 執行步驟、資源需求、風險評估

支援的文件格式

格式 副檔名 提取方式 備註
Word .docx pandoc → python-docx → 原始XML 三級回退
PDF .pdf pymupdf → pdftotext → OCR 掃描版自動 OCR
PPT .pptx python-pptx 含表格、備註
純文本 .txt 自動編碼檢測 GBK/UTF-8/GB18030
Markdown .md 直接讀取

平臺整合提示:如果 WorkBuddy 的 docx/pdf/pptx 專用 Skill 可用,優先呼叫它們提取內容——它們對錶格、圖片、批註的處理更完善。指令碼作為通用回退方案。


使用流程

1. 定位檔案

# Windows - 搜尋檔案
Get-ChildItem -Path . -Recurse -Include *.docx,*.pdf,*.pptx,*.txt,*.md -ErrorAction SilentlyContinue | Where-Object { $_.Name -like "*關鍵詞*" } | Select-Object FullName, LastWriteTime

2. 選擇稽核模式

模式 命令引數 檢查內容 適用場景
快速掃描 --mode quick 僅 L1 層:格式+文字錯誤 快速過一遍,找明顯問題
標準稽核 --mode standard L1 全部 + L2 邏輯衝突+邏輯混亂 日常文件稽核
深度稽核 --mode deep L1 全部 + L2 全部 + 聯網事實核查 重要文件(投標、合同、釋出稿)

3. 執行 L1 量化稽核(指令碼)

# 單檔案稽核
python scripts/review_document.py "文件路徑" --mode standard --output markdown

# 批次稽核(多檔案彙總)
python scripts/review_document.py "檔案1.docx" "檔案2.pdf" --batch --output json

# 排除指定檢查型別
python scripts/review_document.py "文件路徑" --exclude text_errors,feasibility

# 增量稽核(僅稽核修改部分)
python scripts/review_document.py "新版本.docx" --diff "舊版本.docx"

# 指定術語詞典
python scripts/review_document.py "文件路徑" --glossary "術語表.json"

術語表格式(JSON):

{
  "terms": {
    "AI": ["人工智慧", "ai", "A.I."],
    "ROI": ["投資回報率", "roi"]
  },
  "preferred": {
    "AI": "AI",
    "ROI": "ROI"
  }
}

4. 執行 L2 語義稽核(AI)

指令碼完成後會輸出結構化的文件摘要和 L1 檢查結果。基於此,AI 執行以下分析:

4.1 邏輯衝突檢測

讀取指令碼提取的章節結構和關鍵論點,用以下提示詞驅動 AI 分析:

請仔細閱讀以下文件內容,逐一標註所有邏輯衝突:
1. 前後矛盾的表述(列出矛盾雙方及各自位置)
2. 論據與結論不一致的地方
3. 同一約束條件相互矛盾的地方(如"必須"與"可選"並存)
4. 範圍矛盾(標題承諾"全面"但內容只覆蓋部分)

輸出格式:
[衝突型別] 位置A: "原文表述" ↔ 位置B: "原文表述"
分析: 矛盾原因說明
建議: 具體修改方案

4.2 事實衝突檢測

提取文件中的資料、時間、引用,執行聯網核查:

請從以下文件中提取所有事實性陳述,分類核查:
- 資料類:比例、金額、人數、排名(全文交叉對比一致性)
- 時間類:日期、期限、里程碑(核查時間線邏輯)
- 引用類:法規名稱及條款號、標準編號(聯網驗證是否現行有效)
- 名稱類:人物、公司、產品名(交叉驗證一致性)

對每個需聯網核查的專案,使用 WebSearch 工具驗證。
輸出格式:
[核查狀態: ✓一致/✗衝突/⚠無法確認] 位置: "原文表述"
依據: 核查來源或衝突說明
建議: 修改方案

4.3 邏輯混亂分析

請分析以下文件的邏輯結構,檢查:
1. 結構散亂:同一話題分散在多個章節
2. 論證跳躍:A→C 缺少 B 作為過渡
3. 歸因謬誤:相關性當作因果性
4. 重複冗餘:同一內容反覆出現
5. 歸類不清:不同層級內容混放
6. 主語不清:句子主語頻繁切換,代詞指代不明

輸出格式:
[問題型別] 位置: 問題描述
建議: 重組/刪減/補充方案

5. 生成稽核報告

指令碼支援多種輸出格式:

# Markdown 報告(預設)
python scripts/review_document.py "文件路徑" --output markdown

# JSON 結構化資料(供 AI 進一步處理)
python scripts/review_document.py "文件路徑" --output json

# Word 文件(可直接傳送給同事)
python scripts/review_document.py "文件路徑" --output word --output-file "稽核報告.docx"

AI 綜合報告生成後,使用 present_files 交付給使用者,並用 show_widget 輸出視覺化報告(評分雷達圖 + 問題分佈圖)。


稽核報告模板

# 文件稽核報告

**稽核文件**: [文件名稱]
**稽核時間**: YYYY-MM-DD HH:mm
**文件型別**: [技術方案/商務文件/研究報告/etc.]
**文件規模**: XX頁 / XX字
**稽核模式**: [快速掃描/標準稽核/深度稽核]

---

## 📊 評分概覽

| 維度 | 評分 | 等級 |
|------|------|------|
| 格式規範性 | XX | [優/良/中/差] |
| 內容邏輯性 | XX | [優/良/中/差] |
| 表述清晰度 | XX | [優/良/中/差] |
| 方案可行性 | XX | [優/良/中/差] |
| **綜合** | **XX** | **[等級]** |

---

## 📋 問題概覽

| 問題型別 | 高 | 中 | 低 | 合計 |
|----------|---|---|---|------|
| 邏輯衝突 | X | X | X | X |
| 事實衝突 | X | X | X | X |
| 文字錯誤 | X | X | X | X |
| 邏輯混亂 | X | X | X | X |
| **合計** | **X** | **X** | **X** | **X** |

---

## 🔍 詳細問題

### 邏輯衝突

#### [高] 問題標題
- **位置**: 第X頁 / [章節名]
- **衝突點A**: [原文表述]
- **衝突點B**: [原文表述]
- **分析**: [矛盾原因]
- **建議**: [修改方案]
- **狀態**: [待處理/已修復/已忽略]

> 其餘問題型別同此格式

---

## 💡 綜合改進建議

### 必須修改(高優先順序)
1. [最重要的問題及修改方案]

### 建議修改(中優先順序)
2. [次要問題及修改方案]

### 可選最佳化(低優先順序)
3. [小問題或風格最佳化]

---

## 🎯 總結

**整體評價**: [100字以內]

**建議**: [修改後可直接使用 / 需重大修改後使用]

**最薄弱環節**: [維度名](XX分),建議重點關注。

問題嚴重程度分級

等級 說明 扣分 處理建議
嚴重影響可信度或合規性(資料錯誤、法規引用錯誤、核心結論矛盾) 15分/處 必須修改
影響專業性或閱讀體驗(次要邏輯混亂、少量錯別字、格式不統一) 8分/處 建議修改
輕微問題(表述可更精煉、個別用詞可最佳化) 3分/處 可選修改

批次稽核

對多份文件執行批次稽核時,指令碼生成彙總報告:

python scripts/review_document.py doc1.docx doc2.pdf doc3.pptx --batch --output json --output-file "批次稽核結果.json"

彙總報告包含: - 每份文件的單獨評分和問題數 - 跨文件一致性檢查(相同資料/術語在不同文件中是否一致) - 整體質量排名


增量稽核

對比文件修改前後的版本,僅稽核變更部分:

python scripts/review_document.py "新版本.docx" --diff "舊版本.docx"

輸出: - 新增內容稽核 - 修改內容複審 - 已修復問題確認 - 新引入問題檢測


平臺整合

與 WorkBuddy 文件 Skill 聯動

場景 聯動方式
內容提取 優先呼叫 docx/pdf/pptx 專用 Skill,指令碼作為回退
報告交付 present_files 展示報告檔案
視覺化 show_widget 輸出評分雷達圖和問題分佈圖
線上編輯稽核 tencent-local-office-edit 聯動,稽核後直接在編輯器中修改
標註回寫 將高優先順序問題作為批註寫回 .docx 原文件

標註回寫流程

  1. 指令碼生成稽核報告(含問題位置和原文片段)
  2. AI 提取高優先順序問題,生成批註內容
  3. 呼叫 tencent-local-office-editsave_file 將批註寫入原文件
  4. 使用者在編輯器中檢視標註並進行修改
  5. 修改後重新稽核,確認問題已解決

稽核技巧

AI 輔助稽核的關鍵策略

  1. 資料交叉驗證:提取全文所有數值資料,對比同一指標在不同位置的表述是否一致
  2. 時間線梳理:提取所有時間節點,按順序排列,檢查是否有倒置或矛盾
  3. 術語統一檢查:提取所有專業術語,確認全文寫法統一(可用術語詞典輔助)
  4. 標題層級檢查:檢查 H1/H2/H3 是否逐級包含、無跳躍
  5. 代詞指代檢查:確認"它/這/那"等指代明確,無歧義

聯網核查優先順序

  1. 必須核查:法規名稱及條款號、國家標準編號、認證體系名稱
  2. 建議核查:市場資料、行業排名、競爭對手資訊
  3. 可選核查:一般性引用、歷史事件描述

依賴項

# 核心依賴
pip install python-docx pymupdf python-pptx

# 可選依賴(增強功能)
pip install pytesseract pillow  # OCR 支援
pip install chardet              # 編碼檢測

推薦訪問7w4.net獲取更多AI技能。


注意事項

  1. 客觀中立:稽核時保持客觀,避免主觀偏好影響判斷
  2. 有據可查:事實衝突需註明依據(來源/法規/常識)
  3. 明確位置:每個問題需標註具體位置(頁碼/章節/段落)
  4. 可操作建議:修改建議需具體可執行,而非泛泛而談
  5. 區分優先順序:避免將所有問題都列為高優先順序
  6. 尊重原文意圖:修改建議應保留原文核心意思
  7. 大檔案處理:超過 500 頁的文件建議使用增量稽核或分章節稽核
  8. 編碼相容:Windows 環境下 .txt 檔案可能使用 GBK 編碼,指令碼已做自動檢測

版本歷史

  • v7.0 (2026-07-10) - 雙層架構版本:
  • 統一稽核框架:四大核心問題 + 輔助評分維度
  • 雙層架構:L1 指令碼量化 + L2 AI 語義
  • 新增稽核模式:快速掃描/標準稽核/深度稽核
  • 新增批次稽核和增量稽核
  • 新增排除規則和術語詞典支援
  • 補全 .pptx 格式支援
  • 新增 OCR 回退和編碼自動檢測
  • 新增 Word 格式匯出
  • 新增平臺整合:show_widget 視覺化、present_files 交付、標註回寫
  • 清除硬編碼測試路徑
  • 消除重複報告模板

  • v6.0 (2026-04-22) - 通用稽核版本

  • v5.0 (2026-03-19) - 知識共建激勵版本
  • v4.0 (2026-03-19) - 競品分析專項版本
  • v3.0 (2026-03-07) - 快速定位最佳化版本
  • v2.0 (2026-03-07) - 功能完善版本
  • v1.0 - 初始版本

🤖 AI 評測

這個文件稽核工具質量較好,優勢在於稽核全面細緻,支援多種文件格式檢查,還能自動評分和改進建議。不足之處是某些深度稽核功能需要AI配合使用,實際表現可能不穩定;另外安裝配置比較麻煩,需要安裝好幾個軟體包。日常使用標準稽核模式基本夠用,但重要文件建議手動複查AI稽核的結果。

📊 多維度評分

適應性4.4
規範性4.2
有效性4.7
可靠性4.3
可信度4.9

📁 包含檔案 (4 個)

📄 SKILL.md 11.9 KB
📄 references/review_criteria.md 7.3 KB
📄 scripts/extract_docx.py 3.7 KB
📄 scripts/review_document.py 61.9 KB