📚

法律問答知識提取

👤 楊衛薪 📦 v1.0.0 ⭐ 4.4 ⬇️ 71 下載
📚 知識管理 免費

📖 技能介紹


name: legal-qa-extractor homepage: https://github.com/cat-xierluo/legal-skills author: 楊衛薪律師(微信ywxlaw) version: "1.0.0" license: CC-BY-NC description: 從律師與客戶溝通記錄中提取有價值的法律問答對,生成結構化知識庫內容。本技能應在使用者需要整理客戶諮詢記錄、從對話中提取可複用法律知識、建立問答知識庫、或準備內容營銷素材時使用。支援嚴格客戶資訊脫敏處理。 slug: legal-qa-extractor displayName: "法律問答知識提取"


法律問答提取技能

概述

從律師與客戶的溝通記錄中提取有價值的法律問答對(客戶問題 + 律師解答),生成結構化知識庫內容。適用於將客戶諮詢轉化為可複用的法律知識,供後續整理成文章、案例或學習材料。

核心價值:提取那些可以被其他客戶複用的問答內容,而不是單一客戶的具體案情。

核心原則

客戶資訊保護

絕對禁止在問答內容中包含: - ❌ 客戶真實姓名 - ❌ 企業/機構名稱 - ❌ 具體地址、聯絡方式 - ❌ 任何可識別個人或企業的資訊

脫敏處理標準: - ✅ 客戶姓名 → 使用"當事人"、"客戶"、"甲/乙"等代稱 - ✅ 企業名稱 → 使用"某公司"、"某企業"、"該企業"等代稱 - ✅ 具體資訊 → 模糊化為"某地"、"某時間"、"相關人員"等 - ✅ 客戶原話 → 脫敏後引用:"客戶詢問..."而非"張總說..."

問答對的價值判斷

提取的問答應該滿足以下條件之一: - 普遍性:其他客戶也可能遇到同類問題 - 典型性:代表了某類法律場景的常見關切 - 教育性:律師的解答有普法價值或指導意義 - 複用性:可以獨立成文或作為知識庫條目

工作流程

步驟 1:分析輸入內容

獲取溝通記錄文件和使用者的具體要求,理解: - 文件中的溝通內容和情境 - 使用者希望重點關注哪些方面 - 哪些問答具有複用價值

步驟 2:識別有價值的問答對

完整梳理文件中的問答內容,按以下維度識別價值:

問答識別維度

  1. 直接問答 - 客戶明確提出問題,律師給出解答
  2. 追問回應 - 客戶追問,律師進一步解釋
  3. 風險提醒 - 律師主動提醒的風險點及應對建議
  4. 操作指引 - 涉及流程、步驟、注意事項的問答
  5. 普遍關切 - 其他客戶也可能遇到的同類問題

問答提取方法

  • 語義分析:理解客戶真實問題和律師核心觀點
  • 邏輯歸納:將分散的對話整理為獨立問答對
  • 價值評估:判斷問答是否具有普遍適用性
  • 標準化表述:將口語化表達轉化為規範的問答格式

步驟 3:生成結構化報告

輸出檔案儲存至原文件的同一目錄,檔案命名:{原文件名}_法律問答提取_{YYYYMMDD}.md

輸出格式詳見 output-template.md

每個問答對包含以下部分:

  • 問題:客戶提出的問題(標準化表述)
  • 律師解答:律師的核心觀點和建議(300-500字)
  • 問題背景(可選):該問題出現的情境(200-300字)
  • 價值標籤:普遍性/典型性/教育性/複用性
  • 適用場景:什麼情況下讀者會關心這個問答

步驟 4:問答分類與關聯

提供以下分析維度:

  • 問答特徵分析:重點問答數量、常規問答數量、價值分佈
  • 領域分類:按法律領域或業務場景分類
  • 關聯分析:哪些問答之間存在關聯、可組合成文章

質量標準

  • 獨立性:每個問答對可以獨立理解,不依賴完整對話背景
  • 普遍性:問答內容對其他客戶也有參考價值
  • 完整性:問題和解答都清晰完整,沒有斷章取義
  • 脫敏嚴格:嚴格遵循客戶資訊保護規則
  • 可複用:提取的問答可以直接用於文章、知識庫或學習材料

輸入要求

本技能接受以下型別的輸入:

  1. 文件路徑:使用者提供的溝通記錄文件路徑
  2. 貼上內容:使用者直接貼上的溝通記錄內容
  3. 使用者要求:使用者希望重點關注哪些型別的問答

    發現更多技能外掛,請訪問7w4.net。

配置與歸檔

使用者配置

本技能支援通過 config/.env 檔案自定義掃描行為:

# 複製模板
cp config/.env.example config/.env

# 編輯配置
QA_EXTRACTOR_SCAN_PATHS=~/Documents/legal-consultations
QA_EXTRACTOR_SCAN_DEPTH=3
QA_EXTRACTOR_FILE_TYPES=md,txt

掃描記錄

技能會維護 archive/scan-log.json 記錄掃描狀態:

{
  "version": "1.1.0",
  "last_full_scan": "2026-05-10T23:00:00+08:00",
  "watch_paths": [
    {
      "path": "~/Documents/legal-consultations",
      "last_scanned": "2026-05-10T23:00:00+08:00",
      "status": "active"
    }
  ],
  "projects": {
    "潛在專案_A": {
      "source_files": ["path/to/file1.md", "path/to/file2.md"],
      "last_extracted": "2026-05-10",
      "qa_count": 8,
      "output_file": "archive/extractions/2026-05-10_潛在專案_A_qa.md",
      "status": "active"
    }
  },
  "files": {
    "path/to/file.md": {
      "content_hash": "sha256:abc123...",
      "last_modified": "2026-05-09",
      "last_extracted": "2026-05-10",
      "qa_count": 5,
      "status": "active"
    }
  },
  "archived": {
    "path/to/old_project": {
      "archived_at": "2026-05-01",
      "reason": "moved_by_user"
    }
  }
}

欄位說明:

欄位 用途
files.*.content_hash 檔案內容指紋,變化時觸發重新提取
files.*.status active / archived,歸檔後跳過掃描
projects.*.source_files 同一專案的多份溝通記錄,合併輸出
projects.*.status active / archived,專案歸檔後鎖定
archived.* 記錄已移走的路徑,防止重複掃描

增量掃描邏輯:

資料夾型別判斷(用於識別歸檔與活動專案):

命名模式 型別 處理方式
純數字 / 日期區間(如 2425 01-0626 01-06 歸檔容器 深度掃描內部子資料夾
日期+姓名(如 260323 張美金...260404 顧憶芬... 直接專案 直接掃描該資料夾
其他 專案 直接掃描該資料夾
  1. 遍歷 watch_paths 下所有直接子資料夾
  2. 判斷每個資料夾型別(歸檔容器 / 直接專案)
  3. 對歸檔容器遞迴掃描;對直接專案掃描內容檔案
  4. 對每個檔案計算 content_hash
  5. 若檔案不在 scan-log,或 hash 與記錄不一致 → 觸發提取
  6. 若專案內所有檔案均變化才觸發提取
  7. 提取完成後,按專案合併多份記錄,輸出單份 QA 檔案

抽取結果歸檔

抽取的問答對儲存在 archive/extractions/ 目錄,按專案聚合:

archive/
├── scan-log.json              # 掃描狀態記錄
└── extractions/
    ├── 2026-05-10_潛在專案_A_qa.md   # 專案A的多輪諮詢合併
    ├── 2026-05-10_潛在專案_B_qa.md   # 專案B的單次記錄
    └── 2026-05-11_潛在專案_C_qa.md   # 專案C(後續增量新增)

多輪諮詢合併邏輯: - 同一專案資料夾內的所有 .md/.txt 檔案視為同一專案的多輪溝通 - 提取時按檔案順序(檔名或修改時間)整合所有問答對 - 去重:相同問題的多次出現保留最新解答 - 輸出檔名:{日期}_{專案名}_qa.md

注意archive/ 目錄不納入 Git 版本控制。

適用場景

  • 整理客戶諮詢記錄為可複用知識
  • 從對話中提取內容營銷素材
  • 建立法律問答知識庫
  • 準備普法文章的素材
  • 製作客戶常見問題清單
  • 定時掃描專案資料夾,增量提取新內容

🤖 AI 評測

這個 Skill 質量較好,文件規範詳細,規則定義清晰,質量標準明確,脫敏要求嚴格,測試體系完善。它能把律師和客戶的溝通記錄整理成結構化的法律問答知識庫,方便複用和法律知識沉澱。優點是流程清晰、模板完善、分類合理;不足是目前主要靠 AI 理解執行,實際效果會因 AI 能力不同而有差異,且還不支援直接處理 PDF、Word 等常見文件格式。

📊 多維度評分

適應性4.3
規範性4.5
有效性4.5
可靠性3.9
可信度5

📁 包含檔案 (20 個)

📄 CHANGELOG.md 2.8 KB
📄 LICENSE.txt 12.3 KB
📄 SKILL.md 7.7 KB
📄 assets/benchmarks/01-single-issue.md 271 B
📄 assets/benchmarks/02-multi-issue-switching.md 295 B
📄 assets/benchmarks/03-same-issue-repeated.md 286 B
📄 assets/benchmarks/04-follow-up-questions.md 247 B
📄 assets/benchmarks/05-proactive-risk-reminder.md 289 B
📄 assets/benchmarks/06-admin-heavy.md 265 B
📄 assets/benchmarks/07-incomplete-answer.md 281 B
📄 assets/benchmarks/08-batch-mixed-directory.md 334 B
📄 assets/benchmarks/README.md 855 B
📄 config/.env.example 748 B
📄 references/batch-processing-rules.md 2.3 KB
📄 references/benchmark-rubric.md 2.8 KB
📄 references/extraction-rules.md 4.6 KB
📄 references/intake-checklist.md 2.4 KB
📄 references/output-template.md 4.2 KB
📄 references/review-checklist.md 2 KB
📄 references/scan-log-spec.md 3 KB