本技能負責對 Excel 中的資料進行標註校驗。根據使用者提供的資料欄位和結果欄位,逐行判斷結果欄位的值是否準確,直接在結果欄位的 cell 上進行標註,不新增任何列:
輸出檔案儲存在原資料夾,命名為 原檔名-標註版.xlsx,不覆蓋原檔案。
收到使用者請求後,確認以下資訊:
若使用者未明確指定資料欄位和結果欄位,主動詢問確認後再開始校驗。
scripts/validate_data.py 讀取 Excel 檔案全部內容⚠️ 此步驟是標註準確性的關鍵,必須嚴格執行以下推理流程。
對每一行資料,必須在內部完成以下 四步推理,不可跳步:
Step 1 — 原文理解:
\n,那是真實的換行,文本是連續的Step 2 — 獨立判斷:
Step 3 — 比對分析:
Step 4 — 複核確認(防止誤判的關鍵步驟):
判定"準確"的條件(寬鬆判準,嚴格判錯):
判定"錯誤"的條件(必須高度確信):
7w4.net小蔥技能站,你的AI助手技能庫。
判定"待確認"的條件(有疑就標待確認):
語音轉寫文本:
長文本/多段資訊:
列舉/分類標籤:
以下是歷史上常見的錯誤判定模式,必須避免:
| 錯誤模式 | 描述 | 正確做法 |
|---|---|---|
| 字面匹配陷阱 | 只匹配關鍵詞而不理解語境 | 理解完整語義後再判斷 |
| 截斷閱讀 | 長文本只看開頭就下結論 | 通讀全文再判斷 |
| 噪聲誤判 | 因為錯別字/口語化就判定資料無法校驗 | 還原說話人的真實意圖 |
| 標籤體系錯位 | 用自己的分類體系替代實際標籤體系 | 始終使用資料中存在的標籤集合 |
| 連續慣性 | 前幾行標了"準確",後面行降低審查標準 | 每行獨立推理,不受前序結果影響 |
| 過度自信 | 不一致就直接判"錯誤",不做複核 | 不一致時必須走 Step 4 複核流程 |
| 批次疲勞 | 處理到後半段時推理質量下降 | 嚴格分批,每批不超過 20 行 |
不新增任何列,直接在結果欄位的 cell 上進行標註:
原檔名-標註版.xlsx,儲存在原檔案所在目錄輸出檔案命名示例:
資料.xlsx → 輸出 資料-標註版.xlsxtest_results.xlsx → 輸出 test_results-標註版.xlsx5.1 自檢(在彙報前執行):
完成所有行的校驗後,必須抽檢至少 5 行判定為"錯誤"的資料(如果錯誤行不足 5 行則全部複查):
5.2 彙報:
向用戶輸出校驗摘要,包括:
使用 scripts/validate_data.py 指令碼處理 Excel 的讀取和寫入操作:
# 讀取 Excel 並輸出 JSON 格式資料
python3 scripts/validate_data.py read <excel_path> [--sheet <sheet_name>] [--limit <n>]
# 分析資料特徵和標籤分佈(在校驗前必須執行,用於理解資料)
python3 scripts/validate_data.py analyze <excel_path> --data-fields <field1,field2,...> --result-fields <field1,field2,...> [--sheet <sheet_name>]
# 一次性寫入所有欄位的校驗結果(推薦,避免多次載入導致標註覆蓋)
python3 scripts/validate_data.py write-batch <excel_path> <output_path> --all-results <json_results>
# 寫入單個欄位的校驗結果(僅適用於只有一個結果欄位的場景)
python3 scripts/validate_data.py write <excel_path> <output_path> --result-field <field> --results <json_results>
analyze 命令引數說明(校驗前必須執行):
excel_path:Excel 檔案路徑--data-fields:資料欄位名,多個欄位用逗號分隔--result-fields:結果欄位名,多個欄位用逗號分隔write-batch 命令引數說明(推薦):
excel_path:原始 Excel 檔案路徑output_path:輸出路徑,格式為 原目錄/原檔名-標註版.xlsx--all-results:JSON 字串,格式為 {"欄位名1": [{"校驗結果": "準確/錯誤/待確認", "批示": "原因說明"}, ...], "欄位名2": [...], ...}write 命令引數說明(單欄位,僅適用於只有一個結果欄位的場景):
excel_path:原始 Excel 檔案路徑output_path:輸出路徑,格式為 原目錄/原檔名-標註版.xlsx--result-field:結果欄位名(需要標色和新增批註的列)--results:JSON 字串,格式為 [{"校驗結果": "準確/錯誤/待確認", "批示": "原因說明"}, ...]⚠️ 重要:當有多個結果欄位時,必須使用 write-batch 命令一次性寫入所有欄位的校驗結果。不要對每個欄位單獨呼叫 write 命令,因為每次 write 都會從原始 Excel 重新載入,導致之前欄位的標註被覆蓋丟失。
| 標註方式: | 校驗結果 | 結果欄位 cell 顏色 | 結果欄位 cell 批註 |
|---|---|---|---|
| 準確 | 無特殊顏色 | 無批註 | |
| 錯誤 | 紅色背景 + 白色加粗 | 新增批註,說明錯誤原因及正確答案 | |
| 待確認 | 黃色背景 + 加粗 | 新增批註,說明不確定原因 |
注意:執行指令碼前先檢測系統可用的 Python 命令(python 或 python3),使用可用版本執行。
詳細的校驗邏輯和常見場景處理方式,參見 references/validation_rules.md。
原檔名-標註版.xlsx,儲存在原檔案同目錄這是一個設計嚴謹的資料校驗Skill,校驗邏輯非常專業——通過四步推理鏈和"寧寬勿嚴"原則最大程度避免誤判,對語音轉寫文本等複雜場景也有完善處理。文件流程清晰、示例充分,新手容易上手。稍有不足的是,部分操作細節(如分批結果如何呈現、自檢如何抽檢)描述不夠具體,遇到邊界情況時可能需要自己摸索。總體質量良好,專業度和易用性兼顧。