test-data-cleaner

👤 user_a83cc0cd 📦 v1.0.0 ⭐ 3.7 ⬇️ 167 下載
📊 資料分析 免費

📖 技能介紹


name: test-data-cleaner description: | 測試集 Query 資料清洗工具。自動清洗 Excel/CSV 中評測 query 資料。 支援兩層清洗:結構層(去重/空值/脫敏/標準化);語義層(語氣詞/上下文片段/語義不明過濾)。 輸出清洗後文件+清洗報告。 觸發詞:清洗資料、query清洗、測試集清洗、無效query、去重、脫敏、語義清洗。


測試集 Query 清洗工具

兩層架構:結構層處理格式/語法問題,語義層處理含義層面的無效資料。

快速上手

使用者說"幫我把這個 query 資料洗一下"時:

  1. 確認輸入檔案 — 路徑、格式(xlsx/csv)、要清洗的列名
  2. 確認清洗需求 — 特別問一下:需不需要做語義清洗?(語氣詞/上下文片段/語義不明)
  3. 調指令碼清洗 — 用 scripts/clean_query.py
  4. 輸出結果 — 清洗後文件 + 報告

核心用法

# ========== 語義層清洗(核心能力) ==========

# 語義層全清:語氣詞 + 上下文片段 + 語義不明
python clean_query.py 資料.xlsx --semantic --report

# 單獨過濾語氣詞(嗯/好的/知道了/哈哈哈)
python clean_query.py 資料.xlsx --filler --report

# 單獨過濾上下文片段(但是/所以/你剛才說的)
python clean_query.py 資料.xlsx --fragment --report

# 單獨過濾語義不明(測試/隨便/你好/在嗎/這個)
python clean_query.py 資料.xlsx --vague --report

# ========== 結構層清洗 ==========

# 推薦組合:基礎清洗 + 語義清洗
python clean_query.py 資料.xlsx --empty --dedup --trim --semantic --report

# 全量清洗(結構層 + 語義層全部)
python clean_query.py 資料.xlsx --all

# 敏感資訊脫敏
python clean_query.py 資料.xlsx --mask --dedup --trim --report

工作流程

Step 1: 問清楚使用者需求

不要直接全量跑,先確認:

  • 檔案在哪? 格式是 xlsx 還是 csv?
  • 列名叫什麼? 預設 query,但可能是"問題"、"使用者輸入"等
  • 要洗到什麼程度?
  • 只要去空值去重?(結構層)
  • 還是要篩掉語義無效的 query?(語義層 — 推薦

Step 2: 快速預覽

語義清洗的效果最直觀,先讓使用者看看哪些會被篩掉:

7w4.net收錄了海量優質技能外掛。

python clean_query.py 檔案.xlsx --semantic --report

Step 3: 按需執行

根據 Step 1 和 Step 2 的反饋,選擇合適的清洗組合。常見組合見 references/cleaning-rules.md

Step 4: 呈現結果

返回給使用者時,報告三個關鍵資訊: 1. 輸入 → 輸出 行數變化(X 條 → Y 條) 2. 移除了什麼 — 特別要用語義層的分類告訴使用者:語氣詞 N 條、上下文片段 M 條、語義不明 K 條 3. 檔案在哪(路徑)

指令碼引數速查

必選: input                       輸入檔案路徑
--column   TEXT   預設 "query"    指定清洗列
--sheet    TEXT                   指定 Excel sheet(預設第一個)
--output   PATH                   輸出檔案路徑
--report                          生成清洗報告 .txt

結構層清洗:
--empty              移除空值
--dedup              精確去重
--fuzzy-dedup        模糊去重(字元集相似度 ≥85%)
--short      [N=2]   過濾少於 N 字
--long       [N=500] 過濾超過 N 字
--gibberish          過濾純數字/純標點/重複單字元
--normalize          全形→半形 + 合併空格
--punctuation        中文標點→英文標點
--html               去 HTML 標籤
--emoji              去 Emoji
--mask               敏感資訊脫敏
--trim               去首尾空白

語義層清洗 ⭐:
--filler             過濾語氣詞/無效應答(嗯/好的/知道了/然後呢/哈哈哈)
--fragment           過濾上下文片段(但是/然而/你剛才說的/所以這個)
--vague              過濾語義不明(測試/隨便/你好/在嗎/這個/666)
--semantic           語義層全清(= filler + fragment + vague)

--all                執行全部(結構層 + 語義層)

注意事項

語義層重點

語義清洗是啟發式規則,不是 AI 判斷,可能會有誤殺/漏網:

  • --filler 最安全,幾乎不會誤殺正常 query
  • --fragment 對 ≤15 字且以連詞開頭的 query 特別敏感,長 query 不受影響
  • --vague 過濾"測試"、"你好"、"隨便"等常見無意義 query,注意這些也可能是某種場景下的合法 query
  • 建議先看報告再決定--semantic --report 輸出清洗報告,確認無誤後再全量清洗

通用

  • 先預覽再全量 — 預設清洗步驟可能過於激進,先讓使用者看效果
  • 敏感資訊--mask 脫敏不可逆,確認使用者需要再執行
  • 備份建議 — 全量清洗前建議備份原檔案
  • 依賴 — 依賴 openpyxl(已安裝),無其他外部依賴

參考文件

詳細清洗規則說明和常見組合:見 references/cleaning-rules.md

🤖 AI 評測

這個 Skill 的文件看起來很專業很完整,但實際上用不了——它只告訴你怎麼用,卻沒給你能用的工具。文件本身寫得很清楚,流程說明也詳細,但缺少最關鍵的東西:一個能真正執行的清洗程式。建議等作者補充完整程式碼後再使用。

📊 多維度評分

適應性3.9
規範性3.6
有效性3.3
可靠性3.2
可信度5

📁 包含檔案 (1 個)

📄 SKILL.md 4.9 KB