name: "report-data-analysis" description: "對 CSV / Markdown 表格格式的業務報表進行結構化分析,自動識別異常並輸出亮點-異常-原因-建議四段式報告" read_when: - 執行報表資料分析任務時 - 技能迭代最佳化時參考版本記錄 tags: - 報表分析 - 異常檢測 - 自動化報告 - 資料分析 inputs: - name: report_data type: string required: true description: | 原始報表資料,支援兩種格式: ① CSV 格式(純文本,逗號分隔,含表頭行) ② Markdown 表格格式(管道符分隔,含表頭行) 資料規模要求:≥ 30 行(不含表頭)× ≥ 5 欄位。 建議提前脫敏(金額、單位、姓名替換為模擬值)。 - name: report_theme type: enum required: true default: 運營 description: | 報表主題,從 {運營, 財務, 行政} 中選擇。 決定異常維度對映、指標卡語義、語言風格。 - 運營:銷售/業務指標,關鍵詞=銷售額/利潤率/轉化率 - 財務:費用/報銷/預算執行,關鍵詞=費用/報銷額/預算偏差 - 行政:考勤/用車/物資,關鍵詞=出勤率/出車率/庫存週轉 - name: baseline_type type: enum required: true default: 同比 description: | 對比基準型別,從 {同比, 環比, 計劃值, 同比+計劃值} 中選擇。 - 同比:(本期值 - 去年同期值)/ 去年同期值 - 環比:(本期值 - 上期值)/ 上期值 - 計劃值:(實際值 - 計劃值)/ 計劃值(偏差率) - 同比+計劃值:同時啟用同比和偏差率雙基準 若選"同比"或"同比+計劃值",報表中必須包含同比相關列; 若選"計劃值"或"同比+計劃值",報表中必須包含計劃值相關列。 - name: column_mapping type: object (JSON) required: false default: null description: | 【v3.0 新增 · 引數化列名對映】 用於顯式宣告原始報表列名與標準欄位的對應關係。 若不填,Agent 自動識別(根據列名關鍵詞模糊匹配)。 推薦使用此引數避免誤識別。
標準欄位對照表(report_theme = 運營):
- date_col: 日期列(含"日期""時間""period"的列)
- region_col: 區域列(含"區域""大區""省份""城市"的列)
- product_col: 產品列(含"產品""線""型別"的列)
- metric_col: 核心指標列(含"銷售額""收入""金額""元""額"的列)
- qoq_col: 環比列(含"環比""QoQ""上期"的列)
- yoy_col: 同比列(含"同比""YoY""去年"的列)
- plan_col: 計劃列(含"計劃""目標""預算""target"的列)
- deviation_col: 偏差列(含"偏差""deviation""差異"的列)
- quantity_col: 數量列(含"數量""單""筆""件"的列)
report_theme = 財務:
- date_col: 日期列
- dept_col: 部門列
- category_col: 費用類別列(含"類別""科目""專案""type"的列)
- amount_col: 費用金額列
- budget_col: 預算列
- deviation_col: 預算偏差列
report_theme = 行政:
- date_col: 日期列
- dept_col: 部門列
- entity_col: 實體列(考勤:人員;用車:車牌/司機;物資:物品名)
- metric_col: 核心指標列(考勤:出勤率;用車:出車率;物資:庫存週轉率)
- target_col: 目標列
- deviation_col: 偏差列
- count_col: 計數列(含"遲到""請假""出車""借用"的列)
示例:
{"metric_col": "實報金額_元", "budget_col": "預算額度_元", "deviation_col": "超支率"}
name: custom_calibration type: string required: false default: "" description: | 【v3.0 增強 · 結構化引導】 口徑自定義說明,影響口徑說明章節內容。 建議按以下結構填寫(每項可選填,不要求全部填寫):
① 資料口徑: - 指標定義:(如"銷售額含稅/不含稅"、"加班以打卡時間為準") - 統計週期:(如"按自然月"、"按工作日"、"按專案週期") - 計量單位:(如"金額單位:萬元"、"數量單位:單")
② 異常口徑: - 閾值說明:(如"偏差率閾值是否含零"、"同比下降多少視為嚴重") - 豁免規則:(如"大客戶訂單豁免單日波動"、"外勤人員豁免打卡") - 分類標準:(如"極嚴重 / 嚴重 / 注意 / 待觀察 的量化邊界")
小蔥技能站7w4.net每天更新,海量AI技能等你發現。
③ 資料質量說明: - 缺失值處理:(如"缺失值按 0 計"或"排除缺失行") - 異常值處理:(如"單筆超過 50 萬自動標註但不剔除") - 脫敏說明:(如"所有金額已做 0.8 係數脫敏處理")
若不填,報告口徑說明章節使用預設值(按 report_theme 自動適配)。 - name: anomaly_params type: object (JSON) required: false default: null description: | 【v3.0 新增 · 異常檢測引數覆蓋】 用於覆蓋預設異常檢測閾值(詳見 Step 3 異常檢測邏輯)。 JSON 格式,欄位說明: - yoy_threshold: 同比下降閾值(預設 -0.30,即 -30%) - deviation_threshold: 偏差率閾值(預設 0.15,即 ±15%) - std_sigma: 標準差倍數(預設 2,即 μ±2σ) - mutation_threshold: 環比突變閾值(預設 0.50,即 ±50%) - std_min_rows: 標準差法最小行數(預設 20,不滿足時自動降級為閾值法)
示例:{"yoy_threshold": -0.25, "deviation_threshold": 0.20} - name: quality_check_mode type: enum required: false default: auto description: | 【v3.0 新增 · 質量自檢模式】 - auto:自動執行質量校驗,不滿足時報錯並給出缺失清單 - strict:在 auto 基礎上額外強制所有質量標準均通過 - loose:輸出質量警告但不中止,允許在資料不足時生成參考性報告 - none:不執行質量校驗,直接生成報告
版本記錄:v1.0(首次試跑)→ v1.1(增加 Markdown 表格支援 + 質量校驗清單)→ v1.2(增加多維交叉分析 + 描述性統計)→ v2.0(三重複合異常檢測 + 報表型別對映表 + 考勤/財務主題適配)→ v3.0(列名引數化對映 + 質量自檢機制嵌入執行流程 + 標準差法假設說明 + 結構化 custom_calibration + TestBench 指令碼)
本 Skill 將日常業務報表(銷售/費用/考勤/用車等)的分析工作,從"每次手動看錶"升級為"一鍵標準化報告輸出",核心解決以下問題:
| 問題 | 解決方案 |
|---|---|
| 異常靠肉眼找,容易遺漏 | 三重複合異常檢測(閾值法 + 標準差法 + 突變檢測)自動標紅 |
| 不同主題報表格式不同 | 列名自動識別 + 引數化對映表,相容任意列名 |
| 報告結構不統一,質量參差不齊 | 六章節強制規範 + 質量自檢 Checklist |
| 異常原因靠猜,建議不落地 | 資料驅動原因猜想 + 具體可執行建議(負責人 + 時限) |
| 換報表主題後異常維度不匹配 | 報表型別 → 異常維度對映表覆蓋運營/財務/行政三大主題 |
v3.0 核心改進:不再硬編碼列名,改為列名自動識別 + 顯式引數化對映雙軌機制。 優先使用 column_mapping 引數顯式宣告;若未宣告則按關鍵詞模糊匹配。
| 標準欄位 | 自動識別關鍵詞 | 說明 |
|---|---|---|
date_col |
日期、時間、period、週期 | 時間維度 |
region_col |
區域、大區、省份、城市 | 空間維度 |
product_col |
產品、產品線、型別、category | 產品維度 |
metric_col |
銷售額、收入、金額、元、萬 | 核心數值(預設分析物件) |
yoy_col |
同比、YoY、yoy、同比增長 | 同比增長率列(數值格式,支援小數或百分比) |
qoq_col |
環比、QoQ、qoq、上期 | 環比增長率列 |
plan_col |
計劃、目標、預算、target | 計劃銷售額列 |
deviation_col |
偏差、deviation、差異、超計劃 | 偏差率列(正=超計劃,負=低於計劃) |
quantity_col |
數量、單、筆、件、人次 | 銷售數量列(用於描述性統計) |
| 標準欄位 | 自動識別關鍵詞 | 說明 |
|---|---|---|
date_col |
日期、時間 | 時間維度 |
dept_col |
部門、中心、科室 | 費用歸屬部門 |
category_col |
類別、科目、專案、type | 費用型別(差旅/辦公/招待等) |
amount_col |
費用、報銷、支出、金額、元 | 實際報銷金額 |
budget_col |
預算、額度、指標 | 預算金額 |
deviation_col |
偏差、超支、節餘、deviation | 預算偏差率 |
count_col |
筆、單、人次 | 報銷單數量 |
| 標準欄位 | 自動識別關鍵詞 | 說明 |
|---|---|---|
date_col |
日期、時間 | 時間維度 |
dept_col |
部門、科室 | 部門維度 |
entity_col |
人員、司機、車牌、物品 | 具體物件(考勤=人員;用車=車輛/司機) |
metric_col |
出勤率、出車率、庫存週轉 | 核心效率指標 |
target_col |
計劃、目標、出勤率目標 | 目標值 |
deviation_col |
偏差、deviation、差異 | 偏差率 |
count_col |
遲到、請假、出車、借用 | 計數型指標(軟性參考,不觸發異常) |
場景:使用者報表的銷售額列叫"實際營收(萬元)",偏差率列叫"執行偏差",其他列名恰好匹配。
column_mapping = {
"metric_col": "實際營收(萬元)",
"deviation_col": "執行偏差",
"yoy_col": "同比增長率"
}
提示:Agent 在執行 Step 1 時,先檢查 column_mapping 是否顯式傳入;若有則直接使用欄位對映;若沒有則按關鍵詞自動識別;若識別失敗則在執行前向用戶確認。
v3.0 核心改進:將質量校驗從"事後檢查"變為"執行前阻斷",不合格不生成報告,直接報錯並給出缺失清單。
| 校驗項 | 要求 | 不滿足時的行為 |
|---|---|---|
| 資料行數 | ≥ 30 行(不含表頭) | quality_check_mode=auto/strict → 報錯中止;loose → 生成參考報告並註明資料不足 |
| 欄位數 | ≥ 5 列 | 同上 |
| 對比基準列存在 | 根據 baseline_type 校驗對應列是否存在 | 報錯並列出缺失列名 |
| 列名可識別 | 至少識別出 date_col 和 metric_col | 若 column_mapping 未傳且自動識別失敗 → 中止並要求使用者提供對映表 |
| 數值格式 | 指標列和比率列必須為數值型(非文本) | 標註格式異常行,繼續執行(loose 模式) |
| 質量維度 | 具體標準 | 不滿足時的處理 |
|---|---|---|
| 資料完整性 | 缺失值比例 < 10% | 輸出警告,繼續執行 |
| 異常覆蓋性 | 至少存在 1 個真實異常(即至少 1 行滿足異常檢測條件) | 輸出警告,繼續執行(防止全部正常導致報告空洞) |
| 多維度性 | 至少存在 2 個不同維度(如區域+產品線;部門+月份) | 輸出警告,繼續執行 |
| 時間跨度 | 時間列跨度 ≥ 5 天 | 輸出警告,標準差法降級為閾值法 |
校驗輸出格式(不符合時輸出):
⚠️ 前置校驗發現以下問題:
1. [ERROR] 資料行數為 {N} 行,不滿足 ≥30 行要求 → 請補充資料
2. [WARN] 對比基準列"同比增長率"未找到 → 請檢查 column_mapping 或確認報表格式
3. [INFO] 資料行數不足 20 行,標準差法將降級為閾值法
執行策略:quality_check_mode={mode} → {繼續執行 / 中止}
1.1 格式識別
- 若 report_data 首行包含逗號(,)且不以 | 開頭 → 識別為 CSV
- 若包含管道符(|)→ 識別為 Markdown 表格
- 若兩種都包含 → 優先 CSV,忽略 Markdown 格式的描述文字
1.2 列名標準化 - 若 column_mapping 已傳入:直接使用對映關係,將原始列名重新命名為標準欄位名 - 若未傳入:按關鍵詞自動識別(見第二節對照表),識別結果在報告中註明 - 自動識別失敗時:中止執行,要求使用者補充 column_mapping
1.3 資料清洗
- 移除表頭行後的純資料行參與統計
- 若 metric_col 或 yoy_col 等數值列出現文本值(如"無資料"、"N/A"),標記為缺失值
- 偏差率計算規則:
- 若已存在 deviation_col:直接使用
- 若無 deviation_col 但有 plan_col:計算 偏差率 = (metric_col - plan_col) / plan_col
- 若既無 deviation_col 也無 plan_col:僅做同比/環比分析,不計算偏差率
v3.0 列名對映表示例(銷售報表):
| 原始列名 | 對映後標準欄位 |
|---|---|
| 日期 | date_col |
| 產品線 | product_col |
| 區域 | region_col |
| 銷售額_元 | metric_col |
| 銷售數量 | quantity_col |
| 環比增長率 | qoq_col |
| 同比增長率 | yoy_col |
| 計劃銷售額_元 | plan_col |
| 偏差率 | deviation_col |
v3.0 改進:標準差法增加正態分佈假設說明,明確適用條件。
使用 Python 工具對所有數值列計算以下統計量:
| 統計量 | 計算方法 | 說明 |
|---|---|---|
| n | COUNT | 有效資料行數 |
| 均值 (μ) | SUM/n | 算術平均數 |
| 標準差 (σ) | STDDEV(n) | 衡量資料離散程度 |
| 最小值 | MIN | 資料下界 |
| 最大值 | MAX | 資料上界 |
| μ±2σ 區間 | μ±2σ | 標準差法異常判定區間 |
關於標準差法的正態分佈假設說明(v3.0 新增):
⚠️ 重要前提:標準差法的有效性依賴於資料近似服從正態分佈(均值兩側資料大致對稱)。若資料嚴重偏態(如收入分佈右偏),標準差法結果可能失準。
不適用標準差法的典型場景: - 資料行數 < 20(樣本量不足,σ 估計不可靠) - 資料存在極端異常值(σ 被異常值放大,導致 μ±2σ 區間過寬,漏檢真正的異常) - 資料明顯非正態分佈(如費用報表中少數大額訂單拉高均值)
自動降級策略:若資料行數 < std_min_rows(預設 20),自動跳過標準差法,僅使用閾值法;若 std_min_rows 已設定但 < 20,強制使用 20 作為最小值。
替代建議:對於偏態資料,優先使用中位數 ± MAD(絕對離差中位數)法或直接使用閾值法,並註明"資料偏態,標準差法結果僅供參考"。
v3.0 改進:支援 anomaly_params 引數覆蓋預設閾值;明確異常檢測優先順序。
| 異常型別 | 判定條件 | 嚴重程度 |
|---|---|---|
| 同比嚴重下降 | yoy_col ≤ yoy_threshold(預設 -0.30,即 -30%) | 🔴 極嚴重 |
| 偏差率正向極端 | deviation_col ≥ deviation_threshold(預設 +0.30,即 +30%) | 🟠 異常偏高(正向警示) |
| 偏差率負向極端 | deviation_col ≤ -deviation_threshold(預設 -0.15,即 -15%) | 🔴 極嚴重 |
| 環比突變暴漲 | qoq_col ≥ mutation_threshold(預設 +0.50,即 +50%) | 🟡 注意(暴漲可能掩蓋質量問題) |
| 環比突變暴跌 | qoq_col ≤ -mutation_threshold(預設 -0.50,即 -50%) | 🟠 嚴重(暴跌需立即關注) |
閾值覆蓋:通過 anomaly_params 引數可覆蓋預設閾值,例如將同比閾值從 -30% 收緊到 -20%。
metric_col < μ - std_sigma × σ 或 metric_col > μ + std_sigma × σ
(std_sigma 預設值為 2,即 μ±2σ)|qoq_col| > mutation_threshold優先順序:閾值法 > 標準差法 > 環比突變檢測
合併規則:
1. 若同一行同時被閾值法和標準差法檢測 → 採用閾值法的嚴重程度
2. 若同一行同時被閾值法和環比突變檢測 → 採用閾值法的嚴重程度
3. 異常彙總表列出每行觸發的所有方法,供讀者交叉驗證
4. 標準差法正向極端(metric_col > μ + 2σ)→ ⚠️ 超常表現,單獨分類,不計入負面異常統計
對每個 Top 異常,從以下維度進行交叉分析(若報表中存在該維度):
| 維度 | 分析方法 |
|---|---|
| 區域維度 | 計算該區域所有行的指標均值,與全域性均值對比 |
| 產品維度 | 計算該產品線所有行的指標均值,與全域性均值對比 |
| 時間維度 | 檢查該異常是否有連續性(同一區域+產品線是否多期異常) |
| 基準維度 | 同時計算同比和偏差率,交叉驗證異常是否雙重觸發 |
交叉定位輸出格式:
**多維度交叉定位:**
- **區域維度**:{區域} 同比均值 {X}%(全域性均值 {Y}%),{高於/低於} 全域性 {Z} 個百分點
- **產品維度**:{產品} 偏差率均值 {X}%(全域性均值 {Y}%),{高於/低於} 全域性 {Z} 個百分點
- **時間維度**:{是否連續異常}(若是,列出連續異常日期)
v3.0 改進:章節一增加列名對映說明章節;質量校驗清單整合到執行流程末尾。
質量標準:章節 < 5 → 報告不完整;指標卡 < 5 → 關鍵指標不足;異常項 < 3 → 檢測能力不足;具體建議 < 3 → 建議無落地性。 以上標準在 quality_check_mode=strict 時為強制要求;quality_check_mode=auto 時為警告要求。
必含內容: - 資料規模:總行數、有效資料行數、欄位數、時間跨度 - 維度拆解:列出識別出的所有維度(時間/區域/產品/目標等)及唯一值數量 - 描述性統計:所有數值列的 n/μ/σ/最小值/最大值/μ±2σ 區間(工具計算) - v3.0 新增:列名對映說明(若使用 column_mapping,列出原始列名→標準欄位的對映關係)
章節校驗標準:欄位數 ≥ 5,描述性統計覆蓋所有數值列
運營主題指標卡示例:
| # | 指標卡 | 數值 | 說明 |
|---|---|---|---|
| ① | 總銷售額/總費用 | {計算值} | 累計值,工具計算 |
| ② | 整體同比增長率(均值) | {μ(yoy)} | 低於/高於行業均值 {X}% |
| ③ | 整體計劃完成率(加權均值偏差率) | {μ(deviation)} | 整體{達標/不達標},但個體分化嚴重 |
| ④ | 超計劃項數佔比 | {佔比}% | {N}/{總行數} 項超過計劃 |
| ⑤ | 異常率(閾值法) | {佔比}% | {N} 項觸發偏差率/同比閾值 |
財務主題指標卡示例:
| # | 指標卡 | 數值 |
|---|---|---|
| ① | 總費用 | {計算值} |
| ② | 整體預算執行率(偏差率均值) | {μ(deviation)} |
| ③ | 超預算部門數 | {N} 個 |
| ④ | 最高單筆費用 | {max(amount_col)} |
| ⑤ | 異常率(超預算比例) | {N} 筆 / |
行政主題指標卡示例:
| # | 指標卡 | 數值 |
|---|---|---|
| ① | 整體出勤率/出車率 | {μ(metric_col)} |
| ② | 整體偏差率 | {μ(deviation)} |
| ③ | 不達標部門數 | {N} 個 |
| ④ | 遲到/請假總人次 | {sum(count_col)} |
| ⑤ | 超標準部門數 | {N} 個 |
| baseline_type | 章節名稱 | 必含內容 |
|---|---|---|
| 同比 | 同比增長率分佈 | 同比增長率按維度交叉(區域×產品線/部門×月份)矩陣,含區域均值和顏色標註 |
| 環比 | 環比增長率分佈 | 同上 |
| 計劃值 | 計劃完成率分佈 | 偏差率按區間分佈(≥+30% / +15%~+30% / 0%~+15% / -15%~0% / ≤-15%) |
| 同比+計劃值 | 同比+計劃值對比分析 | 同時包含同比分佈和偏差率分佈,交叉發現雙重異常行 |
v3.0 改進:Top 異常按嚴重程度排序,每項必含:觸發方法、多維度定位、原因猜想(分"資料支援"和"需核實"兩類)。
異常項格式:
#### 🔴 極嚴重 #{N}:{維度組合} · {核心指標} · {異常值}({日期})
| 專案 | 內容 |
|------|------|
| **觸發方法** | {閾值法 / 標準差法 / 突變檢測}({具體條件}) |
| **嚴重程度** | 🔴 極嚴重 / 🔴 嚴重 / 🟡 注意 |
| **資料表現** | {實際值};{計劃值}(偏差{偏差率}%);同比 {yoy}% |
**多維度交叉定位:**
- **區域維度**:{區域} {指標}均值 {X}%(全域性均值 {Y}%),{高於/低於} 全域性 {Z} 個百分點
- **產品/類別維度**:{產品} {指標}均值 {X}%
- **時間維度**:{是否有連續性,若有則列出日期}
**原因猜想(資料驅動):**
1. **{猜想標題}**({資料支援 / 需核實}):{支撐資料或待核實事項}
2. **需進一步核實**:{需要業務人員確認的事項}
v3.0 改進:每條建議必含:對應異常編號、具體措施、預期效果、建議負責人、建議時限。
建議格式:
#### 建議{N}:【{優先順序}】{建議標題}
| 專案 | 內容 |
|------|------|
| **對應異常** | #{異常編號}({異常描述}) |
| **建議措施** | ① **{時間}**:{具體行動}<br>② **{時間}**:{具體行動} |
| **預期效果** | {量化預期} |
| **建議負責人** | {角色或部門} |
| **建議時限** | {時間要求} |
口徑說明內容(按 report_theme + custom_calibration 自適應生成):
| 口徑項 | 定義 |
|---|---|
| 同比增長率 | (本期值 - 去年同期值)/ 去年同期值,數值格式為小數(-0.30 = -30%) |
| 環比增長率 | (本期值 - 上期值)/ 上期值 |
| 偏差率 | (實際值 - 計劃值)/ 計劃值,正值=超計劃,負值=低於計劃 |
| 異常閾值(預設) | 同比下降 ≥ 30%;|偏差率| ≥ 15%;標準差偏離 > μ±2σ;環比變化 > ±50% |
| 標準差法說明 | 資料需近似正態分佈;行數 < 20 時自動降級為閾值法;偏態資料僅供參考 |
| 缺失值處理 | 缺失值按該列均值填充(比率列按 0 填充),並在報告中註明 |
v3.0 質量自檢結果(執行流程末尾自動生成):
## 六·二、質量自檢清單(v3.0 自動校驗 ✅)
| 質量維度 | 要求 | 實際 | 結果 |
|---------|------|------|------|
| 資料行數 | ≥ 30 行 | {N} 行 | ✅/❌ |
| 欄位數 | ≥ 5 列 | {N} 列 | ✅/❌ |
| 報告章節數 | ≥ 5 章節 | {N} 章節 | ✅/❌ |
| 關鍵指標卡 | ≥ 5 個 | {N} 個 | ✅/❌ |
| 異常項識別 | ≥ 3 項 | {N} 項(Top {N}) | ✅/❌ |
| 具體建議 | ≥ 3 條(均含負責人+時限) | {N} 條 | ✅/❌ |
| 數值計算方式 | 工具計算 | Python工具計算 | ✅ |
| 多維度分析 | 區域×產品線/部門×月份 | 已執行 | ✅ |
| 異常檢測方法 | ≥ 2 種 | {N} 種(閾值/標準差/突變) | ✅ |
| 原因猜想資料驅動 | 每條均含資料支撐或"需核實" | 全部符合 | ✅ |
| 列名對映記錄 | 若使用 column_mapping,記錄原始→標準對映 | 已記錄/未使用 | ✅/ℹ️ |
**總體評定**:{通過 / 有警告 / 不通過}
v3.0 改進:擴充套件異常維度覆蓋,增加財務/行政場景的具體閾值說明。
| 異常型別 | 核心指標 | 預設閾值 | 嚴重程度分級 |
|---|---|---|---|
| 同比嚴重下滑 | yoy_col | ≤ -0.30 | -0.30~-0.50 🟡;≤ -0.50 🔴 |
| 偏差率負向 | deviation_col | ≤ -0.15 | -0.15~-0.30 🟡;≤ -0.30 🔴 |
| 偏差率正向極端 | deviation_col | ≥ +0.30 | ≥ +0.30 ⚠️ 超常 |
| 環比突變暴漲 | qoq_col | ≥ +0.50 | ≥ +0.50 🟡(需分析是否異常) |
| 環比突變暴跌 | qoq_col | ≤ -0.50 | -0.50~-0.70 🟠;≤ -0.70 🔴 |
| 標準差異常 | metric_col | > μ±2σ | 低於下界 🔴;高於上界 ⚠️ |
| 異常型別 | 核心指標 | 預設閾值 | 嚴重程度分級 |
|---|---|---|---|
| 超預算嚴重 | deviation_col | ≥ +0.20 | +0.20~+0.50 🟡;≥ +0.50 🔴 |
| 嚴重節餘 | deviation_col | ≤ -0.30 | ⚠️ 異常偏低(可能資金未使用) |
| 單筆費用極高 | amount_col | > μ+2σ | 🟡 超常 |
| 報銷頻次異常 | count_col | 同比 > +0.50 | 🟡 報銷頻次暴漲(需核實) |
| 部門費用集中 | 某部門費用佔比 | > 40% | 🟡 費用過度集中某部門 |
| 異常型別 | 核心指標 | 預設閾值 | 嚴重程度分級 |
|---|---|---|---|
| 出勤率嚴重偏低 | metric_col(出勤率) | < 85% | 75%~85% 🟡;< 75% 🔴 |
| 偏差率不達標 | deviation_col | ≤ -0.10 | -0.10~-0.20 🟡;≤ -0.20 🔴 |
| 遲到人次過多 | count_col(遲到) | > 5人次/部門平均人數×10% | 🟡 注意(無固定閾值) |
| 請假人次過多 | count_col(請假) | > 部門平均請假×2倍 | 🟡 參考項(無固定閾值) |
| 出車率極高 | metric_col(出車率) | > 95% | ⚠️ 出車率極高,可能外勤管理鬆散 |
| 出車率極低 | metric_col(出車率) | < 50% | 🟡 車輛閒置率過高 |
注意:行政主題的計數型指標(遲到、請假、出車次數)無固定閾值,作為"軟性參考項"呈現在報告中,不觸發異常標記,但作為背景資訊輔助判斷。
| 約束項 | 說明 |
|---|---|
| 資料規模 | 最少 30 行(不含表頭),行數不足時報告質量不可靠 |
| 列名識別 | 若列名包含生僻字或特殊縮寫,自動識別可能失敗,請使用 column_mapping 顯式宣告 |
| 偏差率計算 | 若報表既無 deviation_col 也無 plan_col,報告將不包含偏差率分析章節 |
| 同比資料 | 若報表無同比列,baseline_type 強制降級為"計劃值"或"環比" |
| 標準差法 | 行數 < 20 或資料嚴重偏態時自動降級為閾值法 |
| 報告語言 | 目前僅支援簡體中文輸出 |
| 多語言報表 | 若列名為英文,需在 column_mapping 中傳入英文欄位名對映 |
| 置信區間 | 目前僅使用 μ±2σ,未來可擴充套件為按偏態自適應(IQR 法替代) |
輸入資料:[貼上 CSV 內容]
report_theme: 運營
baseline_type: 同比+計劃值
column_mapping: {"metric_col": "銷售額_元", "yoy_col": "同比增長率", "deviation_col": "偏差率"}
quality_check_mode: auto
輸入資料:[貼上 Markdown 表格內容]
report_theme: 財務
baseline_type: 計劃值
column_mapping: {"amount_col": "實際報銷_元", "budget_col": "預算額度_元", "deviation_col": "超支率"}
anomaly_params: {"deviation_threshold": 0.20, "yoy_threshold": -0.20}
quality_check_mode: strict
輸入資料:[貼上 Markdown 表格內容]
report_theme: 行政
baseline_type: 計劃值
column_mapping: {"metric_col": "出勤率", "deviation_col": "偏差率"}
custom_calibration: |
① 資料口徑:出勤率=(應勤天數-缺勤天數)/應勤天數;外勤人員按實際打卡天數折算;遲到≥9:05打卡計遲到1次。
② 異常口徑:部門平均出勤率低於85%為嚴重;低於95%為注意;豁免規則:外勤人員豁免打卡率考核。
③ 資料質量:缺失值(未打卡)按0.5天計算;離職當月按實際上班天數統計。
quality_check_mode: auto
| 版本 | 日期 | 變更說明 |
|---|---|---|
| v1.0 | 2026-05-08 | 首次試跑,支援 CSV 銷售報表,同比/環比雙基準,閾值法異常檢測 |
| v1.1 | 2026-05-08 | 增加 Markdown 表格解析,質量校驗清單(11項全部可驗證),改善異常項輸出格式 |
| v1.2 | 2026-05-08 | 增加多維交叉分析(區域×產品線矩陣),增加描述性統計(n/μ/σ/μ±2σ),增加 Top 10 異常詳情 |
| v2.0 | 2026-05-08 | 三重複合異常檢測(閾值法+標準差法+突變檢測),4級嚴重程度量化,報表型別→異常維度對映表,運營/財務/行政三大主題適配,行政考勤計數型指標軟性參考機制 |
| v3.0 | 2026-05-08 | ① 列名硬編碼改為引數化對映表(column_mapping + 自動識別雙軌)② 質量自檢機制嵌入執行流程(Step 0 前置校驗,strict/auto/loose/none 四模式)③ 標準差法增加正態分佈假設說明和自動降級策略 ④ custom_calibration 結構化引導(資料口徑/異常口徑/資料質量三段式)⑤ anomaly_params 引數支援閾值覆蓋 ⑥ 新增財務/行政主題具體異常閾值 ⑦ 質量校驗清單整合到報告第六章 ⑧ TestBench 斷言指令碼(scripts/test_report_skill.py)⑨ 平行測試資料集(references/財務_費用報表_測試資料.csv + references/行政_用車報表_測試資料.md) |
這是一份偏向文件化的技能規範,規則定義詳細、異常檢測方法多樣、質量檢查機制完善。但技能缺少可直接執行的計算程式碼,更多依賴使用者自行實現。報告結構要求嚴格,包含6個強制章節和多項質量標準,適合對報告格式有規範化需求的場景。文件質量較高但實操性中等,建議等待補充程式碼實現後再投入使用。