資料分析助手

👤 李明璟 ✓ 已認證 📦 v1.0.0 ⭐ 4.4 ⬇️ 212 下載
📊 資料分析 免費

📖 技能介紹


name: data-analysis-reporter description: 從資料自動生成分析報告,包含統計摘要、趨勢分析、異常檢測和視覺化建議。適用於資料分析、統計報告、趨勢分析、運營報表、A/B測試報告等場景。 description_zh: 從資料自動生成分析報告,包含統計摘要、趨勢分析、異常檢測和視覺化建議。 description_en: Automatically generate analysis reports from data, including statistical summaries, trend analysis, anomaly detection, and visualization suggestions. version: 1.0.0 trigger: - 資料分析 - data analysis - 分析報告 - 資料包告 - 統計 - 趨勢分析 - report - 報表 allowed-tools: - Read - Write - Edit - Grep - Glob


資料分析報告生成器 (Data Analysis Reporter)

一、核心使命

從原始資料(CSV、JSON、資料庫匯出)自動生成結構清晰、洞察明確、可執行的資料分析報告。

判斷生成成功的唯一標準:決策者讀完報告後,能準確理解資料現狀、識別關鍵問題、明確下一步行動,無需再追問資料細節。

本 Skill 反對"資料堆砌"和"圖表炫技",堅持資料 → 洞察 → 行動的遞進邏輯。

二、五階段處理流程

階段 1:資料理解 (Data Understanding)

對輸入資料進行全量掃描,理解資料結構和質量。

1.1 資料結構識別

識別維度 識別方法 輸出欄位
資料規模 行數、列數 row_countcolumn_count
欄位型別 推斷每列資料型別 numericcategoricaldatetimetext
欄位含義 欄位名 + 抽樣值推斷業務含義 field_meaning
時間範圍 時間欄位 min/max date_range
主鍵/唯一鍵 唯一值數 = 行數 primary_key
缺失情況 每列缺失率 missing_rate
重複情況 重複行數 duplicate_count

可呼叫 scripts/analyze.py --overview <file> 輔助分析。

1.2 資料質量評估決策表

質量維度 優秀 合格 警告 危險
缺失率 < 5% 5-15% 15-30% > 30%
重複率 < 1% 1-3% 3-5% > 5%
異常值佔比 < 1% 1-3% 3-5% > 5%
一致性 100% > 95% 90-95% < 90%
時效性 當天 1 周內 1 月內 > 1 月

1.3 資料型別推斷規則

欄位特徵 推斷型別 處理方式
全為數字(含小數) 數值型 數值統計
全為整數且唯一值<20 類別型(可能是) 頻次統計
符合日期格式 時間型 時間序列
文本且唯一值多 文本型 詞頻/摘要
True/False、0/1 布林型 佔比統計

階段 2:統計描述 (Statistical Description)

對數值欄位計算描述性統計,對類別欄位計算頻次分佈。

2.1 數值欄位統計

統計量 含義 用途
count 非空數 資料完整性
mean 均值 集中趨勢
median 中位數 集中趨勢(抗異常值)
mode 眾數 最常見值
std 標準差 離散程度
min 最小值 資料範圍
max 最大值 資料範圍
p25 / p50 / p75 分位數 分佈形態
skew 偏度 分佈對稱性
kurt 峰度 分佈尖銳度

2.2 類別欄位統計

統計量 含義
unique 唯一值數
top 最常見值
freq 最常見值頻次
各類別佔比 分佈情況

2.3 分佈形態判斷決策表

偏度 形態 解讀 視覺化建議
skew ≈ 0 對稱 正態分佈 直方圖 + 正態曲線
skew > 1 右偏 少數高值拉高均值 箱線圖 + 對數軸
skew < -1 左偏 少數低值拉低均值 箱線圖
峰度 > 3 尖峰 資料集中在均值附近 直方圖
峰度 < 3 平峰 資料分散 直方圖

可呼叫 scripts/analyze.py --stats <file> 輸出統計摘要。

階段 3:趨勢識別 (Trend Identification)

對時間序列資料,識別趨勢、週期、突變。

3.1 趨勢型別識別

趨勢型別 識別方法 業務含義
長期趨勢 線性迴歸斜率 整體走向
週期性 自相關、FFT 季節、周內規律
突變點 滑動視窗均值差異 事件影響
季節性 同期對比(同比/環比) 週期波動
噪聲 殘差分析 隨機波動

3.2 同比環比計算決策表

對比型別 計算方法 適用
環比 (MoM) (本期-上期)/上期 月度資料
同比 (YoY) (本期-去年同期)/去年同期 年度資料
周環比 (WoW) (本週-上週)/上週 週數據
日環比 (DoD) (今日-昨日)/昨日 日資料

3.3 趨勢解讀規則

變化幅度 解讀 報告措辭
> +50% 暴漲 "顯著增長"
+20% ~ +50% 大幅增長 "明顯提升"
+5% ~ +20% 增長 "穩步增長"
-5% ~ +5% 持平 "保持穩定"
-5% ~ -20% 下降 "有所下滑"
-20% ~ -50% 大幅下降 "明顯下降"
< -50% 暴跌 "顯著下滑"

階段 4:異常檢測 (Anomaly Detection)

識別資料中的異常點,分為點異常、上下文異常、集合異常。

4.1 異常檢測方法決策表

方法 適用 檢測原理 優缺點
3σ 準則 正態分佈 偏離均值 3 個標準差 簡單,僅適用正態
IQR 方法 任意分佈 超出 [Q1-1.5IQR, Q3+1.5IQR] 穩健,推薦
Z-score 正態分佈 z
滑動視窗 時間序列 偏離區域性均值 檢測突變點
同比異常 時間序列 偏離去年同期 檢測季節性異常
箱線圖 任意分佈 視覺識別 直觀

4.2 異常分類與處置

異常型別 可能原因 處置方式
資料錯誤 採集錯誤、錄入錯誤 標記並剔除
業務事件 活動、促銷、事故 解釋原因
系統故障 服務中斷、bug 排查並修復
真實異常 業務真實波動 深入分析
外部影響 節假日、政策、競品 關聯分析

4.3 異常報告格式

異常點:2026-07-15 銷售額 = 850 萬
- 正常範圍:[120, 180] 萬
- 偏離程度:+394%(超出 3σ)
- 可能原因:雙 11 大促(業務事件)
- 影響:單日銷售額創歷史新高
- 建議:剔除該異常點後重新分析趨勢

階段 5:報告生成 (Report Generation)

根據分析目的選擇模板(詳見 references/report-templates.md),生成結構化報告。

5.1 報告骨架

# {報告標題}

## 執行摘要
(200 字內,核心發現 + 關鍵建議)

## 資料說明
- 資料來源:
- 時間範圍:
- 資料規模:
- 資料質量:

## 核心指標
| 指標 | 本期 | 上期 | 環比 | 同比 |
|------|------|------|------|------|

## 詳細分析
### 分析維度一:{dimension}
- 發現:
- 資料:
- 洞察:

### 分析維度二:{dimension}
...

## 異常與風險
- 異常點 1:...
- 風險提示:...

## 結論與建議
### 結論
1. ...
2. ...

### 建議
1. [短期] ...
2. [中期] ...
3. [長期] ...

## 附錄
- 資料明細表
- 視覺化建議(詳見 visualization-guide.md)

5.2 報告型別決策表

報告型別 適用場景 核心章節 詳略程度
銷售分析 銷售、營收 業績、渠道、產品 詳細
使用者行為 使用者、流量 漏斗、留存、畫像 詳細
運營週報 日常運營 KPI、進展、問題 簡潔
財務月報 財務 收入、成本、利潤 詳細
A/B 測試 實驗分析 假設、結果、顯著性 嚴謹

三、核心決策表

決策表 A:分析維度選擇

資料特徵 推薦分析維度
含時間欄位 時間趨勢、同比環比
含類別欄位 分組對比、佔比分析
含數值欄位 分佈、相關、迴歸
含使用者 ID 留存、漏斗、畫像
含地理位置 區域分佈、熱力圖
含渠道欄位 渠道對比、歸因

決策表 B:視覺化圖表選擇

分析目的 推薦圖表 詳見
趨勢變化 折線圖、面積圖 visualization-guide.md
對比差異 柱狀圖、條形圖
佔比分佈 餅圖、環形圖、堆疊柱
相關關係 散點圖、氣泡圖
分佈形態 直方圖、箱線圖
轉化流程 漏斗圖
地理位置 地圖、熱力圖
多維對比 雷達圖

決策表 C:報告詳略程度

受眾 詳略 重點
高管 極簡 結論、建議、風險
業務負責人 適中 KPI、趨勢、問題
資料團隊 詳細 方法、資料、異常
全員 簡潔 亮點、對比

四、安全規則(不可逾越)

  1. 不臆造資料:未在資料中出現的結果一律不得編造
  2. 不改原始資料:異常值剔除需說明,不得靜默修改
  3. 統計嚴謹:顯著性檢驗、樣本量、置信區間必須標註
  4. 因果慎斷:相關 ≠ 因果,需明確區分
  5. 樣本充分:樣本量不足(<30)時明確提示
  6. 資料脫敏:涉及個人資訊的需脫敏處理
  7. 時間對齊:同比環比需對齊業務日曆(如節假日)
  8. 口徑一致:指標定義需明確,避免口徑不一致
  9. 圖表誠實:座標軸不誤導、不截斷、不從非零開始(除非必要)
  10. 結論可驗證:所有結論需可回溯到資料

五、工作流程

當用戶提交資料檔案時,按以下步驟執行:

1. 讀取資料 → 呼叫 analyze.py --overview 輸出資料概覽
2. 資料質量評估 → 標記缺失、重複、異常
3. 呼叫 analyze.py --stats 輸出統計摘要
4. 時間欄位 → 趨勢分析、同比環比
5. 類別欄位 → 分組對比、佔比分析
6. 數值欄位 → 分佈、相關性分析
7. 異常檢測 → 標記並解釋
8. 選擇報告模板 → 填充骨架
9. 視覺化建議 → 推薦圖表型別
10. 輸出報告 + 資料附件

輸出格式示例:

# 7 月銷售資料分析報告

## 執行摘要
7 月銷售額 1850 萬,環比增長 12.3%,同比增長 28.5%。主力品類 A 貢獻 45% 營收。華東區增長最快(+35%)。需關注品類 C 連續 2 個月下滑。

## 資料說明
- 資料來源:銷售系統匯出
- 時間範圍:2026-07-01 至 2026-07-31
- 資料規模:12,350 條訂單
- 資料質量:缺失率 0.3%,無重複

## 核心指標
| 指標 | 本期 | 上期 | 環比 | 同比 |
|------|------|------|------|------|
| 銷售額 | 1850 萬 | 1648 萬 | +12.3% | +28.5% |
| 訂單數 | 12,350 | 11,200 | +10.3% | +22.1% |
| 客單價 | 1498 | 1471 | +1.8% | +5.2% |

## 詳細分析
### 品類分析
- 品類 A:832 萬(45%),環比 +18%
- 品類 B:520 萬(28%),環比 +8%
- 品類 C:320 萬(17%),環比 -12%(連續 2 月下滑,需關注)
- 品類 D:178 萬(10%),環比 +5%

### 區域分析
- 華東:740 萬(40%),環比 +35%(最快)
- 華北:480 萬(26%),環比 +5%
- 華南:380 萬(21%),環比 +8%
- 其他:250 萬(13%),環比 -3%

## 異常與風險
- 異常點:7 月 15 日銷售額 850 萬(雙 11 預熱活動)
- 風險:品類 C 連續下滑,需排查原因

## 結論與建議
### 結論
1. 整體銷售向好,環比同比雙增長
2. 品類 A 是核心增長引擎
3. 品類 C 是潛在風險點

### 建議
1. [短期] 排查品類 C 下滑原因(競品、價格、庫存)
2. [中期] 加大華東區成功經驗複製
3. [長期] 最佳化品類結構,降低對 A 的依賴

## 視覺化建議
- 銷售趨勢:折線圖(按日)
- 品類佔比:餅圖
- 區域對比:柱狀圖
- 品類 C 趨勢:單獨折線圖(突出下滑)

六、與 analyze.py 指令碼的協作

scripts/analyze.py 提供以下命令:

  • python analyze.py --overview <file> — 資料概覽
  • python analyze.py --stats <file> — 統計摘要
  • python analyze.py --trend <file> --date <欄位> — 趨勢分析
  • python analyze.py --anomalies <file> — 異常檢測
  • python analyze.py --report <file> -t sales -o report.md — 生成報告
  • python analyze.py --corr <file> — 相關性分析

支援輸入格式: - CSV(自動識別分隔符) - JSON(物件陣列) - JSONL(每行一個 JSON)

指令碼輸出的欄位包括: - overview:資料概覽(行數、列數、型別、缺失) - stats:統計摘要(數值欄位) - frequency:頻次分佈(類別欄位) - trend:趨勢分析(時間欄位) - anomalies:異常點列表 - correlations:相關係數矩陣

七、特殊場景處理

7.1 小樣本資料

  • 樣本量 < 30:標註"小樣本,結論僅供參考"
  • 不做顯著性檢驗
  • 不做複雜統計推斷
  • 以描述性統計為主

7.2 缺失值處理

缺失率 處理方式
< 5% 直接分析,標註缺失
5-15% 單獨分析缺失分佈,可用均值/中位數填充
15-30% 謹慎分析,明確缺失影響
> 30% 該欄位不建議作為主要分析維度

7.3 多資料來源合併

  • 明確各資料來源口徑
  • 關聯鍵一致性檢查
  • 合併後去重檢查
  • 時間範圍對齊

7.4 即時資料 vs 離線資料

  • 即時資料:強調最新狀態、短期趨勢
  • 離線資料:強調歷史對比、長期規律
  • 注意資料延遲(T+1 等)

7.5 A/B 測試資料

  • 明確實驗假設
  • 檢查樣本量是否充分
  • 檢查分流是否均衡
  • 計算顯著性(p 值、置信區間)
  • 關注業務意義而非僅統計意義

八、質量自檢清單

每次輸出報告前,逐項確認:

  • [ ] 資料來源、時間範圍、規模已說明
  • [ ] 資料質量(缺失、重複、異常)已評估
  • [ ] 核心指標有同比/環比對比
  • [ ] 趨勢分析含變化幅度和解讀
  • [ ] 異常點已識別並解釋
  • [ ] 結論有資料支撐
  • [ ] 建議具體、可執行、分優先順序
  • [ ] 視覺化建議與資料型別匹配
  • [ ] 無臆造資料
  • [ ] 統計方法使用正確
  • [ ] 樣本量、置信區間已標註(如適用)
  • [ ] 因果關係謹慎表述

九、與其他 Skill 的協作

  • 配合 meeting-notes-generator:會議中討論的資料分析可生成本報告
  • 配合 seo-optimizer:SEO 資料(排名、流量)分析報告

    小蔥技能7w4.net有完整的技能分類。

  • 配合 email-writer-pro:報告通過郵件傳送給相關方

十、版本記錄

  • v1.0.0:初始版本,建立五階段流程、決策表、5 種報告模板、視覺化指南、分析指令碼

🤖 AI 評測

這是一款專業的資料分析報告生成工具,能自動完成從資料讀取、統計分析到報告輸出的完整流程。優勢在於流程體系完整、決策規則詳細、模板可直接使用,輸出的報告結構清晰、重點突出。不足是缺乏實際案例演示,上手時可能需要一定摸索。整體質量良好,適合需要頻繁生成資料分析報告的使用者使用。

📊 多維度評分

適應性4.1
規範性4.3
有效性4.7
可靠性4.2
可信度5

📁 包含檔案 (5 個)

📄 SKILL.md 14.7 KB
📄 _meta.json 401 B
📄 references/report-templates.md 12.1 KB
📄 references/visualization-guide.md 9.3 KB
📄 scripts/analyze.py 29 KB