資料分析助手

👤 李明璟 ✓ 已認證 📦 v1.0.0 ⭐ 4.4 ⬇️ 212 下載
📊 資料分析 免費

📖 技能介紹

資料分析報告生成器 (Data Analysis Reporter)

一、核心使命

從原始資料(CSV、JSON、資料庫匯出)自動生成結構清晰、洞察明確、可執行的資料分析報告。

判斷生成成功的唯一標準:決策者讀完報告後,能準確理解資料現狀、識別關鍵問題、明確下一步行動,無需再追問資料細節。

本 Skill 反對"資料堆砌"和"圖表炫技",堅持資料 → 洞察 → 行動的遞進邏輯。

二、五階段處理流程

階段 1:資料理解 (Data Understanding)

對輸入資料進行全量掃描,理解資料結構和質量。

1.1 資料結構識別:

識別維度 識別方法 輸出欄位
資料規模 行數、列數 row_count、column_count
欄位型別 推斷每列資料型別 numeric、categorical、datetime、text
欄位含義 欄位名 + 抽樣值推斷業務含義 field_meaning
時間範圍 時間欄位 min/max date_range
主鍵/唯一鍵 唯一值數 = 行數 primary_key
缺失情況 每列缺失率 missing_rate
重複情況 重複行數 duplicate_count

可呼叫 scripts/analyze.py --overview <file> 輔助分析。

1.2 資料質量評估決策表:

質量維度 優秀 合格 警告 危險
缺失率 < 5% 5-15% 15-30% > 30%
重複率 < 1% 1-3% 3-5% > 5%
異常值佔比 < 1% 1-3% 3-5% > 5%
一致性 100% > 95% 90-95% < 90%
時效性 當天 1 周內 1 月內 > 1 月

1.3 資料型別推斷規則:

欄位特徵 推斷型別 處理方式
全為數字(含小數) 數值型 數值統計
全為整數且唯一值<20 類別型(可能是) 頻次統計
符合日期格式 時間型 時間序列
文本且唯一值多 文本型 詞頻/摘要
True/False、0/1 布林型 佔比統計

階段 2:統計描述 (Statistical Description)

對數值欄位計算描述性統計,對類別欄位計算頻次分佈。

2.1 數值欄位統計:

統計量 含義 用途
count 非空數 資料完整性
mean 均值 集中趨勢
median 中位數 集中趨勢(抗異常值)
mode 眾數 最常見值
std 標準差 離散程度
min 最小值 資料範圍
max 最大值 資料範圍
p25 / p50 / p75 分位數 分佈形態
skew 偏度 分佈對稱性
kurt 峰度 分佈尖銳度

2.2 類別欄位統計:

統計量 含義
unique 唯一值數
top 最常見值
freq 最常見值頻次
各類別佔比 分佈情況

2.3 分佈形態判斷決策表:

偏度 形態 解讀 視覺化建議
skew ≈ 0 對稱 正態分佈 直方圖 + 正態曲線
skew > 1 右偏 少數高值拉高均值 箱線圖 + 對數軸
skew < -1 左偏 少數低值拉低均值 箱線圖
峰度 > 3 尖峰 資料集中在均值附近 直方圖
峰度 < 3 平峰 資料分散 直方圖

可呼叫 scripts/analyze.py --stats <file> 輸出統計摘要。

階段 3:趨勢識別 (Trend Identification)

對時間序列資料,識別趨勢、週期、突變。

3.1 趨勢型別識別:

趨勢型別 識別方法 業務含義
長期趨勢 線性迴歸斜率 整體走向
週期性 自相關、FFT 季節、周內規律
突變點 滑動視窗均值差異 事件影響
季節性 同期對比(同比/環比) 週期波動
噪聲 殘差分析 隨機波動

3.2 同比環比計算決策表:

對比型別 計算方法 適用
環比 (MoM) (本期-上期)/上期 月度資料
同比 (YoY) (本期-去年同期)/去年同期 年度資料
周環比 (WoW) (本週-上週)/上週 週數據
日環比 (DoD) (今日-昨日)/昨日 日資料

3.3 趨勢解讀規則:

變化幅度 解讀 報告措辭
> +50% 暴漲 "顯著增長"
+20% ~ +50% 大幅增長 "明顯提升"
+5% ~ +20% 增長 "穩步增長"
-5% ~ +5% 持平 "保持穩定"
-5% ~ -20% 下降 "有所下滑"
-20% ~ -50% 大幅下降 "明顯下降"
< -50% 暴跌 "顯著下滑"

階段 4:異常檢測 (Anomaly Detection)

識別資料中的異常點,分為點異常、上下文異常、集合異常。

4.1 異常檢測方法決策表:

方法 適用 檢測原理 優缺點
3σ 準則 正態分佈 偏離均值 3 個標準差 簡單,僅適用正態
IQR 方法 任意分佈 超出 [Q1-1.5IQR, Q3+1.5IQR] 穩健,推薦
Z-score 正態分佈 z > 3 類似 3σ
滑動視窗 時間序列 偏離區域性均值 檢測突變點
同比異常 時間序列 偏離去年同期 檢測季節性異常
箱線圖 任意分佈 視覺識別 直觀

4.2 異常分類與處置:

異常型別 可能原因 處置方式
資料錯誤 採集錯誤、錄入錯誤 標記並剔除
業務事件 活動、促銷、事故 解釋原因
系統故障 服務中斷、bug 排查並修復
真實異常 業務真實波動 深入分析
外部影響 節假日、政策、競品 關聯分析

4.3 異常報告格式:

異常點:2026-07-15 銷售額 = 850 萬
- 正常範圍:[120, 180] 萬
- 偏離程度:+394%(超出 3σ)
- 可能原因:雙 11 大促(業務事件)
- 影響:單日銷售額創歷史新高
- 建議:剔除該異常點後重新分析趨勢

階段 5:報告生成 (Report Generation)

根據分析目的選擇模板(詳見 references/report-templates.md),生成結構化報告。

5.1 報告骨架:

# {報告標題}

## 執行摘要
(200 字內,核心發現 + 關鍵建議)

## 資料說明
- 資料來源:
- 時間範圍:
- 資料規模:
- 資料質量:

## 核心指標
| 指標 | 本期 | 上期 | 環比 | 同比 |
|------|------|------|------|------|

## 詳細分析
### 分析維度一:{dimension}
- 發現:
- 資料:
- 洞察:

### 分析維度二:{dimension}
...

## 異常與風險
- 異常點 1:...
- 風險提示:...

## 結論與建議
### 結論
1. ...
2. ...

### 建議
1. [短期] ...
2. [中期] ...
3. [長期] ...

## 附錄
- 資料明細表
- 視覺化建議(詳見 visualization-guide.md)

5.2 報告型別決策表:

報告型別 適用場景 核心章節 詳略程度
銷售分析 銷售、營收 業績、渠道、產品 詳細
使用者行為 使用者、流量 漏斗、留存、畫像 詳細
運營週報 日常運營 KPI、進展、問題 簡潔
財務月報 財務 收入、成本、利潤 詳細
A/B 測試 實驗分析 假設、結果、顯著性 嚴謹

三、核心決策表

決策表 A:分析維度選擇

資料特徵 推薦分析維度
含時間欄位 時間趨勢、同比環比
含類別欄位 分組對比、佔比分析
含數值欄位 分佈、相關、迴歸
含使用者 ID 留存、漏斗、畫像
含地理位置 區域分佈、熱力圖
含渠道欄位 渠道對比、歸因

決策表 B:視覺化圖表選擇

分析目的 推薦圖表 詳見
趨勢變化 折線圖、面積圖 visualization-guide.md
對比差異 柱狀圖、條形圖
佔比分佈 餅圖、環形圖、堆疊柱
相關關係 散點圖、氣泡圖
分佈形態 直方圖、箱線圖
轉化流程 漏斗圖
地理位置 地圖、熱力圖
多維對比 雷達圖

決策表 C:報告詳略程度

受眾 詳略 重點
高管 極簡 結論、建議、風險
業務負責人 適中 KPI、趨勢、問題
資料團隊 詳細 方法、資料、異常
全員 簡潔 亮點、對比

四、安全規則(不可逾越)

  1. 不臆造資料:未在資料中出現的結果一律不得編造
  2. 不改原始資料:異常值剔除需說明,不得靜默修改
  3. 統計嚴謹:顯著性檢驗、樣本量、置信區間必須標註
  4. 因果慎斷:相關 ≠ 因果,需明確區分
  5. 樣本充分:樣本量不足(<30)時明確提示
  6. 資料脫敏:涉及個人資訊的需脫敏處理
  7. 時間對齊:同比環比需對齊業務日曆(如節假日)
  8. 口徑一致:指標定義需明確,避免口徑不一致
  9. 圖表誠實:座標軸不誤導、不截斷、不從非零開始(除非必要)
  10. 結論可驗證:所有結論需可回溯到資料

    發現更多技能外掛,請訪問7w4.net。

五、工作流程

當用戶提交資料檔案時,按以下步驟執行:

1. 讀取資料 → 呼叫 analyze.py --overview 輸出資料概覽
2. 資料質量評估 → 標記缺失、重複、異常
3. 呼叫 analyze.py --stats 輸出統計摘要
4. 時間欄位 → 趨勢分析、同比環比
5. 類別欄位 → 分組對比、佔比分析
6. 數值欄位 → 分佈、相關性分析
7. 異常檢測 → 標記並解釋
8. 選擇報告模板 → 填充骨架
9. 視覺化建議 → 推薦圖表型別
10. 輸出報告 + 資料附件

輸出格式示例:

# 7 月銷售資料分析報告

## 執行摘要
7 月銷售額 1850 萬,環比增長 12.3%,同比增長 28.5%。主力品類 A 貢獻 45% 營收。華東區增長最快(+35%)。需關注品類 C 連續 2 個月下滑。

## 資料說明
- 資料來源:銷售系統匯出
- 時間範圍:2026-07-01 至 2026-07-31
- 資料規模:12,350 條訂單
- 資料質量:缺失率 0.3%,無重複

## 核心指標
| 指標 | 本期 | 上期 | 環比 | 同比 |
|------|------|------|------|------|
| 銷售額 | 1850 萬 | 1648 萬 | +12.3% | +28.5% |
| 訂單數 | 12,350 | 11,200 | +10.3% | +22.1% |
| 客單價 | 1498 | 1471 | +1.8% | +5.2% |

## 詳細分析
### 品類分析
- 品類 A:832 萬(45%),環比 +18%
- 品類 B:520 萬(28%),環比 +8%
- 品類 C:320 萬(17%),環比 -12%(連續 2 月下滑,需關注)
- 品類 D:178 萬(10%),環比 +5%

### 區域分析
- 華東:740 萬(40%),環比 +35%(最快)
- 華北:480 萬(26%),環比 +5%
- 華南:380 萬(21%),環比 +8%
- 其他:250 萬(13%),環比 -3%

## 異常與風險
- 異常點:7 月 15 日銷售額 850 萬(雙 11 預熱活動)
- 風險:品類 C 連續下滑,需排查原因

## 結論與建議
### 結論
1. 整體銷售向好,環比同比雙增長
2. 品類 A 是核心增長引擎
3. 品類 C 是潛在風險點

### 建議
1. [短期] 排查品類 C 下滑原因(競品、價格、庫存)
2. [中期] 加大華東區成功經驗複製
3. [長期] 最佳化品類結構,降低對 A 的依賴

## 視覺化建議
- 銷售趨勢:折線圖(按日)
- 品類佔比:餅圖
- 區域對比:柱狀圖
- 品類 C 趨勢:單獨折線圖(突出下滑)

六、與 analyze.py 指令碼的協作

scripts/analyze.py 提供以下命令:

  • python analyze.py --overview <file> — 資料概覽
  • python analyze.py --stats <file> — 統計摘要
  • python analyze.py --trend <file> --date <欄位> — 趨勢分析
  • python analyze.py --anomalies <file> — 異常檢測
  • python analyze.py --report <file> -t sales -o report.md — 生成報告
  • python analyze.py --corr <file> — 相關性分析

支援輸入格式:

  • CSV(自動識別分隔符)
  • JSON(物件陣列)
  • JSONL(每行一個 JSON)

指令碼輸出的欄位包括:

  • overview:資料概覽(行數、列數、型別、缺失)
  • stats:統計摘要(數值欄位)
  • frequency:頻次分佈(類別欄位)
  • trend:趨勢分析(時間欄位)
  • anomalies:異常點列表
  • correlations:相關係數矩陣

七、特殊場景處理

7.1 小樣本資料

  • 樣本量 < 30:標註"小樣本,結論僅供參考"
  • 不做顯著性檢驗
  • 不做複雜統計推斷
  • 以描述性統計為主

7.2 缺失值處理

缺失率 處理方式
< 5% 直接分析,標註缺失
5-15% 單獨分析缺失分佈,可用均值/中位數填充
15-30% 謹慎分析,明確缺失影響
> 30% 該欄位不建議作為主要分析維度

7.3 多資料來源合併

  • 明確各資料來源口徑
  • 關聯鍵一致性檢查
  • 合併後去重檢查
  • 時間範圍對齊

7.4 即時資料 vs 離線資料

  • 即時資料:強調最新狀態、短期趨勢
  • 離線資料:強調歷史對比、長期規律
  • 注意資料延遲(T+1 等)

7.5 A/B 測試資料

  • 明確實驗假設
  • 檢查樣本量是否充分
  • 檢查分流是否均衡
  • 計算顯著性(p 值、置信區間)
  • 關注業務意義而非僅統計意義

八、質量自檢清單

每次輸出報告前,逐項確認:

  • [ ] 資料來源、時間範圍、規模已說明
  • [ ] 資料質量(缺失、重複、異常)已評估
  • [ ] 核心指標有同比/環比對比
  • [ ] 趨勢分析含變化幅度和解讀
  • [ ] 異常點已識別並解釋
  • [ ] 結論有資料支撐
  • [ ] 建議具體、可執行、分優先順序
  • [ ] 視覺化建議與資料型別匹配
  • [ ] 無臆造資料
  • [ ] 統計方法使用正確
  • [ ] 樣本量、置信區間已標註(如適用)
  • [ ] 因果關係謹慎表述

九、與其他 Skill 的協作

  • 配合 meeting-notes-generator:會議中討論的資料分析可生成本報告
  • 配合 seo-optimizer:SEO 資料(排名、流量)分析報告
  • 配合 email-writer-pro:報告通過郵件傳送給相關方

十、版本記錄

  • v1.0.0:初始版本,建立五階段流程、決策表、5 種報告模板、視覺化指南、分析指令碼

🤖 AI 評測

這是一款專業的資料分析報告生成工具,能自動完成從資料讀取、統計分析到報告輸出的完整流程。優勢在於流程體系完整、決策規則詳細、模板可直接使用,輸出的報告結構清晰、重點突出。不足是缺乏實際案例演示,上手時可能需要一定摸索。整體質量良好,適合需要頻繁生成資料分析報告的使用者使用。

📊 多維度評分

適應性4.1
規範性4.3
有效性4.7
可靠性4.2
可信度5

📁 包含檔案 (5 個)

📄 SKILL.md 14.7 KB
📄 _meta.json 401 B
📄 references/report-templates.md 12.1 KB
📄 references/visualization-guide.md 9.3 KB
📄 scripts/analyze.py 29 KB