name: data-analysis-reporter description: 從資料自動生成分析報告,包含統計摘要、趨勢分析、異常檢測和視覺化建議。適用於資料分析、統計報告、趨勢分析、運營報表、A/B測試報告等場景。 description_zh: 從資料自動生成分析報告,包含統計摘要、趨勢分析、異常檢測和視覺化建議。 description_en: Automatically generate analysis reports from data, including statistical summaries, trend analysis, anomaly detection, and visualization suggestions. version: 1.0.0 trigger: - 資料分析 - data analysis - 分析報告 - 資料包告 - 統計 - 趨勢分析 - report - 報表 allowed-tools: - Read - Write - Edit - Grep - Glob
從原始資料(CSV、JSON、資料庫匯出)自動生成結構清晰、洞察明確、可執行的資料分析報告。
判斷生成成功的唯一標準:決策者讀完報告後,能準確理解資料現狀、識別關鍵問題、明確下一步行動,無需再追問資料細節。
本 Skill 反對"資料堆砌"和"圖表炫技",堅持資料 → 洞察 → 行動的遞進邏輯。
對輸入資料進行全量掃描,理解資料結構和質量。
1.1 資料結構識別:
| 識別維度 | 識別方法 | 輸出欄位 |
|---|---|---|
| 資料規模 | 行數、列數 | row_count、column_count |
| 欄位型別 | 推斷每列資料型別 | numeric、categorical、datetime、text |
| 欄位含義 | 欄位名 + 抽樣值推斷業務含義 | field_meaning |
| 時間範圍 | 時間欄位 min/max | date_range |
| 主鍵/唯一鍵 | 唯一值數 = 行數 | primary_key |
| 缺失情況 | 每列缺失率 | missing_rate |
| 重複情況 | 重複行數 | duplicate_count |
可呼叫 scripts/analyze.py --overview <file> 輔助分析。
1.2 資料質量評估決策表:
| 質量維度 | 優秀 | 合格 | 警告 | 危險 |
|---|---|---|---|---|
| 缺失率 | < 5% | 5-15% | 15-30% | > 30% |
| 重複率 | < 1% | 1-3% | 3-5% | > 5% |
| 異常值佔比 | < 1% | 1-3% | 3-5% | > 5% |
| 一致性 | 100% | > 95% | 90-95% | < 90% |
| 時效性 | 當天 | 1 周內 | 1 月內 | > 1 月 |
1.3 資料型別推斷規則:
| 欄位特徵 | 推斷型別 | 處理方式 |
|---|---|---|
| 全為數字(含小數) | 數值型 | 數值統計 |
| 全為整數且唯一值<20 | 類別型(可能是) | 頻次統計 |
| 符合日期格式 | 時間型 | 時間序列 |
| 文本且唯一值多 | 文本型 | 詞頻/摘要 |
| True/False、0/1 | 布林型 | 佔比統計 |
對數值欄位計算描述性統計,對類別欄位計算頻次分佈。
2.1 數值欄位統計:
| 統計量 | 含義 | 用途 |
|---|---|---|
| count | 非空數 | 資料完整性 |
| mean | 均值 | 集中趨勢 |
| median | 中位數 | 集中趨勢(抗異常值) |
| mode | 眾數 | 最常見值 |
| std | 標準差 | 離散程度 |
| min | 最小值 | 資料範圍 |
| max | 最大值 | 資料範圍 |
| p25 / p50 / p75 | 分位數 | 分佈形態 |
| skew | 偏度 | 分佈對稱性 |
| kurt | 峰度 | 分佈尖銳度 |
2.2 類別欄位統計:
| 統計量 | 含義 |
|---|---|
| unique | 唯一值數 |
| top | 最常見值 |
| freq | 最常見值頻次 |
| 各類別佔比 | 分佈情況 |
2.3 分佈形態判斷決策表:
| 偏度 | 形態 | 解讀 | 視覺化建議 |
|---|---|---|---|
| skew ≈ 0 | 對稱 | 正態分佈 | 直方圖 + 正態曲線 |
| skew > 1 | 右偏 | 少數高值拉高均值 | 箱線圖 + 對數軸 |
| skew < -1 | 左偏 | 少數低值拉低均值 | 箱線圖 |
| 峰度 > 3 | 尖峰 | 資料集中在均值附近 | 直方圖 |
| 峰度 < 3 | 平峰 | 資料分散 | 直方圖 |
可呼叫 scripts/analyze.py --stats <file> 輸出統計摘要。
對時間序列資料,識別趨勢、週期、突變。
3.1 趨勢型別識別:
| 趨勢型別 | 識別方法 | 業務含義 |
|---|---|---|
| 長期趨勢 | 線性迴歸斜率 | 整體走向 |
| 週期性 | 自相關、FFT | 季節、周內規律 |
| 突變點 | 滑動視窗均值差異 | 事件影響 |
| 季節性 | 同期對比(同比/環比) | 週期波動 |
| 噪聲 | 殘差分析 | 隨機波動 |
3.2 同比環比計算決策表:
| 對比型別 | 計算方法 | 適用 |
|---|---|---|
| 環比 (MoM) | (本期-上期)/上期 | 月度資料 |
| 同比 (YoY) | (本期-去年同期)/去年同期 | 年度資料 |
| 周環比 (WoW) | (本週-上週)/上週 | 週數據 |
| 日環比 (DoD) | (今日-昨日)/昨日 | 日資料 |
3.3 趨勢解讀規則:
| 變化幅度 | 解讀 | 報告措辭 |
|---|---|---|
| > +50% | 暴漲 | "顯著增長" |
| +20% ~ +50% | 大幅增長 | "明顯提升" |
| +5% ~ +20% | 增長 | "穩步增長" |
| -5% ~ +5% | 持平 | "保持穩定" |
| -5% ~ -20% | 下降 | "有所下滑" |
| -20% ~ -50% | 大幅下降 | "明顯下降" |
| < -50% | 暴跌 | "顯著下滑" |
識別資料中的異常點,分為點異常、上下文異常、集合異常。
4.1 異常檢測方法決策表:
| 方法 | 適用 | 檢測原理 | 優缺點 |
|---|---|---|---|
| 3σ 準則 | 正態分佈 | 偏離均值 3 個標準差 | 簡單,僅適用正態 |
| IQR 方法 | 任意分佈 | 超出 [Q1-1.5IQR, Q3+1.5IQR] | 穩健,推薦 |
| Z-score | 正態分佈 | z | |
| 滑動視窗 | 時間序列 | 偏離區域性均值 | 檢測突變點 |
| 同比異常 | 時間序列 | 偏離去年同期 | 檢測季節性異常 |
| 箱線圖 | 任意分佈 | 視覺識別 | 直觀 |
4.2 異常分類與處置:
| 異常型別 | 可能原因 | 處置方式 |
|---|---|---|
| 資料錯誤 | 採集錯誤、錄入錯誤 | 標記並剔除 |
| 業務事件 | 活動、促銷、事故 | 解釋原因 |
| 系統故障 | 服務中斷、bug | 排查並修復 |
| 真實異常 | 業務真實波動 | 深入分析 |
| 外部影響 | 節假日、政策、競品 | 關聯分析 |
4.3 異常報告格式:
異常點:2026-07-15 銷售額 = 850 萬
- 正常範圍:[120, 180] 萬
- 偏離程度:+394%(超出 3σ)
- 可能原因:雙 11 大促(業務事件)
- 影響:單日銷售額創歷史新高
- 建議:剔除該異常點後重新分析趨勢
根據分析目的選擇模板(詳見 references/report-templates.md),生成結構化報告。
5.1 報告骨架:
# {報告標題}
## 執行摘要
(200 字內,核心發現 + 關鍵建議)
## 資料說明
- 資料來源:
- 時間範圍:
- 資料規模:
- 資料質量:
## 核心指標
| 指標 | 本期 | 上期 | 環比 | 同比 |
|------|------|------|------|------|
## 詳細分析
### 分析維度一:{dimension}
- 發現:
- 資料:
- 洞察:
### 分析維度二:{dimension}
...
## 異常與風險
- 異常點 1:...
- 風險提示:...
## 結論與建議
### 結論
1. ...
2. ...
### 建議
1. [短期] ...
2. [中期] ...
3. [長期] ...
## 附錄
- 資料明細表
- 視覺化建議(詳見 visualization-guide.md)
5.2 報告型別決策表:
| 報告型別 | 適用場景 | 核心章節 | 詳略程度 |
|---|---|---|---|
| 銷售分析 | 銷售、營收 | 業績、渠道、產品 | 詳細 |
| 使用者行為 | 使用者、流量 | 漏斗、留存、畫像 | 詳細 |
| 運營週報 | 日常運營 | KPI、進展、問題 | 簡潔 |
| 財務月報 | 財務 | 收入、成本、利潤 | 詳細 |
| A/B 測試 | 實驗分析 | 假設、結果、顯著性 | 嚴謹 |
| 資料特徵 | 推薦分析維度 |
|---|---|
| 含時間欄位 | 時間趨勢、同比環比 |
| 含類別欄位 | 分組對比、佔比分析 |
| 含數值欄位 | 分佈、相關、迴歸 |
| 含使用者 ID | 留存、漏斗、畫像 |
| 含地理位置 | 區域分佈、熱力圖 |
| 含渠道欄位 | 渠道對比、歸因 |
| 分析目的 | 推薦圖表 | 詳見 |
|---|---|---|
| 趨勢變化 | 折線圖、面積圖 | visualization-guide.md |
| 對比差異 | 柱狀圖、條形圖 | |
| 佔比分佈 | 餅圖、環形圖、堆疊柱 | |
| 相關關係 | 散點圖、氣泡圖 | |
| 分佈形態 | 直方圖、箱線圖 | |
| 轉化流程 | 漏斗圖 | |
| 地理位置 | 地圖、熱力圖 | |
| 多維對比 | 雷達圖 |
| 受眾 | 詳略 | 重點 |
|---|---|---|
| 高管 | 極簡 | 結論、建議、風險 |
| 業務負責人 | 適中 | KPI、趨勢、問題 |
| 資料團隊 | 詳細 | 方法、資料、異常 |
| 全員 | 簡潔 | 亮點、對比 |
當用戶提交資料檔案時,按以下步驟執行:
1. 讀取資料 → 呼叫 analyze.py --overview 輸出資料概覽
2. 資料質量評估 → 標記缺失、重複、異常
3. 呼叫 analyze.py --stats 輸出統計摘要
4. 時間欄位 → 趨勢分析、同比環比
5. 類別欄位 → 分組對比、佔比分析
6. 數值欄位 → 分佈、相關性分析
7. 異常檢測 → 標記並解釋
8. 選擇報告模板 → 填充骨架
9. 視覺化建議 → 推薦圖表型別
10. 輸出報告 + 資料附件
輸出格式示例:
# 7 月銷售資料分析報告
## 執行摘要
7 月銷售額 1850 萬,環比增長 12.3%,同比增長 28.5%。主力品類 A 貢獻 45% 營收。華東區增長最快(+35%)。需關注品類 C 連續 2 個月下滑。
## 資料說明
- 資料來源:銷售系統匯出
- 時間範圍:2026-07-01 至 2026-07-31
- 資料規模:12,350 條訂單
- 資料質量:缺失率 0.3%,無重複
## 核心指標
| 指標 | 本期 | 上期 | 環比 | 同比 |
|------|------|------|------|------|
| 銷售額 | 1850 萬 | 1648 萬 | +12.3% | +28.5% |
| 訂單數 | 12,350 | 11,200 | +10.3% | +22.1% |
| 客單價 | 1498 | 1471 | +1.8% | +5.2% |
## 詳細分析
### 品類分析
- 品類 A:832 萬(45%),環比 +18%
- 品類 B:520 萬(28%),環比 +8%
- 品類 C:320 萬(17%),環比 -12%(連續 2 月下滑,需關注)
- 品類 D:178 萬(10%),環比 +5%
### 區域分析
- 華東:740 萬(40%),環比 +35%(最快)
- 華北:480 萬(26%),環比 +5%
- 華南:380 萬(21%),環比 +8%
- 其他:250 萬(13%),環比 -3%
## 異常與風險
- 異常點:7 月 15 日銷售額 850 萬(雙 11 預熱活動)
- 風險:品類 C 連續下滑,需排查原因
## 結論與建議
### 結論
1. 整體銷售向好,環比同比雙增長
2. 品類 A 是核心增長引擎
3. 品類 C 是潛在風險點
### 建議
1. [短期] 排查品類 C 下滑原因(競品、價格、庫存)
2. [中期] 加大華東區成功經驗複製
3. [長期] 最佳化品類結構,降低對 A 的依賴
## 視覺化建議
- 銷售趨勢:折線圖(按日)
- 品類佔比:餅圖
- 區域對比:柱狀圖
- 品類 C 趨勢:單獨折線圖(突出下滑)
scripts/analyze.py 提供以下命令:
python analyze.py --overview <file> — 資料概覽python analyze.py --stats <file> — 統計摘要python analyze.py --trend <file> --date <欄位> — 趨勢分析python analyze.py --anomalies <file> — 異常檢測python analyze.py --report <file> -t sales -o report.md — 生成報告python analyze.py --corr <file> — 相關性分析支援輸入格式: - CSV(自動識別分隔符) - JSON(物件陣列) - JSONL(每行一個 JSON)
指令碼輸出的欄位包括:
- overview:資料概覽(行數、列數、型別、缺失)
- stats:統計摘要(數值欄位)
- frequency:頻次分佈(類別欄位)
- trend:趨勢分析(時間欄位)
- anomalies:異常點列表
- correlations:相關係數矩陣
| 缺失率 | 處理方式 |
|---|---|
| < 5% | 直接分析,標註缺失 |
| 5-15% | 單獨分析缺失分佈,可用均值/中位數填充 |
| 15-30% | 謹慎分析,明確缺失影響 |
| > 30% | 該欄位不建議作為主要分析維度 |
每次輸出報告前,逐項確認:
meeting-notes-generator:會議中討論的資料分析可生成本報告seo-optimizer:SEO 資料(排名、流量)分析報告小蔥技能7w4.net有完整的技能分類。
email-writer-pro:報告通過郵件傳送給相關方這是一款專業的資料分析報告生成工具,能自動完成從資料讀取、統計分析到報告輸出的完整流程。優勢在於流程體系完整、決策規則詳細、模板可直接使用,輸出的報告結構清晰、重點突出。不足是缺乏實際案例演示,上手時可能需要一定摸索。整體質量良好,適合需要頻繁生成資料分析報告的使用者使用。