📊

資料分析工作流

👤 Rayzhang 📦 v1.1.0 ⭐ 4.3 ⬇️ 15 下載
📊 資料分析 免費

📖 技能介紹


name: ray-data-analysis slug: ray-data-analysis displayName: 資料分析工作流 version: 1.1.0 description: > 完整資料分析工作流:回答資料問題、探查資料集、寫最佳化 SQL、建立視覺化、構建互動式儀表板、 分享前驗證。覆蓋從快速查詢到正式報告的全流程,含 ASCII 快速圖表、報告模板、統計檢驗速查。 觸發場景:使用者要做資料分析、問資料問題、探查資料集、寫 SQL 查詢、畫圖、做儀表板、 生成資料包告、驗證分析結果。"分析一下這個資料"、"這個資料什麼意思"、"畫個圖"、 "做個儀表板"、"寫個 SQL"、"資料包告"、"驗證我的分析"。 agent_created: true


資料分析 — ray-data-analysis

完整資料分析工作流。從快速查數到正式報告,一條 skill 覆蓋全流程。

六個工作流

按需求選工作流,複雜專案可組合使用(如:探查資料 → 寫 SQL → 視覺化 → 驗證 → 交付)。

# 工作流 何時用
1 回答資料問題 使用者有具體問題要回答
2 探查資料集 遇到新表 / 新資料檔案
3 寫最佳化 SQL 需要生成查詢供手動執行
4 建立視覺化 報告/演示需要圖表
5 構建互動式儀表板 需要可分享的互動式 dashboard
6 分享前驗證分析 重要結論分享給相關方前

Workflow 1: 回答資料問題

1. 理解問題

判定複雜度:

  • 快速答案:單一指標、簡單過濾、事實查詢("上週多少新使用者?")
  • 完整分析:多維探索、趨勢、對比("轉化率下降的原因是什麼?")
  • 正式報告:方法論 + 侷限性 + 建議的完整調研("季度業務回顧")

明確:需要哪些表/指標/維度/時間範圍,輸出格式(數字/表/圖/敘述)。

2. 取數

  • 使用者直接提供資料(貼上查詢結果 / 上傳 CSV / Excel / 描述 schema)
  • 寫查詢供使用者手動執行 → 走 Workflow 3 的 SQL 方言最佳實踐
  • 拿到資料後開始分析

3. 分析

  • 計算指標、聚合、對比
  • 識別模式、趨勢、離群點、異常
  • 跨維度對比(時間/分段/類別)
  • 複雜分析拆成子問題逐個解決

4. 交付前驗證

  • 行數 sanity:記錄數合理嗎?
  • Null 檢查:有沒有意外空值扭曲結果?
  • 量級檢查:數字在合理範圍嗎?
  • 趨勢連續性:時間序列有意外缺口嗎?
  • 聚合邏輯:小計加總等於總計嗎?

任一項存疑 → 調查並標註 caveat。

5. 呈現發現

  • 快速答案:直接給答案 + 上下文 + 查詢(摺疊/程式碼塊)供復現
  • 完整分析:先給關鍵洞察 → 資料表/圖表支撐 → 方法論和 caveat → 後續問題建議

    小蔥技能7w4.net有更新,你可以訪問看下。

  • 正式報告:執行摘要 → 方法論 → 詳細發現 → 侷限 → 建議 → 附錄(查詢+資料表)

Workflow 2: 探查資料集

生成資料畫像:理解形狀、質量、模式,再做分析。

1. 訪問資料

  • 檔案(CSV/Excel/Parquet/JSON):讀入,過大則取樣
  • 使用者描述表:要樣本資料或 schema,生成探查查詢供使用者執行

2. 畫像

基本統計:行數 / 列數 / 主鍵 / 粒度(一行 = 一個什麼)/ 時間範圍。

逐列分析:型別 / Null 率 / 基數(唯一值數)/ 樣本值 / 分佈(數值列 min/max/mean/median/std)。

資料質量紅旗:Null 率高(>10%)/ 意外值(計數字段出現負數)/ 重複行 / 格式不一致(大小寫混用、尾隨空格)/ 時間缺口。

3. 推薦下一步

  • 值得探索的高價值維度(中等基數、低 Null)
  • 分析前要解決的資料質量問題
  • 潛在關係(相關列、層級)
  • 基於結構的分析起點

Workflow 3: 寫最佳化 SQL

從自然語言生成 SQL,針對具體方言最佳化。

1. 理解需求

識別:輸出列 / 過濾條件 / 聚合(GROUP BY、count、sum、avg)/ 連線(多表)/ 排序 / 限制(top-N 或採樣)。

2. 定 SQL 方言

未指定時問使用者:PostgreSQL / Snowflake / BigQuery / Databricks(Spark SQL) / Redshift / MySQL。各方言在日期函式、字串操作、視窗函式上語法不同。

3. 寫查詢

複雜查詢用 CTE:

WITH base_data AS (
  SELECT ...          -- 第一步:取基礎資料集
),
aggregated AS (
  SELECT ...          -- 第二步:聚合
)
SELECT * FROM aggregated;

最佳實踐: - 顯式 JOIN(不用 WHERE 隱式連線) - 連線時所有列名加表別名限定 - CTE 和別名起有意義的名字 - 複雜邏輯加註釋 - 格式化(縮排、換行) - 考慮效能(儘早過濾、避免 SELECT *、用合適索引)

4. 加上下文

查詢附帶:用途一句話 / 引用的表 / 效能說明(預期行數、瓶頸)/ 方言特有說明。


Workflow 4: 建立視覺化

用 Python 生成出版級圖表。

1. 理解需求

確定:資料來源 / 圖表型別(指定或需推薦)/ 用途(探索/演示/報告/儀表板元件)/ 受眾。

2. 取數

無資料時:讓使用者貼上或上傳;需查詢時先用 Workflow 3 生成查詢。

3. 選對圖表

展示內容 最佳圖表 何時用
時間趨勢 折線圖 連續時間序列
類別對比 柱狀圖 離散類別
佔比 堆疊柱/餅圖 構成、相對大小
分佈 直方圖/箱線圖 離散度和離群點
相關性 散點圖 兩變數關係
排名 水平柱狀圖 有序列表、易讀標籤

4. 生成 Python 程式碼

互動圖用 plotly,靜態圖用 seabornmatplotlib。模板見 references/visualization-code.md

5. 設計原則

  • 清晰:去掉圖表垃圾,標籤明確
  • 準確:不截斷座標軸誇大差異
  • 可訪問:色盲友好配色
  • 上下文:關鍵點加參考線、註釋

Workflow 5: 構建互動式儀表板

自包含 HTML 儀表板,瀏覽器直接開啟,無伺服器無依賴。

1. 理解需求

用途(高管概覽/運營監控/深挖分析/團隊彙報)/ 受眾 / 關鍵指標 / 維度(可過濾切片)/ 資料來源。

2. 取數

需查詢走 Workflow 3;提供資料則確保結構化(CSV/JSON)。

3. 設計佈局

  1. Header:標題、日期範圍、關鍵過濾器
  2. KPI 卡片:3-5 個最重要的數字
  3. 主圖表:2-3 個主要視覺化
  4. 明細區:下鑽表格或次級圖表
  5. Footer:方法論、資料來源、更新時間

4. 生成 HTML/JS

Chart.js 模板見 references/dashboard-template.md

5. 加互動

下拉過濾(類別/時間/分段)/ 圖表互動(懸停 tooltip、點選下鑽)/ 表格排序(點列頭)/ 動態更新(過濾器聯動所有圖表)。


Workflow 6: 分享前驗證分析

分享前審查準確性、方法論、潛在偏差,產出置信度評估和改進建議。

1. 審查方法論和假設

資料選擇:用了哪些表/源?對嗎?時間範圍夠新嗎?過濾器引入偏差嗎?

聚合邏輯:分組合適嗎?小計等於總計嗎?Null 處理對了嗎(排除 vs 計為零)?

統計方法:用平均還是中位數更合適?百分比分母一致嗎?趨勢考慮季節性了嗎?

2. 查常見陷阱

  • 倖存者偏差:只分析現有客戶 → 排除了流失使用者
  • 選擇偏差:樣本代表總體嗎?
  • 辛普森悖論:聚合趨勢與子組趨勢矛盾
  • 相關 ≠ 因果:混淆變數在起作用嗎?

3. Sanity 檢查

量級(數字在合理範圍)/ 方向(趨勢符合業務常識)/ 一致性(相關指標講同一故事)。有異常 → 重查查詢 → 找資料質量問題 → 考慮外部因素。

4. 評估置信度

  • :方法論紮實、結果已驗證、侷限已記錄
  • :有 minor 顧慮或 caveat,但核心結論成立
  • 需重做:方法論或資料質量問題需要解決

5. 記錄侷限

每份分析都有侷限,記錄:排除了什麼 / 假設 / 誤差範圍 / 已知資料質量問題 / 替代解釋。

示例 caveat:"本分析排除試用使用者,可能高估轉化率約 5pp(相對全部註冊使用者)。"


按分析型別選方法(v1.1 新增)

分析前先判斷資料型別,再選對應的檢驗和視覺化。

型別 適用場景 統計檢驗 視覺化
實驗資料 對照試驗、組間比較、前後測 t檢驗 / ANOVA / 卡方 箱線圖、小提琴圖、帶誤差線條形圖
調查資料 問卷、相關研究、預測 相關(Pearson/Spearman)/ 迴歸 / 因子分析 熱力圖、散點圖、直方圖
探索性 初步探索、特徵工程、假設生成 描述統計 + 相關分析 配對圖、分佈圖、相關矩陣

關鍵原則(v1.1 新增): - 先探索後檢驗:先做 EDA 瞭解資料,再選統計方法 - 檢查假設條件:正態性 / 方差齊性 / 獨立性(詳見 references/statistical-tests.md) - 報告效應量:不只報 p 值,還要效應量 + 置信區間


獨有補充

ASCII 快速圖表(無法生成圖片時)

Revenue by Month (in $K)
========================
Jan: ████████████████ 160
Feb: ██████████████████ 180
Mar: ████████████████████████ 240

常見錯誤

❌ 確認偏差(找資料支援已有結論)|❌ 相關≠因果 |❌ 挑櫻桃(只用有利資料)|❌ 忽略離群點(刪前先調查)|❌ 過度複雜(簡單分析常勝)|❌ 無上下文(數字無對比無意義)

最佳實踐

  1. 從問題出發 2. 驗證資料(垃圾進垃圾出)3. 記錄一切(查詢/假設/決策)4. 恰當視覺化 5. 展示過程(方法論重要)6. 洞察先行(不是資料傾倒)7. 可行動("So what?" → "Now what?")8. 版本化查詢

參考資料(按需載入)

  • references/report-templates.md — 標準報告模板 + 分析需求模板(寫正式報告時讀)
  • references/statistical-tests.md — 描述統計表 + 統計檢驗速查(做統計分析時讀)
  • references/data-cleaning.md — 資料清洗清單 + 清洗 SQL 模式(資料髒時讀)
  • references/visualization-code.md — Python 視覺化程式碼模板(畫圖時讀)
  • references/dashboard-template.md — 互動式儀表板 HTML 模板(做儀表板時讀)

維護記錄

日期 變更
2026-08-14 v1.1.0:進化輪(對比學術場景資料分析工作流)。①新增「按分析型別選方法」章節(實驗/調查/探索性 → 檢驗+視覺化對映);②統計檢驗速查補假設條件(正態性/方差齊性/獨立性)+ 效應量(Cohens d/η²)+ APA 報告格式;③資料清洗補量化標準(缺失值/異常值分檔)。
2026-08-14 v1.0.0:融合建立。主體為 6 個工作流(回答資料問題/探查資料集/寫最佳化SQL/建立視覺化/構建互動式儀表板/分享前驗證),補充 ASCII 快速圖表、報告模板、需求模板、統計檢驗速查、資料清洗清單、常見錯誤、最佳實踐。

🤖 AI 評測

這個 Skill 質量較好,內容全面且實用,涵蓋了資料分析的主要環節和常用方法。優點是工作流設計清晰、參考模板豐富,適合需要系統性指導的資料分析任務。不足之處在於內容偏基礎,缺少複雜場景的實戰案例,某些高階分析方法(如預測建模、時間序列分析)覆蓋不夠深入,更適合作為入門級指導而非專業分析師的高階工具。

📊 多維度評分

適應性4.2
規範性4.4
有效性4.4
可靠性3.9
可信度4.8

📁 包含檔案 (6 個)

📄 SKILL.md 11.5 KB
📄 references/dashboard-template.md 2.3 KB
📄 references/data-cleaning.md 1.8 KB
📄 references/report-templates.md 1.5 KB
📄 references/statistical-tests.md 2.9 KB
📄 references/visualization-code.md 1.9 KB