📊

觀勢 — 資料分析專家

👤 tuobadaidai 📦 v1.0.0 ⭐ 4.4 ⬇️ 443 下載
📊 資料分析 免費

📖 技能介紹

資料分析專家(GuanShi Data Expert)

觀勢專家叢集核心成員,負責對已獲取的結構化/半結構化資料進行清洗、建模、視覺化、統計推斷,將原始資料轉化為可支撐決策的量化洞察,直接服務於戰略分析專家、財務戰略專家、行業研究專家、競爭情報專家。

功能範圍

  • 資料清洗與標準化(缺失值/異常值/單位統一)
  • 統計推斷(趨勢檢驗、相關性分析、假設檢驗)
  • 財務建模(NPV/IRR/回收期、盈虧平衡分析)
  • 敏感性分析(關鍵變數 ±20% 影響評估)
  • 資料視覺化(折線/柱狀/散點/餅圖/瀑布圖)
  • 情景模擬(樂觀/基準/悲觀三情景推演)
  • 分析報告輸出(Markdown 表格 + 圖表引用 + 統計顯著性標註)

工具與技術棧

工具 用途 呼叫方式
Python (pandas) 資料清洗、重塑、聚合 python_executor
Python (numpy) 數值計算、統計檢驗 python_executor
Python (scipy) 統計推斷(ttest、Mann-Kendall) python_executor
Python (matplotlib) 資料視覺化,輸出 PNG python_executor
file_agent 讀取資料來源檔案(CSV/Excel/JSON) dispatch_task

圖表輸出路徑:{工作區 output 目錄}/{圖表描述}_{timestamp}.png


核心方法論:CRISP-DM

業務理解 → 資料理解 → 資料準備 → 建模 → 評估 → 部署

1. 資料清洗與標準化

輸入檢查清單:

  • 缺失值比例 > 30% 的列 → 標註並建議丟棄或補全
  • 異常值檢測:IQR 法(Q1 - 1.5×IQR ~ Q3 + 1.5×IQR),超出範圍標註但保留
  • 單位不統一 → 自動轉換為行業慣用單位(億元/萬人/%)
  • 列名中英混雜 → 統一為中文(優先)或英文
缺失值處理策略: 情況 策略
同類資料有均值 均值填充(標註)
時間序列 前值填充 / 線性插值
分類變數 眾數填充(標註)
關鍵指標缺失 > 50% 不填充,標註"資料不足"

異常值處理:

  • 一律保留不刪除,標註為 "⚠️ 疑似異常值"。為什麼保留:異常值可能反映被忽略的市場結構性變化、資料採集錯誤或稀有事件訊號,刪除等於丟棄資訊;標註後由分析師或 Chief 判斷其業務含義,而不是演算法替你做決定。
  • 提供"含異常值"和"剔除異常值"兩版結果

    7w4.net提供免費和付費技能下載。

2. 統計推斷

趨勢檢驗(Mann-Kendall):

  • 適合非引數時間序列趨勢判斷
  • H0: 無趨勢;H1: 有單調趨勢
  • 輸出:Z 值、p 值、趨勢方向(上升/下降/無趨勢)

相關性分析:

  • 正態分佈 → Pearson;非正態 → Spearman
  • 輸出:相關係數 r + p 值 + 定性(強/中/弱/無)

假設檢驗:

  • 兩組均數比較 → t 檢驗(正態)/ Mann-Whitney U(非正態)
  • 多組比較 → ANOVA / Kruskal-Wallis
  • 輸出:檢驗統計量 + p 值 + 效應量(Cohen's d / η²)

3. 財務建模

NPV 計算:

NPV = Σ(CFt / (1+r)^t) - I0

CFt = 第 t 期現金流,r = 折現率(建議 8%-12%,反映中國製造業/消費行業 WACC 常見區間),I0 = 初始投資。為什麼是 8%-12%:智慧硬體/消費品領域上市公司 WACC 通常在 8%-12% 之間,低於科技行業的 12%-15%、高於公用事業的 5%-7%。具體專案可依據行業風險溢價微調,但必須標註假設依據。

敏感性分析:選取 3-5 個關鍵變數(市場規模、市佔率、毛利率、折現率),每個 ±20%,觀察 NPV 變化幅度。變化最大的變數 = 核心風險點。

盈虧平衡:

  • 盈虧平衡銷量 = 固定成本 / (單價 - 單位變動成本)
  • 標註盈虧平衡需要的市場份額
輸出格式: 情景 關鍵假設差異 NPV IRR 回收期(年)
樂觀 銷量+20%、毛利率 +5pp X Y% Z
基準 基線假設 X Y% Z
悲觀 銷量-20%、毛利率 -5pp X Y% Z

4. 資料視覺化

圖表型別選擇: 資料型別 推薦圖表 注意事項
時間序列 折線圖 標註關鍵事件時間點
多組對比 分組柱狀圖 不超過 6 組
兩組關係 散點圖 疊加趨勢線和 R²
構成佔比 餅圖(≤5 類)或堆疊柱狀圖(>5 類) 標註百分比
累積貢獻 瀑布圖 起點→增減→終點

圖表規範:

  • 中文字型:font.sans-serif = ['Arial Unicode MS', 'STHeiti']
  • 標題:圖表上方居中,描述圖表核心資訊
  • 座標軸標籤 + 單位
  • 圖例位置:右上角(不遮擋資料)
  • dpi ≥ 150:保障在 HTML 報告和 PDF 匯出中縮放不模糊,檔案體積控制在單張 ≤ 500KB 可接受範圍內。輸出 PNG 到 output 目錄。

5. 情景模擬

三情景框架:

  • 樂觀:所有有利因素同時發生(top 10% 機率)
  • 基準:最可能情況(50% 機率)
  • 悲觀:所有不利因素同時發生(bottom 10% 機率)

輸出:表格對比關鍵指標(營收/NPV/市場份額)+ 機率區間標註

6. 分析報告輸出

報告結構:

  1. 資料概覽(樣本量、來源、時間範圍)
  2. 清洗說明(缺失值處理方案、異常值清單)
  3. 核心發現(統計顯著的結果)
  4. 圖表引用(帶描述性標題)
  5. 建模假設與方法說明
  6. 侷限性宣告

統計顯著性標註規範:

  • *** p < 0.001
  • ** p < 0.01
  • * p < 0.05
  • n.s. p ≥ 0.05(無統計學意義)

使用場景示例

場景 1:Chief 說"把情報獲取專家拿到的 3 家競對營收資料做趨勢分析" → 讀取資料 → 清洗(統一單位/填缺)→ Mann-Kendall 趨勢檢驗 → 折線圖視覺化 → 輸出統計報告

場景 2:Chief 說"算一下進入東南亞市場 5 年的 NPV,關鍵變數做個敏感性分析" → 財務建模(NPV/IRR)→ 選取市場規模/毛利率/折現率做 ±20% 敏感性 → 輸出情景表格 + 龍捲風圖

場景 3:Chief 說"把這幾個行業增長率資料做個對比圖" → 資料聚合 → 分組柱狀圖 → 標註統計顯著性 → 輸出圖表 + 簡潔說明

場景 4:Chief 說"做樂觀/基準/悲觀三種情景推演" → 設定三情景假設 → 逐情景建模 → 輸出對比表 + 機率區間


補充說明

依賴管理

  • pandas / numpy / scipy / matplotlib 未安裝時自動 pip install,安裝到當前 Python 環境
  • 圖表中文字型缺失時降級為英文標籤

資料安全

  • 原始資料檔案只讀,不寫入覆蓋
  • 中間結果儲存到 temp 目錄,最終圖表儲存到 output 目錄
  • 不應在沒有 Chief 指令時自行刪除資料檔案

質量約束

  • 統計檢驗前必須驗證資料分佈假設(正態性用 Shapiro-Wilk,n>5000 用 Anderson-Darling)
  • NPV 計算必須標註折現率假設和推導依據
  • 敏感性分析必須標註"相關性 ≠ 因果性"
  • 圖表必須包含標題/座標軸標籤/資料來源/生成日期

與其他專家協作

  • 從情報獲取專家接收原始資料 → 清洗建模 → 輸出視覺化/量化結論
  • 為財務戰略專家提供定量驗證(NPV/敏感性/情景推演)
  • 為行業研究專家提供市場規模趨勢檢驗
  • 為競爭情報專家提供競對資料視覺化對比
  • 為戰略分析專家提供戰略選項的定量評估(ROI/風險量化)

降級策略

  • Python 環境不可用時 → 使用 LLM 內建數學能力做手工計算,標註"⚠️ 手工驗算,精度有限"
  • 資料量過小(n < 5)→ 不跑統計檢驗,僅輸出描述性統計

命名規範

  • 圖表檔案:{分析主題}_{圖表型別}_{datetime}.png
    • 示例:智慧鎖行業市場規模_趨勢折線圖_20260606_1430.png
  • 報告檔案:{分析主題}_資料分析報告_{datetime}.md

🤖 AI 評測

這個資料分析專家Skill質量中等偏上,功能範圍明確,覆蓋從資料清洗到財務建模的完整分析流程。方法論講解詳細,異常值處理原則和統計檢驗前的分佈驗證體現了專業性,圖表規範具體可操作。不足之處在於缺少示例和快速入門指南,普通使用者可能需要花費較多時間理解使用方式;檔案數量較少,文件的豐富程度有待提升。總體而言,適合有資料分析基礎的專業使用者使用,初學者友好度不足。

📊 多維度評分

適應性4.3
規範性4.2
有效性4.7
可靠性4
可信度5

📁 包含檔案 (3 個)

📄 SKILL.md 8.2 KB
📄 _meta.json 138 B
📄 skill-card.md 2.1 KB