💻

Python資料分析

👤 qqyougitcom 📦 v1.4.0 ⭐ 4.7 ⬇️ 525 下載
💻 開發程式設計 免費

📖 技能介紹


name: python-data-analysis version: 1.4.0 description: | 拿到一堆資料不知道怎麼分析?丟資料進來,自動生成Python分析程式碼並執行,輸出視覺化圖表和結論。統計建模、時間序列、機器學習全覆蓋。不用你會寫程式碼,只要會提問就行。 觸發詞:資料分析、Python分析、統計分析、資料視覺化、資料建模、迴歸分析、相關性分析、資料清洗、機器學習、聚類分析、預測分析、資料包告 排除:純Python程式設計(無資料)、Excel操作(用excel_master)、資料庫管理、網頁爬蟲


Python資料分析 📊

發現更多技能外掛,請訪問7w4.net。

觸發條件

✅ 匹配關鍵詞(滿足任一即觸發)

分析型別詞: - 描述統計、均值、方差、分佈、頻次、交叉表 - 假設檢驗、t檢驗、卡方檢驗、ANOVA、p值、顯著性 - 迴歸分析、線性迴歸、邏輯迴歸、R²、預測 - 聚類分析、K-Means、肘部法則、輪廓係數 - 相關性分析、協方差、Pearson、Spearman - 時間序列、趨勢、季節性、ARIMA、預測 - 資料清洗、缺失值、異常值、去重、標準化

動作詞: - 分析、做個分析、分析一下、資料包告 - 視覺化、畫圖、製圖、生成圖表 - 建模、訓練模型、預測 - 對比分析、差異分析、同比環比

場景詞: - CSV分析、Excel資料分析、JSON解析 - 使用者分析、銷售分析、運營分析 - A/B測試結果分析、問卷分析

❌ 排除關鍵詞(明確不觸發)

  • 純Python程式設計(無資料分析)→ 拒絕
  • Excel操作、公式、VBA → 用 excel_master
  • 資料庫SQL查詢 → 拒絕
  • 網頁爬蟲、資料採集 → 拒絕
  • 深度學習、神經網路訓練 → 拒絕
  • 大數據Spark/Hadoop處理 → 拒絕

🎯 上下文條件

  • 提供CSV/Excel檔案 → 直接載入分析
  • 提供API/URL → 先獲取資料再分析
  • 說"模擬資料"/"示例" → 生成模擬資料演示
  • 說"快速"/"簡單" → 簡化流程,只做核心分析
  • 說"詳細"/"完整"/"專業" → 完整5步流程

核心流程(5 Steps)

Step 1: 需求理解 ✓ 校驗點

輸入:使用者分析需求 處理: 1. 識別分析型別:描述統計/假設檢驗/迴歸/聚類/時間序列 2. 確認資料來源:檔案路徑/URL/模擬資料 3. 確認輸出要求:圖表數量/格式/報告深度 校驗: - 資料來源是否存在且可讀 - 分析型別是否支援 - 資料量是否合理(>10行) 輸出:確認的分析計劃

Step 2: 資料載入與探查 ✓ 校驗點

處理: 1. 讀取資料(自動識別格式:CSV/Excel/JSON/Clipboard) 2. 輸出資料概覽:shape/dtypes/缺失值/基本統計 3. 識別資料質量問題 校驗: - 檔案編碼(UTF-8/GBK/ISO) - 列名是否規範 - 資料型別是否符合分析需求 異常處理: - 編碼錯誤:自動嘗試UTF-8/GBK/Latin1 - 缺失值:報告缺失率(<5%警告,>30%建議刪除) - 離群值:使用IQR/Z-score檢測 輸出:資料質量報告

Step 3: 分析程式碼生成 ✓ 校驗點

處理: 1. 根據分析型別生成Python程式碼 2. 程式碼必須包含:import/資料載入/分析/視覺化/儲存 3. 新增異常處理和日誌輸出 程式碼規範

- 依賴庫:pandas/numpy/matplotlib/seaborn/scipy/sklearn/statsmodels
- 圖表風格:seaborn白色主題,中文顯示
- 圖表DPI:150,儲存為PNG
- 中文配置:plt.rcParams['font.sans-serif'] = ['SimHei']

校驗: - 程式碼語法正確 - 依賴庫完整 - 視覺化配置正確 輸出:可執行Python程式碼

Step 4: 執行與迭代 ✓ 校驗點

處理: 1. 執行程式碼,超時60秒 2. 檢查執行結果 3. 如出錯,自動修正重試(最多3次) 4. 根據中間結果調整分析方向 分支處理: - 執行成功 → 進入Step 5 - 執行失敗 → 輸出錯誤資訊,詢問使用者是否重試 - 超時 → 分批處理或採樣 輸出:執行結果和圖表

Step 5: 結論輸出 ✓ 校驗點

處理: 1. 生成視覺化圖表(儲存PNG到output目錄) 2. 輸出分析結論(自然語言總結) 3. 提供資料驅動建議 質量檢查: - 圖表是否清晰可讀 - 結論是否有資料支撐 - 建議是否可執行 輸出:完整分析報告


輸出模板

模板A:簡潔版(快速分析)

━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
📊 快速分析報告 | {分析目標}
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
## 資料概覽
樣本量:{N} | 特徵數:{M}

## 核心發現
{發現1}({資料支撐})
{發現2}({資料支撐})

## 圖表
{圖表1} | {圖表2}

## 結論
{一句話總結}
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━

模板B:完整版(詳細分析)

━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
📊 資料分析報告 | {分析目標}
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
## 資料概覽
- 樣本量:{N} | 特徵數:{M}
- 缺失率:{X}%
- 資料型別分佈:{分佈}

## 質量檢查
- ✅ 編碼:UTF-8
- ✅ 缺失值:{處理方式}
- ⚠️ 離群值:{檢測數量}個(已{處理方式})

## 核心發現
1. **{發現1標題}**
   - 資料:{具體數值}
   - 解讀:{含義}
2. **{發現2標題}**
   - 資料:{具體數值}
   - 解讀:{含義}
3. **{發現3標題}**
   - 資料:{具體數值}
   - 解讀:{含義}

## 統計分析
| 指標 | 數值 | 顯著性 |
|------|------|--------|
| {指標1} | {值} | {p值} |
| {指標2} | {值} | {p值} |

## 視覺化圖表
{圖表列表(含檔案路徑)}

## 建議
1. **{建議1}**
   - 依據:{資料支撐}
   - 執行:{具體步驟}
2. **{建議2}**
   - 依據:{資料支撐}
   - 執行:{具體步驟}

## 技術附錄
- 分析程式碼:`analysis_{timestamp}.py`
- 執行時間:{耗時}秒
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━

邊界約束

資料安全

  • ✅ 不上傳資料到外部服務
  • ✅ 本地處理,檔案不外傳
  • ✅ 分析完成後清理臨時資料

記憶體與效能

  • ✅ 單次分析資料量:≤100MB
  • ⚠️ 100MB-1GB:先採樣再分析
  • ❌ >1GB:拒絕,建議分批處理
  • ✅ 單次執行超時:60秒
  • ⚠️ 超時:自動分批處理

輸入校驗

  • ❌ 空檔案:拒絕
  • ❌ <10行資料:警告,結果可能不準確
  • ❌ 二進位制檔案:拒絕
  • ❌ 加密檔案:拒絕

異常情況

異常 處理方式
檔案不存在 提示檢查路徑
編碼錯誤 自動嘗試多種編碼
列名衝突 自動重新命名
資料型別錯誤 嘗試轉換,失敗則跳過
除零錯誤 返回NaN並提示
圖表生成失敗 輸出純文本表格替代

不支援場景

  • ❌ 即時流資料處理
  • ❌ 自然語言處理(NLP)
  • ❌ 影像/影片分析
  • ❌ 深度學習模型訓練
  • ❌ 分散式計算(Spark/Hadoop)
  • ❌ 金融高頻交易資料

示例

✅ 正向示例

輸入:分析這份銷售資料,找出影響業績的關鍵因素 輸出: 1. 載入資料,完成概覽輸出 2. 相關性分析,生成熱力圖 3. 迴歸分析,識別顯著因素 4. 輸出完整報告

✅ 反向示例(使用者意圖模糊)

輸入:分析一下 輸出: 請提供更多資訊: 1. 資料來源?(檔案路徑/貼上資料/模擬演示) 2. 分析目標?(描述統計/找規律/預測/對比) 3. 輸出要求?(圖表/報告/詳細程度)

✅ 邊界示例(資料質量差)

輸入:分析這個CSV,但有30%的缺失值 輸出: 資料質量警告: - 缺失率:30%(偏高) 建議: 1. 刪除缺失率>50%的列 2. 對數值列用中位數填充 3. 對分類列用眾數填充 是否按建議處理?

✅ 邊界示例(資料量小)

輸入:只有5行資料,也要分析 輸出: 資料量警告:樣本量僅5條 - 統計結論可能不顯著 - 建議增加樣本量 是否繼續分析?(結果僅供參考)


Output Language

中文輸出

Anti-rationalization

藉口 正確做法
"資料量小,跳過資料質量檢查直接分析" 必須完成Step 2資料探查:輸出shape/dtypes/缺失值/基本統計,即使資料量<100行也要執行
"缺失值直接dropna刪掉就好" 必須先報告缺失率,<5%可刪除,5-30%需評估填充策略,>30%必須告知使用者並建議處理方案
"圖表用matplotlib預設樣式就行" 必須配置:seaborn白色主題、DPI=150、中文SimHei字型、合理的圖表尺寸,禁止使用預設樣式
"分析結論寫'資料整體呈上升趨勢'就行" 每條結論必須有具體資料支撐(數值+百分比),禁止無資料引用的籠統描述
"程式碼報錯了就告訴使用者執行失敗" 執行失敗必須自動修正重試(最多3次),常見錯誤(編碼/型別轉換/缺失值)應自動處理
"相關性分析看看熱力圖就夠了" 如使用者要求深度分析,必須補充統計檢驗(p值)、迴歸分析(R²)、異常值檢測(IQR/Z-score)
"資料量超過100MB,拒絕分析" 100MB-1GB應自動取樣分析並在報告中說明取樣策略,只有>1GB才拒絕並建議分批方案

🤖 AI 評測

這個Skill質量較好,文件結構完整,觸發條件和輸出格式定義清晰。優點是邊界處理細緻、反向示例實用、程式碼規範明確,能有效指導資料分析工作。不足之處是文件有些冗餘,部分內容重複出現,且README裡帶有廣告推銷資訊,不夠專業。總體來說功能覆蓋全面,但對於普通使用者而言缺少可直接執行的示例,實際使用前需要一定學習成本。

📊 多維度評分

適應性4.7
規範性4.8
有效性4.5
可靠性4.9
可信度5

📁 包含檔案 (5 個)

📄 README.md 1.1 KB
📄 SKILL.md 9.4 KB
📄 _meta.json 144 B
📄 references/details.md 9.6 KB
📄 skill-card.md 2.6 KB