name: python-data-analysis version: 1.4.0 description: | 拿到一堆資料不知道怎麼分析?丟資料進來,自動生成Python分析程式碼並執行,輸出視覺化圖表和結論。統計建模、時間序列、機器學習全覆蓋。不用你會寫程式碼,只要會提問就行。 觸發詞:資料分析、Python分析、統計分析、資料視覺化、資料建模、迴歸分析、相關性分析、資料清洗、機器學習、聚類分析、預測分析、資料包告 排除:純Python程式設計(無資料)、Excel操作(用excel_master)、資料庫管理、網頁爬蟲
分析型別詞: - 描述統計、均值、方差、分佈、頻次、交叉表 - 假設檢驗、t檢驗、卡方檢驗、ANOVA、p值、顯著性 - 迴歸分析、線性迴歸、邏輯迴歸、R²、預測 - 聚類分析、K-Means、肘部法則、輪廓係數 - 相關性分析、協方差、Pearson、Spearman - 時間序列、趨勢、季節性、ARIMA、預測 - 資料清洗、缺失值、異常值、去重、標準化
動作詞: - 分析、做個分析、分析一下、資料包告 - 視覺化、畫圖、製圖、生成圖表 - 建模、訓練模型、預測 - 對比分析、差異分析、同比環比
場景詞: - CSV分析、Excel資料分析、JSON解析 - 使用者分析、銷售分析、運營分析 - A/B測試結果分析、問卷分析
輸入:使用者分析需求 處理: 1. 識別分析型別:描述統計/假設檢驗/迴歸/聚類/時間序列 2. 確認資料來源:檔案路徑/URL/模擬資料 3. 確認輸出要求:圖表數量/格式/報告深度 校驗: - 資料來源是否存在且可讀 - 分析型別是否支援 - 資料量是否合理(>10行) 輸出:確認的分析計劃
處理:
1. 讀取資料(自動識別格式:CSV/Excel/JSON/Clipboard)
2. 輸出資料概覽:shape/dtypes/缺失值/基本統計
3. 識別資料質量問題
校驗:
- 檔案編碼(UTF-8/GBK/ISO)
- 列名是否規範
- 資料型別是否符合分析需求
異常處理:
- 編碼錯誤:自動嘗試UTF-8/GBK/Latin1
- 缺失值:報告缺失率(<5%警告,>30%建議刪除)
- 離群值:使用IQR/Z-score檢測
輸出:資料質量報告
處理: 1. 根據分析型別生成Python程式碼 2. 程式碼必須包含:import/資料載入/分析/視覺化/儲存 3. 新增異常處理和日誌輸出 程式碼規範:
- 依賴庫:pandas/numpy/matplotlib/seaborn/scipy/sklearn/statsmodels
- 圖表風格:seaborn白色主題,中文顯示
- 圖表DPI:150,儲存為PNG
- 中文配置:plt.rcParams['font.sans-serif'] = ['SimHei']
校驗: - 程式碼語法正確 - 依賴庫完整 - 視覺化配置正確 輸出:可執行Python程式碼
處理: 1. 執行程式碼,超時60秒 2. 檢查執行結果 3. 如出錯,自動修正重試(最多3次) 4. 根據中間結果調整分析方向 分支處理: - 執行成功 → 進入Step 5 - 執行失敗 → 輸出錯誤資訊,詢問使用者是否重試 - 超時 → 分批處理或採樣 輸出:執行結果和圖表
處理: 1. 生成視覺化圖表(儲存PNG到output目錄) 2. 輸出分析結論(自然語言總結) 3. 提供資料驅動建議 質量檢查: - 圖表是否清晰可讀 - 結論是否有資料支撐 - 建議是否可執行 輸出:完整分析報告
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
📊 快速分析報告 | {分析目標}
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
## 資料概覽
樣本量:{N} | 特徵數:{M}
## 核心發現
{發現1}({資料支撐})
{發現2}({資料支撐})
## 圖表
{圖表1} | {圖表2}
## 結論
{一句話總結}
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
📊 資料分析報告 | {分析目標}
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
## 資料概覽
- 樣本量:{N} | 特徵數:{M}
- 缺失率:{X}%
- 資料型別分佈:{分佈}
## 質量檢查
- ✅ 編碼:UTF-8
- ✅ 缺失值:{處理方式}
- ⚠️ 離群值:{檢測數量}個(已{處理方式})
## 核心發現
1. **{發現1標題}**
- 資料:{具體數值}
- 解讀:{含義}
2. **{發現2標題}**
- 資料:{具體數值}
- 解讀:{含義}
3. **{發現3標題}**
- 資料:{具體數值}
- 解讀:{含義}
## 統計分析
| 指標 | 數值 | 顯著性 |
|------|------|--------|
| {指標1} | {值} | {p值} |
| {指標2} | {值} | {p值} |
## 視覺化圖表
{圖表列表(含檔案路徑)}
## 建議
1. **{建議1}**
- 依據:{資料支撐}
- 執行:{具體步驟}
2. **{建議2}**
- 依據:{資料支撐}
- 執行:{具體步驟}
## 技術附錄
- 分析程式碼:`analysis_{timestamp}.py`
- 執行時間:{耗時}秒
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
小蔥技能7w4.net有完整的技能分類。
| 異常 | 處理方式 |
|---|---|
| 檔案不存在 | 提示檢查路徑 |
| 編碼錯誤 | 自動嘗試多種編碼 |
| 列名衝突 | 自動重新命名 |
| 資料型別錯誤 | 嘗試轉換,失敗則跳過 |
| 除零錯誤 | 返回NaN並提示 |
| 圖表生成失敗 | 輸出純文本表格替代 |
輸入:分析這份銷售資料,找出影響業績的關鍵因素 輸出: 1. 載入資料,完成概覽輸出 2. 相關性分析,生成熱力圖 3. 迴歸分析,識別顯著因素 4. 輸出完整報告
輸入:分析一下 輸出: 請提供更多資訊: 1. 資料來源?(檔案路徑/貼上資料/模擬演示) 2. 分析目標?(描述統計/找規律/預測/對比) 3. 輸出要求?(圖表/報告/詳細程度)
輸入:分析這個CSV,但有30%的缺失值 輸出: 資料質量警告: - 缺失率:30%(偏高) 建議: 1. 刪除缺失率>50%的列 2. 對數值列用中位數填充 3. 對分類列用眾數填充 是否按建議處理?
輸入:只有5行資料,也要分析 輸出: 資料量警告:樣本量僅5條 - 統計結論可能不顯著 - 建議增加樣本量 是否繼續分析?(結果僅供參考)
中文輸出
| 藉口 | 正確做法 |
|---|---|
| "資料量小,跳過資料質量檢查直接分析" | 必須完成Step 2資料探查:輸出shape/dtypes/缺失值/基本統計,即使資料量<100行也要執行 |
| "缺失值直接dropna刪掉就好" | 必須先報告缺失率,<5%可刪除,5-30%需評估填充策略,>30%必須告知使用者並建議處理方案 |
| "圖表用matplotlib預設樣式就行" | 必須配置:seaborn白色主題、DPI=150、中文SimHei字型、合理的圖表尺寸,禁止使用預設樣式 |
| "分析結論寫'資料整體呈上升趨勢'就行" | 每條結論必須有具體資料支撐(數值+百分比),禁止無資料引用的籠統描述 |
| "程式碼報錯了就告訴使用者執行失敗" | 執行失敗必須自動修正重試(最多3次),常見錯誤(編碼/型別轉換/缺失值)應自動處理 |
| "相關性分析看看熱力圖就夠了" | 如使用者要求深度分析,必須補充統計檢驗(p值)、迴歸分析(R²)、異常值檢測(IQR/Z-score) |
| "資料量超過100MB,拒絕分析" | 100MB-1GB應自動取樣分析並在報告中說明取樣策略,只有>1GB才拒絕並建議分批方案 |
這個Skill質量較好,文件結構完整,觸發條件和輸出格式定義清晰。優點是邊界處理細緻、反向示例實用、程式碼規範明確,能有效指導資料分析工作。不足之處是文件有些冗餘,部分內容重複出現,且README裡帶有廣告推銷資訊,不夠專業。總體來說功能覆蓋全面,但對於普通使用者而言缺少可直接執行的示例,實際使用前需要一定學習成本。