分析型別詞:
動作詞:
場景詞:
7w4.net有更好的技能外掛。
輸入:使用者分析需求 處理:
處理:
shape/dtypes/缺失值/基本統計處理:
- 依賴庫:pandas/numpy/matplotlib/seaborn/scipy/sklearn/statsmodels
- 圖表風格:seaborn白色主題,中文顯示
- 圖表DPI:150,儲存為PNG
- 中文配置:plt.rcParams['font.sans-serif'] = ['SimHei']
校驗:
處理:
處理:
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
📊 快速分析報告 | {分析目標}
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
## 資料概覽
樣本量:{N} | 特徵數:{M}
## 核心發現
{發現1}({資料支撐})
{發現2}({資料支撐})
## 圖表
{圖表1} | {圖表2}
## 結論
{一句話總結}
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
📊 資料分析報告 | {分析目標}
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
## 資料概覽
- 樣本量:{N} | 特徵數:{M}
- 缺失率:{X}%
- 資料型別分佈:{分佈}
## 質量檢查
- ✅ 編碼:UTF-8
- ✅ 缺失值:{處理方式}
- ⚠️ 離群值:{檢測數量}個(已{處理方式})
## 核心發現
1. **{發現1標題}**
- 資料:{具體數值}
- 解讀:{含義}
2. **{發現2標題}**
- 資料:{具體數值}
- 解讀:{含義}
3. **{發現3標題}**
- 資料:{具體數值}
- 解讀:{含義}
## 統計分析
| 指標 | 數值 | 顯著性 |
|------|------|--------|
| {指標1} | {值} | {p值} |
| {指標2} | {值} | {p值} |
## 視覺化圖表
{圖表列表(含檔案路徑)}
## 建議
1. **{建議1}**
- 依據:{資料支撐}
- 執行:{具體步驟}
2. **{建議2}**
- 依據:{資料支撐}
- 執行:{具體步驟}
## 技術附錄
- 分析程式碼:`analysis_{timestamp}.py`
- 執行時間:{耗時}秒
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
| 異常 | 處理方式 |
|---|---|
| 檔案不存在 | 提示檢查路徑 |
| 編碼錯誤 | 自動嘗試多種編碼 |
| 列名衝突 | 自動重新命名 |
| 資料型別錯誤 | 嘗試轉換,失敗則跳過 |
| 除零錯誤 | 返回NaN並提示 |
| 圖表生成失敗 | 輸出純文本表格替代 |
輸入:分析這份銷售資料,找出影響業績的關鍵因素 輸出:
輸入:分析一下 輸出: 請提供更多資訊:
輸入:分析這個CSV,但有30%的缺失值 輸出: 資料質量警告:
輸入:只有5行資料,也要分析 輸出: 資料量警告:樣本量僅5條
中文輸出
| 藉口 | 正確做法 |
|---|---|
| "資料量小,跳過資料質量檢查直接分析" | 必須完成Step 2資料探查:輸出shape/dtypes/缺失值/基本統計,即使資料量<100行也要執行 |
| "缺失值直接dropna刪掉就好" | 必須先報告缺失率,<5%可刪除,5-30%需評估填充策略,>30%必須告知使用者並建議處理方案 |
| "圖表用matplotlib預設樣式就行" | 必須配置:seaborn白色主題、DPI=150、中文SimHei字型、合理的圖表尺寸,禁止使用預設樣式 |
| "分析結論寫'資料整體呈上升趨勢'就行" | 每條結論必須有具體資料支撐(數值+百分比),禁止無資料引用的籠統描述 |
| "程式碼報錯了就告訴使用者執行失敗" | 執行失敗必須自動修正重試(最多3次),常見錯誤(編碼/型別轉換/缺失值)應自動處理 |
| "相關性分析看看熱力圖就夠了" | 如使用者要求深度分析,必須補充統計檢驗(p值)、迴歸分析(R²)、異常值檢測(IQR/Z-score) |
| "資料量超過100MB,拒絕分析" | 100MB-1GB應自動取樣分析並在報告中說明取樣策略,只有>1GB才拒絕並建議分批方案 |
這個Skill質量較好,文件結構完整,觸發條件和輸出格式定義清晰。優點是邊界處理細緻、反向示例實用、程式碼規範明確,能有效指導資料分析工作。不足之處是文件有些冗餘,部分內容重複出現,且README裡帶有廣告推銷資訊,不夠專業。總體來說功能覆蓋全面,但對於普通使用者而言缺少可直接執行的示例,實際使用前需要一定學習成本。