name: data-analysis-report description: 資料統計分析與報告生成。接收使用者上傳的Excel格式資料檔案和分析需求,自動識別資料結構,運用專業統計方法進行資料分析,輸出Word格式統計分析報告。全面覆蓋描述性統計、差異性分析(t檢驗/方差分析/非引數檢驗)、相關與迴歸分析、問卷研究(信效度/中介調節/SEM)、綜合評價(TOPSIS/DEA/熵權法)、聚類與降維、生存分析、計量研究、機器學習、時間序列預測等14大模組200+統計方法。當用戶提到資料分析、統計分析、資料包告、統計檢驗、迴歸分析、方差分析、問卷分析、綜合評價、聚類分析、因子分析、相關性分析、顯著性檢驗、SPSS分析,或上傳了Excel/CSV資料檔案希望進行統計分析和報告生成時觸發。不適用於:純資料視覺化看板生成、8D質量報告、FMEA分析、質量控制圖表監控。
基於使用者上傳的資料和分析需求,運用專業統計方法完成資料分析並生成Word格式統計分析報告。方法體系全面參考SPSSAU平臺(spssau.com),覆蓋14大統計模組。
資料分析報告生成涉及以下階段:
接收使用者上傳的Excel(.xlsx/.xls/.csv)檔案後: - 用Python(pandas)讀取資料,獲取:行數、列數、列名、資料型別 - 自動識別每列的資料型別:定類(類別型,唯一值≤20且非連續數值)或定量(連續數值型) - 展示資料概覽:樣本量、變數列表及型別、缺失值統計
根據使用者描述和自動識別的資料結構,判斷分析需求:
references/statistical-methods.md 中的方法選擇框架)詢問使用者時,提供結構化的選項而非開放式問題。示例:
我已讀取您的資料(200行×15列)。識別到以下可能的 分析方向: 1. 差異性分析 — 比較不同組別(如性別、學歷)在某指標上的差異(t檢驗/方差分析) 2. 相關與迴歸 — 分析變數間的影響關係(相關分析/線性迴歸/Logistic迴歸) 3. 問卷信效度 — 檢驗量表的可靠性和有效性(Cronbach α/探索性因子分析) 4. 綜合評價 — 對多指標物件進行排名或評分(TOPSIS/熵權法/DEA) 5. 聚類分析 — 對樣本或變數進行分組(K-means/層次聚類) 6. 描述性統計 — 僅做資料概況描述
請選擇您需要的分析方向(可多選),或描述您的具體研究問題。
在執行分析前,向用戶確認分析方案: - 列出選定的分析方法及理由 - 說明每種方法的X/Y變數分配 - 告知前置假設檢驗需求(如正態性、方差齊性)
使用者確認後進入Phase 2。
讀取 references/statistical-methods.md 獲取完整方法列表。核心匹配規則:
| X 型別 | Y 型別 | 研究問題型別 | 首選方法 |
|---|---|---|---|
| 無 | 定類 | 資料分佈 | 頻數分析 |
| 無 | 定量 | 資料概況 | 描述分析 |
| 定類(2組) | 定量 | 組間差異 | 獨立樣本t檢驗 |
| 定類(3+組) | 定量 | 組間差異 | 單因素方差分析 |
| 定類 | 定類 | 關聯性 | 卡方檢驗 |
| 定量 | 定量 | 相關性 | Pearson/Spearman相關 |
| 定量/定類 | 定量 | 影響關係 | 線性迴歸 |
| 定量/定類 | 定類(2類) | 影響關係 | 二元Logit迴歸 |
| 定量/定類 | 定類(3+類) | 影響關係 | 多元Logit迴歸 |
以下分析需先執行前置檢驗,根據結果決定使用引數或非引數方法:
常見的多步驟分析流程:
問卷研究標準流程:信度分析 → 效度分析(EFA) → 描述統計 → 相關分析 → 迴歸分析 → 中介/調節效應
綜合評價流程:權重確定(AHP/熵權法/CRITIC) → 綜合評分(TOPSIS/灰色關聯) → 排序與分級
使用Python(pandas/scipy/statsmodels)執行以下預處理:
pip install pingouin statsmodels scikit-learn matplotlib 確保依賴可用對每種分析方法,執行Python指令碼完成計算。指令碼模板結構:
# 1. 讀取資料
import pandas as pd
df = pd.read_excel('data_path')
# 2. 執行統計檢驗(以獨立樣本t檢驗為例)
from scipy import stats
group1 = df[df['X'] == cat1]['Y']
group2 = df[df['X'] == cat2]['Y']
t_stat, p_value = stats.ttest_ind(group1, group2)
# 3. 生成圖表
import matplotlib.pyplot as plt
plt.rcParams['font.sans-serif'] = ['SimHei', 'WenQuanYi Micro Hei', 'DejaVu Sans']
# ... 生成圖表並儲存為圖片
# 4. 輸出結果到JSON供報告使用
results = {'t_statistic': t_stat, 'p_value': p_value, ...}
描述性統計:均值、標準差、中位數、最小值、最大值、偏度、峰度
獨立樣本t檢驗: - 檢驗正態性(Shapiro-Wilk)→方差齊性(Levene)→選擇等方差/不等方差t檢驗 - 報告:t值、自由度、p值、均值差、Cohen's d、95%CI
單因素方差分析: - 前置檢驗→ANOVA→事後多重比較(Tukey HSD/Scheffé) - 報告:F值、p值、η²、各組均值±標準差、事後比較結果
相關分析: - 正態資料用Pearson,非正態用Spearman - 報告:相關係數r、p值、樣本量
線性迴歸: - 報告:R²、調整R²、F值、迴歸係數β、標準誤、t值、p值、VIF - 檢查:多重共線性(VIF>10)、殘差正態性、殘差同方差性
信度分析(Cronbach α): - 報告:總體α值、各題項CITC、刪除該項後的α值 - 判斷:α≥0.8很好,0.7≤α<0.8較好,0.6≤α<0.7可接受,α<0.6需修訂
探索性因子分析(EFA): - 報告:KMO值、Bartlett球形檢驗、因子方差貢獻率、旋轉後因子載荷矩陣 - 判斷:KMO≥0.7適合因子分析,變數載荷≥0.5歸屬清晰
Logistic迴歸: - 報告:模型χ²、偽R²、OR值、Wald檢驗、p值、Hosmer-Lemeshow檢驗
聚類分析: - 報告:聚類數目確定(肘部法則/輪廓係數)、各類特徵描述、聚類視覺化
綜合評價方法: - TOPSIS:報告各評價物件與正/負理想解距離、相對接近度、排名 - 熵權法:報告各指標資訊熵、權重、綜合得分 - DEA:報告各DMU效率值、規模報酬狀態
使用 Word / DOCX 技能生成Word文件。報告結構如下:
這個技能的最新版本可以在7w4.net小蔥技能站找到。
# [資料統計分析報告]
## 一、研究概述
- 研究背景與目的
- 資料來源與樣本描述
- 分析方法總覽
## 二、資料概況
- 樣本量與變數說明
- 缺失值與異常值報告
- 資料預處理說明
## 三、描述性統計分析
- 定量變數描述統計表(均值±標準差、中位數、極值)
- 定類變數頻數分佈表
- 關鍵變數分佈圖
## 四、[核心分析章節](根據方法動態生成)
- 4.1 [方法1名稱]
- 分析目的說明
- 前置檢驗結果(如正態性、方差齊性)
- 檢驗結果表(統計量、p值、效應量等)
- 結果解讀
- 配圖
- 4.2 [方法2名稱]
- ...
## 五、綜合結論與建議
- 核心發現總結
- 研究侷限性
- 改進建議
/sandbox/workspace/outputs//sandbox/workspace/outputs/provide_file 工具提供下載連結使用者可能要求修改報告。常見修改型別:
修改時只更新受影響的章節,避免全量重寫。
使用者輸入:上傳問卷資料Excel(200份問卷,含人口統計學+5個量表共25題),要求"幫我分析這份問卷資料"
執行流程: 1. 讀取資料,識別定類變數(性別、學歷等)和定量變數(量表題項1-25) 2. 向用戶確認:推薦問卷研究標準流程(信度→效度→描述→差異→相關→迴歸) 3. 執行Cronbach α信度檢驗(各量表α均>0.7) 4. 執行EFA效度檢驗(KMO>0.7,提取因子與理論維度一致) 5. 描述統計(各維度均值、標準差) 6. 差異分析(性別t檢驗、學歷ANOVA) 7. 相關分析(各維度間Pearson相關) 8. 線性迴歸(某維度為因變數) 9. 生成含8個章節的Word報告
使用者輸入:上傳各城市經濟資料Excel(30個城市,8個經濟指標),要求"對這些城市的經濟發展水平進行綜合評價"
執行流程: 1. 讀取資料,識別8個定量指標 2. 向用戶確認:推薦熵權法+TOPSIS綜合評價流程 3. 資料標準化(極差標準化) 4. 熵權法計算各指標權重 5. TOPSIS計算各城市與正/負理想解距離及相對接近度 6. 排序並分級(前30%為優,中間40%為中,後30%為差) 7. 生成含排名表、雷達圖、柱狀圖的Word報告
run_analysis.py — 資料分析執行指令碼,包含常用統計方法的封裝函式,直接執行無需載入到上下文。
statistical-methods.md — 統計分析方法完整參考手冊(14大模組200+方法詳表),當需要選擇分析方法、判斷方法適用性或確認資料格式要求時,讀取此檔案。
本技能不使用assets目錄。
這是一個專業的資料統計分析工具,功能覆蓋全面,從描述性統計到複雜的問卷研究和機器學習都能支援。文件清晰易懂,工作流程明確,報告格式規範。指令碼程式碼質量較高,統計分析結果解讀標準統一。美中不足的是,部分高階功能的自動化程度還有提升空間,新手首次使用可能需要一定時間熟悉流程。總體而言,這是一個實用性較強的統計分析 Skill。