基於使用者上傳的資料和分析需求,運用專業統計方法完成資料分析並生成Word格式統計分析報告。方法體系全面參考SPSSAU平臺(spssau.com),覆蓋14大統計模組。
資料分析報告生成涉及以下階段:
接收使用者上傳的Excel(.xlsx/.xls/.csv)檔案後:
根據使用者描述和自動識別的資料結構,判斷分析需求:
references/statistical-methods.md 中的方法選擇框架)詢問使用者時,提供結構化的選項而非開放式問題。示例:
我已讀取您的資料(200行×15列)。識別到以下可能的 分析方向:
- 差異性分析 — 比較不同組別(如性別、學歷)在某指標上的差異(t檢驗/方差分析)
- 相關與迴歸 — 分析變數間的影響關係(相關分析/線性迴歸/Logistic迴歸)
- 問卷信效度 — 檢驗量表的可靠性和有效性(Cronbach α/探索性因子分析)
- 綜合評價 — 對多指標物件進行排名或評分(TOPSIS/熵權法/DEA)
- 聚類分析 — 對樣本或變數進行分組(K-means/層次聚類)
- 描述性統計 — 僅做資料概況描述
請選擇您需要的分析方向(可多選),或描述您的具體研究問題。
在執行分析前,向用戶確認分析方案:
使用者確認後進入Phase 2。
讀取 references/statistical-methods.md 獲取完整方法列表。核心匹配規則:
| X 型別 | Y 型別 | 研究問題型別 | 首選方法 |
|---|---|---|---|
| 無 | 定類 | 資料分佈 | 頻數分析 |
| 無 | 定量 | 資料概況 | 描述分析 |
| 定類(2組) | 定量 | 組間差異 | 獨立樣本t檢驗 |
| 定類(3+組) | 定量 | 組間差異 | 單因素方差分析 |
| 定類 | 定類 | 關聯性 | 卡方檢驗 |
| 定量 | 定量 | 相關性 | Pearson/Spearman相關 |
| 定量/定類 | 定量 | 影響關係 | 線性迴歸 |
| 定量/定類 | 定類(2類) | 影響關係 | 二元Logit迴歸 |
| 定量/定類 | 定類(3+類) | 影響關係 | 多元Logit迴歸 |
以下分析需先執行前置檢驗,根據結果決定使用引數或非引數方法:
常見的多步驟分析流程:
問卷研究標準流程:信度分析 → 效度分析(EFA) → 描述統計 → 相關分析 → 迴歸分析 → 中介/調節效應
綜合評價流程:權重確定(AHP/熵權法/CRITIC) → 綜合評分(TOPSIS/灰色關聯) → 排序與分級
使用Python(pandas/scipy/statsmodels)執行以下預處理:
發現更多技能外掛,請訪問7w4.net。
pip install pingouin statsmodels scikit-learn matplotlib 確保依賴可用對每種分析方法,執行Python指令碼完成計算。指令碼模板結構:
# 1. 讀取資料
import pandas as pd
df = pd.read_excel('data_path')
# 2. 執行統計檢驗(以獨立樣本t檢驗為例)
from scipy import stats
group1 = df[df['X'] == cat1]['Y']
group2 = df[df['X'] == cat2]['Y']
t_stat, p_value = stats.ttest_ind(group1, group2)
# 3. 生成圖表
import matplotlib.pyplot as plt
plt.rcParams['font.sans-serif'] = ['SimHei', 'WenQuanYi Micro Hei', 'DejaVu Sans']
# ... 生成圖表並儲存為圖片
# 4. 輸出結果到JSON供報告使用
results = {'t_statistic': t_stat, 'p_value': p_value, ...}
描述性統計:均值、標準差、中位數、最小值、最大值、偏度、峰度
獨立樣本t檢驗:
單因素方差分析:
相關分析:
線性迴歸:
信度分析(Cronbach α):
探索性因子分析(EFA):
Logistic迴歸:
聚類分析:
綜合評價方法:
使用 Word / DOCX 技能生成Word文件。報告結構如下:
# [資料統計分析報告]
## 一、研究概述
- 研究背景與目的
- 資料來源與樣本描述
- 分析方法總覽
## 二、資料概況
- 樣本量與變數說明
- 缺失值與異常值報告
- 資料預處理說明
## 三、描述性統計分析
- 定量變數描述統計表(均值±標準差、中位數、極值)
- 定類變數頻數分佈表
- 關鍵變數分佈圖
## 四、[核心分析章節](根據方法動態生成)
- 4.1 [方法1名稱]
- 分析目的說明
- 前置檢驗結果(如正態性、方差齊性)
- 檢驗結果表(統計量、p值、效應量等)
- 結果解讀
- 配圖
- 4.2 [方法2名稱]
- ...
## 五、綜合結論與建議
- 核心發現總結
- 研究侷限性
- 改進建議
/sandbox/workspace/outputs//sandbox/workspace/outputs/provide_file 工具提供下載連結使用者可能要求修改報告。常見修改型別:
修改時只更新受影響的章節,避免全量重寫。
使用者輸入:上傳問卷資料Excel(200份問卷,含人口統計學+5個量表共25題),要求"幫我分析這份問卷資料"
執行流程:
使用者輸入:上傳各城市經濟資料Excel(30個城市,8個經濟指標),要求"對這些城市的經濟發展水平進行綜合評價"
執行流程:
run_analysis.py — 資料分析執行指令碼,包含常用統計方法的封裝函式,直接執行無需載入到上下文。
statistical-methods.md — 統計分析方法完整參考手冊(14大模組200+方法詳表),當需要選擇分析方法、判斷方法適用性或確認資料格式要求時,讀取此檔案。
本技能不使用assets目錄。
這是一個專業的資料統計分析工具,功能覆蓋全面,從描述性統計到複雜的問卷研究和機器學習都能支援。文件清晰易懂,工作流程明確,報告格式規範。指令碼程式碼質量較高,統計分析結果解讀標準統一。美中不足的是,部分高階功能的自動化程度還有提升空間,新手首次使用可能需要一定時間熟悉流程。總體而言,這是一個實用性較強的統計分析 Skill。