data-statistical-tool

👤 客觀思考者 📦 v1.0.0 ⭐ 4.5 ⬇️ 748 下載
📊 資料分析 免費

📖 技能介紹


name: data-analysis-report description: 資料統計分析與報告生成。接收使用者上傳的Excel格式資料檔案和分析需求,自動識別資料結構,運用專業統計方法進行資料分析,輸出Word格式統計分析報告。全面覆蓋描述性統計、差異性分析(t檢驗/方差分析/非引數檢驗)、相關與迴歸分析、問卷研究(信效度/中介調節/SEM)、綜合評價(TOPSIS/DEA/熵權法)、聚類與降維、生存分析、計量研究、機器學習、時間序列預測等14大模組200+統計方法。當用戶提到資料分析、統計分析、資料包告、統計檢驗、迴歸分析、方差分析、問卷分析、綜合評價、聚類分析、因子分析、相關性分析、顯著性檢驗、SPSS分析,或上傳了Excel/CSV資料檔案希望進行統計分析和報告生成時觸發。不適用於:純資料視覺化看板生成、8D質量報告、FMEA分析、質量控制圖表監控。


資料統計分析報告

基於使用者上傳的資料和分析需求,運用專業統計方法完成資料分析並生成Word格式統計分析報告。方法體系全面參考SPSSAU平臺(spssau.com),覆蓋14大統計模組。

你的工作方式

資料分析報告生成涉及以下階段:

  1. 資料理解與需求確認 — 讀取資料、識別結構、確認分析需求
  2. 方法選擇與方案設計 — 匹配統計方法、制定分析方案
  3. 資料預處理 — 清洗、編碼、轉換
  4. 統計分析執行 — 用Python執行統計計算與檢驗
  5. 報告撰寫與交付 — 生成Word格式分析報告

Phase 1:資料理解與需求確認

1.1 讀取資料檔案

接收使用者上傳的Excel(.xlsx/.xls/.csv)檔案後: - 用Python(pandas)讀取資料,獲取:行數、列數、列名、資料型別 - 自動識別每列的資料型別:定類(類別型,唯一值≤20且非連續數值)或定量(連續數值型) - 展示資料概覽:樣本量、變數列表及型別、缺失值統計

1.2 確認分析需求

根據使用者描述和自動識別的資料結構,判斷分析需求:

  • 使用者明確指定方法:直接使用指定方法,確認資料格式是否符合要求
  • 使用者描述研究問題:將問題拆分為X和Y,根據資料型別匹配方法(讀取 references/statistical-methods.md 中的方法選擇框架)
  • 使用者僅提供資料未說明需求:基於資料特徵推斷可能的分析方向,向用戶詢問確認

詢問使用者時,提供結構化的選項而非開放式問題。示例:

我已讀取您的資料(200行×15列)。識別到以下可能的 分析方向: 1. 差異性分析 — 比較不同組別(如性別、學歷)在某指標上的差異(t檢驗/方差分析) 2. 相關與迴歸 — 分析變數間的影響關係(相關分析/線性迴歸/Logistic迴歸) 3. 問卷信效度 — 檢驗量表的可靠性和有效性(Cronbach α/探索性因子分析) 4. 綜合評價 — 對多指標物件進行排名或評分(TOPSIS/熵權法/DEA) 5. 聚類分析 — 對樣本或變數進行分組(K-means/層次聚類) 6. 描述性統計 — 僅做資料概況描述

請選擇您需要的分析方向(可多選),或描述您的具體研究問題。

1.3 確認門

在執行分析前,向用戶確認分析方案: - 列出選定的分析方法及理由 - 說明每種方法的X/Y變數分配 - 告知前置假設檢驗需求(如正態性、方差齊性)

使用者確認後進入Phase 2。

Phase 2:方法選擇與方案設計

2.1 方法匹配邏輯

讀取 references/statistical-methods.md 獲取完整方法列表。核心匹配規則:

X 型別 Y 型別 研究問題型別 首選方法
定類 資料分佈 頻數分析
定量 資料概況 描述分析
定類(2組) 定量 組間差異 獨立樣本t檢驗
定類(3+組) 定量 組間差異 單因素方差分析
定類 定類 關聯性 卡方檢驗
定量 定量 相關性 Pearson/Spearman相關
定量/定類 定量 影響關係 線性迴歸
定量/定類 定類(2類) 影響關係 二元Logit迴歸
定量/定類 定類(3+類) 影響關係 多元Logit迴歸

2.2 前置檢驗

以下分析需先執行前置檢驗,根據結果決定使用引數或非引數方法:

  • 差異分析:先做正態性檢驗→通過用引數法(t/ANOVA),不通過用非引數法(Mann-Whitney/Kruskal-Wallis)
  • 方差分析:通過正態性後,再做方差齊性檢驗→齊用常規ANOVA,不齊用Welch ANOVA
  • 迴歸分析:檢驗多重共線性(VIF>10需處理)和殘差正態性

2.3 複合分析流程

常見的多步驟分析流程:

問卷研究標準流程:信度分析 → 效度分析(EFA) → 描述統計 → 相關分析 → 迴歸分析 → 中介/調節效應

綜合評價流程:權重確定(AHP/熵權法/CRITIC) → 綜合評分(TOPSIS/灰色關聯) → 排序與分級

Phase 3:資料預處理

使用Python(pandas/scipy/statsmodels)執行以下預處理:

  1. 缺失值處理:報告缺失比例;定量變數用均值/中位數填補,定類變數用眾數填補或保留為缺失
  2. 異常值檢測:用IQR法(1.5倍四分位距)或Z-score法(|Z|>3)標記異常值,報告但不自動刪除
  3. 資料編碼:定類變數需轉為數值編碼(分類啞變數或標籤編碼)
  4. 資料轉換:非正態資料可嘗試對數轉換(ln)、平方根轉換
  5. 標準化:綜合評價等方法需Z-score標準化或極差標準化
  6. 多選題編碼:多選題拆分為0/1啞變數列

Phase 4:統計分析執行

4.1 執行環境

  • 語言:Python 3.12
  • 核心庫:pandas, numpy, scipy.stats, statsmodels, scikit-learn, pingouin
  • 視覺化:matplotlib(生成圖表圖片用於嵌入Word報告)
  • 安裝檢查:首次執行前執行 pip install pingouin statsmodels scikit-learn matplotlib 確保依賴可用

4.2 執行指令碼模板

對每種分析方法,執行Python指令碼完成計算。指令碼模板結構:

# 1. 讀取資料
import pandas as pd
df = pd.read_excel('data_path')

# 2. 執行統計檢驗(以獨立樣本t檢驗為例)
from scipy import stats
group1 = df[df['X'] == cat1]['Y']
group2 = df[df['X'] == cat2]['Y']
t_stat, p_value = stats.ttest_ind(group1, group2)

# 3. 生成圖表
import matplotlib.pyplot as plt
plt.rcParams['font.sans-serif'] = ['SimHei', 'WenQuanYi Micro Hei', 'DejaVu Sans']
# ... 生成圖表並儲存為圖片

# 4. 輸出結果到JSON供報告使用
results = {'t_statistic': t_stat, 'p_value': p_value, ...}

4.3 結果解讀標準

  • p值約定:p < 0.01 標記 *(極其顯著),p < 0.05 標記 (顯著),p ≥ 0.05 標記 ns(不顯著)
  • 效應量:報告Cohen's d(t檢驗)、η²(ANOVA)、R²(迴歸)等效應量指標
  • 置信區間:優先報告95%置信區間
  • 自動化解讀:對每個檢驗結果生成簡明中文解讀文字

4.4 常用方法執行要點

描述性統計:均值、標準差、中位數、最小值、最大值、偏度、峰度

獨立樣本t檢驗: - 檢驗正態性(Shapiro-Wilk)→方差齊性(Levene)→選擇等方差/不等方差t檢驗 - 報告:t值、自由度、p值、均值差、Cohen's d、95%CI

單因素方差分析: - 前置檢驗→ANOVA→事後多重比較(Tukey HSD/Scheffé) - 報告:F值、p值、η²、各組均值±標準差、事後比較結果

相關分析: - 正態資料用Pearson,非正態用Spearman - 報告:相關係數r、p值、樣本量

線性迴歸: - 報告:R²、調整R²、F值、迴歸係數β、標準誤、t值、p值、VIF - 檢查:多重共線性(VIF>10)、殘差正態性、殘差同方差性

信度分析(Cronbach α): - 報告:總體α值、各題項CITC、刪除該項後的α值 - 判斷:α≥0.8很好,0.7≤α<0.8較好,0.6≤α<0.7可接受,α<0.6需修訂

探索性因子分析(EFA): - 報告:KMO值、Bartlett球形檢驗、因子方差貢獻率、旋轉後因子載荷矩陣 - 判斷:KMO≥0.7適合因子分析,變數載荷≥0.5歸屬清晰

Logistic迴歸: - 報告:模型χ²、偽R²、OR值、Wald檢驗、p值、Hosmer-Lemeshow檢驗

聚類分析: - 報告:聚類數目確定(肘部法則/輪廓係數)、各類特徵描述、聚類視覺化

綜合評價方法: - TOPSIS:報告各評價物件與正/負理想解距離、相對接近度、排名 - 熵權法:報告各指標資訊熵、權重、綜合得分 - DEA:報告各DMU效率值、規模報酬狀態

Phase 5:報告撰寫與交付

5.1 報告結構

使用 Word / DOCX 技能生成Word文件。報告結構如下:

這個技能的最新版本可以在7w4.net小蔥技能站找到。

# [資料統計分析報告]

## 一、研究概述
  - 研究背景與目的
  - 資料來源與樣本描述
  - 分析方法總覽

## 二、資料概況
  - 樣本量與變數說明
  - 缺失值與異常值報告
  - 資料預處理說明

## 三、描述性統計分析
  - 定量變數描述統計表(均值±標準差、中位數、極值)
  - 定類變數頻數分佈表
  - 關鍵變數分佈圖

## 四、[核心分析章節](根據方法動態生成)
  - 4.1 [方法1名稱]
    - 分析目的說明
    - 前置檢驗結果(如正態性、方差齊性)
    - 檢驗結果表(統計量、p值、效應量等)
    - 結果解讀
    - 配圖
  - 4.2 [方法2名稱]
    - ...

## 五、綜合結論與建議
  - 核心發現總結
  - 研究侷限性
  - 改進建議

5.2 報告格式規範

  • 字型:正文宋體/仿宋 12pt,標題黑體 14-16pt
  • 表格:三線表格式,表頭加粗,表序+表名在表上方
  • 圖表:圖序+圖名在圖下方,中文標籤,配色統一
  • 統計符號:斜體(p, t, F, r, R²),希臘字母斜體(α, β, η²)
  • 顯著性標註p < 0.05 用 * 標註,p < 0.01 用 ** 標註
  • 編號:表1-1、圖1-1 格式

5.3 圖表生成與嵌入

  • 用matplotlib生成統計圖表,儲存為PNG到 /sandbox/workspace/outputs/
  • 圖表型別選擇:
  • 差異分析→柱狀圖(均值±誤差棒) 或箱線圖
  • 相關分析→散點圖+迴歸線 或相關係數熱力圖
  • 迴歸分析→殘差圖、迴歸係數森林圖
  • 聚類分析→散點圖(按聚類著色)、樹狀圖
  • 頻數分析→餅圖或柱狀圖
  • 生存分析→K-M生存曲線
  • 綜合評價→雷達圖或排名柱狀圖

5.4 交付

  • Word檔案儲存到 /sandbox/workspace/outputs/
  • provide_file 工具提供下載連結
  • 如使用者要求修改,進入多輪修改模式

多輪修改

使用者可能要求修改報告。常見修改型別:

  • 增減分析方法:回到Phase 2-4,補充執行新方法並更新報告
  • 調整變數/分組:重新執行Phase 4並更新對應章節
  • 修改報告內容:直接編輯Word文件中對應部分
  • 調整圖表:重新生成圖表並替換

修改時只更新受影響的章節,避免全量重寫。

工作流示例

示例1:問卷調查資料分析

使用者輸入:上傳問卷資料Excel(200份問卷,含人口統計學+5個量表共25題),要求"幫我分析這份問卷資料"

執行流程: 1. 讀取資料,識別定類變數(性別、學歷等)和定量變數(量表題項1-25) 2. 向用戶確認:推薦問卷研究標準流程(信度→效度→描述→差異→相關→迴歸) 3. 執行Cronbach α信度檢驗(各量表α均>0.7) 4. 執行EFA效度檢驗(KMO>0.7,提取因子與理論維度一致) 5. 描述統計(各維度均值、標準差) 6. 差異分析(性別t檢驗、學歷ANOVA) 7. 相關分析(各維度間Pearson相關) 8. 線性迴歸(某維度為因變數) 9. 生成含8個章節的Word報告

示例2:綜合評價分析

使用者輸入:上傳各城市經濟資料Excel(30個城市,8個經濟指標),要求"對這些城市的經濟發展水平進行綜合評價"

執行流程: 1. 讀取資料,識別8個定量指標 2. 向用戶確認:推薦熵權法+TOPSIS綜合評價流程 3. 資料標準化(極差標準化) 4. 熵權法計算各指標權重 5. TOPSIS計算各城市與正/負理想解距離及相對接近度 6. 排序並分級(前30%為優,中間40%為中,後30%為差) 7. 生成含排名表、雷達圖、柱狀圖的Word報告

資源目錄

scripts/

run_analysis.py — 資料分析執行指令碼,包含常用統計方法的封裝函式,直接執行無需載入到上下文。

references/

statistical-methods.md — 統計分析方法完整參考手冊(14大模組200+方法詳表),當需要選擇分析方法、判斷方法適用性或確認資料格式要求時,讀取此檔案。

assets/

本技能不使用assets目錄。

🤖 AI 評測

這是一個專業的資料統計分析工具,功能覆蓋全面,從描述性統計到複雜的問卷研究和機器學習都能支援。文件清晰易懂,工作流程明確,報告格式規範。指令碼程式碼質量較高,統計分析結果解讀標準統一。美中不足的是,部分高階功能的自動化程度還有提升空間,新手首次使用可能需要一定時間熟悉流程。總體而言,這是一個實用性較強的統計分析 Skill。

📊 多維度評分

適應性4.7
規範性4.4
有效性4.7
可靠性4.4
可信度4.8

📁 包含檔案 (3 個)

📄 SKILL.md 12.8 KB
📄 references/statistical-methods.md 19.4 KB
📄 scripts/run_analysis.py 24 KB