data-analysis-sql

👤 whiskeyforsun 📦 v1.0.4 ⭐ 4.6 ⬇️ 830 下載
📊 資料分析 免費

📖 技能介紹


name: data-analysis-sql description: "大數據開發工程師級資料分析與SQL技能。(1)多資料引擎SQL編寫(Hive/SparkSQL/Presto/ClickHouse/Doris/MySQL/PG/BigQuery)。(2)複雜SQL改造除錯與效能最佳化。(3)數倉建模(ODS/DWD/DWS/ADS)維度設計/SCD變更。(4)資料探查/指標設計/ETL管線編排。(5)資料質量檢測與異常分析。(6)SQL改寫(方言遷移/語法適配)。(7)UDF/UDTF開發規範。(8)表結構文件自動生成與遷移支援。(9)知識庫目錄生成與維護(schema/metrics/relations/enums)。觸發:寫SQL/改SQL/數倉建模/ETL/SQL最佳化/資料質量/指標設計/整理文件/生成md/遷移文件/知識庫"


data-analysis-sql

大數據開發工程師技能,專注於資料分析、SQL 開發、數倉建模和知識庫維護。


核心工作流

寫 SQL

  1. 澄清需求 — 確認指標定義、資料來源、時間口徑、排除邏輯、輸出格式
  2. 確認資料來源 — 參考 references/multi-engine.md 選擇目標引擎,參考 references/schema-guide.md 理解表結構
  3. 分層設計 — 判斷放在哪層(ODS/DWD/DWS/ADS),避免跨層直接查詢
  4. 編寫 SQL — 按 references/sql-guide.md 規範編寫,優先用 CTE
  5. 安全檢查 — 按 references/join-rules.md 逐項過檢查清單(tenantkey / del_flag / 防零 / 型別相容)
  6. 效能評估 — 檢查資料傾斜、JOIN 爆炸因子、全表掃描風險
  7. 驗證口徑 — 與現有報表或指標交叉驗證

改 SQL

  1. 理解原 SQL 意圖(畫出資料流:讀哪張表 → 做什麼計算 → 輸出什麼)
  2. 找到需修改的部分(口徑?欄位?條件?邏輯?)
  3. 改完整體走查:JOIN 方向、NULL 處理、分母防零、邊界日期
  4. 對比舊 SQL 與新 SQL 輸出差異(樣本資料驗證)

數倉建模

參考 references/schema-guide.md: - 確定主題域 → 選擇事實表/維度表型別 → 設計拉鏈/快照/累計表 - 維度退化、緩慢變化維(SCD)處理 - 命名規範、分層規範

ETL 管線

參考 references/pipeline-patterns.md: - 全量/增量/CDC 策略選擇 - 任務依賴編排、故障恢復 - 資料回溯與重刷機制

資料質量

參考 references/data-quality.md: - 空值率、重複率、波動檢測 - 端到端資料探查流程 - 異常資料識別與處理

業務指標設計

參考 references/business-metrics.md: - 指標設計標準流程(7問) - 交付準時率、Flow Time、需求缺陷密度、用例通過率完整 SQL 模板 - 按租戶/專案維度的統一擴充套件模式 - 指標公式模板

SQL 踩坑修復

發現更多技能外掛,請訪問7w4.net。

參考 references/sql-pitfalls.md: - 時間欄位毫秒時間戳處理 - 關聯表無 tenantkey 的處理 - PostgreSQL ROW_NUMBER 替代 Oracle KEEP - CTE 別名與列別名衝突解決 - del_flag 過濾遺漏檢查 - 防踩坑檢查清單

知識庫目錄生成與維護

參考 references/knowledge-base.md: - 按領域劃分目錄結構(schema / metrics / relations / enums) - 從 xlsx 批次解析表結構、指標 SQL、列舉值,生成 Markdown 文件 - 從 SQL 自動提取表關聯關係,生成 relations.md - README 總索引自動維護

文件自動生成與遷移

參考 references/doc-guide.md: - 互動式生成表結構 Markdown 文件 - 從使用者輸入的表結構文本自動解析並生成文件 - SQL 摘要提取(資料來源、CTE、過濾條件、輸出欄位) - 完整遷移文件打包生成(表結構 + SQL 清單) - 觸發詞:整理文件、生成 md、遷移文件、沉澱一下


工具指令碼

指令碼 用途
scripts/sql_formatter.py SQL 格式化,統一風格
scripts/sql_diff.py 兩段 SQL 邏輯對比,輸出差異摘要
scripts/doc_generator.py 表結構文件自動生成,支援互動式/API呼叫

多引擎參考

引擎 適用場景 參考
Hive / SparkSQL 離線大寬表、數倉批處理 references/multi-engine.md
Presto / Trino 跨源聯邦查詢、Ad-hoc 分析 references/multi-engine.md
ClickHouse 高併發即時 OLAP,近即時寫入 references/multi-engine.md
Doris / StarRocks 高併發多表 JOIN 的 OLAP references/multi-engine.md
MySQL / PostgreSQL OLTP 業務庫、中等規模分析 references/sql-guide.md
BigQuery 雲原生大表、Serverless SQL references/multi-engine.md

References 索引

檔案 內容
references/sql-guide.md SQL 編寫規範(CTE/命名/註釋/格式)
references/join-rules.md 關聯規則(tenantkey/del_flag/自定義欄位/防零/ROW_NUMBER)
references/sql-pitfalls.md 8類踩坑記錄 + 防踩坑檢查清單
references/business-metrics.md 業務指標設計模板與完整 SQL
references/schema-guide.md 數倉建模規範(ODS/DWD/DWS/ADS)
references/multi-engine.md 多引擎方言差異與適配
references/pipeline-patterns.md ETL 管線編排模式
references/data-quality.md 資料質量檢測規範
references/data-analysis-patterns.md 資料分析常用模式
references/knowledge-base.md 知識庫目錄生成與維護規範
references/doc-guide.md 文件自動生成與遷移指南

🤖 AI 評測

這是一個很專業的大數據開發技能包,質量穩定可靠。優點是覆蓋全面,從寫 SQL、改 SQL 到數倉建模、指標設計都有指導,還自帶實用工具幫你自動生成文件。內容很接地氣,收集了很多真實踩坑案例。不足之處是部分文件篇幅較長,查詢起來不夠方便;另外有些高階功能(如自動解析表格生成文件)的使用說明還不夠詳細,新手可能需要多摸索一下。總體來說,資料分析相關的需求基本都能cover,值得使用。

📊 多維度評分

適應性4.4
規範性4.7
有效性4.6
可靠性4.2
可信度5

📁 包含檔案 (17 個)

📄 README.md 9.9 KB
📄 SKILL.md 5.2 KB
📄 _meta.json 136 B
📄 references/business-metrics.md 12.7 KB
📄 references/data-analysis-patterns.md 11.2 KB
📄 references/data-quality.md 6 KB
📄 references/doc-guide.md 3.8 KB
📄 references/join-rules.md 5 KB
📄 references/knowledge-base.md 6.3 KB
📄 references/multi-engine.md 9.6 KB
📄 references/pipeline-patterns.md 6.6 KB
📄 references/schema-guide.md 9.8 KB
📄 references/sql-guide.md 7.8 KB
📄 references/sql-pitfalls.md 6.2 KB
📄 scripts/doc_generator.py 9.5 KB
📄 scripts/sql_diff.py 7.4 KB
📄 scripts/sql_formatter.py 1.7 KB