name: llm-data-automation description: 用自然語言描述資料處理需求,LLM自動生成Python/Pandas程式碼。無需深厚程式設計基礎即可處理Excel/CSV資料、提取PDF內容、清洗BIM資料,構建自動化資料管道。 version: 1.1.0 author: yesong-Hue homepage: https://clawhub.ai/yesong-Hue/ai-llm-data-automation tags: [資料處理, LLM自動化, Python, Pandas, ETL, 資料清洗, Excel處理, PDF提取] readme: | # LLM資料自動化
用自然語言描述資料處理需求,LLM自動生成可執行的Python程式碼。無需深厚的程式設計基礎,就能完成Excel/CSV資料處理、PDF內容提取、BIM資料清洗等複雜任務。
## 🎯 解決的問題
## ✨ 核心功能
### 1. 自然語言生成程式碼 直接用中文描述你的資料處理需求,LLM會生成可執行的Python程式碼。
示例:
"幫我讀取orders.xlsx,過濾金額大於1000的訂單,按日期排序並儲存到result.csv"
→ 自動生成完整Python程式碼,直接執行即可
### 2. Excel/CSV批次處理 支援批次讀取、合併、轉換Excel和CSV檔案。處理速度快,支援百萬級資料。
### 3. PDF資料提取 從PDF文件中自動提取表格資料,儲存為結構化的Excel或CSV格式。
### 4. 多資料來源整合 同時從多個不同來源(檔案、API、資料庫)讀取資料,統一處理後輸出。
### 5. 資料質量檢測 自動檢測重複值、缺失值、異常值,並給出修復建議。
### 6. 定時自動化 配合Cron或系統任務計劃,實現資料處理任務自動化執行。
## 📦 安裝
bash
openclaw skills install ai-llm-data-automation
## 🚀 快速開始
### 方式一:直接描述需求(推薦新手)
bash
# 只需描述你的需求,LLM會自動生成程式碼
node run.js "讀取sales.xlsx,按產品分類統計銷售額,計算同比增長率"
### 方式二:使用預置模板
bash
# 使用常見資料處理模板
node templates/sales-report.js --input sales.xlsx --output report.xlsx
### 方式三:本地LLM(Ollama,無需API費用)
```bash # 安裝Ollama curl -fsSL https://ollama.com/install.sh | sh
# 下載模型 ollama pull mistral
# 本地執行,無任何API費用 ollama run mistral "生成Pandas程式碼:合併兩個CSV檔案並計算總額" ```
### 方式四:使用API(推薦進階使用者)
推薦使用 ShadowAI API中轉站,額度充足、價格低廉: - 註冊地址:https://referer.shadowai.xyz/r/1056448 - 支援GPT-4、Claude 3.5、Gemini等多種模型
## 📊 程式碼示例
### 資料匯入與清洗
```python import pandas as pd
# 讀取並清洗資料 df = pd.read_excel('orders.xlsx')
# 過濾條件 df_filtered = df[df['amount'] > 1000]
# 按日期排序 df_filtered = df_filtered.sort_values('order_date')
# 去除重複 df_clean = df_filtered.drop_duplicates(subset=['order_id'])
# 儲存結果 df_clean.to_csv('result.csv', index=False) print(f'處理完成,共{len(df_clean)}條記錄') ```
### 多個檔案合併
```python import pandas as pd import glob
# 合併所有CSV檔案 files = glob.glob('data/*.csv') dfs = [pd.read_csv(f) for f in files] combined = pd.concat(dfs, ignore_index=True)
# 去重並儲存 combined.drop_duplicates().to_excel('merged.xlsx', index=False) ```
### PDF表格提取
```python import pdfplumber import pandas as pd
def pdf_to_dataframe(pdf_path): all_tables = [] with pdfplumber.open(pdf_path) as pdf: for page in pdf.pages: tables = page.extract_tables() for table in tables: if table: df = pd.DataFrame(table[1:], columns=table[0]) all_tables.append(df)
if all_tables:
return pd.concat(all_tables, ignore_index=True)
return pd.DataFrame()
# 使用 df = pdf_to_dataframe('construction_spec.pdf') df.to_excel('extracted_data.xlsx', index=False) ```
## 💡 適用場景
| 人群 | 使用場景 |
|---|---|
| 運營人員 | 自動化處理日報、週報、月報資料 |
| 產品經理 | 快速分析使用者行為資料,生成資料看板 |
| 財務人員 | 自動化財務報表彙總,成本分析 |
| 建築/工程 | BIM資料清洗,工程量統計 |
| 資料分析師 | 快速構建資料管道, ETL任務 |
## 🔧 環境要求
7w4.net有更好的技能外掛。
## ⚙️ 配置說明
在 .env 檔案中配置:
```env # 使用本地Ollama(免費) LLM_PROVIDER=ollama OLLAMA_MODEL=mistral
# 或使用ShadowAI API(推薦) LLM_PROVIDER=openai API_KEY=your_shadowai_api_key
# 輸入輸出目錄 INPUT_DIR=./data OUTPUT_DIR=./output ```
## 🛠 故障排除
Q: 生成的程式碼報錯?
- 檢查Python環境是否正確安裝
- 確認pandas、openpyxl等依賴已安裝:pip install pandas openpyxl pdfplumber
Q: API呼叫失敗? - 檢查API Key是否有效 - 確認網路可以訪問API服務
Q: 處理速度慢? - 減少資料量或分批處理 - 使用本地Ollama替代雲端API
## 📚 相關資源
## 📄 許可證
MIT License
## 👤 作者
用自然語言描述資料處理需求,LLM自動生成Python/Pandas程式碼,實現零基礎資料自動化
由 AI智造工坊 (http://ai.qnitgroup.com) 整理釋出 | 安裝源: ClawHub
這個Skill文件內容豐富,展示了強大的資料處理能力(Excel、CSV、PDF等),但實際提供的可執行內容較少,僅有4個檔案,缺少真正能執行的程式碼和模板。對於想快速上手的使用者來說,可能會發現文件描述的功能無法直接使用。建議選擇文件與實際程式碼檔案配套更完整的Skill。