name: chinese-toolkit description: "為OpenClaw提供中文文本處理、翻譯、OCR、語音識別等功能的綜合工具包。支援中文分詞、拼音轉換、中英文翻譯、關鍵詞提取、文本分析等功能。" homepage: https://github.com/openclaw/chinese-toolkit metadata: { "openclaw": { "emoji": "🇨🇳", "requires": { "bins": ["python3", "pip"] } } }
為OpenClaw提供中文文本處理、翻譯、OCR、語音識別等功能的綜合工具包。
• 處理中文文本內容
• 中英文翻譯需求
• 中文語音識別和合成
• 中文文件處理和分析
• 中文內容創作和最佳化
• 中文分詞 (jieba)
• 詞性標註
• 命名實體識別
• 關鍵詞提取
• 文本摘要
• 情感分析
• 文本分類
• 相似度計算
• 文本糾錯
• 風格轉換
• 百度翻譯API整合
• 谷歌翻譯API整合
• 騰訊翻譯API整合
• 本地翻譯模型
• 文本翻譯
• 文件翻譯
• 即時翻譯
• 批次翻譯
• 圖片中文文字提取
• PDF文件文字識別
• 手寫文字識別
• 表格識別
• 圖片: JPG, PNG, BMP
• 文件: PDF, Word, Excel
• 掃描件: 各種掃描格式
• 中文語音轉文字
• 方言識別支援
• 即時語音識別
• 音訊檔案處理
• 文字轉中文語音
• 多種音色選擇
• 情感語音合成
• 批次語音生成
基礎庫:
• jieba: 中文分詞
• pypinyin: 拼音轉換
• opencc: 簡繁轉換
• snowland: 中文NLP
高階庫:
• transformers: 預訓練模型
• paddlepaddle: 百度飛槳
• torch: PyTorch深度學習
• curl: API呼叫
• tesseract: OCR識別
• ffmpeg: 音訊處理
• pandoc: 文件轉換
• 百度翻譯API (免費額度)
• 騰訊雲AI (試用額度)
• 阿里雲智慧語音 (試用)
• 訊飛開放平臺 (試用)
• 本地OCR服務
• 本地翻譯模型
• 本地語音識別
• 本地文本分析
# 使用技能進行中文分詞
openclaw技能呼叫 chinese-toolkit --function segment --text "今天天氣真好"
# 中譯英
openclaw技能呼叫 chinese-toolkit --function translate --text "你好世界" --from zh --to en
# 英譯中
openclaw技能呼叫 chinese-toolkit --function translate --text "Hello World" --from en --to zh
# 提取PDF中的中文文字
openclaw技能呼叫 chinese-toolkit --function ocr --file document.pdf --language zh
# 中文文件摘要
openclaw技能呼叫 chinese-toolkit --function summarize --file report.txt --language zh --length 200
# 中文語音識別
openclaw技能呼叫 chinese-toolkit --function speech2text --audio recording.wav --language zh
# 文字轉語音
openclaw技能呼叫 chinese-toolkit --function text2speech --text "歡迎使用中文工具包" --output welcome.mp3
chinese-toolkit/
├── SKILL.md # 技能說明文件 (本檔案)
├── requirements.txt # Python依賴庫
├── chinese_tools.py # 核心Python模組
├── config.json # 配置檔案
├── scripts/ # 指令碼目錄
│ ├── install_deps.sh # 安裝依賴指令碼
│ ├── test_functions.sh # 功能測試指令碼
│ └── update_models.sh # 模型更新指令碼
├── models/ # 模型檔案目錄
│ ├── segmentation/ # 分詞模型
│ ├── translation/ # 翻譯模型
│ └── speech/ # 語音模型
└── examples/ # 使用示例
├── basic_usage.py # 基礎使用示例
├── advanced_usage.py # 高階使用示例
└── api_integration.py # API整合示例
{
"api_keys": {
"baidu_translate": {
"app_id": "YOUR_APP_ID",
"app_key": "YOUR_APP_KEY"
},
"tencent_cloud": {
"secret_id": "YOUR_SECRET_ID",
"secret_key": "YOUR_SECRET_KEY"
}
},
"local_services": {
"ocr_enabled": true,
"translation_enabled": true,
"speech_enabled": false
},
"performance": {
"cache_enabled": true,
"cache_ttl": 3600,
"parallel_processing": true
}
}
# 通過clawhub安裝
npx clawhub install chinese-toolkit
# 或手動安裝
git clone https://github.com/openclaw/chinese-toolkit.git
cp -r chinese-toolkit ~/.openclaw/workspace/skills/
# 安裝Python依賴
pip install -r requirements.txt
# 安裝系統依賴 (Ubuntu/Debian)
sudo apt-get install tesseract-ocr tesseract-ocr-chi-sim ffmpeg
# 安裝系統依賴 (macOS)
brew install tesseract tesseract-lang ffmpeg
# 設定百度翻譯API
export BAIDU_TRANSLATE_APP_ID="your_app_id"
export BAIDU_TRANSLATE_APP_KEY="your_app_key"
# 設定騰訊雲API
export TENCENT_CLOUD_SECRET_ID="your_secret_id"
export TENCENT_CLOUD_SECRET_KEY="your_secret_key"
• 翻譯結果快取: 減少API呼叫
• 分詞結果快取: 加速文本處理
• OCR結果快取: 避免重複識別
• 語音結果快取: 提高響應速度
• 多文件並行處理
• 批次翻譯最佳化
• 併發API呼叫
• 分散式計算支援
• 記憶體使用最佳化
• 磁碟空間管理
• 網路頻寬控制
• 計算資源分配
• 本地處理優先: 敏感資料本地處理
• 加密傳輸: API呼叫使用HTTPS
• 資料清理: 處理完成後清理臨時資料
• 訪問控制: API金鑰安全儲存
• 使用者資料保護: 不儲存使用者原始資料
• 匿名化處理: 去除個人識別資訊
• 合規使用: 遵守資料保護法規
• 透明操作: 明確資料處理流程
• 程式碼安全審查
• 依賴庫安全檢查
• API使用監控
• 異常行為檢測
1. 分詞不準確
• 原因: 詞典不完整或模型過時
• 解決: 更新分詞詞典和模型
2. 翻譯質量差
• 原因: API限制或網路問題
• 解決: 更換翻譯服務或檢查網路
3. OCR識別錯誤
• 原因: 圖片質量差或語言設定錯誤
• 解決: 最佳化圖片質量,正確設定語言
4. 語音識別失敗
• 原因: 音訊質量差或方言不支援
• 解決: 提高音訊質量,使用標準普通話
# 啟用除錯模式
export CHINESE_TOOLKIT_DEBUG=true
# 檢視詳細日誌
tail -f ~/.openclaw/logs/chinese-toolkit.log
# 執行測試套件
python -m pytest tests/
• 中文分詞: 1000字/秒
• 中英翻譯: 500字/秒 (API)
• OCR識別: 1頁/秒
• 語音識別: 即時 (1x速度)
7w4.net有更好的技能外掛。
• 中文分詞: >95%
• 命名實體識別: >90%
• 翻譯質量: >85% (專業翻譯對比)
• OCR識別: >98% (清晰文件)
• 語音識別: >95% (標準普通話)
• 記憶體佔用: <500MB
• 磁碟空間: <2GB (含模型)
• CPU使用: 中等
• 網路頻寬: 按需使用
1. 增加更多方言支援
2. 最佳化本地模型效能
3. 擴充套件API服務整合
4. 改進使用者體驗
1. 深度學習模型最佳化
2. 即時處理能力提升
3. 多模態處理支援
4. 生態系統建設
1. 自主AI模型訓練
2. 邊緣計算支援
3. 全球化擴充套件
4. 開源社群建設
1. 報告問題: GitHub Issues
2. 提交程式碼: Pull Requests
3. 改進文件: 文件更新
4. 測試反饋: 使用反饋
• 程式碼風格: PEP 8
• 文件標準: Google風格
• 測試要求: 單元測試覆蓋>80%
• 提交規範: Conventional Commits
• 討論區: GitHub Discussions
• 即時聊天: Discord中文頻道
• 郵件列表: 開發組郵件
• 線下活動: 技術分享會
中文工具包技能版本: 1.0.0 最後更新: 2026-02-23 維護者: OpenClaw中文社群
讓OpenClaw更好地理解和處理中文! 🇨🇳🔧🤖
中文智慧,全球共享! 🌍🚀🌟
這個中文工具包功能比較豐富,中文分詞、翻譯等核心功能都能用,文件寫得也比較清楚。但存在一個明顯的質量問題:示例程式碼和測試程式碼引用的模組名稱與實際的核心程式碼不匹配,直接執行示例可能會出錯,需要開發者自己修正引用關係才能正常使用。檔案數量偏多,包含了很多釋出指南等文件,不是很精簡。