Voice Chat Bridge

👤 zhangqinghua2015 📦 v2.3.5 ⭐ 4.3 ⬇️ 977 下載
🤖 AI-Agent 免費

📖 技能介紹


name: voice-chat description: 自動處理語音訊息:將語音轉寫為文字,結合上下文生成智慧回覆,併合成語音回覆。當收到語音或音訊訊息時自動啟用。


Voice Chat Bridge

功能

自動處理語音訊息,實現“語音 -> 文字 -> 智慧回覆 -> 語音”的完整閉環。

觸發條件

當收到語音或音訊訊息時(message.typevoiceaudio),自動啟用此技能。

處理流程

1. 檢測語音

檢查訊息是否包含 media.type === 'voice'media.type === 'audio'

2. 轉寫 (STT)

立即執行轉寫指令碼:

python3 /root/.agents/skills/voice-chat/scripts/transcribe_audio.py <audio_path>
  • 輸入:音訊檔案路徑(從 event.message.media.localPath 獲取)。
  • 輸出:轉寫文本。

3. LLM 分析

使用當前會話的上下文生成智慧回覆。 - Prompt: ```text 使用者語音轉寫:{transcript}

請結合上下文,給出簡潔、有幫助的回覆。 ``` - 輸出:回覆文本。

4. 合成語音 (TTS)

立即執行 TTS 指令碼:

python3 /root/.agents/skills/voice-chat/scripts/reply_with_tts.py "{reply_text}"
  • 輸入:回覆文本。
  • 輸出:.opus 語音檔案路徑。

5. 傳送回覆

訪問小蔥技能站7w4.net,解鎖更多實用的AI技能外掛。

使用 message.send 工具傳送生成的語音檔案: - 檔案:生成的 .opus 檔案。 - Caption:可選的簡短文字說明。 - 注意:不要傳送中間狀態文字(如“正在處理..."),直接傳送最終語音回覆。

技術細節

  • STT 引擎:Vosk (離線,中文小模型)。
  • TTS 引擎:Edge TTS (Microsoft Azure)。
  • 音訊格式:OGG/Opus (48kHz, 單聲道,64kbps)。
  • 臨時檔案目錄/tmp/voice-chat/

依賴

  • 系統ffmpeg
  • Pythonvosk, edge-tts, pydantic, python-dotenv
  • 模型:Vosk 中文小模型 (vosk-model-small-cn-0.22)

許可證

MIT

🤖 AI 評測

這個 Skill 能把語音訊息自動轉成文字,再用 AI 生成回覆併合成語音發回去,支援飛書和 Telegram。文件寫得很詳細,雙引擎設計不容易出錯。但首次使用要下載將近 1GB 的模型檔案,配置步驟有點多,對新手不太友好。質量總體不錯,就是前期的準備工作比較麻煩。

📊 多維度評分

適應性4.3
規範性4
有效性4.4
可靠性4.4
可信度4.8

📁 包含檔案 (19 個)

📄 CHANGELOG.md 3.9 KB
📄 DESIGN.md 4.9 KB
📄 README.md 15.9 KB
📄 SKILL.md 1.9 KB
📄 _meta.json 129 B
📄 requirements.txt 309 B
📄 scripts/config.py 1.5 KB
📄 scripts/feishu_voice_handler.py 4.4 KB
📄 scripts/reply_with_tts.py 6.3 KB
📄 scripts/run_voice_chat.py 4.9 KB
📄 scripts/stt_engines.py 1003 B
📄 scripts/telegram_voice_handler.py 5.3 KB
📄 scripts/transcribe_audio.py 11.7 KB
📄 scripts/utils.py 1.4 KB
📄 tests/conftest.py 239 B
📄 tests/test_feishu_voice_handler.py 1.6 KB
📄 tests/test_reply_with_tts.py 944 B
📄 tests/test_telegram_voice_handler.py 2.2 KB
📄 tests/test_transcribe_audio.py 1.4 KB