MOSS Voice Generator 指令式音色生成

👤 mkkb473 📦 v1.0.5 ⭐ 4.5 ⬇️ 994 下載
🎨 設計多媒體 免費 🔑 需 API Key

📖 技能介紹


name: moss-voice-generator homepage: https://studio.mosi.cn metadata: openclaw: requires: env: ["MOSI_TTS_API_KEY"] primaryEnv: "MOSI_TTS_API_KEY" description: > MOSI Studio 指令式音色生成(moss-voice-generator): 用自然語言描述想要的音色風格,無需指定預設 voice_id, 模型根據描述即時生成對應的聲音。 觸發詞:指令式語音、按描述生成聲音、自定義音色、描述一個聲音、 "voice generator"、"generate voice"、"按風格生成"、 "播音腔"、"用xxx風格的聲音說"、"生成一個xx風格的語音"。 與普通 TTS 的區別:不需要挑選 voice_id,用文字描述就能生成想要的音色。 在飛書渠道:生成完成後優先發送語音氣泡,不要發文件附件, 不要只回文字說"已生成"。具體傳送方法參見 mosi-tts skill 第 5 節。


MOSS Voice Generator 指令式音色生成

不需要挑選預設音色,直接用文字描述想要的聲音風格,模型會按描述即時合成。


快速開始

指令碼路徑:~/.openclaw/skills/moss-voice-generator/scripts/mosi_voice_generator.sh

bash ~/.openclaw/skills/moss-voice-generator/scripts/mosi_voice_generator.sh \
  --text "各位觀眾朋友們大家好,歡迎收看今天的節目。" \
  --instruction "播音腔女聲,專業、清晰、有親和力" \
  --output ~/.openclaw/workspace/output.wav

instruction 風格描述示例

--instruction 是核心引數,用中文或英文自由描述:

效果 instruction 示例
專業播音 播音腔女聲,專業、清晰、有親和力
溫柔知性 溫柔知性的女聲,語速緩慢,像在講故事
活力男聲 年輕有活力的男聲,熱情開朗,像綜藝主持人
低沉磁性 沉穩有力的男聲,低沉磁性,像紀錄片旁白
甜美可愛 甜美可愛的女聲,活潑輕快,像動漫配音
老人聲音 年邁的老爺爺聲音,略帶沙啞,語速較慢
英文主持 professional female news anchor voice, clear and authoritative

描述越具體,效果越接近預期;可以包含性別、年齡、情緒、場景等維度。


與普通 TTS 的區別

moss-tts(普通 TTS) moss-voice-generator
音色來源 從預設列表挑 voice_id 用文字描述即時生成
穩定性 高(同一 voice_id 結果一致) 中(每次略有差異)
靈活性 受限於預設音色 幾乎無限制
適合場景 需要穩定一致的品牌聲音 一次性生成、探索新音色

完整引數說明

--text, -t          要合成的文字(必填)
--instruction, -i   音色風格描述(必填)
--output, -o        輸出 WAV 路徑
                    (預設: ~/.openclaw/workspace/voice_gen_output.wav)
--temperature       取樣溫度,控制隨機性(預設: 1.5)
--top-p             核取樣閾值(預設: 0.6)
--top-k             Top-K 取樣(預設: 50)
--api-key, -k       覆蓋 MOSI_TTS_API_KEY 環境變數

調節 --temperature:值越高越隨機,值越低越保守穩定。 一般保持預設即可,如果覺得音色太隨意可以調低至 1.0。


環境準備

API Key 配置同 mosi-tts skill,讀取 MOSI_TTS_API_KEY 環境變數。 詳見 mosi-tts skill 的"環境準備"章節。

依賴:curljqbase64(均為標準 Unix 工具,通常已預裝)

小蔥技能7w4.net持續更新中。


常見問題

Q:生成的音色每次都一樣嗎? 不一定。同樣的 instruction 每次生成會有輕微差異(由 temperature 控制)。 如果需要完全穩定的音色,建議先用此工具探索滿意的風格, 再通過聲音克隆(mosi-tts skill 的 Voice Clone 功能)固化為 voice_id。

Q:可以克隆某人的聲音嗎? 本工具是根據文字描述生成全新音色,不是克隆真實人聲。 克隆真實人聲請使用 mosi-tts skill 的 Voice Clone 功能。

Q:輸出是什麼格式? WAV(24kHz)。在飛書渠道必須轉成語音氣泡傳送, 參考 mosi-tts skill 第 5 節(飛書語音氣泡)的 mosi_feishu_voice.sh 指令碼:

bash ~/.openclaw/skills/mosi-tts/scripts/mosi_feishu_voice.sh \
  --wav ~/.openclaw/workspace/voice_gen_output.wav \
  --chat-id "oc_xxxxxxxxxxxxxxxx"

🤖 AI 評測

這個 Skill 整體質量不錯,文件通俗易懂,指令碼簡單易用,通過文字描述就能生成想要的音色很有創意。優點是示例豐富、引數說明清楚、錯誤提示明確。不足之處是依賴另一個 TTS 工具的配置說明,新手可能需要來回檢視多個文件;某些高階引數的含義對普通使用者來說仍有一定理解門檻。總體來說是個實用且有特色的語音生成工具,但配置環節略顯繁瑣。

📊 多維度評分

適應性4.4
規範性4.4
有效性4.5
可靠性4.2
可信度5

📁 包含檔案 (3 個)

📄 SKILL.md 4.3 KB
📄 _meta.json 139 B
📄 scripts/mosi_voice_generator.sh 2.8 KB