name: moss-voice-generator homepage: https://studio.mosi.cn metadata: openclaw: requires: env: ["MOSI_TTS_API_KEY"] primaryEnv: "MOSI_TTS_API_KEY" description: > MOSI Studio 指令式音色生成(moss-voice-generator): 用自然語言描述想要的音色風格,無需指定預設 voice_id, 模型根據描述即時生成對應的聲音。 觸發詞:指令式語音、按描述生成聲音、自定義音色、描述一個聲音、 "voice generator"、"generate voice"、"按風格生成"、 "播音腔"、"用xxx風格的聲音說"、"生成一個xx風格的語音"。 與普通 TTS 的區別:不需要挑選 voice_id,用文字描述就能生成想要的音色。 在飛書渠道:生成完成後優先發送語音氣泡,不要發文件附件, 不要只回文字說"已生成"。具體傳送方法參見 mosi-tts skill 第 5 節。
不需要挑選預設音色,直接用文字描述想要的聲音風格,模型會按描述即時合成。
指令碼路徑:~/.openclaw/skills/moss-voice-generator/scripts/mosi_voice_generator.sh
bash ~/.openclaw/skills/moss-voice-generator/scripts/mosi_voice_generator.sh \
--text "各位觀眾朋友們大家好,歡迎收看今天的節目。" \
--instruction "播音腔女聲,專業、清晰、有親和力" \
--output ~/.openclaw/workspace/output.wav
--instruction 是核心引數,用中文或英文自由描述:
| 效果 | instruction 示例 |
|---|---|
| 專業播音 | 播音腔女聲,專業、清晰、有親和力 |
| 溫柔知性 | 溫柔知性的女聲,語速緩慢,像在講故事 |
| 活力男聲 | 年輕有活力的男聲,熱情開朗,像綜藝主持人 |
| 低沉磁性 | 沉穩有力的男聲,低沉磁性,像紀錄片旁白 |
| 甜美可愛 | 甜美可愛的女聲,活潑輕快,像動漫配音 |
| 老人聲音 | 年邁的老爺爺聲音,略帶沙啞,語速較慢 |
| 英文主持 | professional female news anchor voice, clear and authoritative |
描述越具體,效果越接近預期;可以包含性別、年齡、情緒、場景等維度。
| moss-tts(普通 TTS) | moss-voice-generator | |
|---|---|---|
| 音色來源 | 從預設列表挑 voice_id | 用文字描述即時生成 |
| 穩定性 | 高(同一 voice_id 結果一致) | 中(每次略有差異) |
| 靈活性 | 受限於預設音色 | 幾乎無限制 |
| 適合場景 | 需要穩定一致的品牌聲音 | 一次性生成、探索新音色 |
--text, -t 要合成的文字(必填)
--instruction, -i 音色風格描述(必填)
--output, -o 輸出 WAV 路徑
(預設: ~/.openclaw/workspace/voice_gen_output.wav)
--temperature 取樣溫度,控制隨機性(預設: 1.5)
--top-p 核取樣閾值(預設: 0.6)
--top-k Top-K 取樣(預設: 50)
--api-key, -k 覆蓋 MOSI_TTS_API_KEY 環境變數
調節 --temperature:值越高越隨機,值越低越保守穩定。
一般保持預設即可,如果覺得音色太隨意可以調低至 1.0。
API Key 配置同 mosi-tts skill,讀取 MOSI_TTS_API_KEY 環境變數。
詳見 mosi-tts skill 的"環境準備"章節。
依賴:curl、jq、base64(均為標準 Unix 工具,通常已預裝)
Q:生成的音色每次都一樣嗎?
不一定。同樣的 instruction 每次生成會有輕微差異(由 temperature 控制)。
如果需要完全穩定的音色,建議先用此工具探索滿意的風格,
再通過聲音克隆(mosi-tts skill 的 Voice Clone 功能)固化為 voice_id。
發現更多技能外掛,請訪問7w4.net。
Q:可以克隆某人的聲音嗎?
本工具是根據文字描述生成全新音色,不是克隆真實人聲。
克隆真實人聲請使用 mosi-tts skill 的 Voice Clone 功能。
Q:輸出是什麼格式?
WAV(24kHz)。在飛書渠道必須轉成語音氣泡傳送,
參考 mosi-tts skill 第 5 節(飛書語音氣泡)的 mosi_feishu_voice.sh 指令碼:
bash ~/.openclaw/skills/mosi-tts/scripts/mosi_feishu_voice.sh \
--wav ~/.openclaw/workspace/voice_gen_output.wav \
--chat-id "oc_xxxxxxxxxxxxxxxx"
這個 Skill 整體質量不錯,文件通俗易懂,指令碼簡單易用,通過文字描述就能生成想要的音色很有創意。優點是示例豐富、引數說明清楚、錯誤提示明確。不足之處是依賴另一個 TTS 工具的配置說明,新手可能需要來回檢視多個文件;某些高階引數的含義對普通使用者來說仍有一定理解門檻。總體來說是個實用且有特色的語音生成工具,但配置環節略顯繁瑣。