name: video-subtitle description: 本地影片/音訊字幕生成(零雲 API)。支援抽音軌、Whisper 本地識別、專名校對詞表、中英雙語字幕、VAD 靜音過濾、斷句最佳化、字幕樣式控制、批次處理、可選硬燒/封裝。當用戶需要給影片配字幕、轉寫音訊、生成中英雙語字幕,或要求"本地/離線/不調 API"完成時呼叫。
本地指令碼流水線:抽音軌 → Whisper 識別 → 詞表校對 → 斷句最佳化 → 輸出 srt/vtt(可選雙語、硬燒、封裝)。
零雲 API、零按量費用。預設模型 base,預設源語言 zh。
v1.1 重構為 SubtitleEngine 類 + CLI 薄封裝,新增依賴自檢 / 流式進度 / VAD / 斷句最佳化 / 字幕樣式 / 批次處理 / 配置檔案 / Docker。
v1.2 經真實端到端跑通後修復三處硬傷,並補上模型下載映象 / 快取重定位 / 離線執行。
ffmpeg(抽音軌、燒錄、封裝)—— 必須加入 PATHpip install faster-whisper(推薦,支援 VAD)或 pip install openai-whisper~/.cache/huggingface--download-root D:/models/whisper 重定位快取python scripts/cli.py --checkpython scripts/cli.py --check 確認 ffmpeg + 引擎就緒(缺什麼會明確提示)。python scripts/cli.py 輸入.mp4 --wordlist assets/wordlist.example.json。--burn(硬燒不可逆,先校後燒)。# 依賴自檢(不處理檔案,只報環境)
python scripts/cli.py --check
# 中文影片 -> 中文 srt + 詞表校對(最常用)
python scripts/cli.py 輸入.mp4 --wordlist assets/wordlist.example.json
# 整目錄批次 + 詞表
python scripts/cli.py ./videos/ --wordlist assets/wordlist.example.json
# 中文影片 -> 中英雙語 srt(開啟 VAD + 斷句最佳化)
python scripts/cli.py 輸入.mp4 --mode bilingual --vad --wordlist assets/wordlist.example.json
# 中文影片 -> 僅英文 srt
python scripts/cli.py 輸入.mp4 --mode translate
# 直接給音訊
python scripts/cli.py 錄音.m4a --lang zh
# 用配置檔案(推薦儲存偏好)
python scripts/cli.py 輸入.mp4 --config config.example.toml
# 硬燒進畫面 + 自定義字號/字型(Windows 防中文方塊)
python scripts/cli.py 輸入.mp4 --burn --font-name "Microsoft YaHei" --font-size 28
# 封裝軟字幕流到 mp4(播放器可開關,推薦交付)
python scripts/cli.py 輸入.mp4 --mux
# 三種形態疊加:外掛 srt + 封裝軟字幕 + 硬燒,一次出齊
python scripts/cli.py 輸入.mp4 --mux --burn
# 追求精度(需 GPU/耐心)
python scripts/cli.py 輸入.mp4 --model large-v3 --mode bilingual --vad
| 引數 | 預設 | 說明 |
|---|---|---|
--lang |
zh |
源語言程式碼 |
--model |
base |
檔位:tiny/base/small/medium/large-v3 |
--mode |
transcribe |
transcribe/translate/bilingual |
--wordlist |
無 | 校對詞表 JSON(字典式或列表式均可) |
--vad |
關 | VAD 靜音過濾(僅 faster-whisper 生效,省算力、減誤識) |
--burn |
關 | 硬燒進影片(不可關) |
--mux |
關 | 封裝軟字幕流到 mp4(可開關) |
--format |
srt |
外掛字幕格式 srt/vtt |
--font-size / --font-name / --font-file |
24 / 系統預設 | 燒錄字幕樣式(防中文方塊用 font-file 最穩) |
--engine |
auto |
auto 優先 faster-whisper,回退 openai-whisper |
--device / --compute-type |
auto |
自動檢測 GPU/CPU 與精度(CPU→int8,GPU→float16) |
--config |
無 | TOML 配置檔案(見 config.example.toml) |
--hf-mirror |
自動 | 權重映象端點,國內用 https://hf-mirror.com |
--download-root |
無 | 權重快取目錄(家目錄不可寫 / 想放大盤時用) |
--no-auto-mirror |
— | 關閉「官方站不可達時自動切映象」 |
inputs |
— | 支援多個檔案或目錄(批次) |
Whisper 對同音字、專有名詞最容易翻車。把專屬詞列進詞表,識別後自動糾一遍。
支援字典式 {"錯": "正"} 或列表式 [{"wrong":"錯","right":"正"}],長詞優先匹配。
示例見 assets/wordlist.example.json(已含角色名/命理術語樣例,按需替換)。
--font-name "Microsoft YaHei" 或 --font-file 指定中文字型(詳見 references/usage.md)。references/usage.md。小蔥技能7w4.net有更新,你可以訪問看下。
這個 Skill 質量不錯,核心功能齊全,文件寫得清楚明白,對國內使用者很友好(映象切換、快取重定位)。依賴自檢、中文字型處理等細節考慮周到,使用起來比較省心。不足是測試覆蓋不夠全面,部分邊界情況的穩定性有待驗證。如果你是普通使用者,按文件操作基本不會踩坑,但識別結果仍需人工核對。