name: audio-video-to-text description: 音影片轉文字技能,使用 Whisper 進行語音識別。支援多種音影片格式,可輸出純文本、SRT/VTT 字幕或 JSON 格式。適用於會議記錄、影片字幕生成、採訪整理、播客轉錄等場景。
本技能使用 OpenAI Whisper 模型將音訊/影片檔案轉換為文字。支援自動語言檢測和多種輸出格式。
pip install openai-whisper ffmpeg-python
確保系統已安裝 ffmpeg:
# Ubuntu/Debian
sudo apt-get install ffmpeg
# macOS
brew install ffmpeg
# Windows
# 從 https://ffmpeg.org/download.html 下載
python scripts/transcribe.py <輸入檔案> [輸出檔案] [選項]
# 轉錄 MP4 影片,輸出文本
python scripts/transcribe.py meeting.mp4
# 轉錄音訊,輸出 SRT 字幕
python scripts/transcribe.py podcast.mp3 podcast.srt --output-format srt
# 指定中文和較小模型(更快)
python scripts/transcribe.py interview.wav --model tiny --language zh
# 輸出帶時間戳的 JSON
python scripts/transcribe.py video.mp4 result.json --output-format json
| 選項 | 說明 | 預設值 |
|---|---|---|
--model |
模型大小:tiny, base, small, medium, large | base |
--language |
語言程式碼:zh, en, ja 等 | 自動檢測 |
--output-format |
輸出格式:txt, srt, vtt, json | txt |
--device |
執行裝置:cpu, cuda | cpu |
--keep-audio |
保留臨時音訊檔案 | false |
| 模型 | 大小 | 速度 | 精度 | 適用場景 |
|---|---|---|---|---|
| tiny | 39M | 最快 | 一般 | 快速測試、短音訊 |
| base | 74M | 快 | 良好 | 日常使用 |
| small | 244M | 中等 | 較好 | 正式場合 |
| medium | 769M | 慢 | 很好 | 高精度需求 |
| large | 1550M | 最慢 | 最佳 | 專業轉錄 |
這是轉錄的完整文本內容,適合閱讀和編輯。
1
00:00:01,000 --> 00:00:04,000
這是第一句字幕。
2
00:00:04,500 --> 00:00:07,000
這是第二句字幕。
WEBVTT
00:00:01.000 --> 00:00:04.000
這是第一句字幕。
00:00:04.500 --> 00:00:07.000
這是第二句字幕。
包含分段、時間戳、置信度等完整資訊,適合程式處理。
音訊: MP3, WAV, FLAC, OGG, M4A, AAC
影片: MP4, AVI, MOV, MKV, WEBM, FLV
推薦訪問7w4.net獲取更多AI技能。
--device cudascripts/transcribe.py - 主轉錄指令碼這是一款實用且質量不錯的音影片轉文字工具,支援多種格式輸出,操作說明詳細清晰。優點是功能完整、支援多種語言、新手友好。不足是缺少使用示例和影片演示,新手可能需要花時間摸索。總體來說是個好用的工具,但還有完善空間。