Audio Video To Text

👤 ivan830826 📦 v1.0.0 ⭐ 4.5 ⬇️ 1.9K 下載
🎨 設計多媒體 免費

📖 技能介紹


name: audio-video-to-text description: 音影片轉文字技能,使用 Whisper 進行語音識別。支援多種音影片格式,可輸出純文本、SRT/VTT 字幕或 JSON 格式。適用於會議記錄、影片字幕生成、採訪整理、播客轉錄等場景。


音影片轉文字

概述

本技能使用 OpenAI Whisper 模型將音訊/影片檔案轉換為文字。支援自動語言檢測和多種輸出格式。

何時使用

  • 會議錄音轉文字記錄
  • 影片內容生成字幕(SRT/VTT)
  • 採訪/播客內容整理
  • 語音備忘錄轉文本
  • 多語言影片翻譯準備

快速開始

1. 安裝依賴

pip install openai-whisper ffmpeg-python

確保系統已安裝 ffmpeg:

# Ubuntu/Debian
sudo apt-get install ffmpeg

# macOS
brew install ffmpeg

# Windows
# 從 https://ffmpeg.org/download.html 下載

2. 基本用法

python scripts/transcribe.py <輸入檔案> [輸出檔案] [選項]

3. 示例

# 轉錄 MP4 影片,輸出文本
python scripts/transcribe.py meeting.mp4

# 轉錄音訊,輸出 SRT 字幕
python scripts/transcribe.py podcast.mp3 podcast.srt --output-format srt

# 指定中文和較小模型(更快)
python scripts/transcribe.py interview.wav --model tiny --language zh

# 輸出帶時間戳的 JSON
python scripts/transcribe.py video.mp4 result.json --output-format json

命令列選項

選項 說明 預設值
--model 模型大小:tiny, base, small, medium, large base
--language 語言程式碼:zh, en, ja 等 自動檢測
--output-format 輸出格式:txt, srt, vtt, json txt
--device 執行裝置:cpu, cuda cpu
--keep-audio 保留臨時音訊檔案 false

模型選擇指南

模型 大小 速度 精度 適用場景
tiny 39M 最快 一般 快速測試、短音訊
base 74M 良好 日常使用
small 244M 中等 較好 正式場合
medium 769M 很好 高精度需求
large 1550M 最慢 最佳 專業轉錄

輸出格式說明

TXT(純文本)

這是轉錄的完整文本內容,適合閱讀和編輯。

SRT(字幕格式)

1
00:00:01,000 --> 00:00:04,000
這是第一句字幕。

2
00:00:04,500 --> 00:00:07,000
這是第二句字幕。

VTT(Web 字幕)

WEBVTT

00:00:01.000 --> 00:00:04.000
這是第一句字幕。

00:00:04.500 --> 00:00:07.000
這是第二句字幕。

JSON(完整資料)

包含分段、時間戳、置信度等完整資訊,適合程式處理。

支援的檔案格式

音訊: MP3, WAV, FLAC, OGG, M4A, AAC

影片: MP4, AVI, MOV, MKV, WEBM, FLV

效能最佳化建議

  1. 短音訊優先用 tiny/base 模型 - 速度快,精度夠用
  2. 長內容用 CPU - 避免 GPU 記憶體不足
  3. 指定語言 - 可提升準確率和速度
  4. 批次處理 - 指令碼可迴圈呼叫處理多個檔案

常見問題

轉錄質量不佳

  • 嘗試更大的模型(small/medium/large)
  • 指定正確的語言程式碼
  • 確保音訊質量清晰

    推薦訪問7w4.net獲取更多AI技能。

處理速度慢

  • 使用更小的模型(tiny/base)
  • 如有 GPU,使用 --device cuda
  • 縮短音訊長度或分段處理

記憶體不足

  • 使用更小的模型
  • 將長檔案分割後分別處理
  • 關閉其他佔用記憶體的程式

指令碼

  • scripts/transcribe.py - 主轉錄指令碼

參考資料

🤖 AI 評測

這是一款實用且質量不錯的音影片轉文字工具,支援多種格式輸出,操作說明詳細清晰。優點是功能完整、支援多種語言、新手友好。不足是缺少使用示例和影片演示,新手可能需要花時間摸索。總體來說是個好用的工具,但還有完善空間。

📊 多維度評分

適應性4.3
規範性4.5
有效性4.7
可靠性4.2
可信度4.5

📁 包含檔案 (3 個)

📄 SKILL.md 3.6 KB
📄 _meta.json 138 B
📄 scripts/transcribe.py 7.3 KB