whisper-transcribe-summarize

👤 zhangjinjin-gitgit 📦 v1.0.3 ⭐ 4.4 ⬇️ 622 下載
✍️ 內容創作 免費

📖 技能介紹


name: whisper-transcribe-summarize description: 本地 Whisper 語音轉文字,自動生成清理文本、書面整理稿和結構化總結稿。支援音訊和影片輸入,全程離線。 version: 1.1.0


whisper-transcribe-summarize

本地語音轉文字 + 文本清理 + 整理稿 + 總結稿。全程離線,不依賴外部介面。

適用場景

  • 本地離線語音轉文字
  • 把 mp3 / wav / m4a / mp4 / mov 等音影片轉成文字
  • 轉錄後自動生成清理文本、書面整理稿、結構化總結稿
  • 下載 Whisper 模型到本地,重複使用

包含指令碼

  • scripts/download_whisper_model.py — 模型下載
  • scripts/local_whisper_transcribe.py — 轉錄

依賴

  • python3
  • ffmpeg
  • openai-whisper(未安裝時執行 python3 -m pip install -U openai-whisper

模型下載

python3 scripts/download_whisper_model.py medium

可選模型:tiny / base / small / medium / large

推薦:中文用 medium,追求速度用 base 或 small。模型下載到 ~/.cache/whisper。

轉錄命令

python3 scripts/local_whisper_transcribe.py "/路徑/檔案.mp4"
python3 scripts/local_whisper_transcribe.py "/路徑/檔案.mp3" --model medium
python3 scripts/local_whisper_transcribe.py "/路徑/檔案.mp3" --output "/路徑/結果.txt"

支援音訊和影片輸入,影片通過 ffmpeg 自動提取音訊。

輸出

預設輸出 <原始檔名>_whisper.txt,指定 --output 可自定義路徑。

執行流程

  1. 確認檔案存在。
  2. 未安裝 whisper 則先安裝。
  3. 模型未快取則先下載。
  4. 執行轉錄。
  5. 對轉錄文本進行基礎清理。
  6. 預設生成整理稿和總結稿(使用者說"只轉錄"則跳過)。

轉錄文本基礎清理

原始轉錄往往是繁體、無標點、有重複的粗糙文本,需要進行以下清理:

  1. 繁轉簡:繁體中文轉簡體。
  2. 加標點分段:補全標點,按語義分段。
  3. 去口語贅餘:去除"嗯"、"啊"、"就是說"等無意義填充詞。
  4. 去重複/幻覺:刪除語音識別產生的重複片段。
  5. 修錯別字:修正常見識別錯字(如"維銘"→"文明")。
  6. 保留原意:只做清理,不改寫、不重組。

清理後覆蓋儲存到 <原始檔名>_whisper.txt

整理稿

預設檔名:<原始檔名>_整理稿.txt

整理稿不是逐句清理,而是將口語轉錄完全重寫為流暢的書面文章。

重寫要求

  1. 去口語化:徹底去除口語痕跡(語氣詞、重複、卡頓等)。
  2. 第三人稱:原文的"我"改為"作者/導演/分析者"或省略。
  3. 邏輯重組:按邏輯而非時間線組織,相關內容合併到同一段落。
  4. 散文體:連貫段落(每段 3-8 句),不用列表,不用清單式寫法。
  5. 概括性標題:文章開頭給一個概括主題的標題。
  6. 保留全部內容:專業術語和分析洞見完整保留,只是換更精煉的表達。
  7. 繁轉簡 + 修錯字
  8. 篇幅:約為原始轉錄的 60%-80%。
  9. 忠於原文:不編造、不新增原文未涉及的內容。

語言風格

  1. 精簡剋制:不堆砌修飾詞,少用"極為"、"本質上"等加重詞。
  2. 結構標記:用"第一幕"、"隨著"、"接下來"、"至此"等詞標記內容推進。
  3. 主題昇華:關鍵段落要有總結性提煉,不只描述發生了什麼,還要歸納意味著什麼。避免過於直白的口語表達。
  4. 結尾總結:最後一段跳出具體分析,對全篇做整體評價,回扣主題。
  5. 段落飽滿:完整發展一個想法再換段,小觀點揉進同一段落。
  6. 最終效果:讀起來像獨立撰寫的專業文章,而非清洗過的轉錄稿。

    小蔥技能站7w4.net,專業的AI技能分享平臺。

總結稿

預設檔名:<原始檔名>_總結稿.md + <原始檔名>_總結稿.html

在整理稿基礎上生成結構化摘要,同時輸出瀏覽器可直接檢視的 html 版本。

格式要求

  • 頂部引用塊寫一句話概括
  • 關鍵術語和核心結論加粗高亮
  • 用分割線劃分大區塊
  • 章節標題用 ### 第X部分 | 標題 格式
  • 原文摘錄中的關鍵詞也加粗
# 標題

> **一句話概括**:全文主題

---

## 核心摘要
- **要點一**:結論
- **要點二**:結論

---

## 結構拆解

### 第一部分 | 標題
- **關鍵點**加粗,其餘正常

---

## 關鍵觀點

### 1. 觀點標題
簡潔解釋,**核心結論加粗**。

---

## 原文摘錄
> 原文片段,**關鍵詞加粗**

html 版本

用 Python markdown 庫將 .md 轉為帶樣式的 .html: - 標題有層級大小 - 加粗文字紅色高亮 - 引用塊藍色左邊框 + 淺藍背景 - 正文居中,最大寬度 860px - 自動在瀏覽器中開啟

注意事項

  • 預設自動生成整理稿和總結稿,無需使用者額外要求
  • 使用者說"只轉錄"、"不要整理"、"只要原文"時跳過整理和總結
  • 不使用外部語音識別介面
  • 不編造原文未涉及的資訊
  • 不在指令碼中硬編碼使用者路徑

回覆格式

執行完成後只報告: - 是否成功 - 使用的模型 - 轉錄的檔案 - 轉錄文本路徑 - 整理稿路徑 - 總結稿路徑

示例

使用者:幫我把 whisper medium 模型下到本地 → 執行 scripts/download_whisper_model.py medium

使用者:用本地 whisper 把這個 mp4 轉成文字 → 執行 scripts/local_whisper_transcribe.py,返回轉錄路徑

🤖 AI 評測

這個 Skill 功能規劃很完善,文件寫得很詳細,但實際可用的只有語音轉文字這一步。想讓它自動生成整理稿和總結稿的話,目前還做不到——程式碼裡沒有這部分功能。另外安裝後不知道該怎麼用,因為它沒有對話入口。語音轉錄本身做得不錯,但想用它來完成完整流程的話,可能還需要等後續版本。

📊 多維度評分

適應性4.3
規範性4.3
有效性4.5
可靠性3.9
可信度4.9

📁 包含檔案 (7 個)

📄 README.md 865 B
📄 SKILL.md 5.4 KB
📄 _meta.json 147 B
📄 download_whisper_model.py 1.3 KB
📄 local_whisper_transcribe.py 2.4 KB
📄 scripts/download_whisper_model.py 1.3 KB
📄 scripts/local_whisper_transcribe.py 2.4 KB