PDF/EPUB/MOBI轉TXT,TXT轉MD附帶翻譯功能

👤 七仔的AI工具箱 📦 v1.0.6 ⭐ 4.5 ⬇️ 284 下載
📄 辦公效率 免費

📖 技能介紹

epub-to-txt 技能包

EPUB / MOBI / PDF → TXT → Markdown → 多語言翻譯 全流程,零 token 消耗

7w4.net收錄了海量優質技能外掛。

📦 包含指令碼

指令碼 功能 依賴
epub-to-txt.py EPUB → TXT(單本) 零依賴
epub-to-txt-batch.py EPUB → TXT(批次) 零依賴
mobi-to-txt.py MOBI → TXT(單本) ⭐v3.2新增 mobi(pip install mobi)
mobi-to-txt-batch.py MOBI → TXT(批次) ⭐v3.2新增 mobi(pip install mobi)
pdf-to-txt.py PDF → TXT(單本) clawpdf + PyMuPDF兜底
pdf-to-txt-batch.py PDF → TXT(批次) clawpdf + PyMuPDF兜底
pdf-to-txt-ocr.py 掃描/圖片型 PDF → TXT(本地 OCR) ⭐新增 RapidOCR(本地離線,含中文模型)
txt-to-md.py TXT → Markdown(單本) 零依賴
txt-to-md-batch.py TXT → Markdown(批次) 零依賴
txt-translate.py TXT/MD 多語言翻譯(單本)⭐新增 argostranslate(本地離線)
txt-translate-batch.py TXT/MD 多語言翻譯(批次)⭐新增 argostranslate(本地離線)
generate-test-epub.py 生成測試 EPUB 零依賴

🔄 完整流水線

EPUB/PDF  →  TXT  →  翻譯(可選)  →  Markdown  →  AI潤色(最少token)
  ↳ 指令碼     ↳ 指令碼   ↳ 本地模型     ↳ 零token     ↳ 只做最後精修

為什麼這樣設計? - EPUB/PDF → TXT:用指令碼處理,零 token - 翻譯:Argos Translate 本地神經網路模型推理,零 token、完全離線 - TXT → Markdown:用指令碼識別標題/章節/正文,零 token - AI 潤色:只處理"人味"部分,少量 token,節省 90%

🌐 多語言翻譯(v3 新增)

引擎: 1. Argos Translate(預設)——純本地開源神經翻譯,模型首次自動下載(en→zh 約 200MB),之後完全離線、零 token 2. translate-shell(備選,--engine trans)——需系統已裝 trans 命令且聯網

特性: - ✅ 保留章節結構(=== 邊框、── 小節、Markdown # 標題均不破壞,後設資料行不翻譯) - ✅ 多語言:--from / --to 任意支援的語言對(en/zh/ja/ko/fr/de/es/ru/ar/pt...),無直連模型時自動經英語中轉 - ✅ 雙語對照:--bilingual 原文+譯文交錯輸出 - ✅ 斷點續傳:翻譯中斷後重跑同一命令,自動從上次進度繼續(進度存 .progress.json

# 英文書 → 中文(最常用)
python3 txt-translate.py book.txt                    # 輸出 book.zh.txt
python3 txt-translate.py book.txt 中文版.txt          # 指定輸出名
python3 txt-translate.py book.md --to zh             # Markdown 也支援

# 其他語言
python3 txt-translate.py book.txt --from en --to ja  # 英→日
python3 txt-translate.py book.txt --from ja --to zh  # 日→中(經英語中轉)

# 雙語對照 / 批次
python3 txt-translate.py book.txt --bilingual
python3 txt-translate-batch.py ~/books_txt/ --from en --to zh

安裝(一次性)

pip install argostranslate
# 首次翻譯時自動下載對應語言模型,之後完全離線

典型場景:英文 EPUB → 中文 Markdown

python3 epub-to-txt.py english-book.epub /tmp/book.txt   # Step 1: EPUB → TXT
python3 txt-translate.py /tmp/book.txt /tmp/book.zh.txt  # Step 2: 本地翻譯 → 中文
python3 txt-to-md.py /tmp/book.zh.txt /tmp/book.zh.md    # Step 3: TXT → Markdown

效能參考:CPU 上約 1~3 段/秒,一本 300 頁英文書約 30~60 分鐘(後臺跑即可,斷點續傳不怕中斷)。 翻譯質量說明:Argos 為開源離線模型,質量接近早期谷歌翻譯,適合"通讀理解";出版級質量可在譯後讓 AI 只潤色關鍵章節(少量 token)。

🚀 使用方法

1. EPUB → TXT

python3 epub-to-txt.py input.epub [output.txt]
python3 epub-to-txt.py input.epub    # 自動同名輸出

3. MOBI → TXT ⭐v3.2新增

pip install mobi                              # 一次性安裝依賴
python3 mobi-to-txt.py input.mobi [output.txt]   # 單本
python3 mobi-to-txt-batch.py ~/books/             # 批次

原理:MOBI → kindleunpack 解壓(生成內嵌EPUB或Mobi7檔案)→ 複用 EPUB 解析邏輯 → TXT 支援 K8 新版(生成EPUB)和 Mobi7 老版(直接生成 book.html),自動識別,零額外配置

4. PDF → TXT

python3 pdf-to-txt.py input.pdf [output.txt]      # 文字型 PDF(含 PyMuPDF 兜底)

4b. 掃描/圖片型 PDF → TXT(本地 OCR)⭐新增

pip install rapidocr-onnxruntime pymupdf pillow   # 一次性裝好本地 OCR 引擎
python3 pdf-to-txt-ocr.py input.pdf [output.txt]  # 預設 dpi=200,逐頁 OCR
python3 pdf-to-txt-ocr.py input.pdf --dpi 300 --from-page 1 --to-page 5  # 高畫質/分段

引擎 RapidOCR(onnxruntime 推理,自帶中文模型),完全離線、零 token。 適合出版社掃描書、影印本、無文字層的圖片型 PDF。

5. TXT → Markdown(新增!)

python3 txt-to-md.py input.txt [output.md]
python3 txt-to-md.py "/path/中國REITs操作手冊.txt"   # 自動輸出同名.md

6. 批次轉換

python3 epub-to-txt-batch.py /path/to/books/      # EPUB批次
python3 mobi-to-txt-batch.py /path/to/books/     # MOBI批次
python3 txt-to-md-batch.py /path/to/txts/        # TXT批次

📋 典型使用場景

場景:MOBI 書籍轉 Markdown

pip install mobi                               # 首次安裝
python3 mobi-to-txt.py 巴菲特致股東的信.mobi /tmp/buffett.txt  # Step 1: MOBI → TXT
python3 txt-to-md.py /tmp/buffett.txt /tmp/buffett.md           # Step 2: TXT → Markdown

場景:把一本書轉成可編輯的 Markdown

# Step 1: EPUB → TXT
python3 epub-to-txt.py 智慧商業.epub /tmp/智慧商業.txt

# Step 2: TXT → Markdown(自動識別章節)
python3 txt-to-md.py /tmp/智慧商業.txt /tmp/智慧商業.md

# Step 3: AI 潤色(只潤色,節省token)
# → 丟給 AI:"請潤色這段文字,讓它更有傳播力"

場景:批次處理一資料夾電子書

# 批次 EPUB → TXT
python3 epub-to-txt-batch.py ~/books/

# 批次 TXT → Markdown
python3 txt-to-md-batch.py ~/books_txt/

# 驗證結果
ls ~/books_txt/*.md | wc -l

🔍 TXT → Markdown 識別規則

原文本格式 轉換結果
=== 書名 === # 書名(一級標題)
作者:XXX *作者:XXX*(斜體)
── 小節名 ── ### 小節名(三級標題)
普通正文 保持原樣
多餘空行 合併為單空行

⚠️ 已知限制

  • 掃描型 PDF:已支援!用 pdf-to-txt-ocr.py(RapidOCR 本地中文 OCR,零 token)
  • 純圖片 EPUB:不支援(需先把圖片匯出再 OCR,可擴充套件)
  • 複雜分欄排版:OCR 按自然閱讀順序輸出,多欄可能序列(建議 --dpi 300 提升)
  • 非標準章節標題(如 【第一章】):需要手動調整

🧪 測試驗證

已成功轉換的書籍: - 國企三資盤活(EPUB,33章,609KB) - 中國REITs操作手冊(EPUB,67章,925KB → 917KB MD) - 智慧商業、模型思維、水平思考、查理日記 等

📁 檔案結構

epub-to-txt/
├── SKILL.md                # 本檔案
├── epub-to-txt.py          # EPUB單本轉TXT(零依賴)
├── epub-to-txt-batch.py    # EPUB批次轉TXT(零依賴)
├── mobi-to-txt.py          # MOBI單本轉TXT(需mobi庫)⭐v3.2新增
├── mobi-to-txt-batch.py    # MOBI批次轉TXT(需mobi庫)⭐v3.2新增
├── pdf-to-txt.py           # PDF單本轉TXT
├── pdf-to-txt-batch.py     # PDF批次轉TXT
├── pdf-to-txt-ocr.py       # 掃描型PDF轉TXT(RapidOCR本地OCR)⭐v3新增
├── txt-to-md.py            # TXT單本轉Markdown
├── txt-to-md-batch.py      # TXT批次轉Markdown
├── txt-translate.py        # TXT/MD多語言翻譯(單本)⭐v3新增
├── txt-translate-batch.py  # TXT/MD多語言翻譯(批次)⭐v3新增
├── generate-test-epub.py   # 生成測試 EPUB
└── vendor/                 # 第三方依賴(pdfminer)

💡 設計理念

外部化思維:把每次解決問題的方案寫成檔案,不是隻存在腦子裡

指令碼 = 經驗的固化 = 零 token 消耗的 AI 工作流


版本:v3.2(2026-07-29)新增 mobi-to-txt / mobi-to-txt-batch,支援 MOBI → TXT(需 pip install mobi)

版本:v3.1(2026-07-25)新增 pdf-to-txt-ocr 掃描版 PDF 本地中文 OCR(RapidOCR,零 token)

🤖 AI 評測

這個技能包功能很實用,能把各種格式的電子書轉換成可編輯的文本,處理流程完整。最大的優點是翻譯不需要API費用,離線就能用。但翻譯質量一般,速度也比較慢;圖片型電子書和複雜排版的PDF處理效果不太好,章節識別偶爾會出錯。適合對排版要求不高、主要用來閱讀理解的使用者,對出版級或專業翻譯需求來說還有差距。

📊 多維度評分

適應性4.6
規範性4.5
有效性4.6
可靠性4.4
可信度4.5

📁 包含檔案 (13 個)

📄 SKILL.md 8.6 KB
📄 epub-to-txt-batch.py 7.3 KB
📄 epub-to-txt.py 8.9 KB
📄 generate-test-epub.py 6.1 KB
📄 mobi-to-txt-batch.py 8.5 KB
📄 mobi-to-txt.py 11 KB
📄 pdf-to-txt-batch.py 2.6 KB
📄 pdf-to-txt-ocr.py 4.1 KB
📄 pdf-to-txt.py 3.8 KB
📄 txt-to-md-batch.py 3.1 KB
📄 txt-to-md.py 4.3 KB
📄 txt-translate-batch.py 2.6 KB
📄 txt-translate.py 13.7 KB