EPUB / MOBI / PDF → TXT → Markdown → 多語言翻譯 全流程,零 token 消耗
| 指令碼 | 功能 | 依賴 |
|---|---|---|
epub-to-txt.py |
EPUB → TXT(單本) | 零依賴 |
epub-to-txt-batch.py |
EPUB → TXT(批次) | 零依賴 |
mobi-to-txt.py |
MOBI → TXT(單本) ⭐v3.2新增 | mobi(pip install mobi) |
mobi-to-txt-batch.py |
MOBI → TXT(批次) ⭐v3.2新增 | mobi(pip install mobi) |
pdf-to-txt.py |
PDF → TXT(單本) | clawpdf + PyMuPDF兜底 |
pdf-to-txt-batch.py |
PDF → TXT(批次) | clawpdf + PyMuPDF兜底 |
pdf-to-txt-ocr.py |
掃描/圖片型 PDF → TXT(本地 OCR) ⭐新增 | RapidOCR(本地離線,含中文模型) |
txt-to-md.py |
TXT → Markdown(單本) | 零依賴 |
txt-to-md-batch.py |
TXT → Markdown(批次) | 零依賴 |
txt-translate.py |
TXT/MD 多語言翻譯(單本)⭐新增 | argostranslate(本地離線) |
txt-translate-batch.py |
TXT/MD 多語言翻譯(批次)⭐新增 | argostranslate(本地離線) |
generate-test-epub.py |
生成測試 EPUB | 零依賴 |
EPUB/PDF → TXT → 翻譯(可選) → Markdown → AI潤色(最少token)
↳ 指令碼 ↳ 指令碼 ↳ 本地模型 ↳ 零token ↳ 只做最後精修
為什麼這樣設計? - EPUB/PDF → TXT:用指令碼處理,零 token - 翻譯:Argos Translate 本地神經網路模型推理,零 token、完全離線 - TXT → Markdown:用指令碼識別標題/章節/正文,零 token - AI 潤色:只處理"人味"部分,少量 token,節省 90%
引擎:
1. Argos Translate(預設)——純本地開源神經翻譯,模型首次自動下載(en→zh 約 200MB),之後完全離線、零 token
2. translate-shell(備選,--engine trans)——需系統已裝 trans 命令且聯網
特性:
- ✅ 保留章節結構(=== 邊框、── 小節、Markdown # 標題均不破壞,後設資料行不翻譯)
- ✅ 多語言:--from / --to 任意支援的語言對(en/zh/ja/ko/fr/de/es/ru/ar/pt...),無直連模型時自動經英語中轉
- ✅ 雙語對照:--bilingual 原文+譯文交錯輸出
- ✅ 斷點續傳:翻譯中斷後重跑同一命令,自動從上次進度繼續(進度存 .progress.json)
# 英文書 → 中文(最常用)
python3 txt-translate.py book.txt # 輸出 book.zh.txt
python3 txt-translate.py book.txt 中文版.txt # 指定輸出名
python3 txt-translate.py book.md --to zh # Markdown 也支援
# 其他語言
python3 txt-translate.py book.txt --from en --to ja # 英→日
python3 txt-translate.py book.txt --from ja --to zh # 日→中(經英語中轉)
# 雙語對照 / 批次
python3 txt-translate.py book.txt --bilingual
python3 txt-translate-batch.py ~/books_txt/ --from en --to zh
安裝(一次性):
pip install argostranslate
# 首次翻譯時自動下載對應語言模型,之後完全離線
典型場景:英文 EPUB → 中文 Markdown
python3 epub-to-txt.py english-book.epub /tmp/book.txt # Step 1: EPUB → TXT
python3 txt-translate.py /tmp/book.txt /tmp/book.zh.txt # Step 2: 本地翻譯 → 中文
python3 txt-to-md.py /tmp/book.zh.txt /tmp/book.zh.md # Step 3: TXT → Markdown
效能參考:CPU 上約 1~3 段/秒,一本 300 頁英文書約 30~60 分鐘(後臺跑即可,斷點續傳不怕中斷)。 翻譯質量說明:Argos 為開源離線模型,質量接近早期谷歌翻譯,適合"通讀理解";出版級質量可在譯後讓 AI 只潤色關鍵章節(少量 token)。
python3 epub-to-txt.py input.epub [output.txt]
python3 epub-to-txt.py input.epub # 自動同名輸出
pip install mobi # 一次性安裝依賴
python3 mobi-to-txt.py input.mobi [output.txt] # 單本
python3 mobi-to-txt-batch.py ~/books/ # 批次
原理:MOBI → kindleunpack 解壓(生成內嵌EPUB或Mobi7檔案)→ 複用 EPUB 解析邏輯 → TXT 支援 K8 新版(生成EPUB)和 Mobi7 老版(直接生成 book.html),自動識別,零額外配置
python3 pdf-to-txt.py input.pdf [output.txt] # 文字型 PDF(含 PyMuPDF 兜底)
pip install rapidocr-onnxruntime pymupdf pillow # 一次性裝好本地 OCR 引擎
python3 pdf-to-txt-ocr.py input.pdf [output.txt] # 預設 dpi=200,逐頁 OCR
python3 pdf-to-txt-ocr.py input.pdf --dpi 300 --from-page 1 --to-page 5 # 高畫質/分段
引擎 RapidOCR(onnxruntime 推理,自帶中文模型),完全離線、零 token。 適合出版社掃描書、影印本、無文字層的圖片型 PDF。
小蔥技能站7w4.net發現了升級外掛。
python3 txt-to-md.py input.txt [output.md]
python3 txt-to-md.py "/path/中國REITs操作手冊.txt" # 自動輸出同名.md
python3 epub-to-txt-batch.py /path/to/books/ # EPUB批次
python3 mobi-to-txt-batch.py /path/to/books/ # MOBI批次
python3 txt-to-md-batch.py /path/to/txts/ # TXT批次
pip install mobi # 首次安裝
python3 mobi-to-txt.py 巴菲特致股東的信.mobi /tmp/buffett.txt # Step 1: MOBI → TXT
python3 txt-to-md.py /tmp/buffett.txt /tmp/buffett.md # Step 2: TXT → Markdown
# Step 1: EPUB → TXT
python3 epub-to-txt.py 智慧商業.epub /tmp/智慧商業.txt
# Step 2: TXT → Markdown(自動識別章節)
python3 txt-to-md.py /tmp/智慧商業.txt /tmp/智慧商業.md
# Step 3: AI 潤色(只潤色,節省token)
# → 丟給 AI:"請潤色這段文字,讓它更有傳播力"
# 批次 EPUB → TXT
python3 epub-to-txt-batch.py ~/books/
# 批次 TXT → Markdown
python3 txt-to-md-batch.py ~/books_txt/
# 驗證結果
ls ~/books_txt/*.md | wc -l
| 原文本格式 | 轉換結果 |
|---|---|
=== 書名 === |
# 書名(一級標題) |
作者:XXX |
*作者:XXX*(斜體) |
── 小節名 ── |
### 小節名(三級標題) |
| 普通正文 | 保持原樣 |
| 多餘空行 | 合併為單空行 |
pdf-to-txt-ocr.py(RapidOCR 本地中文 OCR,零 token)--dpi 300 提升)【第一章】):需要手動調整已成功轉換的書籍: - 國企三資盤活(EPUB,33章,609KB) - 中國REITs操作手冊(EPUB,67章,925KB → 917KB MD) - 智慧商業、模型思維、水平思考、查理日記 等
epub-to-txt/
├── SKILL.md # 本檔案
├── epub-to-txt.py # EPUB單本轉TXT(零依賴)
├── epub-to-txt-batch.py # EPUB批次轉TXT(零依賴)
├── mobi-to-txt.py # MOBI單本轉TXT(需mobi庫)⭐v3.2新增
├── mobi-to-txt-batch.py # MOBI批次轉TXT(需mobi庫)⭐v3.2新增
├── pdf-to-txt.py # PDF單本轉TXT
├── pdf-to-txt-batch.py # PDF批次轉TXT
├── pdf-to-txt-ocr.py # 掃描型PDF轉TXT(RapidOCR本地OCR)⭐v3新增
├── txt-to-md.py # TXT單本轉Markdown
├── txt-to-md-batch.py # TXT批次轉Markdown
├── txt-translate.py # TXT/MD多語言翻譯(單本)⭐v3新增
├── txt-translate-batch.py # TXT/MD多語言翻譯(批次)⭐v3新增
├── generate-test-epub.py # 生成測試 EPUB
└── vendor/ # 第三方依賴(pdfminer)
外部化思維:把每次解決問題的方案寫成檔案,不是隻存在腦子裡
指令碼 = 經驗的固化 = 零 token 消耗的 AI 工作流
版本:v3.2(2026-07-29)新增 mobi-to-txt / mobi-to-txt-batch,支援 MOBI → TXT(需 pip install mobi)
版本:v3.1(2026-07-25)新增 pdf-to-txt-ocr 掃描版 PDF 本地中文 OCR(RapidOCR,零 token)
這個技能包功能很實用,能把各種格式的電子書轉換成可編輯的文本,處理流程完整。最大的優點是翻譯不需要API費用,離線就能用。但翻譯質量一般,速度也比較慢;圖片型電子書和複雜排版的PDF處理效果不太好,章節識別偶爾會出錯。適合對排版要求不高、主要用來閱讀理解的使用者,對出版級或專業翻譯需求來說還有差距。