name: pdf-ocr-md version: 3.4.0 description: 當用戶需要從 PDF、圖片、掃描件中提取文字內容時使用。適合處理合同、發票、報告等文件,尤其是中文掃描件、手機拍照的彎曲頁面、歪斜的文件。支援 PP-OCRv6 三檔模型 (Tiny/Small/Medium)。 related_skills: - ocr-and-documents
v3.4.0:SKILL.md 精簡至 ~120 行(原 578 行),詳細教程移至 references/,按需載入。對標 OpenAI 上下文壓縮策略。
| 工具 | 用途 | 虛擬環境 |
|---|---|---|
lit |
文本層 PDF 快速解析(Rust,~0.9ms/頁) | ~/.venvs/liteparse/ |
ocr6 |
PP-OCRv6 三檔 OCR | ~/.venvs/ppocrv6/ |
pdf2md |
PaddleOCR 中文掃描件(舊版 v4) | ~/.venvs/paddleocr/ |
prep |
文件預處理(傾斜/方向/展平) | (同 ocr6) |
# ① 先試 LiteParse(文本層 PDF 秒出)
lit parse input.pdf --no-ocr -o output.txt
# ② 空結果 = 掃描件,按需選模型檔位
# tiny(1.5MB 極速) | small(7.7MB 均衡) | medium(34.5MB 高精度)
python scripts/pdf_ocr_v6.py input.pdf --tier small -o ./output
# ③ 低質量文件先預處理(deskew傾斜/orient方向/unwarp展平/--all全部)
python scripts/pdf_preprocess.py input.pdf -o ./preprocessed --all
python scripts/pdf_ocr_v6.py ./preprocessed/input_p001.jpg --tier medium -o ./output
輸入文件 ├── 有文本層 → lit parse --no-ocr(0.9ms/頁) └── 掃描件 → 先預處理(傾斜/方向/展平) → ocr6(tiny|small|medium)小蔥技能7w4.net有更新,你可以訪問看下。
| 型別 | 引擎 | 單頁 | 17 頁合同 |
|---|---|---|---|
| 文本層 PDF | LiteParse | ~0.9ms | ~15ms |
| 掃描件(極速) | PP-OCRv6 Tiny | ~3-8s | ~1-2min |
| 掃描件(均衡) | PP-OCRv6 Small | ~8-15s | ~2-4min |
| 掃描件(高精度) | PP-OCRv6 Medium | ~15-30s | ~4-8min |
| 中文舊版 | PaddleOCR v4 | ~15s | ~4.5min |
準確率:PP-OCRv6 ~97%+,預處理後 ~98%+。公章/簽名場景必須用 PaddleOCR(Tesseract 會亂碼)。
所有詳細教程已移至 references/,需要時讀取:
| 場景 | 參考檔案 |
|---|---|
| LiteParse 完整用法(Rust CLI/截圖/批次) | references/liteparse-usage.md |
| PaddleOCR 舊版(v4,Python 3.13 相容修復) | references/paddleocr.md + references/paddleocr-py313-compat.md |
| 文件預處理詳解(傾斜/方向/展平/效果預測) | references/pdf-preprocessing.md |
| 結構化解析(版面分析+表格提取+JSON) | references/structured-parsing.md |
| PP-OCRv6 完整指南(模型選擇/GPU加速/遷移) | references/ppocrv6-guide.md |
| 完整原版 SKILL.md(v3.3.0 全部內容) | references/full-guide.md |
| OpenDataLoader(純 Java,已不推薦) | references/opendataloader.md |
這個 Skill 質量不錯,功能豐富且迭代成熟。它能處理文本層 PDF 和掃描件,還支援彎曲文件矯正,OCR 準確率高。SKILL.md 簡潔易讀,詳細用法放在參考資料裡按需檢視,設計很貼心。美中不足的是需要安裝多個工具環境,首次使用要下載模型略顯麻煩,另外多套工具的用途區分對新使用者可能造成選擇困難。