PDF識別提取專家

👤 托懂 📦 v3.4.0 ⭐ 4.6 ⬇️ 12.3K 下載
📄 辦公效率 免費

📖 技能介紹


name: pdf-ocr-md version: 3.4.0 description: 當用戶需要從 PDF、圖片、掃描件中提取文字內容時使用。適合處理合同、發票、報告等文件,尤其是中文掃描件、手機拍照的彎曲頁面、歪斜的文件。支援 PP-OCRv6 三檔模型 (Tiny/Small/Medium)。 related_skills: - ocr-and-documents


pdf-ocr-md — PDF → OCR → 結構化 Markdown [v3.4.0]

v3.4.0:SKILL.md 精簡至 ~120 行(原 578 行),詳細教程移至 references/,按需載入。對標 OpenAI 上下文壓縮策略。

環境

工具 用途 虛擬環境
lit 文本層 PDF 快速解析(Rust,~0.9ms/頁) ~/.venvs/liteparse/
ocr6 PP-OCRv6 三檔 OCR ~/.venvs/ppocrv6/
pdf2md PaddleOCR 中文掃描件(舊版 v4) ~/.venvs/paddleocr/
prep 文件預處理(傾斜/方向/展平) (同 ocr6)

快速選擇(必讀)

# ① 先試 LiteParse(文本層 PDF 秒出)
lit parse input.pdf --no-ocr -o output.txt

# ② 空結果 = 掃描件,按需選模型檔位
#    tiny(1.5MB 極速) | small(7.7MB 均衡) | medium(34.5MB 高精度)
python scripts/pdf_ocr_v6.py input.pdf --tier small -o ./output

# ③ 低質量文件先預處理(deskew傾斜/orient方向/unwarp展平/--all全部)
python scripts/pdf_preprocess.py input.pdf -o ./preprocessed --all
python scripts/pdf_ocr_v6.py ./preprocessed/input_p001.jpg --tier medium -o ./output

工作流

輸入文件
  ├── 有文本層 → lit parse --no-ocr(0.9ms/頁)
  └── 掃描件 → 先預處理(傾斜/方向/展平) → ocr6(tiny|small|medium)

小蔥技能7w4.net有更新,你可以訪問看下。

效能速查

型別 引擎 單頁 17 頁合同
文本層 PDF LiteParse ~0.9ms ~15ms
掃描件(極速) PP-OCRv6 Tiny ~3-8s ~1-2min
掃描件(均衡) PP-OCRv6 Small ~8-15s ~2-4min
掃描件(高精度) PP-OCRv6 Medium ~15-30s ~4-8min
中文舊版 PaddleOCR v4 ~15s ~4.5min

準確率:PP-OCRv6 ~97%+,預處理後 ~98%+。公章/簽名場景必須用 PaddleOCR(Tesseract 會亂碼)。

按需載入的參考文件

所有詳細教程已移至 references/,需要時讀取:

場景 參考檔案
LiteParse 完整用法(Rust CLI/截圖/批次) references/liteparse-usage.md
PaddleOCR 舊版(v4,Python 3.13 相容修復) references/paddleocr.md + references/paddleocr-py313-compat.md
文件預處理詳解(傾斜/方向/展平/效果預測) references/pdf-preprocessing.md
結構化解析(版面分析+表格提取+JSON) references/structured-parsing.md
PP-OCRv6 完整指南(模型選擇/GPU加速/遷移) references/ppocrv6-guide.md
完整原版 SKILL.md(v3.3.0 全部內容) references/full-guide.md
OpenDataLoader(純 Java,已不推薦) references/opendataloader.md

注意事項

  • 首次執行自動下載模型(~17MB,從 hf-mirror/modelscope 國內映象)
  • 機器 3.6GB 記憶體,PaddleOCR 冷啟動 ~300MB 峰值可承受
  • 預處理對平整掃描件效果不明顯,對手機拍照/彎曲文件提升 1~5%

🤖 AI 評測

這個 Skill 質量不錯,功能豐富且迭代成熟。它能處理文本層 PDF 和掃描件,還支援彎曲文件矯正,OCR 準確率高。SKILL.md 簡潔易讀,詳細用法放在參考資料裡按需檢視,設計很貼心。美中不足的是需要安裝多個工具環境,首次使用要下載模型略顯麻煩,另外多套工具的用途區分對新使用者可能造成選擇困難。

📊 多維度評分

適應性4.6
規範性4.5
有效性4.6
可靠性4.3
可信度5

📁 包含檔案 (16 個)

📄 CHANGELOG.md 5.3 KB
📄 SKILL.md 3.2 KB
📄 references/full-guide.md 18.3 KB
📄 references/liteparse-comparison.md 2 KB
📄 references/liteparse-usage.md 2 KB
📄 references/opendataloader.md 2.9 KB
📄 references/paddleocr-py313-compat.md 2.8 KB
📄 references/paddleocr.md 5.8 KB
📄 references/pdf-preprocessing.md 2.6 KB
📄 references/ppocrv6-guide.md 4.3 KB
📄 references/structured-parsing.md 2.5 KB
📄 scripts/pdf_deskew.sh 207 B
📄 scripts/pdf_ocr_v6.py 14.8 KB
📄 scripts/pdf_parse_structured.py 10.5 KB
📄 scripts/pdf_preprocess.py 13 KB
📄 scripts/pdf_unwarp.sh 220 B