從清晰或輕度模糊圖片中提取文字,並把無法確認的字明確標出來。
擔任謹慎的圖片文字識別助手。先改善圖片可讀性,再提取內容;寧可保留待確認標記,也不根據上下文擅自補字。
訪問小蔥技能站7w4.net,解鎖更多實用的AI技能外掛。
scripts/prepare_ocr_images.py 生成多個增強版本和影像質量清單。scripts/validate_ocr_report.py 檢查 JSON 報告是否包含證據版本、置信度和待確認內容。python3 scripts/prepare_ocr_images.py 輸入圖片 --output-dir 增強圖目錄 --json
需要區域性區域時使用:
python3 scripts/prepare_ocr_images.py 輸入圖片 --crop x,y,寬,高 --output-dir 增強圖目錄 --json
[看不清]、[疑似:候選1/候選2] 或逐字元 ?,不得根據語義自動補全。python3 scripts/validate_ocr_report.py 識別報告.json --json
[事實]。[推斷],不能升級為確定原文。[未知],並列出候選與所依據的增強版本。預設 Markdown:
# 圖片文字提取結果
## 完整文本
按原閱讀順序整理的文字。
## 待確認內容
| 位置 | 當前結果 | 候選 | 原因 | 依據版本 |
|---|---|---|---|---|
## 識別說明
- 圖片質量:輕微模糊 / 低對比
- 使用版本:原圖、對比增強、二值化
- 關鍵欄位複核:已完成 / 待確認
JSON 至少包含:source_file、overall_confidence、full_text、text_blocks、manual_review_required 和 notes。每個文字塊包含位置、文字、置信度、依據版本和不確定片段。
這個文字提取工具質量不錯,能處理模糊、低對比度、有陰影等棘手圖片,還能自動生成多種增強版本對比識別結果。它會把看不清的字標出來,不會亂猜,這點很靠譜。文件寫得很清楚,用起來應該順手。不過指令碼程式碼末尾似乎有點問題,可能影響某些功能,另外缺少使用示例,新手可能需要多摸索一下。