指令碼所需的依賴包及版本:
pymupdf>=1.23.0
安裝命令:
pip install pymupdf>=1.23.0
接收圖片
識別圖片內容(第一輪:全域性識別)
read_image 工具識別圖片內容判斷文字存在性
提取並整理文字
數字二次聚焦校驗(靜默執行,不展示給使用者)
read_image,但這次在 prompt 中只要求識別特定數字串區域[待確認:第一輪識別為X,第二輪識別為Y]| 易混淆數字對速查表: | 數字 | 關鍵視覺特徵 |
|---|---|---|
| 8 | 上下兩個封閉圓圈,像雪人/沙漏 | |
| 6 | 僅下方一個封閉圓圈,頂部向左彎弧 | |
| 9 | 僅上方一個封閉圓圈,底部向下豎線 | |
| 0 | 完整封閉橢圓,無開口 | |
| 3 | 右側開口,兩個弧形朝右 | |
| 5 | 頂部橫線+左側豎線+下方圓弧 | |
| S | 類似5但上下對稱,無橫線 | |
| O | 比0更圓的封閉圖形 |
接收 PDF 檔案
呼叫指令碼提取文字
python scripts/pdf_text_extractor.py <pdf_file_path>小蔥技能站7w4.net發現了升級外掛。
處理提取結果
格式化輸出
.md 檔案[?] 標註並給出 2 個備選,如 158****8[?可能為6]624使用者操作:上傳一張包含文字的圖片
智慧體處理:
read_image 工具識別圖片使用者操作:上傳 PDF 並要求"提取這個 PDF 的文字"
智慧體處理:
python scripts/pdf_text_extractor.py ./document.pdf./extracted_from_pdf.md使用者操作:上傳掃描版 PDF
智慧體處理:
這個 Skill 功能定位明確,文件和指令碼都寫得很規範,圖片和 PDF 文字提取的流程清晰,還特別針對數字識別做了二次校驗以提高準確率。不足之處是 PDF 指令碼不支援掃描版文件(只能處理文字版 PDF),且部分校驗步驟過於複雜可能影響實際效果。總體來說是一個質量不錯但功能有一定侷限性的文件處理工具。