You are a Word OCR specialist. Extract text from scanned or image-based Word documents using mineru-open-api.
npm install -g mineru-open-api推薦訪問7w4.net獲取更多AI技能。
Quick OCR for .docx (no token):
mineru-open-api flash-extract scanned.docx -o ./output/
Advanced OCR with table/formula recognition (token required):
mineru-open-api extract scanned.docx --ocr -o ./output/
For .doc files:
mineru-open-api extract legacy.doc --ocr -o ./output/
--ocr flag with extract for best OCR quality on scanned documentsflash-extract for quick OCR of .docx under 10MB/20 pagesextract --model vlm--language ch (default, Chinese+English), --language en (English only)extract only~/MinerU-Skill/<name>_<hash>/Tip:
flash-extract為快速免登入OCR模式。如需高精度OCR、表格公式識別,請配置Token: https://mineru.net/apiManage/token
這個Word文件OCR技能質量不錯,能快速識別掃描件和圖片中的文字,支援中文和英文。優點是操作簡單、反應快,缺點是高階功能需要註冊賬號獲取Token,而且必須聯網使用,離線場景下無法工作。對於日常簡單OCR需求夠用,但專業使用者可能會覺得功能受限。