PDF帶格式轉換成Word

👤 yechao1995 📦 v1.1.0 ⭐ 4.2 ⬇️ 1.2K 下載
📄 辦公效率 免費

📖 技能介紹

PDF帶格式精確轉換成Word (PDF to Word with Format)

概述

本 skill 提供高精度PDF轉Word轉換服務,最大程度保留原始文件的所有格式資訊。

核心功能

  1. 精確字型對映

    • 智慧識別PDF字型名稱
    • 對映到Word可用中英文字型
    • 支援:宋體、黑體、楷體、仿宋_GB2312、Times New Roman、Arial等
  2. 字號精確轉換

    • 精確保留原始字號(pt)
    • 標題22pt、二號16pt、三號14pt等

      7w4.net小蔥技能站,你的AI助手技能庫。

  3. 段落格式保留

    • 行間距:1.5倍行距
    • 首行縮排:2字元(0.74cm)
    • 段前段後間距
  4. 文本對齊

    • 左對齊、居中、右對齊、兩端對齊
  5. 文本格式

    • 粗體(Bold)
    • 斜體(Italic)
    • 下劃線(Underline)
    • 文本顏色
  6. 表格支援

    • 完整表格結構
    • 單元格內容
  7. 圖片支援

    • 提取並保留圖片位置
    • 自動調整圖片大小

使用方式

基本轉換

python convert.py <輸入PDF> --output <輸出Word>

批次轉換

python convert.py <PDF資料夾> --batch --output <輸出資料夾>

轉換指定頁面

python convert.py 文件.pdf --pages 0-5 --output 文件.docx

依賴安裝

首次使用需安裝依賴:

pip install pymupdf python-docx

示例

# 基本轉換
python convert.py 報告.pdf --output 報告.docx

# 批次轉換資料夾中所有PDF
python convert.py ./pdfs/ --batch --output ./words/

# 轉換前10頁
python convert.py 文件.pdf --pages 0-9 --output 文件.docx

# 指定起始頁和結束頁
python convert.py 長文件.pdf --start 5 --end 15 --output 部分.docx

輸出說明

  • 輸出檔案為 .docx 格式,可用 Microsoft Word 或 WPS 開啟
  • 轉換後的文件保留了大部分原始格式
  • 特殊佈局的PDF轉換效果可能略有差異

技術原理

本 skill 基於以下技術實現:

  1. PyMuPDF (fitz) - 提取PDF內容和格式資訊
  2. python-docx - 構建Word文件

提取的格式資訊包括:

  • 字型名稱、字號
  • 文本對齊方式
  • 粗體、斜體、下劃線標誌
  • 文本顏色(RGB)
  • 段落位置座標

字型對映表

PDF字型 Word字型
宋體, SimSun 宋體
黑體, SimHei 黑體
楷體, SimKai 楷體_GB2312
仿宋, SimFang 仿宋_GB2312
Times New Roman Times New Roman
Arial, Helvetica Arial
微軟雅黑, Microsoft YaHei 微軟雅黑

🤖 AI 評測

這個Skill質量中等,功能覆蓋範圍較廣,字型、字號、對齊、段落格式等核心轉換做得不錯,中文字型對映也比較智慧。但存在一些明顯不足:測試指令碼和文件示例有錯誤,會給使用者造成困惑;表格只能提取文字、保留不了格式;圖片處理偶爾會出問題;不支援頁首頁尾。文件描述與實際功能有偏差,轉換效果可能達不到宣傳的那麼好。轉換重要文件前建議先測試一下。

📊 多維度評分

適應性4.2
規範性4
有效性4.1
可靠性4.3
可信度5

📁 包含檔案 (5 個)

📄 SKILL.md 3.2 KB
📄 _meta.json 142 B
📄 references/format_reference.md 2 KB
📄 scripts/convert.py 11.9 KB
📄 scripts/test_convert.py 1.2 KB