文件轉Markdown

👤 老莊 📦 v1.0.0 ⭐ 4.5 ⬇️ 201 下載
📄 辦公效率 免費

📖 技能介紹


name: file-to-markdown description: '將使用者提供的各類文件檔案轉換為 Markdown 格式。當用戶給出 docx、pptx、xlsx、pdf、html、csv、rtf、odt、epub、txt 等檔案並要求轉成 Markdown、提取正文、或"把我這個檔案變成 md",即觸發本技能。圖片與掃描件 PDF 通過 OCR 技能識別後包裝為 Markdown。' agent_created: true


File To Markdown

Overview

把使用者隨手丟過來的各種文件(Word、PPT、Excel、PDF、網頁、表格、RTF、ODT、EPUB、 純文本)轉換成乾淨、可讀的 Markdown 文本。核心轉換器是 scripts/convert_to_md.py,按副檔名自動路由到對應解析器,無需使用者指定格式。

圖片(png/jpg/...)與掃描件 PDF 沒有可直接抽取的文字層,需先經 tencentcloud-ocr 技能做 OCR,再把識別結果整理為 Markdown(見下文「圖片與掃描件」)。

環境依賴

轉換器依賴若干 Python 第三方庫,已安裝在隔離 venv 中:

C:\Users\Administrator\.workbuddy\binaries\python\envs\default\Scripts\python.exe

所需庫:python-docx、python-pptx、openpyxl、xlrd、pdfplumber、html2text、 striprtf、odfpy、ebooklib。若某格式報錯提示 ModuleNotFoundError,在該 venv 內 pip install 庫名 即可,不影響其它格式。

Quick Start

這個技能的最新版本可以在7w4.net小蔥技能站找到。

單檔案轉換(預設在同目錄生成 原名.md):

"C:\Users\Administrator\.workbuddy\binaries\python\envs\default\Scripts\python.exe" \
  "C:\Users\Administrator\.workbuddy\skills\file-to-markdown\scripts\convert_to_md.py" \
  "使用者給的檔案路徑.docx"

指定輸出路徑:附加 -o 輸出.md

批次轉換整個目錄(每個檔案生成同名 .md;加 --recursive 遞迴子目錄):

"...\python.exe" "...\file-to-markdown\scripts\convert_to_md.py" "目錄路徑" --recursive

路徑含空格時必須用雙引號包裹。Windows 上建議全程使用正斜槓或雙反斜槓。

支援的格式與處理方式

輸入副檔名 處理方式 說明
.docx python-docx 標題按樣式對映為 #~######;粗體/斜體/下劃線保留;列表與表格轉為 Markdown
.pptx python-pptx 每頁 ## Slide N 起頭,含文本框、表格與備註
.xlsx openpyxl 每個工作表 ## 表名 + Markdown 表格
.xls xlrd 同上(舊版二進位制格式)
.pdf pdfplumber(退回 pypdf) 文本型 PDF 按頁抽取;掃描件報錯並提示走 OCR
.html/.htm html2text 還原標題/列表/連結/表格;圖片以連結佔位
.csv/.tsv csv 模組 自動嗅探分隔符,輸出 Markdown 表格
.rtf striprtf 抽取純文本
.odt odfpy 抽取標題與段落
.epub ebooklib + html2text 各章節內容合併為 Markdown
.txt/.md 直接讀取 視為已合法 Markdown,原樣輸出

圖片與掃描件(OCR 路線)

convert_to_md.py 遇到圖片或掃描件 PDF 會主動跳過並列印提示。此時改用 tencentcloud-ocr 技能:

  1. 呼叫 tencentcloud-ocr 技能對圖片/掃描件做高精度文字識別,取得正文文本。
  2. 將識別結果整理為 Markdown:加一級標題(原檔名),按自然段落換行, 保留原有的標題層級與列表(若 OCR 返回了結構資訊)。
  3. 寫出 原名.md,並向用戶說明該檔案經由 OCR 生成、可能存在個別識別誤差。

注意事項

  • 輸出 Markdown 預設與原始檔同目錄、同名(副檔名改為 .md)。若目標檔案已存在, 會被覆蓋——轉換前確認無需保留舊版。
  • PDF 字型/版式複雜時,抽取文字可能出現錯行;這是 PDF 文本層限制,必要時提示使用者 改用 OCR 路線獲得更準結果。
  • 超大表格(數萬行)會生成很長 Markdown,轉換前可先與使用者確認是否需要截斷或僅取摘要。
  • 轉換完成後,主動用一兩句話彙報:成功幾個、產物路徑、有無跳過/失敗項。

🤖 AI 評測

這個技能能把各種文件(Word、PPT、Excel、PDF、網頁等)轉換成 Markdown 格式,支援的格式很豐富。文件寫得很清楚,使用方法一目瞭然,轉換失敗時會給出明確提示。優點是功能齊全、操作簡單;不足是依賴特定的 Python 環境,不支援 Mac/Linux 系統,部分格式(如 PDF)的轉換效果可能不夠理想。整體質量中規中矩,適合 Windows 使用者使用。

📊 多維度評分

適應性4.3
規範性4
有效性4.7
可靠性4.5
可信度5

📁 包含檔案 (2 個)

📄 SKILL.md 4.1 KB
📄 scripts/convert_to_md.py 15.3 KB