name: file-to-markdown description: '將使用者提供的各類文件檔案轉換為 Markdown 格式。當用戶給出 docx、pptx、xlsx、pdf、html、csv、rtf、odt、epub、txt 等檔案並要求轉成 Markdown、提取正文、或"把我這個檔案變成 md",即觸發本技能。圖片與掃描件 PDF 通過 OCR 技能識別後包裝為 Markdown。' agent_created: true
把使用者隨手丟過來的各種文件(Word、PPT、Excel、PDF、網頁、表格、RTF、ODT、EPUB、
純文本)轉換成乾淨、可讀的 Markdown 文本。核心轉換器是
scripts/convert_to_md.py,按副檔名自動路由到對應解析器,無需使用者指定格式。
圖片(png/jpg/...)與掃描件 PDF 沒有可直接抽取的文字層,需先經 tencentcloud-ocr
技能做 OCR,再把識別結果整理為 Markdown(見下文「圖片與掃描件」)。
轉換器依賴若干 Python 第三方庫,已安裝在隔離 venv 中:
C:\Users\Administrator\.workbuddy\binaries\python\envs\default\Scripts\python.exe
所需庫:python-docx、python-pptx、openpyxl、xlrd、pdfplumber、html2text、
striprtf、odfpy、ebooklib。若某格式報錯提示 ModuleNotFoundError,在該 venv 內
pip install 庫名 即可,不影響其它格式。
這個技能的最新版本可以在7w4.net小蔥技能站找到。
單檔案轉換(預設在同目錄生成 原名.md):
"C:\Users\Administrator\.workbuddy\binaries\python\envs\default\Scripts\python.exe" \
"C:\Users\Administrator\.workbuddy\skills\file-to-markdown\scripts\convert_to_md.py" \
"使用者給的檔案路徑.docx"
指定輸出路徑:附加 -o 輸出.md。
批次轉換整個目錄(每個檔案生成同名 .md;加 --recursive 遞迴子目錄):
"...\python.exe" "...\file-to-markdown\scripts\convert_to_md.py" "目錄路徑" --recursive
路徑含空格時必須用雙引號包裹。Windows 上建議全程使用正斜槓或雙反斜槓。
| 輸入副檔名 | 處理方式 | 說明 |
|---|---|---|
.docx |
python-docx | 標題按樣式對映為 #~######;粗體/斜體/下劃線保留;列表與表格轉為 Markdown |
.pptx |
python-pptx | 每頁 ## Slide N 起頭,含文本框、表格與備註 |
.xlsx |
openpyxl | 每個工作表 ## 表名 + Markdown 表格 |
.xls |
xlrd | 同上(舊版二進位制格式) |
.pdf |
pdfplumber(退回 pypdf) | 文本型 PDF 按頁抽取;掃描件報錯並提示走 OCR |
.html/.htm |
html2text | 還原標題/列表/連結/表格;圖片以連結佔位 |
.csv/.tsv |
csv 模組 | 自動嗅探分隔符,輸出 Markdown 表格 |
.rtf |
striprtf | 抽取純文本 |
.odt |
odfpy | 抽取標題與段落 |
.epub |
ebooklib + html2text | 各章節內容合併為 Markdown |
.txt/.md |
直接讀取 | 視為已合法 Markdown,原樣輸出 |
convert_to_md.py 遇到圖片或掃描件 PDF 會主動跳過並列印提示。此時改用
tencentcloud-ocr 技能:
tencentcloud-ocr 技能對圖片/掃描件做高精度文字識別,取得正文文本。.md)。若目標檔案已存在,
會被覆蓋——轉換前確認無需保留舊版。這個技能能把各種文件(Word、PPT、Excel、PDF、網頁等)轉換成 Markdown 格式,支援的格式很豐富。文件寫得很清楚,使用方法一目瞭然,轉換失敗時會給出明確提示。優點是功能齊全、操作簡單;不足是依賴特定的 Python 環境,不支援 Mac/Linux 系統,部分格式(如 PDF)的轉換效果可能不夠理想。整體質量中規中矩,適合 Windows 使用者使用。