論文精讀翻譯

👤 fandywang87 📦 v1.0.0 ⭐ 4.4 ⬇️ 2.1K 下載
📚 知識管理 免費

📖 技能介紹


name: paper-translation description: > ArXiv 論文精讀級中文翻譯,同步到 IMA 知識庫 + 騰訊文件。 基於 5 篇論文(MDL/Kunlun/OneTrans/RankMixer/MixFormer)3 輪迭代實戰經驗。 觸發場景:翻譯論文、翻譯 arxiv、論文精讀、論文中文翻譯、paper translation、 translate paper、翻譯這篇論文、幫我翻譯、精讀翻譯、論文全文翻譯、 把這篇論文翻譯成中文、翻譯 arxiv 論文到知識庫。


ArXiv 論文精讀翻譯

Base directory for this skill: {SKILL_DIR}

將 ArXiv 論文逐段翻譯成中文,生成雙版本 Markdown(IMA + 騰訊文件),並上傳到兩個平臺。

三條鐵律

  1. 完整翻譯不精簡 — 逐段翻譯每個 paragraph,不遺漏任何論證細節。大模型傾向於"幫你歸納",但使用者要的是精讀級翻譯。
  2. 譯註顯式標記 — 大模型解讀必須用 > **[譯註]**:... 引用塊,絕不混入原文翻譯。

    小蔥技能有更好的技能skills外掛。

  3. 簡稱首次標全稱,後續直接用 — 首次出現標註全稱並核對原文,後續不再展開。避免錯誤展開(如 TA=Target Attention 被誤寫為 Transformer Aggregator)。

標準 6 步流程

Step 1: 獲取原文

web_fetch https://arxiv.org/html/<id>v<n>
  • 只 fetch 一次,節省 token
  • 同步下載圖片:curl -sL -o x{n}.png https://arxiv.org/html/<paper_id>/x{n}.png
  • 下載後檢查檔案大小,相同大小的異常檔案(404 垃圾響應)刪除

Step 2: 翻譯生成

  • 逐段翻譯,不做精簡
  • 首行元資訊:原標題、arxiv 連結、年月、機構、翻譯輔助大模型名稱
  • 簡稱首次出現標全稱(核對原文),後續用簡稱
  • 譯註用 > **[譯註]**:... 格式
  • 結構化排版:多級標題 + 列表 + 加粗 + 表格 + 引用塊
  • 公式保留 LaTeX;\bm 全部替換為 \boldsymbol
  • 圖表按原文順序插入所在章節標題之後、小節正文之前
  • 參考文獻完整列出

表格處理策略: - 簡單表格 → Markdown 表格重寫(可搜尋/編輯) - 複雜表格(合併單元格/特殊排版)→ PyMuPDF 從 PDF 擷取

Step 3: 自動化校驗

翻譯完成後,執行校驗指令碼:

python3 {SKILL_DIR}/scripts/validate_translation.py <markdown_file>

校驗項:

檢查項 標準
章節完整性 包含:摘要/引言/相關工作/方法/實驗/結論/參考文獻
LaTeX 相容性 \bm 出現次數 = 0
譯註標記 數量 > 0,格式為 > **[譯註]**
參考文獻 條數列出供人工核對
圖片連結 外鏈格式正確

Step 4: 生成兩版 Markdown

  • IMA 版:圖片用 arxiv 外鏈 URL / base64 data URI
  • 騰訊文件版:用指令碼從 IMA 版自動替換圖片連結為 image_id

圖片上傳流程: 1. curl -sL -o x{n}.png https://arxiv.org/html/<paper_id>/x{n}.png 下載 2. 騰訊文件:mcporter call tencent-docs upload_image → 拿 image_id 3. IMA:直接用 arxiv 外鏈 URL

詳見 references/platform-compat.md

Step 5: 上傳 IMA 知識庫

# create_media → COS 上傳 → add_knowledge(media_type=7 = Markdown)
# 如遇 code=220030(限流),sleep 15s 重試,cos_key 仍有效

Step 6: 上傳騰訊文件

TITLE="【YYYY.MM|組織】XXX 中文翻譯"  # 必須 ≤36 字元
jq -n --arg title "$TITLE" --rawfile mdx "$FILE" --arg cf "markdown" \
  '{title:$title, mdx:$mdx, content_format:$cf}' > /tmp/args.json
mcporter call tencent-docs create_smartcanvas_by_mdx --args "$(cat /tmp/args.json)"

mcporter 傳大引數不支援 --args-file,必須用 --args "$(cat file.json)"

命名規範(強制)

平臺 格式 約束
騰訊文件標題 【YYYY.MM|組織】XXX 中文翻譯 ≤36 字元(按字元數,非位元組)
IMA 檔名 【YYYY.MM|組織】XXX 中文翻譯.md 同名加 .md
  • 兩平臺必須完全一致,不加 v2/圖文版 等字尾
  • 示例:【2026.02|ByteDance】MixFormer 中文翻譯

翻譯後 Checklist

完成翻譯後逐項確認:

  • [ ] grep -c '\\bm' = 0
  • [ ] 簡稱首次出現已標全稱且正確
  • [ ] 譯註均用 > **[譯註]**:... 格式
  • [ ] 圖表位置與原文章節順序一致
  • [ ] 參考文獻條數與原文一致
  • [ ] IMA 版和騰訊文件版圖片格式各自正確
  • [ ] 兩平臺檔名/標題完全一致
  • [ ] 首行包含論文元資訊(標題/連結/年月/機構/大模型名稱)

效率最佳化

  • web_fetch 一次原文(節省 token)
  • 直接生成最終版,不生成中間草稿(減少 50%+ 工具呼叫)
  • 圖片下載 + 上傳並行執行
  • 用指令碼自動從 IMA 版生成騰訊文件版
  • 自動化校驗指令碼在上傳前攔截格式問題

參考文件

🤖 AI 評測

這個翻譯 Skill 質量不錯,文件寫得很細緻,翻譯標準明確,還自帶自動校驗功能,能幫你避免漏翻、譯註亂加等常見問題。平臺適配也考慮得很周全。缺點是沒有任何示例,想知道實際效果只能自己試一把。翻譯質量本身不用擔心,只要按流程走,基本能保證精讀級的專業度。

📊 多維度評分

適應性4.5
規範性4.3
有效性4.6
可靠性4.2
可信度4.8

📁 包含檔案 (5 個)

📄 SKILL.md 5.1 KB
📄 _meta.json 136 B
📄 references/iteration-history.md 1.2 KB
📄 references/platform-compat.md 3.3 KB
📄 scripts/validate_translation.py 5.4 KB