slug: qwen-vl-image-reader name: qwen-vl-image-reader displayName: Qwen-VL 圖片識別 version: 1.0.1 description: 為 DeepSeek 等純文本 LLM Agent 提供圖片識別能力。通過阿里通義千問視覺模型 Qwen-VL 解析圖片,將視覺內容轉為結構化 Markdown 文本,讓純文本模型也能"看懂"圖片。支援截圖、文件、圖表、照片等。
小蔥技能有更好的技能skills外掛。
當前很多 Agent 使用 DeepSeek 等純文本大語言模型作為推理引擎。這類模型雖然文本能力出色,但不支援多模態輸入,無法直接"看到"圖片內容。當用戶傳送截圖、文件照片、圖表、二維碼等圖片時,Agent 只能回覆"我看不到圖片"。
本技能通過在 Agent 和純文本模型之間增加一個 視覺預處理層:
使用者傳送圖片
↓
┌─────────────────────────┐
│ Qwen-VL 視覺模型 │ ← 阿里通義千問(支援多模態)
│ 解析圖片 → 輸出 Markdown │
└─────────────────────────┘
↓ 結構化文本描述
┌─────────────────────────┐
│ DeepSeek / 純文本模型 │ ← 主推理引擎
│ 基於描述繼續推理分析 │
└─────────────────────────┘
↓
使用者獲得有圖片理解的回答
核心價值:不需要更換主模型,零侵入地讓純文本 Agent 獲得圖片理解能力。
| 場景 | 示例 |
|---|---|
| 📸 截圖分析 | 企業微信/釘釘聊天截圖、系統介面截圖 |
| 📄 文件識別 | PDF截圖、紙質文件拍照、合同/發票照片 |
| 📊 圖表解讀 | K線圖、柱狀圖、餅圖、走勢圖截圖 |
| 🖼️ 照片描述 | 產品照片、場景照片的內容描述 |
| 🔍 資訊提取 | 二維碼/條形碼、名片、選單、公告牌 |
| 📋 表格識別 | 圖片中的表格資料提取為結構化 Markdown |
使用者需要在阿里雲百鍊平臺申請 DashScope API Key(新使用者有免費額度)。
| 專案 | 說明 |
|---|---|
| 註冊地址 | https://bailian.console.aliyun.com |
| 環境變數 | export DASHSCOPE_API_KEY=你的金鑰 |
| 費用 | 新使用者免費額度充足,個人使用基本無需付費 |
| 依賴 | Python requests 庫(通常已預裝) |
當用戶傳送或上傳圖片檔案(png/jpg/jpeg/webp/bmp),並要求檢視、分析、總結、提取資訊時,Agent 呼叫本技能。
Step 1: 接收使用者上傳的圖片檔案路徑
↓
Step 2: 指令碼讀取圖片並轉為 base64
↓
Step 3: 呼叫阿里雲 DashScope API(Qwen-VL-Plus)
↓
Step 4: 模型返回結構化 Markdown 描述
↓
Step 5: Agent 將描述注入對話上下文
↓
Step 6: 純文本模型基於描述進行後續推理
python3 skills/qwen-vl-image-reader/scripts/analyze_image.py \
--image_path <圖片檔案路徑>
指令碼會自動從環境變數 DASHSCOPE_API_KEY 讀取金鑰,無需手動傳入。
# 使用更強的模型(qwen-vl-max,更貴但更精準)
python3 skills/qwen-vl-image-reader/scripts/analyze_image.py \
--image_path <圖片路徑> \
--model qwen-vl-max
| 格式 | 說明 |
|---|---|
.png |
PNG 圖片(最常用) |
.jpg / .jpeg |
JPEG 照片/截圖 |
.webp |
WebP 格式(網頁常見) |
.bmp |
BMP 點陣圖 |
模型返回結構化 Markdown,包含以下資訊維度:
### 1. 圖片型別
截圖 / 文件 / 圖表 / 照片 / 其他
### 2. 文字內容
圖片中提取到的所有文字(如介面文字、文件內容、表格資料)
### 3. 視覺描述
圖片中的關鍵視覺元素、佈局結構、顏色、圖示等
### 4. 結構化資料(如有)
表格、列表、層級結構等整理為 Markdown 格式
| 錯誤型別 | 提示資訊 |
|---|---|
| 檔案不存在 | ❌ 圖片檔案不存在 |
| 格式不支援 | ❌ 僅支援 png/jpg/webp/bmp |
| API Key 未配置 | ❌ 未找到 DASHSCOPE_API_KEY 環境變數 |
| API 呼叫失敗 | ❌ 檢查網路連線或 API Key 配置 |
| API 超時 | ⏱️ 解析超時,請稍後重試 |
| 圖片損壞 | ❌ 圖片無法讀取,請重新發送 |
| 模型 | 特點 | 費用 |
|---|---|---|
qwen-vl-plus(預設) |
速度快,價效比高,日常使用推薦 | 低 |
qwen-vl-max |
更強,複雜圖表/文件識別更準 | 較高 |
兩者均支援:中文 OCR、英文 OCR、圖表理解、介面截圖分析、文件識別。
| 圖片型別 | 圖片大小 | image tokens | 輸入 | 輸出 | 總計 |
|---|---|---|---|---|---|
| 小截圖(302×202) | 16KB | 56 | 126 | ~420 | ~545 |
| 大截圖(含大量文字) | 128KB | 152 | 189 | ~1050 | ~1241 |
SkillHub 上還有一個類似的圖片識別技能 ms-qwen-vl,它呼叫的是 ModelScope(魔搭社群) 的 Qwen3-VL API。以下是詳細對比:
| 對比維度 | 本技能 qwen-vl-image-reader | ms-qwen-vl(魔搭版) |
|---|---|---|
| 🏢 API 平臺 | 阿里雲百鍊 DashScope | 魔搭社群 ModelScope |
| 🤖 模型 | Qwen-VL-Plus / Max | Qwen3-VL-30B / 235B |
| 🛠️ Python 依賴 | ✅ 僅 requests(1個) |
❌ openai + PIL + python-dotenv(3個) |
| 📦 安裝體積 | ✅ 超輕量,秒級部署 | ⚠️ 較大,需安裝 OpenAI SDK |
| 🎯 任務型別 | 通用描述+文字提取 | 5種:描述/OCR/問答/檢測/圖表 |
| 🔧 使用門檻 | ✅ 一行命令,無需額外 SDK | ⚠️ 需配置 .env 檔案 |
| 💰 免費額度 | 阿里雲百鍊新使用者免費 | ModelScope 贈送額度 |
| 🔐 模型選擇 | --model 引數切換 |
--precise 精細模式切換 |
| 📝 程式碼風格 | 原生 HTTP 請求(零依賴) | OpenAI SDK 相容呼叫 |
| 你的場景 | 推薦 |
|---|---|
| 📱 追求輕量快速部署,不想裝額外依賴 | ✅ 本技能 |
| 🎯 需要多種任務型別(OCR/物體檢測/圖表解析等) | ✅ ms-qwen-vl |
| 👤 已有阿里雲百鍊賬號 | ✅ 本技能(直接用) |
| 👤 已有魔搭社群賬號 | ✅ ms-qwen-vl |
| 🔄 兩者不衝突 | 可以同時安裝,按需選用 |
| 方案 | 優點 | 缺點 |
|---|---|---|
| ❌ Tesseract OCR | 免費、本地執行 | 對截圖/圖表識別率低,中文差 |
| ❌ MinerU 文件解析 | 適合掃描件 | 需要 GPU,不支援普通圖片 |
| ✅ 本技能 Qwen-VL | 識別率高、中文優秀、免費額度夠用、零依賴 | 需要網路和 API Key |
這是一款做工精良的圖片識別工具,整體質量優秀。它最大的亮點是幾乎不依賴任何外部庫,安裝使用非常簡便。文件寫得非常詳細清楚,程式碼邏輯清晰,錯誤提示也很友好。唯一的不足是需要配合阿里雲 API 使用,會產生少量費用。總體來說非常值得推薦。