🤖

Qwen-VL 圖片識別

👤 Rory 📦 v1.0.2 ⭐ 4.6 ⬇️ 1.2K 下載
🤖 AI-Agent 免費 🔑 需 API Key

📖 技能介紹


slug: qwen-vl-image-reader name: qwen-vl-image-reader displayName: Qwen-VL 圖片識別 version: 1.0.1 description: 為 DeepSeek 等純文本 LLM Agent 提供圖片識別能力。通過阿里通義千問視覺模型 Qwen-VL 解析圖片,將視覺內容轉為結構化 Markdown 文本,讓純文本模型也能"看懂"圖片。支援截圖、文件、圖表、照片等。

7w4.net有更好的技能外掛。


Qwen-VL 圖片識別技能

背景與場景

痛點

當前很多 Agent 使用 DeepSeek 等純文本大語言模型作為推理引擎。這類模型雖然文本能力出色,但不支援多模態輸入,無法直接"看到"圖片內容。當用戶傳送截圖、文件照片、圖表、二維碼等圖片時,Agent 只能回覆"我看不到圖片"。

解決方案

本技能通過在 Agent 和純文本模型之間增加一個 視覺預處理層

使用者傳送圖片
    ↓
┌─────────────────────────┐
│  Qwen-VL 視覺模型       │  ← 阿里通義千問(支援多模態)
│  解析圖片 → 輸出 Markdown │
└─────────────────────────┘
    ↓ 結構化文本描述
┌─────────────────────────┐
│  DeepSeek / 純文本模型   │  ← 主推理引擎
│  基於描述繼續推理分析     │
└─────────────────────────┘
    ↓
使用者獲得有圖片理解的回答

核心價值:不需要更換主模型,零侵入地讓純文本 Agent 獲得圖片理解能力。

適用場景

場景 示例
📸 截圖分析 企業微信/釘釘聊天截圖、系統介面截圖
📄 文件識別 PDF截圖、紙質文件拍照、合同/發票照片
📊 圖表解讀 K線圖、柱狀圖、餅圖、走勢圖截圖
🖼️ 照片描述 產品照片、場景照片的內容描述
🔍 資訊提取 二維碼/條形碼、名片、選單、公告牌
📋 表格識別 圖片中的表格資料提取為結構化 Markdown

前置條件

使用者需要在阿里雲百鍊平臺申請 DashScope API Key(新使用者有免費額度)。

專案 說明
註冊地址 https://bailian.console.aliyun.com
環境變數 export DASHSCOPE_API_KEY=你的金鑰
費用 新使用者免費額度充足,個人使用基本無需付費
依賴 Python requests 庫(通常已預裝)

觸發條件

當用戶傳送或上傳圖片檔案(png/jpg/jpeg/webp/bmp),並要求檢視、分析、總結、提取資訊時,Agent 呼叫本技能。

工作流程

Step 1: 接收使用者上傳的圖片檔案路徑
    ↓
Step 2: 指令碼讀取圖片並轉為 base64
    ↓
Step 3: 呼叫阿里雲 DashScope API(Qwen-VL-Plus)
    ↓
Step 4: 模型返回結構化 Markdown 描述
    ↓
Step 5: Agent 將描述注入對話上下文
    ↓
Step 6: 純文本模型基於描述進行後續推理

執行命令

python3 skills/qwen-vl-image-reader/scripts/analyze_image.py \
  --image_path <圖片檔案路徑>

指令碼會自動從環境變數 DASHSCOPE_API_KEY 讀取金鑰,無需手動傳入。

進階用法

# 使用更強的模型(qwen-vl-max,更貴但更精準)
python3 skills/qwen-vl-image-reader/scripts/analyze_image.py \
  --image_path <圖片路徑> \
  --model qwen-vl-max

支援的圖片格式

格式 說明
.png PNG 圖片(最常用)
.jpg / .jpeg JPEG 照片/截圖
.webp WebP 格式(網頁常見)
.bmp BMP 點陣圖

輸出格式

模型返回結構化 Markdown,包含以下資訊維度:

### 1. 圖片型別
截圖 / 文件 / 圖表 / 照片 / 其他

### 2. 文字內容
圖片中提取到的所有文字(如介面文字、文件內容、表格資料)

### 3. 視覺描述
圖片中的關鍵視覺元素、佈局結構、顏色、圖示等

### 4. 結構化資料(如有)
表格、列表、層級結構等整理為 Markdown 格式

錯誤處理

錯誤型別 提示資訊
檔案不存在 ❌ 圖片檔案不存在
格式不支援 ❌ 僅支援 png/jpg/webp/bmp
API Key 未配置 ❌ 未找到 DASHSCOPE_API_KEY 環境變數
API 呼叫失敗 ❌ 檢查網路連線或 API Key 配置
API 超時 ⏱️ 解析超時,請稍後重試
圖片損壞 ❌ 圖片無法讀取,請重新發送

模型說明

模型 特點 費用
qwen-vl-plus(預設) 速度快,價效比高,日常使用推薦
qwen-vl-max 更強,複雜圖表/文件識別更準 較高

兩者均支援:中文 OCR、英文 OCR、圖表理解、介面截圖分析、文件識別。

Token 消耗參考(實際資料)

圖片型別 圖片大小 image tokens 輸入 輸出 總計
小截圖(302×202) 16KB 56 126 ~420 ~545
大截圖(含大量文字) 128KB 152 189 ~1050 ~1241

與 ms-qwen-vl(魔搭社群版)的對比

SkillHub 上還有一個類似的圖片識別技能 ms-qwen-vl,它呼叫的是 ModelScope(魔搭社群) 的 Qwen3-VL API。以下是詳細對比:

對比維度 本技能 qwen-vl-image-reader ms-qwen-vl(魔搭版)
🏢 API 平臺 阿里雲百鍊 DashScope 魔搭社群 ModelScope
🤖 模型 Qwen-VL-Plus / Max Qwen3-VL-30B / 235B
🛠️ Python 依賴 requests(1個) openai + PIL + python-dotenv(3個)
📦 安裝體積 ✅ 超輕量,秒級部署 ⚠️ 較大,需安裝 OpenAI SDK
🎯 任務型別 通用描述+文字提取 5種:描述/OCR/問答/檢測/圖表
🔧 使用門檻 ✅ 一行命令,無需額外 SDK ⚠️ 需配置 .env 檔案
💰 免費額度 阿里雲百鍊新使用者免費 ModelScope 贈送額度
🔐 模型選擇 --model 引數切換 --precise 精細模式切換
📝 程式碼風格 原生 HTTP 請求(零依賴) OpenAI SDK 相容呼叫

如何選擇

你的場景 推薦
📱 追求輕量快速部署,不想裝額外依賴 本技能
🎯 需要多種任務型別(OCR/物體檢測/圖表解析等) ✅ ms-qwen-vl
👤 已有阿里雲百鍊賬號 本技能(直接用)
👤 已有魔搭社群賬號 ✅ ms-qwen-vl
🔄 兩者不衝突 可以同時安裝,按需選用

與其他方案對比

方案 優點 缺點
❌ Tesseract OCR 免費、本地執行 對截圖/圖表識別率低,中文差
❌ MinerU 文件解析 適合掃描件 需要 GPU,不支援普通圖片
本技能 Qwen-VL 識別率高、中文優秀、免費額度夠用、零依賴 需要網路和 API Key

🤖 AI 評測

這是一款做工精良的圖片識別工具,整體質量優秀。它最大的亮點是幾乎不依賴任何外部庫,安裝使用非常簡便。文件寫得非常詳細清楚,程式碼邏輯清晰,錯誤提示也很友好。唯一的不足是需要配合阿里雲 API 使用,會產生少量費用。總體來說非常值得推薦。

📊 多維度評分

適應性4.5
規範性4.5
有效性4.6
可靠性4.6
可信度5

📁 包含檔案 (4 個)

📄 README.md 450 B
📄 SKILL.md 7 KB
📄 _meta.json 453 B
📄 scripts/analyze_image.py 5.9 KB