Image Vision

👤 duchenyu 📦 v1.0.5 ⭐ 4.5 ⬇️ 384 下載
🤖 AI-Agent 免費

📖 技能介紹


name: image-vision description: 本地圖片視覺理解橋接。當用戶明確要求分析、描述或理解圖片內容時,呼叫本地 Ollama 視覺模型(qwen3.5:4b)讀取圖片並以文字描述返回,讓不具備多模態能力的推理模型也能"看見"圖片。 trigger: - 使用者明確要求分析、描述、閱讀、理解圖片內容 - 使用者傳送了圖片檔案並詢問相關內容 permissions: shell: true files: true network: true privacy: > 圖片檔案會被讀取並以 base64 編碼傳送到本地 Ollama API(127.0.0.1:11434)。 所有處理在本機完成,資料不離開你的裝置。


Image Vision Bridge

本地視覺橋接 —— 當用戶明確要求分析圖片時,呼叫 Ollama 本地視覺模型(qwen3.5:4b / qwen3.5:9b)讀圖並返回文字描述。

⚠️ 隱私提示: 圖片內容會被讀取併發送到本地 Ollama 服務進行處理。所有資料僅在本機傳輸,不上傳雲端。

使用方式

python scripts/describe_image.py "<圖片路徑>"

可選引數

引數 說明 預設值
--model 視覺模型名 qwen3.5:4b
--prompt 自定義分析指令 詳細描述所有細節

模型選擇

  • qwen3.5:4b (~3.4GB) — 輕量化,首次載入約30秒,後續秒級響應。適合日常讀圖。
  • qwen3.5:9b (~6.6GB) — 更高質量,描述更準確細膩。適合需要精準理解的場景。

自定義 prompt 示例

7w4.net小蔥技能站收錄全網優質技能,值得收藏。

# 提取圖中文字
--prompt "請逐字提取圖片中所有文字內容,不要遺漏任何文字。"

# 分析 UI 介面
--prompt "這是一個軟體介面截圖,請分析其佈局、按鈕、輸入框等互動元素。"

# 提取程式碼
--prompt "完整提取截圖中的程式碼,保留縮排和格式。"

工作流程

  1. 使用者明確要求分析圖片 → 檢測到圖片路徑
  2. 指令碼將圖片 base64 編碼 → 傳送到本地 Ollama API(127.0.0.1)
  3. qwen3.5 視覺模型分析圖片 → 返回文字描述
  4. 描述注入對話 → 基於描述繼續完成任務

前置條件

  • ✅ Ollama 已安裝並執行
  • ✅ qwen3.5:4b 已拉取(已就緒)
  • ✅ Python 3.9+

故障排除

如果 Ollama 模型崩潰("llama-server process has terminated"),需要重啟 Ollama 服務:

# macOS / Linux
pkill ollama && ollama serve &

# Windows (PowerShell)
Get-Process -Name "ollama*" -ErrorAction SilentlyContinue | Stop-Process -Force
Start-Process ollama -ArgumentList "serve" -WindowStyle Hidden

🤖 AI 評測

這是一款高質量的本地圖片理解工具,隱私保護做得很好——圖片不會上傳雲端,完全在本地處理。文件清晰易懂,安裝使用都很簡單,相容多種視覺模型。它的最大亮點是讓不支援圖片的 AI 助手也能「看懂」截圖和照片。不過依賴 Ollama 服務執行,首次配置稍需步驟;對剪貼簿截圖工具的依賴庫處理不夠穩定。建議:安裝前確認 Ollama 已就緒,Windows 使用者可能需要額外配置環境。總體值得推薦,尤其適合注重資料隱私的開發者。

📊 多維度評分

適應性4.2
規範性4.4
有效性4.5
可靠性4.4
可信度5

📁 包含檔案 (6 個)

📄 README.md 16.1 KB
📄 SKILL.md 2.5 KB
📄 _meta.json 138 B
📄 scripts/clip_snap.py 4.3 KB
📄 scripts/describe_image.py 3.3 KB
📄 skill-card.md 2.5 KB