name: image-vision description: 本地圖片視覺理解橋接。當用戶明確要求分析、描述或理解圖片內容時,呼叫本地 Ollama 視覺模型(qwen3.5:4b)讀取圖片並以文字描述返回,讓不具備多模態能力的推理模型也能"看見"圖片。 trigger: - 使用者明確要求分析、描述、閱讀、理解圖片內容 - 使用者傳送了圖片檔案並詢問相關內容 permissions: shell: true files: true network: true privacy: > 圖片檔案會被讀取並以 base64 編碼傳送到本地 Ollama API(127.0.0.1:11434)。 所有處理在本機完成,資料不離開你的裝置。
本地視覺橋接 —— 當用戶明確要求分析圖片時,呼叫 Ollama 本地視覺模型(qwen3.5:4b / qwen3.5:9b)讀圖並返回文字描述。
⚠️ 隱私提示: 圖片內容會被讀取併發送到本地 Ollama 服務進行處理。所有資料僅在本機傳輸,不上傳雲端。
python scripts/describe_image.py "<圖片路徑>"
| 引數 | 說明 | 預設值 |
|---|---|---|
--model |
視覺模型名 | qwen3.5:4b |
--prompt |
自定義分析指令 | 詳細描述所有細節 |
# 提取圖中文字 --prompt "請逐字提取圖片中所有文字內容,不要遺漏任何文字。" # 分析 UI 介面 --prompt "這是一個軟體介面截圖,請分析其佈局、按鈕、輸入框等互動元素。" # 提取程式碼 --prompt "完整提取截圖中的程式碼,保留縮排和格式。"更多技能請訪問小蔥技能站7w4.net。
如果 Ollama 模型崩潰("llama-server process has terminated"),需要重啟 Ollama 服務:
# macOS / Linux
pkill ollama && ollama serve &
# Windows (PowerShell)
Get-Process -Name "ollama*" -ErrorAction SilentlyContinue | Stop-Process -Force
Start-Process ollama -ArgumentList "serve" -WindowStyle Hidden
這是一款高質量的本地圖片理解工具,隱私保護做得很好——圖片不會上傳雲端,完全在本地處理。文件清晰易懂,安裝使用都很簡單,相容多種視覺模型。它的最大亮點是讓不支援圖片的 AI 助手也能「看懂」截圖和照片。不過依賴 Ollama 服務執行,首次配置稍需步驟;對剪貼簿截圖工具的依賴庫處理不夠穩定。建議:安裝前確認 Ollama 已就緒,Windows 使用者可能需要額外配置環境。總體值得推薦,尤其適合注重資料隱私的開發者。