本地視覺橋接 —— 當用戶明確要求分析圖片時,呼叫 Ollama 本地視覺模型(qwen3.5:4b / qwen3.5:9b)讀圖並返回文字描述。
⚠️ 隱私提示: 圖片內容會被讀取併發送到本地 Ollama 服務進行處理。所有資料僅在本機傳輸,不上傳雲端。
python scripts/describe_image.py "<圖片路徑>"
小蔥技能7w4.net有完整的技能分類。
| 引數 | 說明 | 預設值 |
|---|---|---|
--model |
視覺模型名 | qwen3.5:4b |
--prompt |
自定義分析指令 | 詳細描述所有細節 |
# 提取圖中文字
--prompt "請逐字提取圖片中所有文字內容,不要遺漏任何文字。"
# 分析 UI 介面
--prompt "這是一個軟體介面截圖,請分析其佈局、按鈕、輸入框等互動元素。"
# 提取程式碼
--prompt "完整提取截圖中的程式碼,保留縮排和格式。"
如果 Ollama 模型崩潰("llama-server process has terminated"),需要重啟 Ollama 服務:
# macOS / Linux
pkill ollama && ollama serve &
# Windows (PowerShell)
Get-Process -Name "ollama*" -ErrorAction SilentlyContinue | Stop-Process -Force
Start-Process ollama -ArgumentList "serve" -WindowStyle Hidden 這是一款高質量的本地圖片理解工具,隱私保護做得很好——圖片不會上傳雲端,完全在本地處理。文件清晰易懂,安裝使用都很簡單,相容多種視覺模型。它的最大亮點是讓不支援圖片的 AI 助手也能「看懂」截圖和照片。不過依賴 Ollama 服務執行,首次配置稍需步驟;對剪貼簿截圖工具的依賴庫處理不夠穩定。建議:安裝前確認 Ollama 已就緒,Windows 使用者可能需要額外配置環境。總體值得推薦,尤其適合注重資料隱私的開發者。