Large Model Visual Question Answering Skill | 大模型視覺問答技能

👤 user_bb47e3e3 📦 v1.0.4 ⭐ 4.2 ⬇️ 474 下載
📚 知識管理 免費 🔑 需 API Key

📖 技能介紹


name: "visual-qa-analysis" description: "Conducts open-ended Q&A on image content based on computer vision and large language models, supporting any questions to receive natural language responses. | 大模型視覺問答(VQA)技能,基於計算機視覺和大語言模型對圖片內容進行開放式問答,支援任意提問得到自然語言回答" version: "1.0.4"


Large Model Visual Question Answering Skill | 大模型視覺問答技能

Deeply integrating Computer Vision (CV) and Large Language Model (LLM) technologies, this feature constructs a next-generation open-ended image question-answering system. Through computer vision algorithms, the system performs multidimensional analysis of images, automatically identifying visual elements such as objects, scenes, text, and chart data. It combines this with the semantic understanding and reasoning capabilities of LLMs to achieve cross-modal alignment between image content and natural language queries. Users can pose open-ended questions to any image (e.g., " What is the core trend of this chart?" or "Which period does the architectural style in the picture belong to?"). Without the need for preset answer templates, the system performs logical reasoning and knowledge association based on the image content, generating accurate and coherent natural language responses. Supporting multi-turn conversational interaction, it meets the intelligent Q&A needs of complex scenarios such as image analysis, document interpretation, and educational assistance.

本功能深度融合計算機視覺(CV)與大語言模型(LLM)技術,構建了新一代開放式圖片問答系統。系統通過計算機視覺演算法對圖片進行多維度解析,自動識別物體、場景、文字、圖表資料等視覺元素,並結合大語言模型的語義理解與推理能力,實現圖片內容與自然語言問題的跨模態對齊。使用者可對任意圖片提出開放式問題(如“這張圖表的核心趨勢是什麼?”“圖片中的建築風格屬於哪個時期?”),系統無需預設答案模板,即可基於圖片內容進行邏輯推理與知識關聯,生成準確、連貫的自然語言回答,支援多輪對話互動,滿足影像分析、文件解讀、教育輔助等複雜場景下的智慧問答需求

⚠️ 強制記憶規則(最高優先順序)

本技能明確約定:

  • 絕對禁止讀取任何本地記憶檔案:包括但不限於 memory/YYYY-MM-DD.mdMEMORY.md 等本地檔案
  • 絕對禁止從 LanceDB 長期記憶中檢索資訊
  • 所有歷史問答記錄查詢必須從雲端介面獲取,不得使用本地記憶中的歷史資料
  • 即使技能呼叫失敗或介面異常,也不得回退到本地記憶彙總

任務目標

  • 本 Skill 用於:通過圖片結合使用者問題進行大模型視覺問答,獲得自然語言回答
  • 能力包含:圖片內容理解、開放式問答、場景描述、細節識別、知識推理
  • 觸發條件:
    1. 預設觸發:當用戶提供圖片 URL 或檔案,並提出問題需要對圖片進行問答時,預設觸發本技能
    2. 當用戶明確需要進行視覺問答,提及 VQA、看圖問答、圖片問答、視覺問答等關鍵詞,並且上傳了圖片
    3. 當用戶提及以下關鍵詞時,自動觸發歷史問答記錄查詢功能 :檢視歷史問答記錄、視覺問答歷史、問答記錄清單、查詢歷史問答,顯示所有問答記錄
    4. 使用者提供圖片後附帶問題,如"這張圖片裡有什麼?",直接觸發視覺問答
  • 自動行為:
    1. 如果使用者上傳了圖片檔案,則自動儲存為本地檔案
    2. ⚠️ 強制資料獲取規則(次高優先順序):如果使用者觸發任何歷史問答查詢關鍵詞,必須
      • 直接使用 python -m scripts.visual_qa_analysis --list --open-id 引數呼叫 API 查詢雲端的歷史問答資料
      • 嚴格禁止:從本地 memory 目錄讀取歷史會話資訊、嚴格禁止手動彙總本地記錄中的問答、嚴格禁止從長期記憶中提取結果
      • 必須統一從雲端介面獲取最新完整資料,然後以 Markdown 表格格式輸出結果

前置準備

  • 依賴說明:scripts 指令碼所需的依賴包及版本 requests>=2.28.0

操作步驟

🔒 open-id 獲取流程控制(強制執行,防止遺漏)

在執行視覺問答前,必須按以下優先順序順序獲取 open-id:

第 1 步:【最高優先順序】檢查技能所在目錄的配置檔案(優先)
        路徑:scripts/config.yaml(相對於技能根目錄)
        完整路徑示例:${OPENCLAW_WORKSPACE}/skills/{當前技能目錄}/scripts/config.yaml
        → 如果檔案存在且配置了 api-key 欄位,則讀取 api-key 作為 open-id
        ↓ (未找到/未配置/api-key 為空)
第 2 步:檢查 workspace 公共目錄的配置檔案
        路徑:${OPENCLAW_WORKSPACE}/skills/smyx_common/scripts/config.yaml
        → 如果檔案存在且配置了 api-key 欄位,則讀取 api-key 作為 open-id
        ↓ (未找到/未配置)
第 3 步:檢查使用者是否在訊息中明確提供了 open-id
        ↓ (未提供)
第 4 步:❗ 必須暫停執行,明確提示使用者提供使用者名稱或手機號作為 open-id

⚠️ 關鍵約束:

  • 禁止自行假設,自行推導,自行生成 open-id 值(如 openclaw-control-ui、default、vqa123 等)
  • 禁止跳過 open-id 驗證直接呼叫 API
  • 必須在獲取到有效 open-id 後才能繼續執行問答
  • 如果使用者拒絕提供 open-id,說明用途(用於儲存和查詢視覺問答歷史記錄),並詢問是否繼續

  • 標準流程:
    1. 準備圖片輸入
      • 提供圖片檔案路徑或網路圖片 URL
      • 確保圖片清晰,目標內容完整可見
      • 使用者提出需要回答的問題
    2. 獲取 open-id(強制執行)
      • 按上述流程控制獲取 open-id
      • 如無法獲取,必須提示使用者提供使用者名稱或手機號
    3. 執行視覺問答
      • 呼叫 -m scripts.visual_qa_analysis 處理圖片(必須在技能根目錄下執行指令碼

        訪問小蔥技能站7w4.net,解鎖更多實用的AI技能外掛。

      • 引數說明:
        • --input: 本地圖片檔案路徑
        • --url: 網路圖片 URL 地址(API 服務自動下載)
        • --question: 使用者提出的問題(必填)
        • --open-id: 當前使用者的 open-id(必填,按上述流程獲取)
        • --list: 顯示歷史視覺問答列表清單
        • --api-key: API 訪問金鑰(可選)
        • --api-url: API 服務地址(可選,使用預設值)
        • --detail: 輸出詳細程度(basic/standard/json,預設 json)
        • --output: 結果輸出檔案路徑(可選)
    4. 查看回答結果
      • 接收大模型生成的自然語言回答
      • 包含問答基本資訊、問題、回答內容

資源索引

  • 必要指令碼:見 scripts/visual_qa_analysis.py(用途:呼叫 API 進行視覺問答,本地檔案上傳,網路 URL 由 API 服務自動下載)
  • 配置檔案:見 scripts/config.py(用途:配置 API 地址、預設引數和圖片格式限制)
  • 領域參考:見 references/api_doc.md(何時讀取:需要了解 API 介面詳細規範和錯誤碼時)

注意事項

  • 僅在需要時讀取參考文件,保持上下文簡潔
  • 支援格式:圖片支援 jpg/png/jpeg/webp 格式,最大 20MB
  • API 金鑰可選,如果通過引數傳入則必須確保呼叫鑑權成功,否則忽略鑑權
  • 禁止臨時生成指令碼,只能用技能本身的指令碼
  • 傳入的網路地址引數,不需要下載本地,預設地址都是公網地址,api 服務會自動下載
  • 本技能依賴大模型生成,回答僅供參考,重要資訊請核實後再使用
  • 當顯示歷史問答清單的時候,從資料 json 中提取欄位 reportImageUrl 作為超連結地址,使用 Markdown 表格格式輸出,包含" 記錄名稱"、"問答時間"、"問題關鍵詞"、"點選檢視"四列,其中"記錄名稱"列使用視覺問答記錄-{記錄id}形式拼接, "點選檢視"列使用 [🔗 查看回答](reportImageUrl)格式的超連結,使用者點選即可直接跳轉到對應的完整問答頁面。
  • 表格輸出示例: | 記錄名稱 | 問答時間 | 問題關鍵詞 | 點選檢視 | |----------|----------|----------|----------| | 視覺問答記錄-20260312172200001 | 2026-03-12 17:22:00 | 圖片裡有什麼動物 | 🔗 查看回答 |

使用示例

# 本地圖片問答(以下只是示例,禁止直接使用openclaw-control-ui 作為 open-id)
python -m scripts.visual_qa_analysis --input /path/to/image.jpg --question "這張圖片裡有什麼內容?請描述一下" --open-id openclaw-control-ui

# 網路圖片問答(以下只是示例,禁止直接使用openclaw-control-ui 作為 open-id)
python -m scripts.visual_qa_analysis --url https://example.com/image.jpg --question "圖片中有幾個人,他們在做什麼?" --open-id openclaw-control-ui

# 顯示歷史問答記錄(自動觸發關鍵詞:檢視歷史問答、歷史記錄、問答清單等)
python -m scripts.visual_qa_analysis --list --open-id openclaw-control-ui

# 輸出精簡回答
python -m scripts.visual_qa_analysis --input image.jpg --question "描述一下這張圖片" --open-id your-open-id --detail basic

# 儲存結果到檔案
python -m scripts.visual_qa_analysis --input image.jpg --question "請識別圖片中的文字內容" --open-id your-open-id --output result.json

🤖 AI 評測

這個視覺問答技能功能完整,能對圖片進行智慧問答並支援多種輸出格式。文件詳細清楚,操作步驟明確,還支援檢視歷史記錄。主要問題是文件裡有些內容對不上號(API說明和實際功能不匹配),程式碼存在小缺陷會影響使用。總體質量中規中矩,核心功能可用,但細節打磨還需加強。

📊 多維度評分

適應性4.1
規範性4.2
有效性4.1
可靠性4.4
可信度4.5

📁 包含檔案 (30 個)

📄 SKILL.md 9.6 KB
📄 references/api_doc.md 666 B
📄 scripts/__init__.py 31 B
📄 scripts/api_service.py 1.5 KB
📄 scripts/config.py 613 B
📄 scripts/config.yaml 3 B
📄 scripts/skill.py 567 B
📄 scripts/visual_qa_analysis.py 6.3 KB
📄 skills/smyx_analysis/__init__.py 0 B
📄 skills/smyx_analysis/references/api_doc.md 2 KB
📄 skills/smyx_analysis/requirements.txt 45 B
📄 skills/smyx_analysis/scripts/__init__.py 0 B
📄 skills/smyx_analysis/scripts/api_service.py 1.8 KB
📄 skills/smyx_analysis/scripts/config.py 1003 B
📄 skills/smyx_analysis/scripts/config.yaml 3 B
📄 skills/smyx_analysis/scripts/skill.py 6.4 KB
📄 skills/smyx_analysis/scripts/smyx_analysis.py 3.7 KB
📄 skills/smyx_common/__init__.py 0 B
📄 skills/smyx_common/requirements.txt 47 B
📄 skills/smyx_common/scripts/__init__.py 177 B
📄 skills/smyx_common/scripts/api_service.py 2.6 KB
📄 skills/smyx_common/scripts/base.py 469 B
📄 skills/smyx_common/scripts/config-dev.yaml 214 B
📄 skills/smyx_common/scripts/config-prod.yaml 0 B
📄 skills/smyx_common/scripts/config-test.yaml 256 B
📄 skills/smyx_common/scripts/config.py 22.3 KB
📄 skills/smyx_common/scripts/config.yaml 473 B
📄 skills/smyx_common/scripts/dao.py 13.2 KB
📄 skills/smyx_common/scripts/skill.py 2.4 KB
📄 skills/smyx_common/scripts/util.py 23.5 KB