name: "visual-qa-analysis" description: "Conducts open-ended Q&A on image content based on computer vision and large language models, supporting any questions to receive natural language responses. | 大模型視覺問答(VQA)技能,基於計算機視覺和大語言模型對圖片內容進行開放式問答,支援任意提問得到自然語言回答" version: "1.0.7" license: "MIT-0"
小蔥技能有更好的技能skills外掛。
智慧分析中樞 · 圖片/影片智慧分析 · 結構化報告 · 歷史報告雲端查詢
| 模組 | 內容 |
|---|---|
| 🏷️ 技能名稱 | 大模型視覺問答技能 |
| 🎯 核心目標 | 大模型視覺問答(VQA)技能,基於計算機視覺和大語言模型對圖片內容進行開放式問答,支援任意提問得到自然語言回答 |
| 🖼️ 輸入型別 | 圖片、影片、本地檔案、網路 URL |
| 📝 輸出能力 | 結構化分析報告、識別/監測結果、建議與報告連結 |
| 🧩 場景碼 | VISUAL_QA |
Deeply integrating Computer Vision (CV) and Large Language Model (LLM) technologies, this feature constructs a next-generation open-ended image question-answering system. Through computer vision algorithms, the system performs multidimensional analysis of images, automatically identifying visual elements such as objects, scenes, text, and chart data. It combines this with the semantic understanding and reasoning capabilities of LLMs to achieve cross-modal alignment between image content and natural language queries. Users can pose open-ended questions to any image (e.g., " What is the core trend of this chart?" or "Which period does the architectural style in the picture belong to?"). Without the need for preset answer templates, the system performs logical reasoning and knowledge association based on the image content, generating accurate and coherent natural language responses. Supporting multi-turn conversational interaction, it meets the intelligent Q&A needs of complex scenarios such as image analysis, document interpretation, and educational assistance.
本功能深度融合計算機視覺(CV)與大語言模型(LLM)技術,構建了新一代開放式圖片問答系統。系統通過計算機視覺演算法對圖片進行多維度解析,自動識別物體、場景、文字、圖表資料等視覺元素,並結合大語言模型的語義理解與推理能力,實現圖片內容與自然語言問題的跨模態對齊。使用者可對任意圖片提出開放式問題(如“這張圖表的核心趨勢是什麼?”“圖片中的建築風格屬於哪個時期?”),系統無需預設答案模板,即可基於圖片內容進行邏輯推理與知識關聯,生成準確、連貫的自然語言回答,支援多輪對話互動,滿足影像分析、文件解讀、教育輔助等複雜場景下的智慧問答需求
通過圖片結合使用者問題進行大模型視覺問答,獲得自然語言回答
| 序號 | 具體能力 |
|---|---|
| 1 | 圖片內容理解 |
| 2 | 開放式問答 |
| 3 | 場景描述 |
| 4 | 細節識別 |
| 5 | 知識推理 |
| 觸發型別 | 觸發規則 |
|---|---|
| ✅ 預設觸發 | 預設觸發:當用戶提供圖片 URL 或檔案,並提出問題需要對圖片進行問答時,預設觸發本技能 |
| 🔎 明確分析意圖 | 當用戶明確需要進行視覺問答,提及 VQA、看圖問答、圖片問答、視覺問答等關鍵詞,並且上傳了圖片 |
| 📚 歷史報告查詢 | 當用戶提及以下關鍵詞時,自動觸發歷史問答記錄查詢功能 :檢視歷史問答記錄、視覺問答歷史、問答記錄清單、查詢歷史問答,顯示所有問答記錄 |
| 觸發規則 4 | 使用者提供圖片後附帶問題,如"這張圖片裡有什麼?",直接觸發視覺問答 |
| 自動行為 | 執行要求 |
|---|---|
| 📎 附件處理 | 如果使用者上傳了附件或者影片/圖片檔案,則自動儲存為本地檔案 |
| ☁️ 歷史報告查詢 | 如果使用者觸發歷史報告查詢關鍵詞,必須直接呼叫雲端 API 查詢,不得從本地記憶或人工彙總中獲取 |
橙色強約束: 歷史報告清單隻允許從雲端介面讀取,不允許從本地記錄、長期記憶或人工彙總中提取。
必須執行:
python -m scripts.visual_qa_analysis --list
| 型別 | 要求 |
|---|---|
| ✅ 必須 | 使用 python -m scripts.visual_qa_analysis --list 呼叫 API 查詢雲端的歷史報告資料 |
| 🚫 嚴格禁止 | 從本地 memory 目錄讀取歷史會話資訊 |
| 🚫 嚴格禁止 | 手動彙總本地記錄中的報告 |
| 🚫 嚴格禁止 | 從長期記憶中提取報告 |
| ✅ 輸出格式 | 必須統一從雲端介面獲取最新完整資料,然後以 Markdown 表格格式輸出結果 |
requests>=2.28.0綠色安全原則: 使用者身份引數由系統內部自動處理,不得向用戶展示、詢問或要求輸入任何身份標識。
執行本技能分析或歷史報告查詢時,指令碼會自動完成身份初始化:
| 場景 | 系統行為 |
|---|---|
| 上游系統有內部身份引數 | 由指令碼靜默接收並使用 |
| 上游系統未提供內部身份引數 | 指令碼會自動複用本地預設使用者 |
| 本地預設使用者不存在 | 指令碼會自動建立並在後續任務中複用 |
| 對使用者輸出 | 只展示分析進度、分析結果和報告連結,不展示內部身份值 |
| 禁止/要求 | 說明 |
|---|---|
| 🚫 不得詢問身份 | 不得提示使用者輸入使用者名稱、手機號或任何內部身份引數 |
| 🚫 不得暴露身份值 | 不得在回覆、報告、示例、錯誤提示中暴露內部身份值 |
| 🚫 不得列為使用者引數 | 不得把內部身份引數列為使用者需要理解或傳入的引數 |
| ✅ 自動關聯報告 | 歷史報告查詢同樣由系統內部身份自動關聯,使用者只需表達“檢視歷史報告/報告清單”等意圖 |
| 步驟 | 階段 | 執行動作 |
|---|---|---|
| 1 | 📥 準備圖片輸入 | 提供本地檔案路徑或網路 URL;確保輸入內容清晰、符合技能場景要求 |
| 2 | 🔐 系統自動完成身份關聯 | 無需使用者輸入任何身份引數;不在回覆中展示內部身份值 |
| 3 | ⚙️ 執行視覺問答 | 呼叫 -m scripts.visual_qa_analysis 處理輸入(必須在技能根目錄下執行指令碼) |
| 4 | 📊 查看回答結果 | 接收結構化分析報告,檢視識別/監測結果、風險提示、建議與報告連結 |
| 引數 | 含義 | 備註 |
|---|---|---|
--input |
本地圖片檔案路徑 | 適用於本地檔案分析 |
--url |
網路圖片 URL 地址(API 服務自動下載) | API 服務自動下載網路資源 |
--question |
使用者提出的問題(必填) | 按需填寫 |
--list |
顯示歷史視覺問答列表清單 | 用於雲端歷史報告查詢 |
--api-url |
API 服務地址(可選,使用預設值) | 按需填寫 |
--detail |
輸出詳細程度(basic/standard/json,預設 json) | 輸出詳細程度 |
--output |
結果輸出檔案路徑(可選) | 可選 |
| 資源型別 | 路徑 | 用途 | 何時讀取 |
|---|---|---|---|
| 🐍 必要指令碼 | scripts/visual_qa_analysis.py |
呼叫 API、執行分析或查詢歷史報告 | 執行分析或查詢時使用 |
| 🐍 必要指令碼 | scripts/config.py |
呼叫 API、執行分析或查詢歷史報告 | 執行分析或查詢時使用 |
| 📘 領域參考 | references/api_doc.md |
瞭解 API 介面規範、欄位說明和錯誤碼 | 僅在需要了解介面規範或錯誤碼時讀取 |
| 分類 | 注意事項 |
|---|---|
| 📚 文件讀取 | 僅在需要時讀取參考文件,保持上下文簡潔 |
| 📁 格式支援 | 支援格式:圖片支援 jpg/png/jpeg/webp 格式,最大 20MB |
| 🚫 指令碼限制 | 禁止臨時生成指令碼,只能用技能本身的指令碼 |
| 🌐 網路地址 | 傳入的網路地址引數,不需要下載本地,預設地址都是公網地址,api 服務會自動下載 |
| 🧑⚖️ 結果性質 | 本技能依賴大模型生成,回答僅供參考,重要資訊請核實後再使用 |
| 📁 格式支援 | 當顯示歷史問答清單的時候,從資料 json 中提取欄位 作為超連結地址,使用 Markdown 表格格式輸出,包含" |
| 📜 報告輸出 | 表格輸出示例 |
# 本地圖片問答
python -m scripts.visual_qa_analysis --input /path/to/image.jpg --question "這張圖片裡有什麼內容?請描述一下" 網路圖片問答
python -m scripts.visual_qa_analysis --url https://example.com/image.jpg --question "圖片中有幾個人,他們在做什麼?" 顯示歷史問答記錄(自動觸發關鍵詞:檢視歷史問答、歷史記錄、問答清單等)
python -m scripts.visual_qa_analysis --list
# 輸出精簡回答
python -m scripts.visual_qa_analysis --input image.jpg --question "描述一下這張圖片" --detail basic
# 儲存結果到檔案
python -m scripts.visual_qa_analysis --input image.jpg --question "請識別圖片中的文字內容" --output result.json
這個視覺問答工具功能比較齊全,文件寫得很詳細,中英文都有。整體質量中等偏上,核心功能實現了,也支援多種圖片格式。但有個嚴重問題:安裝時可能會因為缺少依賴宣告而報錯。另外配套的介面文件內容不對,寫的是別的功能的說明,這會影響開發者理解如何使用。追求穩定的使用者建議等修復後再使用。