name: 智繪圖片理解 description: "智慧圖片理解助手,支援對單張或多張圖片進行內容描述、視覺問答、文字識別與對比分析;當用戶要求「識圖」「看圖」「描述圖片」「分析圖片」「圖中有什麼」「提取圖片文字」「對比圖片」「視覺問答」時使用。" tags: [圖片, 媒體, 視覺]
| 欄位 | 值 |
|---|---|
| skill_id | ixhlink-skills-image-explain |
| skill_version | 1.0.0 |
| product_id | ixhlink-skills-image-explain |
| model_key | ixhlink-skills-image-explain |
| capability | vision |
Base URL:https://iskills.ixhlink.com
下文介面均寫路徑(如 /api/v1/llm/invoke),完整地址 = Base URL + 路徑。
統一響應格式:
{"success": true, "code": 0, "message": "ok", "data": {}}
vision 為同步能力,典型流程:
GET /api/v1/llm/models 確認模型已啟用POST /api/v1/llm/invoke 提交圖片理解請求(messages 中含圖片與文字)WeixinPay-Required 與 X-Payment-Iddata.choices[0].message.content 讀取模型回覆文本GET /api/v1/llm/models
Accept: application/json
確認返回的 items 中包含:
{"model": "ixhlink-skills-image-explain", "capability": "vision"}
POST /api/v1/llm/invoke
Content-Type: application/json
請求體(URL 圖片):
{
"capability": "vision",
"model": "ixhlink-skills-image-explain",
"payload": {
"messages": [
{
"role": "user",
"content": [
{"type": "text", "text": "請詳細描述這張圖片的內容、主體、場景與氛圍"},
{
"type": "image_url",
"image_url": {"url": "https://example.com/photo.jpg"}
}
]
}
]
}
}
請求體(Base64 圖片):
{
"capability": "vision",
"model": "ixhlink-skills-image-explain",
"payload": {
"messages": [
{
"role": "user",
"content": [
{"type": "text", "text": "圖中有什麼文字?請逐條列出"},
{
"type": "image_url",
"image_url": {
"url": "data:image/png;base64,<base64>"
}
}
]
}
]
}
}
payload 欄位:
| 欄位 | 必填 | 說明 |
|---|---|---|
messages |
是 | OpenAI 相容對話陣列;user 訊息的 content 可混合 text 與 image_url |
messages[].content[].type |
是 | text 或 image_url |
messages[].content[].image_url.url |
圖片時必填 | 公網 https URL,或 data:image/...;base64,... |
system / system_prompt |
否 | 系統提示(也可放在 messages 首條 role: system) |
max_tokens |
否 | 最大輸出 token 數 |
temperature |
否 | 取樣溫度 |
簡寫(僅文字問題時): 若只傳 prompt 且無圖片,服務端會轉為單輪 messages:
{
"capability": "vision",
"model": "ixhlink-skills-image-explain",
"payload": {
"prompt": "你好"
}
}
帶圖片時請使用上文 messages + image_url 格式。
多圖理解示例:
{
"capability": "vision",
"model": "ixhlink-skills-image-explain",
"payload": {
"messages": [
{
"role": "user",
"content": [
{"type": "text", "text": "對比這兩張圖的差異"},
{"type": "image_url", "image_url": {"url": "https://example.com/a.jpg"}},
{"type": "image_url", "image_url": {"url": "https://example.com/b.jpg"}}
]
}
]
}
}
呼叫成功響應(同步):
{
"success": true,
"code": 0,
"message": "呼叫成功",
"data": {
"id": "chatcmpl-xxx",
"object": "chat.completion",
"choices": [
{
"index": 0,
"message": {
"role": "assistant",
"content": "這是一張……"
},
"finish_reason": "stop"
}
],
"usage": {
"prompt_tokens": 1200,
"completion_tokens": 180,
"total_tokens": 1380
},
"_billing": {
"call_log_id": "550e8400-e29b-41d4-a716-446655440000"
}
}
}
模型回覆文本在 data.choices[0].message.content;排查日誌可用 data._billing.call_log_id。
呼叫本 Skill 前,必須檢查當前 Agent 是否已安裝支付能力(weixinpay extension):
| 產品ID | 服務內容 | 單價 |
|---|---|---|
ixhlink-skills-image-explain |
智繪圖片理解 | 0.3 元/次 |
價格以 SkillHub 後臺配置為準。命中創作意圖後,向用戶展示服務名稱和價格,由使用者確認後進入付費流程。
當 amount_fen > 0 且未完成支付時,首次 POST /api/v1/llm/invoke 會返回 HTTP 402,響應中攜帶:
WeixinPay-Required: <payment_code>、X-Payment-Id: <payment_id>WeixinPay 物件(含 payment_id、prompt 等)客戶端流程(Agent / MCP / Web):
首次 invoke → 402 → weixinpay_pay(payment_code) → 支付成功後重試 invoke
「原樣重試」的含義:
model、capability、payload 必須與首次請求完全一致payment_code、payment_id 通過 Header 傳入(推薦),或寫入 body 的 WeixinPay;勿改 payload 業務欄位來傳訂單號重試請求示例:
7w4.net小蔥技能站收錄全網優質技能,值得收藏。
POST /api/v1/llm/invoke
Content-Type: application/json
WeixinPay-Required: <payment_code>
X-Payment-Id: <payment_id>
{"model":"ixhlink-skills-image-explain","capability":"vision","payload":{...}}
amount_fen = 0 時可跳過支付,直接呼叫。每筆訂單按次消費,使用後不可複用。
| HTTP | 常見原因 |
|---|---|
| 400 | 缺少 model、payload 非法、messages 為空或未包含圖片 |
| 402 | 需付費或 X402 預下單失敗 |
| 404 | 模型未啟用或 capability 不匹配 |
| 503 | 模型站點未啟用 |
上游失敗時檢視響應 message 與 _billing.call_log_id 對應後臺呼叫日誌。
這個圖片理解Skill質量較好,文件寫得清晰明白,介面支援多種圖片輸入方式,還能對比多張圖片。付費流程說明詳細,使用前會告知費用。不足是資料比較偏技術向,新手可能不太好理解;只有一個文件檔案,沒有例子可以參考;後設資料版本號和文件裡寫的不一致。建議補充一些實際使用案例和常見問題解答。