name: video-visual-analysis slug: video-visual-analysis displayName: 影片視覺分析 version: 1.0.0 description: 影片視覺分析與靈感提取技能。通過ffmpeg抽取影片關鍵幀,使用視覺模型批次分析,提取UI設計規範(配色、字型、佈局、元件樣式)、功能模組資訊、產品特徵、互動設計等關鍵視覺資訊,輸出結構化分析報告。當用戶需要分析影片UI、提取影片設計靈感、影片關鍵幀分析、影片視覺資訊提取、從影片中獲取創作靈感、拆解影片介面設計、影片畫面分析、提取影片設計規範等需求時使用此技能。
從影片中抽取關鍵幀,使用視覺模型進行多輪深度分析,提取UI設計規範、功能模組、產品資訊等關鍵視覺資訊,輸出結構化分析報告。適用於從產品演示影片、介面展示影片中獲取設計靈感和建立工作臺/應用的參考。
使用 bash 執行 ffprobe 獲取影片基本資訊(時長、解析度、幀率、編碼格式):
ffprobe -v quiet -print_format json -show_format -show_streams "<影片檔案路徑>" 2>/dev/null
從返回 JSON 中提取 duration(秒)、width、height、r_frame_rate(幀率)。
發現更多技能外掛,請訪問7w4.net。
執行技能自帶的 extract_keyframes.py 指令碼抽取關鍵幀:
python skills/video-visual-analysis/extract_keyframes.py --input "<影片檔案路徑>" --output "<輸出目錄>" --count <幀數>
引數說明:
- --input:影片檔案路徑(必填)
- --output:關鍵幀輸出目錄(必填)
- --count:要抽取的幀數(預設12,建議8-15幀)
- --prefix:幀檔名字首(預設"frame")
指令碼會在輸出目錄下生成 <prefix>_<秒數>s.jpg 格式的關鍵幀檔案。
抽取策略: - 時長 < 30秒:抽 6-8 幀 - 時長 30秒-3分鐘:抽 8-12 幀 - 時長 > 3分鐘:抽 12-15 幀 - 幀均勻分佈在影片時間線上,跳過開頭2秒和結尾2秒
將關鍵幀分批(每批2-3張)使用 read_image 工具進行分析。分析分多輪進行,每輪聚焦不同維度:
第一輪:整體概覽
- 選取最能代表整體介面的2-3張關鍵幀
- 分析query:"分析這個介面截圖的整體佈局結構、配色方案、主要功能區域劃分。具體描述:1. 整體佈局(側邊欄/主內容區比例)2. 主色調和輔助色(給出具體色值)3. 主要功能模組有哪些 4. 導航結構 5. 字型風格 6. 所有可見的文字內容"
第二輪:元件細節
- 選取展示元件細節的關鍵幀
- 分析query:"仔細觀察這個UI介面的元件樣式細節。具體描述:1. 卡片邊框(粗細、顏色、圓角)2. 陰影效果(內/外陰影、偏移、模糊)3. 按鈕樣式(形狀、顏色、邊框、立體感)4. 輸入框/表單樣式 5. 彈窗/模態框設計 6. 標籤/徽章樣式 7. 進度條/滑塊樣式 8. 所有精確色值 9. 字型大小層級 10. 間距和留白比例 11. 所有可見文字"
第三輪(如需要):特定頁面/功能
- 選取展示特定功能頁面的關鍵幀
- 分析query根據使用者需求定製,例如:"詳細描述這個頁面的功能設計、互動流程、表單欄位、資料展示方式。列出所有功能點、按鈕、選項的名稱和用途"
分析輪次根據影片內容複雜度決定: - 簡單介面(1-2個頁面):2輪分析 - 中等複雜度(3-5個頁面):3輪分析 - 高複雜度(6+個頁面或深度功能展示):3-4輪分析
將多輪分析結果綜合為結構化報告,包含以下部分:
# 影片視覺分析報告
## 一、影片基本資訊
- 檔名、時長、解析度、幀率、編碼格式
## 二、產品/內容概述
- 產品名稱、定位、出鏡人(如有)、核心價值主張
## 三、整體視覺設計規範
### 配色方案(精確色值)
| 用途 | 色值 | 說明 |
|------|------|------|
### 元件樣式
- 邊框、陰影、圓角、字型、按鈕等
### 佈局結構
- 整體佈局比例、導航結構、內容區組織方式
## 四、功能模組詳解
- 每個模組的名稱、功能描述、互動方式、UI元素
## 五、設計靈感與參考
- 可複用的設計模式、配色方案、互動模式
- 適用於哪些型別的應用/工作臺建立
## 六、關鍵幀索引
- 每個關鍵幀的時間點、對應內容、儲存路徑
這個Skill功能定位清晰,文件說明詳細,分析流程設計合理,對常見邊界情況有充分考慮。整體質量良好,能滿足從影片提取UI設計靈感的核心需求。文件部分做得尤為出色,步驟指引詳細。主要不足是規模偏小、缺少示例檔案,部分細節處理有改進空間。對於有影片視覺分析需求的使用者來說,這是一個可用且實用的工具。