🎨

影片視覺分析

👤 cc 📦 v1.0.0 ⭐ 4.5 ⬇️ 128 下載
🎨 設計多媒體 免費

📖 技能介紹


name: video-visual-analysis slug: video-visual-analysis displayName: 影片視覺分析 version: 1.0.0 description: 影片視覺分析與靈感提取技能。通過ffmpeg抽取影片關鍵幀,使用視覺模型批次分析,提取UI設計規範(配色、字型、佈局、元件樣式)、功能模組資訊、產品特徵、互動設計等關鍵視覺資訊,輸出結構化分析報告。當用戶需要分析影片UI、提取影片設計靈感、影片關鍵幀分析、影片視覺資訊提取、從影片中獲取創作靈感、拆解影片介面設計、影片畫面分析、提取影片設計規範等需求時使用此技能。


影片視覺分析

從影片中抽取關鍵幀,使用視覺模型進行多輪深度分析,提取UI設計規範、功能模組、產品資訊等關鍵視覺資訊,輸出結構化分析報告。適用於從產品演示影片、介面展示影片中獲取設計靈感和建立工作臺/應用的參考。

工作流程

第一步:獲取影片資訊

使用 bash 執行 ffprobe 獲取影片基本資訊(時長、解析度、幀率、編碼格式):

ffprobe -v quiet -print_format json -show_format -show_streams "<影片檔案路徑>" 2>/dev/null

從返回 JSON 中提取 duration(秒)、widthheightr_frame_rate(幀率)。

發現更多技能外掛,請訪問7w4.net。

第二步:抽取關鍵幀

執行技能自帶的 extract_keyframes.py 指令碼抽取關鍵幀:

python skills/video-visual-analysis/extract_keyframes.py --input "<影片檔案路徑>" --output "<輸出目錄>" --count <幀數>

引數說明: - --input:影片檔案路徑(必填) - --output:關鍵幀輸出目錄(必填) - --count:要抽取的幀數(預設12,建議8-15幀) - --prefix:幀檔名字首(預設"frame")

指令碼會在輸出目錄下生成 <prefix>_<秒數>s.jpg 格式的關鍵幀檔案。

抽取策略: - 時長 < 30秒:抽 6-8 幀 - 時長 30秒-3分鐘:抽 8-12 幀 - 時長 > 3分鐘:抽 12-15 幀 - 幀均勻分佈在影片時間線上,跳過開頭2秒和結尾2秒

第三步:視覺模型分析

將關鍵幀分批(每批2-3張)使用 read_image 工具進行分析。分析分多輪進行,每輪聚焦不同維度:

第一輪:整體概覽 - 選取最能代表整體介面的2-3張關鍵幀 - 分析query:"分析這個介面截圖的整體佈局結構、配色方案、主要功能區域劃分。具體描述:1. 整體佈局(側邊欄/主內容區比例)2. 主色調和輔助色(給出具體色值)3. 主要功能模組有哪些 4. 導航結構 5. 字型風格 6. 所有可見的文字內容"

第二輪:元件細節 - 選取展示元件細節的關鍵幀 - 分析query:"仔細觀察這個UI介面的元件樣式細節。具體描述:1. 卡片邊框(粗細、顏色、圓角)2. 陰影效果(內/外陰影、偏移、模糊)3. 按鈕樣式(形狀、顏色、邊框、立體感)4. 輸入框/表單樣式 5. 彈窗/模態框設計 6. 標籤/徽章樣式 7. 進度條/滑塊樣式 8. 所有精確色值 9. 字型大小層級 10. 間距和留白比例 11. 所有可見文字"

第三輪(如需要):特定頁面/功能 - 選取展示特定功能頁面的關鍵幀 - 分析query根據使用者需求定製,例如:"詳細描述這個頁面的功能設計、互動流程、表單欄位、資料展示方式。列出所有功能點、按鈕、選項的名稱和用途"

分析輪次根據影片內容複雜度決定: - 簡單介面(1-2個頁面):2輪分析 - 中等複雜度(3-5個頁面):3輪分析 - 高複雜度(6+個頁面或深度功能展示):3-4輪分析

第四步:綜合輸出報告

將多輪分析結果綜合為結構化報告,包含以下部分:

# 影片視覺分析報告

## 一、影片基本資訊
- 檔名、時長、解析度、幀率、編碼格式

## 二、產品/內容概述
- 產品名稱、定位、出鏡人(如有)、核心價值主張

## 三、整體視覺設計規範
### 配色方案(精確色值)
| 用途 | 色值 | 說明 |
|------|------|------|
### 元件樣式
- 邊框、陰影、圓角、字型、按鈕等
### 佈局結構
- 整體佈局比例、導航結構、內容區組織方式

## 四、功能模組詳解
- 每個模組的名稱、功能描述、互動方式、UI元素

## 五、設計靈感與參考
- 可複用的設計模式、配色方案、互動模式
- 適用於哪些型別的應用/工作臺建立

## 六、關鍵幀索引
- 每個關鍵幀的時間點、對應內容、儲存路徑

輸入

  • 影片檔案路徑(必填):使用者上傳的影片檔案
  • 分析重點(可選):使用者希望重點分析的維度,如"UI設計規範"、"功能模組"、"配色方案"、"互動設計"等。未指定時進行全面分析。

輸出

  • 結構化 Markdown 分析報告
  • 關鍵幀圖片檔案(儲存在指定輸出目錄)

邊界情況處理

  1. 影片格式不支援:ffprobe 無法識別時,提示使用者確認影片格式,嘗試轉換為 mp4 後重試
  2. 影片過短(<5秒):減少抽取幀數到3-5幀,直接抽取
  3. ffmpeg/ffprobe 不存在:提示需要安裝 ffmpeg
  4. 關鍵幀抽取失敗:嘗試用不同時間點重新抽取,或增加抽取數量
  5. 視覺模型分析結果不清晰:換用不同角度的 query 重新分析,或放大特定區域
  6. 使用者指定特定時間點分析:支援使用者指定時間點抽取幀,而非均勻分佈

🤖 AI 評測

這個Skill功能定位清晰,文件說明詳細,分析流程設計合理,對常見邊界情況有充分考慮。整體質量良好,能滿足從影片提取UI設計靈感的核心需求。文件部分做得尤為出色,步驟指引詳細。主要不足是規模偏小、缺少示例檔案,部分細節處理有改進空間。對於有影片視覺分析需求的使用者來說,這是一個可用且實用的工具。

📊 多維度評分

適應性4.3
規範性4.3
有效性4.7
可靠性4.2
可信度4.9

📁 包含檔案 (2 個)

📄 SKILL.md 5.4 KB
📄 extract_keyframes.py 5.3 KB