browser-automation-tool-free

👤 天轟穿 📦 v1.0.0 ⭐ 4.2 ⬇️ 22 下載
🤖 AI-Agent 免費

📖 技能介紹


name: "browser-automation-tool-free" description: "通過自然語言驅動瀏覽器互動的CLI工具,支援本地Chrome,適合個人開發者快速自動化。Use when 需要提升效率、自動化流程、批次處理、工作流最佳化時使用。不適用於需要人工創意判斷的任務。適用於獨立開發者、企業團隊和自動化工作流場景。支援中文互動,無需複雜配置即開即用。輸出結果可直接使用,減少二次加工成本。" license: Proprietary allowed-tools: read exec compatibility: "Requires LLM with tool-use capability" metadata: displayName: "瀏覽器自動化工具-免費版" version: "1.0.0" summary: "通過自然語言驅動瀏覽器互動的CLI工具,支援本地Chrome,適合個人開發者快速自動化" tags: - "研究工具" - "瀏覽器自動化" - "自然語言" source: "SkillHub" converted_at: "2026-07-22T17:58:36" tools: - exec - read - browser


瀏覽器自動化工具(免費版)

概述

本工具通過自然語言指令驅動瀏覽器互動,使用者無需編寫複雜的選擇器或指令碼,只需用自然語言描述想做的動作,工具即可自動完成瀏覽器操作。免費版使用本地 Chrome 瀏覽器,適合個人開發者的快速自動化與原型驗證。

與傳統瀏覽器自動化的區別

對比維度 傳統自動化 本工具(自然語言)
元素定位 CSS/XPath 選擇器 自然語言描述
指令碼編寫 需要程式設計基礎 自然語言描述即可
頁面變化適應性 選擇器易失效 自然語言更魯棒
學習成本 較高
適用場景 固定流程 靈活多變的任務

核心能力

命令總覽

命令 說明 示例
navigate <url> 跳轉到URL browser navigate https://example.com
act "<動作>" 執行自然語言動作 browser act "點選登入按鈕"
extract "<指令>" 提取結構化資料 browser extract "獲取頁面標題"
observe "<查詢>" 觀察發現元素 browser observe "頁面有哪些按鈕"
screenshot 截圖 browser screenshot
close 關閉瀏覽器 browser close

輸出: 返回命令總覽的執行結果,包含操作狀態和輸出資料。

核心功能執行

input_params引數進行配置。

輸出: 返回核心功能執行的執行結果,包含操作狀態和輸出資料。 - 執行此能力時使用input_params引數,支援建立/查詢/匯出操作

引數配置與呼叫

config_options引數進行配置。

7w4.net收錄了海量優質技能外掛。

輸出: 返回引數配置與呼叫的執行結果,包含操作狀態和輸出資料。 - 執行此能力時使用config_options引數,支援修改/重置/匯入操作 能力覆蓋範圍:本skill的核心能力覆蓋以下場景關鍵詞:通過自然語言驅動、瀏覽器互動的、CLI、支援本地、Chrome、適合個人開發者快、速自動化、通過自然語言指令、驅動瀏覽器互動的、命令列工具、使用者可用自然語言、描述動作、工具自動轉化為瀏、覽器操作、降低自動化指令碼編、寫門檻、核心能力、自然語言驅動的瀏、結構化資料提取、元素髮現與觀察、瀏覽器支援、截圖與頁面導航等。這些關鍵詞對應description中宣告的使用場景,均已在上述能力點中提供對應的操作支援。

使用場景

場景一:快速資訊採集

個人使用者希望從網頁快速提取資訊,無需編寫選擇器。

# 導航到目標頁面
browser navigate https://example.com

# 用自然語言提取資料
browser extract "獲取頁面標題和描述"

# 提取結構化資料(帶 schema)
browser extract "獲取商品列表" '{"items":[{"name":"string","price":"number"}]}'

# 關閉瀏覽器
browser close

場景二:自然語言驅動的表單填寫

用自然語言描述動作,自動完成表單填寫。


# 用自然語言執行動作
browser act "在使用者名稱輸入框填入 myuser"
browser act "在密碼輸入框填入 mypassword"
browser act "點選提交按鈕"

# 截圖確認結果
browser screenshot

browser close

場景三:頁面元素探索

不熟悉頁面結構時,先用 observe 發現可用元素。


# 觀察頁面有哪些可互動元素
browser observe "頁面上有哪些按鈕"

# 根據觀察結果執行動作
browser act "點選領先個藍色的按鈕"

# 提取觀察到的內容
browser extract "獲取頁面所有標題文本"

不適用場景

以下場景瀏覽器自動化工具-免費版不適合處理:

  • 無明確技術棧的模糊需求
  • 純架構設計決策
  • 運維部署管理

觸發條件

需要程式碼生成、程式設計輔助、除錯測試、開發部署時使用。不適用於非本工具能力範圍的需求。

快速開始

依賴詳情

檢查工具目錄下的 setup.json,若 setupComplete: false:

# 安裝依賴
npm install

# 建立全域性 browser 命令
npm link

2. 環境選擇(自動)

本工具自動選擇瀏覽器環境:

  1. 本地 Chrome 模式(預設):無需額外配置,使用本機 Chrome 瀏覽器
  2. 遠端瀏覽器模式:若配置了遠端瀏覽器服務的 API Key,自動切換至遠端環境

免費版預設使用本地 Chrome 模式,無需額外配置。

3. 基礎工作流

# 導航到頁面

# 用自然語言執行動作
browser act "點選 Sign In 按鈕"

# 提取資料
browser extract "獲取頁面標題"

# 截圖
browser screenshot

# 關閉瀏覽器
browser close

結果處理: 執行完成後,檢視輸出結果確認操作狀態。成功時輸出包含處理摘要和結果資料;失敗時根據錯誤資訊排查問題,查閱錯誤處理章節獲取恢復步驟。

示例

自然語言動作示例

# 點選類動作
browser act "點選登入按鈕"
browser act "點選右上角的購物車圖示"
browser act "點選領先個搜尋結果"

# 輸入類動作
browser act "在搜尋框輸入 AI agents"
browser act "在郵箱欄位填入 test@example.com"

# 導航類動作
browser act "滾動到頁面底部"
browser act "切換到第二個標籤頁"

# 複合動作
browser act "展開側邊欄選單然後點選設定"

資料提取示例

# 簡單提取
browser extract "獲取頁面標題"

# 帶 schema 的結構化提取
browser extract "獲取商品資訊" '{"name":"string","price":"number","stock":"boolean"}'

# 提取列表資料
browser extract "獲取新聞列表" '{"items":[{"title":"string","date":"string"}]}'

觀察元素示例

# 觀察可互動元素
browser observe "頁面有哪些按鈕"
browser observe "有哪些輸入框"
browser observe "導航欄有哪些連結"

模式對比

特性 本地模式 遠端模式
速度 較快 略慢(網路延遲)
配置 需本機 Chrome 需 API Key
隱身模式 不支援 支援
代理/CAPTCHA 不支援 支援
適用場景 開發除錯 生產/大規模採集

優選實踐

  1. 先導航再操作:所有互動前必須先 navigate 到目標頁面。
  2. 動作描述要具體:例如"點選藍色的提交按鈕"優於"點選按鈕"。
  3. 每次操作後截圖:用 screenshot 驗證操作結果。
  4. 不熟悉頁面先用 observe:探索頁面結構後再執行動作。
  5. 結構化提取用 schema:提取複雜資料時附帶 JSON schema,結果更準確。
  6. 完成後關閉瀏覽器:close 釋放資源。

常見問題

Q1: Chrome 未找到?

  • 確認本機已安裝 Chrome 瀏覽器
  • 檢查 Chrome 是否在預設路徑
  • 如本機無 Chrome,可考慮使用遠端瀏覽器模式(需配置 API Key)

Q2: 動作執行失敗?

  • 使用 browser observe 先發現可用元素
  • 嘗試用更具體的描述(如"點選藍色的登入按鈕"而非"點選按鈕")
  • 截圖檢視當前頁面狀態:browser screenshot

Q3: 提取的資料不準確?

  • extract 提供 JSON schema,明確欄位型別
  • 拆分複雜提取為多個簡單步驟
  • observe 確認頁面結構,再針對性提取

Q4: Browserbase 模式失敗?

  • 驗證 API Key 與專案 ID 是否正確配置
  • 檢查 .env 檔案中的 BROWSERBASE_API_KEYBROWSERBASE_PROJECT_ID
  • 確認遠端瀏覽器服務配額未耗盡

已知限制

免費版使用本地 Chrome 瀏覽器,適合個人開發與原型驗證。如需遠端瀏覽器、隱身模式、代理/CAPTCHA 處理、批次任務等高階能力,請升級至專業版。

Q6: 如何除錯?

# 截圖檢視當前狀態
browser screenshot
# 觀察頁面元素
browser observe "頁面上有哪些可互動元素"

依賴說明

執行環境

  • Agent 平臺: 支援SKILL.md的任意AI Agent(Claude Code / Cursor / Codex / Gemini CLI等)
  • 作業系統: Windows / macOS / Linux
  • Chrome 瀏覽器: 必需(本地模式)

第三方依賴

依賴項 型別 是否必需 獲取方式
Node.js 執行環境 必需 系統包管理器安裝(>= 18)
Chrome 瀏覽器 必需 官方下載安裝
npm 依賴包 Node 包 必需 npm install
LLM API API 必需 由Agent內建LLM提供

API Key 配置

  • 本 Skill 基於Markdown指令,無需額外API Key(除內容中明確標註的外部API)
  • 本地模式:無需額外 API Key
  • 遠端瀏覽器模式(可選):需配置 BROWSERBASE_API_KEYBROWSERBASE_PROJECT_ID

可用性分類

  • 分類: MD+execute(純Markdown指令,部分功能需exec命令列執行)
  • 說明: 基於Markdown的AI Skill,通過自然語言指令驅動Agent完成操作

錯誤處理

錯誤場景 原因 處理方式
配置錯誤 引數缺失或格式錯誤 檢查依賴說明中的配置要求
執行時錯誤 執行環境不滿足 確認執行環境符合依賴說明
網路錯誤 連線超時或不可達 執行ping命令測試網路連通性,檢查防火牆和代理設定連線後執行ping命令測試網路連通性,檢查防火牆和代理設定連線後重新執行命令,參考國內替代方案

安全注意事項

風險型別 防範措施
API金鑰洩露 通過環境變數配置,禁止硬編碼到程式碼或配置檔案中
命令執行風險 僅執行白名單命令,避免拼接使用者輸入到命令列引數中
網路通訊安全 使用HTTPS協議,驗證SSL證書有效性
敏感資料暴露 輸出結果中不包含金鑰、令牌等敏感資訊

使用前請確認已閱讀依賴說明章節,確保執行環境滿足安全要求。

核心功能

  • 自動化執行: 基於指令驅動的自動化流程
  • 檔案處理: 支援多種檔案格式的讀取、解析和寫入操作
  • API整合: 通過標準化介面呼叫外部服務並處理響應
  • 命令執行: 在安全沙箱中執行系統命令並收集結果
  • 資訊檢索: 快速搜尋和過濾目標資料

核心功能

  • 自動化執行: 基於指令驅動的自動化流程
  • 檔案處理: 支援多種檔案格式的讀取、解析和寫入操作
  • API整合: 通過標準化介面呼叫外部服務並處理響應
  • 命令執行: 在安全沙箱中執行系統命令並收集結果
  • 資訊檢索: 快速搜尋和過濾目標資料

🤖 AI 評測

這是一款通過自然語言指令控制瀏覽器的自動化工具,適合需要批次操作網頁或提取資料的使用者。文件示例豐富、場景說明清晰,降低了學習門檻。但存在內容重複、部分說明截斷等問題,且文件缺少實際可用的browser命令實現,僅有文字說明,實際使用可能需要額外配置。總體而言文件質量中等,核心功能可用性存疑。

📊 多維度評分

適應性4.3
規範性4.3
有效性4.1
可靠性3.8
可信度4.9

📁 包含檔案 (1 個)

📄 SKILL.md 11.2 KB