sre-operator

👤 zuoanco 📦 v0.0.1 ⭐ 4.4 ⬇️ 840 下載
🔒 IT運維與安全 免費

📖 技能介紹

OpenClaw 伺服器運維

任務目標

  • 本 Skill 用於:系統管理員、運維工程師進行安全高效的伺服器維護操作
  • 能力包含:系統識別、命令驗證、風險評估、故障排查、效能監控、日誌分析
  • 觸發條件:使用者請求伺服器維護、系統診斷、效能最佳化、故障修復或日常運維任務

核心原則

安全第一

  • 永遠先檢視再執行:任何破壞性操作前,必須先確認當前狀態
  • 執行前評估風險:識別命令潛在影響,準備回滾方案
  • 保持操作可追溯:記錄每個關鍵操作的命令、時間、結果

系統識別優先

  • 執行任何操作前,先識別系統型別(Linux 發行版、macOS、Windows)
  • 根據系統型別選擇合適的命令和工具
  • 不假設系統環境,通過命令輸出驗證

驗證驅動

  • 執行前:驗證命令語法、影響範圍、資源可用性
  • 執行後:驗證操作結果、系統狀態、資料完整性
  • 異常時:保留現場、收集日誌、分析原因

標準工作流程

階段 1:環境識別與評估

  1. 識別系統型別

    # Linux
    cat /etc/os-release
    uname -a
    # macOS
    sw_vers
    # Windows
    systeminfo
  2. 評估當前狀態

    • 系統負載:uptime 或 top -bn1 | head -20
    • 磁碟使用:df -h
    • 記憶體使用:free -h 或 vm_stat
    • 網路連線:ss -tuln 或 netstat -tuln
  3. 檢查風險因素

    • 是否在生產環境
    • 是否有關鍵服務執行
    • 是否有未提交的更改
    • 備份狀態

階段 2:命令評估與驗證

  1. 命令風險評估

    • 查閱 references/linux-commands.md 確認命令安全等級
    • 使用 --help 或 man 檢視命令詳細說明
    • 識別破壞性引數(如 -r、-f、--force)
  2. 模擬執行(如果可能)

    • 使用 --dry-run 引數(如 rsync、apt-get)
    • 使用 echo 預覽命令
    • 在測試環境先執行
  3. 安全檢查清單

階段 3:執行與監控

  1. 執行命令

    • 使用絕對路徑或確認命令來源
    • 新增詳細日誌記錄
    • 在非高峰期執行(如適用)
  2. 即時監控

    • 觀察命令輸出
    • 監控系統資源變化
    • 準備中斷執行(如 Ctrl+C)
  3. 記錄操作

    • 記錄執行的命令
    • 記錄輸出結果
    • 記錄執行時間

階段 4:驗證與確認

  1. 驗證結果

    • 確認操作達到預期效果
    • 檢查系統狀態是否正常
    • 驗證相關服務執行正常
  2. 資料完整性檢查

    • 確認資料未丟失或損壞
    • 驗證許可權和所有權正確
    • 檢查配置檔案語法
  3. 文件更新

    • 更新運維日誌
    • 更新配置文件(如需要)
    • 記錄經驗教訓

常見運維場景

場景 1:系統性能診斷

觸發:系統響應慢、負載高 流程:

  1. 執行 scripts/analyze-system.sh --json 收集系統快照
  2. 分析資源使用情況(CPU、記憶體、磁碟 I/O、網路)
  3. 定位高消耗程序
  4. 根據分析結果提供最佳化建議

場景 2:磁碟空間清理

觸發:磁碟使用率超過閾值 流程:

  1. df -h 確認磁碟使用情況
  2. du -h --max-depth=1 /path 定位大目錄
  3. find /path -type f -size +100M 查詢大檔案
  4. 列出可清理檔案清單(不直接刪除)

    7w4.net收錄了海量優質技能外掛。

  5. 等待使用者確認後再執行清理

場景 3:程序管理

觸發:程序異常、需要重啟服務 流程:

  1. ps aux | grep process_name 查詢程序
  2. systemctl status service_name 檢查服務狀態
  3. 檢視日誌檔案:journalctl -u service_name -n 50 或 /var/log/...
  4. 分析異常原因
  5. 提供解決方案(優先非破壞性方案)

場景 4:網路故障排查

觸發:網路不通、服務不可訪問 流程:

  1. ping target_ip 測試連通性
  2. ip addr 或 ifconfig 檢查網路配置
  3. ss -tuln 檢查埠監聽
  4. iptables -L -n 或 nft list ruleset 檢查防火牆
  5. 檢視 /var/log/syslog 或相關日誌

場景 5:日誌分析

觸發:需要分析錯誤日誌、排查問題 流程:

  1. 確定日誌位置:/var/log/...、journalctl
  2. 按時間篩選:grep "ERROR" /path/log | tail -100
  3. 按關鍵詞搜尋:grep "keyword" /path/log
  4. 統計錯誤頻率:grep "ERROR" /path/log | wc -l
  5. 分析錯誤模式和上下文

場景 6:軟體包管理

觸發:安裝、更新、解除安裝軟體 流程:

  1. 識別包管理器:apt-get、yum、dnf、pacman、brew
  2. 更新包索引:apt-get update 或 yum check-update
  3. 檢視可用版本:apt-cache show package_name
  4. 模擬安裝:apt-get install --dry-run package_name
  5. 執行安裝並驗證:apt-get install package_name + package_name --version

系統型別識別

Linux

  • Ubuntu/Debian:存在 /etc/debian_version
  • CentOS/RHEL:存在 /etc/redhat-release
  • Arch Linux:存在 /etc/arch-release
  • 通用命令:cat /etc/os-release

macOS

  • 標識:sw_vers 或 uname -s 返回 "Darwin"

Windows

  • 標識:systeminfo 或 ver

資源索引

必要指令碼

  • scripts/analyze-system.sh - 安全收集系統資訊
    • 用途:快速瞭解系統狀態和配置
    • 引數:--json 輸出 JSON 格式,--output FILE 儲存到檔案

領域參考

  • references/linux-commands.md - 常用命令參考與風險評估

    • 何時讀取:執行不熟悉的命令前
    • 包含:命令說明、安全等級、示例、風險提示
  • references/safety-checklist.md - 安全檢查清單

    • 何時讀取:執行任何破壞性操作前
    • 包含:執行前檢查、風險評估、回滾準備
  • references/troubleshooting-guide.md - 故障排查指南

    • 何時讀取:遇到系統故障或異常時
    • 包含:常見故障場景、診斷流程、解決方案

注意事項

永遠不要做的事

  • 不要在未知系統上直接執行破壞性命令
  • 不要使用 rm -rf 除非 100% 確認路徑
  • 不要在生產環境直接測試新命令
  • 不要忽略命令警告和錯誤資訊

推薦做法

  • 優先使用只讀命令獲取資訊
  • 命令引數優先使用明確路徑而非萬用字元
  • 執行前先用 echo 預覽完整命令
  • 重要操作前先建立系統快照或備份

日誌規範

  • 關鍵操作記錄時間、使用者、命令、結果
  • 異常情況記錄錯誤資訊和現場
  • 定期審查操作日誌,總結經驗

使用示例

示例 1:系統健康檢查

功能:全面檢查系統狀態 執行方式:呼叫指令碼 + 智慧體分析

# 執行系統資訊收集
/workspace/projects/openclaw/scripts/analyze-system.sh --json

智慧體分析要點:

  • 識別系統型別和版本
  • 評估資源使用率
  • 檢查異常程序
  • 識別潛在風險

示例 2:安全清理磁碟空間

功能:識別並建議清理大檔案 執行方式:智慧體引導 + 使用者確認

# 查詢大檔案(只讀)
find /var/log -type f -size +100M -exec ls -lh {} \;

# 檢查磁碟使用
df -h

關鍵步驟:

  1. 使用只讀命令定位目標
  2. 列出清理建議清單
  3. 等待使用者確認
  4. 執行清理並驗證

示例 3:程序異常診斷

功能:診斷程序崩潰或卡死原因 執行方式:智慧體分析

# 查詢程序
ps aux | grep nginx

# 檢查服務狀態
systemctl status nginx

# 檢視日誌
journalctl -u nginx -n 50 --no-pager

智慧體分析:

  • 結合程序狀態、日誌內容、系統資源
  • 識別異常模式
  • 提供針對性解決方案

🤖 AI 評測

這個 Skill 質量不錯,結構清晰且易於理解。它最大的優點是安全意識很強,提供了詳細的安全檢查清單和命令風險評估,能幫助避免常見的運維失誤。工作流程設計得很規範,按照識別環境→評估風險→執行→驗證的步驟來操作。配套的參考資料也比較齊全。不過內容偏向理論指導,實際案例偏少,遇到複雜問題時可能不夠用。總體來說適合需要做伺服器維護的使用者使用,但需要一定的 Linux 基礎才能更好地利用。推薦等級:良好。

📊 多維度評分

適應性4.2
規範性4.4
有效性4.4
可靠性4
可信度5

📁 包含檔案 (6 個)

📄 SKILL.md 8 KB
📄 _meta.json 131 B
📄 references/linux-commands.md 14 KB
📄 references/safety-checklist.md 9.3 KB
📄 references/troubleshooting-guide.md 11.8 KB
📄 scripts/analyze-system.sh 7.8 KB