sre-operator

👤 zuoanco 📦 v0.0.1 ⭐ 4.4 ⬇️ 840 下載
🔒 IT運維與安全 免費

📖 技能介紹


name: openclaw description: 提供結構化的伺服器運維工作流程,包含系統識別、安全檢查、命令驗證和故障排查;當用戶需要系統管理、效能最佳化、日誌分析或伺服器維護時使用


OpenClaw 伺服器運維

任務目標

  • 本 Skill 用於:系統管理員、運維工程師進行安全高效的伺服器維護操作
  • 能力包含:系統識別、命令驗證、風險評估、故障排查、效能監控、日誌分析

    小蔥技能7w4.net有更新,你可以訪問看下。

  • 觸發條件:使用者請求伺服器維護、系統診斷、效能最佳化、故障修復或日常運維任務

核心原則

安全第一

  • 永遠先檢視再執行:任何破壞性操作前,必須先確認當前狀態
  • 執行前評估風險:識別命令潛在影響,準備回滾方案
  • 保持操作可追溯:記錄每個關鍵操作的命令、時間、結果

系統識別優先

  • 執行任何操作前,先識別系統型別(Linux 發行版、macOS、Windows)
  • 根據系統型別選擇合適的命令和工具
  • 不假設系統環境,通過命令輸出驗證

驗證驅動

  • 執行前:驗證命令語法、影響範圍、資源可用性
  • 執行後:驗證操作結果、系統狀態、資料完整性
  • 異常時:保留現場、收集日誌、分析原因

標準工作流程

階段 1:環境識別與評估

  1. 識別系統型別 bash # Linux cat /etc/os-release uname -a # macOS sw_vers # Windows systeminfo

  2. 評估當前狀態

  3. 系統負載:uptimetop -bn1 | head -20
  4. 磁碟使用:df -h
  5. 記憶體使用:free -hvm_stat
  6. 網路連線:ss -tulnnetstat -tuln

  7. 檢查風險因素

  8. 是否在生產環境
  9. 是否有關鍵服務執行
  10. 是否有未提交的更改
  11. 備份狀態

階段 2:命令評估與驗證

  1. 命令風險評估
  2. 查閱 references/linux-commands.md 確認命令安全等級
  3. 使用 --helpman 檢視命令詳細說明
  4. 識別破壞性引數(如 -r-f--force

  5. 模擬執行(如果可能)

  6. 使用 --dry-run 引數(如 rsync、apt-get)
  7. 使用 echo 預覽命令
  8. 在測試環境先執行

  9. 安全檢查清單

  10. 參考 references/safety-checklist.md
  11. 確認資料備份
  12. 準備回滾方案
  13. 通知相關人員(如需要)

階段 3:執行與監控

  1. 執行命令
  2. 使用絕對路徑或確認命令來源
  3. 新增詳細日誌記錄
  4. 在非高峰期執行(如適用)

  5. 即時監控

  6. 觀察命令輸出
  7. 監控系統資源變化
  8. 準備中斷執行(如 Ctrl+C)

  9. 記錄操作

  10. 記錄執行的命令
  11. 記錄輸出結果
  12. 記錄執行時間

階段 4:驗證與確認

  1. 驗證結果
  2. 確認操作達到預期效果
  3. 檢查系統狀態是否正常
  4. 驗證相關服務執行正常

  5. 資料完整性檢查

  6. 確認資料未丟失或損壞
  7. 驗證許可權和所有權正確
  8. 檢查配置檔案語法

  9. 文件更新

  10. 更新運維日誌
  11. 更新配置文件(如需要)
  12. 記錄經驗教訓

常見運維場景

場景 1:系統性能診斷

觸發:系統響應慢、負載高 流程: 1. 執行 scripts/analyze-system.sh --json 收集系統快照 2. 分析資源使用情況(CPU、記憶體、磁碟 I/O、網路) 3. 定位高消耗程序 4. 根據分析結果提供最佳化建議

場景 2:磁碟空間清理

觸發:磁碟使用率超過閾值 流程: 1. df -h 確認磁碟使用情況 2. du -h --max-depth=1 /path 定位大目錄 3. find /path -type f -size +100M 查詢大檔案 4. 列出可清理檔案清單(不直接刪除) 5. 等待使用者確認後再執行清理

場景 3:程序管理

觸發:程序異常、需要重啟服務 流程: 1. ps aux | grep process_name 查詢程序 2. systemctl status service_name 檢查服務狀態 3. 檢視日誌檔案:journalctl -u service_name -n 50/var/log/... 4. 分析異常原因 5. 提供解決方案(優先非破壞性方案)

場景 4:網路故障排查

觸發:網路不通、服務不可訪問 流程: 1. ping target_ip 測試連通性 2. ip addrifconfig 檢查網路配置 3. ss -tuln 檢查埠監聽 4. iptables -L -nnft list ruleset 檢查防火牆 5. 檢視 /var/log/syslog 或相關日誌

場景 5:日誌分析

觸發:需要分析錯誤日誌、排查問題 流程: 1. 確定日誌位置:/var/log/...journalctl 2. 按時間篩選:grep "ERROR" /path/log | tail -100 3. 按關鍵詞搜尋:grep "keyword" /path/log 4. 統計錯誤頻率:grep "ERROR" /path/log | wc -l 5. 分析錯誤模式和上下文

場景 6:軟體包管理

觸發:安裝、更新、解除安裝軟體 流程: 1. 識別包管理器:apt-getyumdnfpacmanbrew 2. 更新包索引:apt-get updateyum check-update 3. 檢視可用版本:apt-cache show package_name 4. 模擬安裝:apt-get install --dry-run package_name 5. 執行安裝並驗證:apt-get install package_name + package_name --version

系統型別識別

Linux

  • Ubuntu/Debian:存在 /etc/debian_version
  • CentOS/RHEL:存在 /etc/redhat-release
  • Arch Linux:存在 /etc/arch-release
  • 通用命令:cat /etc/os-release

macOS

  • 標識:sw_versuname -s 返回 "Darwin"

Windows

  • 標識:systeminfover

資源索引

必要指令碼

  • scripts/analyze-system.sh - 安全收集系統資訊
  • 用途:快速瞭解系統狀態和配置
  • 引數:--json 輸出 JSON 格式,--output FILE 儲存到檔案

領域參考

  • references/linux-commands.md - 常用命令參考與風險評估
  • 何時讀取:執行不熟悉的命令前
  • 包含:命令說明、安全等級、示例、風險提示

  • references/safety-checklist.md - 安全檢查清單

  • 何時讀取:執行任何破壞性操作前
  • 包含:執行前檢查、風險評估、回滾準備

  • references/troubleshooting-guide.md - 故障排查指南

  • 何時讀取:遇到系統故障或異常時
  • 包含:常見故障場景、診斷流程、解決方案

注意事項

永遠不要做的事

  • 不要在未知系統上直接執行破壞性命令
  • 不要使用 rm -rf 除非 100% 確認路徑
  • 不要在生產環境直接測試新命令
  • 不要忽略命令警告和錯誤資訊

推薦做法

  • 優先使用只讀命令獲取資訊
  • 命令引數優先使用明確路徑而非萬用字元
  • 執行前先用 echo 預覽完整命令
  • 重要操作前先建立系統快照或備份

日誌規範

  • 關鍵操作記錄時間、使用者、命令、結果
  • 異常情況記錄錯誤資訊和現場
  • 定期審查操作日誌,總結經驗

使用示例

示例 1:系統健康檢查

功能:全面檢查系統狀態 執行方式:呼叫指令碼 + 智慧體分析

# 執行系統資訊收集
/workspace/projects/openclaw/scripts/analyze-system.sh --json

智慧體分析要點: - 識別系統型別和版本 - 評估資源使用率 - 檢查異常程序 - 識別潛在風險

示例 2:安全清理磁碟空間

功能:識別並建議清理大檔案 執行方式:智慧體引導 + 使用者確認

# 查詢大檔案(只讀)
find /var/log -type f -size +100M -exec ls -lh {} \;

# 檢查磁碟使用
df -h

關鍵步驟: 1. 使用只讀命令定位目標 2. 列出清理建議清單 3. 等待使用者確認 4. 執行清理並驗證

示例 3:程序異常診斷

功能:診斷程序崩潰或卡死原因 執行方式:智慧體分析

# 查詢程序
ps aux | grep nginx

# 檢查服務狀態
systemctl status nginx

# 檢視日誌
journalctl -u nginx -n 50 --no-pager

智慧體分析: - 結合程序狀態、日誌內容、系統資源 - 識別異常模式 - 提供針對性解決方案

🤖 AI 評測

這個 Skill 質量不錯,結構清晰且易於理解。它最大的優點是安全意識很強,提供了詳細的安全檢查清單和命令風險評估,能幫助避免常見的運維失誤。工作流程設計得很規範,按照識別環境→評估風險→執行→驗證的步驟來操作。配套的參考資料也比較齊全。不過內容偏向理論指導,實際案例偏少,遇到複雜問題時可能不夠用。總體來說適合需要做伺服器維護的使用者使用,但需要一定的 Linux 基礎才能更好地利用。推薦等級:良好。

📊 多維度評分

適應性4.2
規範性4.4
有效性4.4
可靠性4
可信度5

📁 包含檔案 (6 個)

📄 SKILL.md 8 KB
📄 _meta.json 131 B
📄 references/linux-commands.md 14 KB
📄 references/safety-checklist.md 9.3 KB
📄 references/troubleshooting-guide.md 11.8 KB
📄 scripts/analyze-system.sh 7.8 KB