KI / Automatisierung 21. April 2026

2026 OpenClaw-Health-Probes, synthetische Verfügbarkeit und Platten-Schwellen auf einer gemieteten Mac mini

ProxyMac Engineering-Team 21. April 2026 ~13 Min. Lesezeit

OpenClaw-Gateways auf einer gemieteten ProxyMac Mac mini in HK, JP, KR, SG oder US können „gesund“ wirken und trotzdem still versagen: der HTTP-Listener bindet noch, aber Modellrouten hängen, die Platte ist zu 92 % voll, oder LaunchAgents starten so schnell neu, dass Logs nie geschrieben werden. Dieses 2026-Playbook ergänzt geschichtete Health-Probes—schnelle localhost-curl-Läufe geplant durch LaunchAgent, langsamere synthetische Verfügbarkeits-Checks von außerhalb Ihres LAN sowie Platten- und Unified-Logging-Schwellen—und verknüpft Fehler mit den Neustartmustern aus Launchctl-Wiederherstellung und den strukturierten Triage-Schritten in Deployment-Fehlerbehebung. Sie erhalten eine fünfspaltige Signal-Matrix (anderes Tabellenlayout als im Rate-Limit-Leitfaden), ein kopierbares curl-Probe-Snippet, Zeitangaben (60 s Takt, 5 s Client-Timeout, 12 GB freier Speicher als Untergrenze) und eine fünfstufige Incident-Matrix, damit Bereitschaft nicht mehr raten muss, ob Cloudflare, TLS oder der Gateway-Prozess zuerst brach.

Kombinieren Sie den Leitfaden mit Automatisierungshinweisen im Hilfe-Center und reservieren Sie Kapazität über Preise, bevor Sie mehr Agenten auf einer Mini stapeln.

Warum Gateways mehr brauchen als „Prozess läuft“

macOS zeigt grün in der Aktivitätsanzeige, während der Worker-Thread auf einem Futex blockiert. Externe Anbieter melden nur, dass ICMP den Host erreicht—nicht dass Ihre OpenClaw-HTTP-Oberfläche HTTP/200 mit JSON liefert, das Modell-Credentials belegt. Probes sollten drei Fragen in Reihenfolge beantworten: Nimmt der Port TCP an? Liefert die App-Logik „ready“? Sind Abhängigkeiten (Platte, Geheimnisse, Upstream-APIs) innerhalb der SLA? Überspringen Sie eine Schicht, und Sie öffnen jeden Freitag dieselbe Sev-2 erneut.

  • Sichtbarkeit durch LaunchAgent: fehlgeschlagene Probes erhöhen einen Zähler, den Sie per Syslog ins SIEM schicken können.
  • Kanarien-Nutzlasten: ein 512-Byte-JSON-Echo belegt TLS-Terminierung und JSON-Parsing, nicht nur TCP.
  • Operator-Sanity: nach 3 aufeinanderfolgenden Probe-Fehlern innerhalb von 2 Minuten nur automatisch neu starten, wenn der letzte saubere Shutdown >10 Minuten zurückliegt—verhindert Fork-Bombs.

Signalarten im Vergleich (Liveness vs. Readiness vs. Business)

SignalWas bestehtWas trotzdem brichtTypisches Probe-ToolVorgeschlagener Takt
TCP offenPort 443 nimmt SYN anTLS-Fehlkonfiguration, App-Panicnc -vz 127.0.0.1 PORTAlle 120 s (günstig)
HTTP-Liveness200 OK, leerer BodyModell-Auth abgelaufencurl -fsS --max-time 5 URLAlle 60 s
HTTP-ReadinessJSON meldet Warteschlangentiefe < SchwelleLLM-Ausfall beim AnbieterSkript mit jqAlle 180 s
Business-ProbeSynthetischer Dialog komplettiertseltene Race-BugsSeparater Worker-MiniAlle 15 Min.

Localhost-Probe-Muster, das TLS-Frontends überlebt

Binden Sie die administrative Health-Route an 127.0.0.1 auf einem hohen Port, getrennt vom öffentlichen Webhook-Socket aus Webhook-Härtung. Ihr LaunchAgent läuft im selben Benutzerkontext wie das Gateway, damit Keychain-Einträge entsperrt bleiben. Nutzen Sie curl --fail --silent --show-error --max-time 5, damit hängende Backends launchd nicht ewig blockieren.

curl -fsS --max-time 5 http://127.0.0.1:18080/healthz || logger -t openclaw-probe "FAIL"

LaunchAgent-Timer (StartInterval, ThrottleInterval)

Apple dokumentiert StartInterval in Sekunden; kombinieren Sie mit ThrottleInterval von mindestens 30, wenn Ihr Probe-Skript auch Remediation auslöst—sonst hämmern Sie launchctl kickstart schneller, als das Gateway Sockets leeren kann. Erfolge nur auf Debug-Level loggen; Fehler sollten eine Zeile mit Epochenzeitstempel, Exit-Code und curl-Zeit ausgeben.

Neustart-Rezepte wiederverwenden: wenn Probes fehlschlagen, rufen Sie dasselbe Wrapper-Skript auf wie in Gateway-Neustart-Wiederherstellung, damit das Betriebsteam ein Runbook einprägt.

Externe synthetische Checks ohne Admin-Routen zu veröffentlichen

Wählen Sie einen externen Monitor mit gegenseitigem TLS-Clientzertifikat oder signierten Request-Headern; niemals unauthentifiziertes Health-JSON öffentlich ausliefern. Latenz von Tokio zu einer JP-Mini sollte für HTTPS-Probes unter 80 ms p95 bleiben—wenn synthetische Checks leiden, localhost-Probes aber grün sind, vermuten Sie eher WAF oder Zertifikatsablauf vors OpenClaw selbst.

Platten- und Unified-Logging-Schwellen

OpenClaw-Workloads, die Transkripte streamen, füllen /var/db/diagnostics schneller als Teams erwarten. Alarmieren Sie, wenn verfügbare Bytes unter 12 GB fallen (nicht Prozent—APFS-Snapshots verzerren Prozentwerte). Verfolgen Sie Wachstumsgeschwindigkeit: mehr als 3 GB pro Tag auf einer Single-Tenant-Mini bedeuten meist, dass Debug-Logging nach einem Vorfall aktiv blieb. Rotieren Sie App-Logs mit newsyslog-artigen Deckeln oder übertragen Sie sie zu Remote-Speicher, bevor gzip-CPU der Modellinferenz wegstiehlt.

Geheimnisrotation: wenn Probes direkt nach Schlüsselrotation mit HTTP 401 fehlschlagen, sollte Ihr Monitor versionierte Secrets aus der Keychain gemäß Geheimnis-Leitfaden lesen—keine langlebigen PATs in plist-Dateien einbetten.

Fünfstufige Incident-Matrix, wenn Probes rot werden

  1. Umfang bestätigen: widersprechen sich localhost- und externe Probes? Wenn nur extern fehlschlägt, mit TLS und DNS beginnen.
  2. LaunchAgent-stderr prüfen: log show --predicate 'process == "curl"' --last 5m unter macOS 15 erfasst die meisten Fehler ohne ausführliche Gateway-Logs.
  3. Abhängigkeiten validieren: Platte, Inode-Anzahl, Modellanbieter-429-Zähler—HTTP-Signaltabelle aus Provider-Failover-Leitfaden wiederverwenden.
  4. Einmal neu starten mit dem abgesicherten kickstart-Muster; wenn Probes innerhalb von 90 Sekunden erneut fehlschlagen, Schleifen stoppen und stattdessen einen Spindump erfassen.
  5. Blast-Radius dokumentieren: welche Automatisierungen pausiert wurden, welche Regionen in HK / JP / KR / SG / US gesund blieben, Artefakte am Change-Ticket verlinken.

FAQ

Sollen Probes als root laufen? Bevorzugen Sie denselben unprivilegierten Benutzer wie das Gateway, damit Dateirechte der Produktion entsprechen.

Kann ich MCP-Health-Endpunkte wiederverwenden? Oft ja—siehe MCP-Setup—aber OpenClaw-Kern-Health separat halten, damit partielle MCP-Ausfälle Gateway-Tod nicht überdecken.

Was ist mit Multi-Agent-Parallelität? Bei Parallelitätsspitzen können Readiness-Probes flappen—Warteschlangenschwellen schärfen, bevor Sie Alarme stummschalten.

Warum ProxyMac Mac mini der richtige Ort zum Härten von OpenClaw-Probes ist

Probes neben dem Gateway auf Apple-Silicon-M4-Hardware in HK / JP / KR / SG / US zu betreiben liefert deterministische CPU für curl+jq-Skripte, native Integration mit launchd und genug Single-Tenant-Platte für ausführliches Logging in Vorfällen—ohne Linux-cgroup-Überraschungen. Mieten Sie die Mini nächst Ihrer Modell-API-Region über Preise, codieren Sie die Probe-Plist im selben Git-Repo wie die OpenClaw-Konfiguration gemäß GitOps-Leitfaden, und geben Sie die Maschine nach Pilotende zurück, damit Finance klare SKUs statt mysteriöser Cloud-Positionen sieht.

Automatisieren mit Reserven für Probes

HK / JP / KR / SG / US Mac mini für OpenClaw + Monitoring-Skripte