2026 — Sondes de santé OpenClaw, disponibilité synthétique et garde-fous disque sur Mac mini louée
Les passerelles OpenClaw sur une Mac mini ProxyMac louée en HK, JP, KR, SG ou US peuvent paraître « saines » tout en échouant en silence : l’écouteur HTTP reste lié, mais les routes modèle sont coincées, le disque est rempli à 92 %, ou les LaunchAgents repartent si vite que les journaux ne se vident jamais. Ce playbook 2026 ajoute des sondes de santé en couches—des curls localhost rapides planifiés par LaunchAgent, des contrôles de disponibilité synthétique plus lents depuis l’extérieur de votre LAN, et des garde-fous disque et journalisation unifiée—puis relie les échecs aux motifs de redémarrage de récupération Launchctl et aux étapes de triage structuré du dépannage de déploiement. Vous obtiendrez une matrice de signaux en cinq colonnes (forme de tableau distincte du guide limites de débit), une sonde curl prête à coller, des cadences chiffrées (60 s, délai client 5 s, plancher 12 Go d’espace libre), et une matrice d’incident en cinq étapes pour que l’astreinte cesse de deviner si Cloudflare, TLS ou le processus passerelle a cassé en premier.
Associez ce guide aux notes d’automatisation du centre d’aide et réservez de la marge via les tarifs avant d’empiler davantage d’agents sur une seule mini.
Pourquoi les passerelles ont besoin de sondes au-delà du « processus actif »
macOS affiche du vert dans le Moniteur d’activité pendant que le fil worker est bloqué sur un futex. Les fournisseurs externes ne disent que si l’ICMP a atteint l’hôte—pas que votre surface HTTP OpenClaw a renvoyé un HTTP/200 avec un corps JSON prouvant le chargement des identifiants modèle. Les sondes doivent répondre dans l’ordre à trois questions : Le port accepte-t-il le TCP ? La logique applicative signale-t-elle prêt ? Les dépendances (disque, secrets, API amont) respectent-elles le SLA ? Sauter une couche, c’est rouvrir le même Sev2 chaque vendredi.
- Visibilité LaunchAgent : les sondes en échec incrémentent un compteur expédiable vers votre SIEM via syslog.
- Charges canaries : un écho JSON de 512 octets prouve la terminaison TLS et l’analyse JSON, pas seulement le TCP.
- Santé opérationnelle : après 3 échecs consécutifs de sondes sur 2 minutes, redémarrez automatiquement seulement si le dernier arrêt propre remonte à plus de 10 minutes—cela évite les bombes à forks.
Types de signaux comparés (liveness, readiness, métier)
| Signal | Ce qui passe | Ce qui casse encore | Outil de sonde typique | Cadence suggérée |
|---|---|---|---|---|
| TCP ouvert | Le port 443 accepte le SYN | Mauvais TLS, panic applicatif | nc -vz 127.0.0.1 PORT | Toutes les 120 s (bon marché) |
| HTTP liveness | 200 OK corps vide | Jeton modèle expiré | curl -fsS --max-time 5 URL | Toutes les 60 s |
| HTTP readiness | Le JSON indique une profondeur de file sous le seuil | Panne LLM amont | Contrôle scripté avec jq | Toutes les 180 s |
| Sonde métier | Une conversation synthétique se termine | Rares courses | Mini worker dédié | Toutes les 15 min |
Schéma sonde localhost qui survit aux fronts TLS
Liez la route administrative de santé à 127.0.0.1 sur un port élevé, distinct du socket webhook public décrit dans le durcissement webhooks. Votre LaunchAgent tourne sous le même utilisateur que la passerelle afin que les éléments Trousseau restent déverrouillés. Utilisez curl --fail --silent --show-error --max-time 5 pour qu’un backend bloqué n’immobilise pas launchd indéfiniment.
curl -fsS --max-time 5 http://127.0.0.1:18080/healthz || logger -t openclaw-probe "FAIL"
Câblage minuteur LaunchAgent (StartInterval, ThrottleInterval)
Apple documente StartInterval en secondes ; combinez avec un ThrottleInterval d’au moins 30 lorsque votre script de sonde déclenche aussi une remédiation—sinon vous martelez launchctl kickstart plus vite que la passerelle ne vide les sockets. Journalisez les succès au niveau Debug seulement ; les échecs doivent émettre une ligne unique avec horodatage epoch, code de sortie et durée curl.
Contrôles synthétiques externes sans exposer les routes admin
Choisissez un moniteur externe qui prend en charge des certificats client mTLS ou des en-têtes de requête signés ; ne publiez jamais de JSON de santé non authentifié sur Internet public. La latence de Tokyo vers une mini JP doit rester sous 80 ms en p95 pour les sondes HTTPS—si les contrôles synthétiques se dégradent pendant que les sondes localhost restent vertes, suspectez un WAF amont ou l’expiration de certificat, pas OpenClaw lui-même.
Garde-fous disque et journalisation unifiée
Les charges OpenClaw qui diffusent des transcriptions remplissent /var/db/diagnostics plus vite que les équipes ne l’imaginent. Alerte lorsque l’espace disponible passe sous 12 Go (pas en pourcentage—les instantanés APFS faussent les pourcentages). Suivez la vélocité de croissance : plus de 3 Go par jour sur une mini mono-locataire signale en général un journal debug laissé allumé après un incident. Faites tourner les journaux applicatifs avec des plafonds style newsyslog ou expédiez vers un stockage distant avant que le gzip CPU ne vole du temps à l’inférence.
Matrice d’incident en cinq étapes quand les sondes passent au rouge
- Confirmer l’étendue : les sondes localhost et externes divergent-elles ? Si seul l’externe échoue, commencez par TLS et DNS.
- Consulter stderr LaunchAgent :
log show --predicate 'process == "curl"' --last 5msous macOS 15 capture la plupart des échecs sans activer les journaux verbeux de la passerelle. - Valider les dépendances : disque, nombre d’inodes, compteurs 429 fournisseur de modèle—réutilisez le tableau des signaux HTTP du guide bascule fournisseur.
- Redémarrer une fois avec le motif kickstart gardé ; si les sondes échouent de nouveau en moins de 90 secondes, cessez la boucle et capturez un spindump à la place.
- Documenter le rayon d’explosion : quelles automatisations étaient en pause, quelles régions HK / JP / KR / SG / US sont restées saines, et reliez les artefacts au ticket de changement.
FAQ
Les sondes doivent-elles tourner en root ? Préférez le même utilisateur non privilégié que la passerelle pour que les permissions fichiers reflètent la production.
Puis-je réutiliser des points de terminaison de santé MCP ? Souvent oui—voir configuration MCP—mais gardez la santé cœur OpenClaw séparée pour qu’une panne MCP partielle ne masque pas la mort de la passerelle.
Et la concurrence multi-agents ? Quand la concurrence explose, les sondes readiness peuvent clignoter—resserrez les seuils de file avant de réduire le bruit des alertes.
Pourquoi la Mac mini ProxyMac est le bon endroit pour durcir les sondes OpenClaw
Exécuter les sondes à côté de la passerelle sur du matériel Apple Silicon M4 en HK / JP / KR / SG / US donne une CPU déterministe pour les scripts curl+jq, une intégration native avec launchd, et assez de disque mono-locataire pour absorber des journaux verbeux pendant les incidents—sans combattre les surprises de cgroup Linux. Louez la mini la plus proche de la région API de vos modèles via les tarifs, codifiez le plist de sonde dans le même dépôt Git que votre configuration OpenClaw selon le guide GitOps, et recyclez la machine en fin de pilote pour que la finance voie des SKU clairs plutôt que des postes de dépense cloud opaques.
Automatisez avec de la marge pour les sondes
Mac mini HK / JP / KR / SG / US pour OpenClaw et scripts de surveillance