AI / Automation

Lokale LLMs beschleunigen: Headroom −95 % Agent-Kontext (2026)

Headroom Kontextkompression für lokale LLM-Tool-Latenz auf Mac mini M4

Sie haben Ollama, DeepSeek oder Llama 3 auf einem Coding-Agent am Mac mini—dann grep im Monorepo, 200 MB Log oder SQL-Dump: UI friert, tok/s bricht ein. Bei 8B–14B lokal schadet Tool-Output-Inflation mehr als Modell-IQ.

Headroom ist eine OSS-Kontextkompressions-Schicht (Apache 2.0), typisch 60–95 % weniger Tokens vor dem LLM, mit CCR. Lokal-first; Cloud-Kosten: Hermes Trajectory Compressor.

Hinweis: ProxyMac veröffentlicht Mac-Dev-Guides; Headroom ist Drittanbieter ohne Verbindung zu uns.

Warum lokale Agenten bei großen Tool-Outputs „hängen“

Latenz skaliert mit Kontextlänge und Speicherbandbreite.

SymptomUrsacheAnzeige
30–120 s „Denken“ nach Tool50k–200k stdout-TokensBalken steht; GPU 100 %
Antworten werden schlechterKV-Cache vollIgnoriert neue Anweisungen
App wirkt eingefrorenSwap auf 8–16 GB miniLüfter; roter Speicherdruck
grep-SchleifeFehlerzeile im RauschenGleicher Tool-Call

Definition: Lokale LLM-Tool-Latenz = Zeit von Tool-Rückgabe bis nächstem Token—dominiert durch Prefill über unkomprimierten Kontext.

Kombinieren Sie mit 8-GB-Speicherbudget bei OpenClaw/MLX.

Headroom-Architektur: komprimieren vor Prefill

Agent (Cursor, OpenClaw, custom) │ tool results · file reads · logs ▼ ┌──────────────────────────────┐ │ Headroom (local) │ │ CacheAligner → ContentRouter │ │ ├─ SmartCrusher (JSON) │ │ ├─ CodeCompressor (AST) │ │ └─ Kompress-base (text) │ │ CCR store (reversible) │ └──────────────────────────────┘ │ compressed messages + headroom_retrieve ▼ Ollama / llama.cpp / MLX API

README-Bench (python -m headroom.evals suite):

WorkloadVorherNachherErsparnis
Code search (100 results)17,7651,40892%
SRE incident debugging65,6945,11892%
GitHub issue triage54,17414,76173%

CCR: Originale auf Disk; headroom_retrieve bei Bedarf—aggressive Kompression ohne Löschen.

Quickstart, CCR.

Entscheidungsmatrix Mac mini

AnsatzToken-KürzungReversibelAm besten für
head -n 50HochNeinHack
Hermes compression.*MittelTeilweiseHermes Agent
Headroom-Proxy60–95 %Ja (CCR)OpenAI-kompatibel lokal
Headroom MCPGleiche EnginesJaMCP/OpenClaw
Nur kleinerer Quant0 % bei LogsN/AFalsches Hebel

OpenClaw am Mac mini: Headroom unterstützt Wrap und ContextEngine-Plugin.

Wenn X, dann Y: Prefill > 10 s auf 7B nach cat → Headroom vor größerer GPU/Cloud.

Szenario A — Ollama + Headroom-Proxy (kein Code-Change)

OpenAI-Base-URL auf Headroom; Weiterleitung zu Ollama.

Stack: Mac mini M2/M3/M4, qwen2.5-coder:7b oder deepseek-r1:8b, Proxy 8787.

Erwartung: 45–90 s8–15 s auf 7B (variiert).

Szenario B — OpenClaw + Headroom MCP

MCP-Tools headroom_compress usw. Parallelitätslimits2 Tasks auf 16 GB.

7-Schritte-Runbook: Headroom + Ollama

Schritt 1 — Headroom installieren

brew install python@3.12 pip install "headroom-ai[proxy,mcp]" headroom --version

Schritt 2 — Ollama Coding-Modell

ollama pull qwen2.5-coder:7b-instruct-q4_K_M ollama serve # default :11434

Schritt 3 — Proxy starten

export OLLAMA_HOST=http://127.0.0.1:11434 headroom proxy --port 8787 --backend ollama

(Proxy-Guide.)

Schritt 4 — Agent auf localhost:8787

OpenAI-kompatibles Beispiel:

export OPENAI_API_BASE=http://127.0.0.1:8787/v1 export OPENAI_API_KEY=ollama # placeholder for local

base URL http://127.0.0.1:8787/v1.

Schritt 5 — Baseline vs. komprimiert

Gleicher Prompt zweimal:

  1. Direkt Ollama — alle TODO
  2. Via Headroom

Schritt 6 — retrieve beim Debug

headroom_retrieve um ERROR bei fehlendem Stack.

Schritt 7 — LaunchAgent (optional)

Speicher-Guide für Node-Heap. Reihenfolge: Ollama, Headroom, Agent.

Fehlerbehebung

Nach Headroom noch langsam

Muster: Niedrige Ratio bei Binär/protobuf.
Fix: JSON/Text-Formatter; CodeCompressor; weniger parallele Reads.

FAIL-Zeile „verloren“

Muster: Aggressives Log-Crush.
Fix: headroom_retrieve; Fehler-Keywords; rg --json ERROR.

Proxy OK, 404 auf /v1/chat/completions

Muster: Falsches Backend; Ollama aus.
Fix: curl tags; Proxy mit richtigem --backend.

SetupEmpfehlung
Cursor + Ollamaproxy 8787 + 7B-Quant
OpenClaw-GatewayMCP + Parallelität 1–2
Hermes 8BHeadroom + 8B-Tuning
MLXHeadroom Tools; MLX-Hybrid

FAQ

Nur Cloud-APIs?+
Nein. Lokal für Ollama/llama.cpp/MLX.
Unterschied zu Hermes?+
Hermes: abgeschlossene Trajektorien. Headroom: eingehender Tool-Kontext.
95 % bricht Genauigkeit?+
Bench 97 % auf BFCL; CCR retrieve behalten.
DeepSeek lokal?+
Ja—OpenAI-kompatibler Server hinter Proxy.
Mindest-RAM?+
16 GB; 8 GB mit 8-GB-Guide.

Dedizierter Mac mini?

Ollama+Headroom headless.