Lokale LLMs beschleunigen: Headroom −95 % Agent-Kontext (2026)
Sie haben Ollama, DeepSeek oder Llama 3 auf einem Coding-Agent am Mac mini—dann grep im Monorepo, 200 MB Log oder SQL-Dump: UI friert, tok/s bricht ein. Bei 8B–14B lokal schadet Tool-Output-Inflation mehr als Modell-IQ.
Headroom ist eine OSS-Kontextkompressions-Schicht (Apache 2.0), typisch 60–95 % weniger Tokens vor dem LLM, mit CCR. Lokal-first; Cloud-Kosten: Hermes Trajectory Compressor.
Warum lokale Agenten bei großen Tool-Outputs „hängen“
Latenz skaliert mit Kontextlänge und Speicherbandbreite.
| Symptom | Ursache | Anzeige |
|---|---|---|
| 30–120 s „Denken“ nach Tool | 50k–200k stdout-Tokens | Balken steht; GPU 100 % |
| Antworten werden schlechter | KV-Cache voll | Ignoriert neue Anweisungen |
| App wirkt eingefroren | Swap auf 8–16 GB mini | Lüfter; roter Speicherdruck |
| grep-Schleife | Fehlerzeile im Rauschen | Gleicher Tool-Call |
Definition: Lokale LLM-Tool-Latenz = Zeit von Tool-Rückgabe bis nächstem Token—dominiert durch Prefill über unkomprimierten Kontext.
Kombinieren Sie mit 8-GB-Speicherbudget bei OpenClaw/MLX.
Headroom-Architektur: komprimieren vor Prefill
Agent (Cursor, OpenClaw, custom)
│ tool results · file reads · logs
▼
┌──────────────────────────────┐
│ Headroom (local) │
│ CacheAligner → ContentRouter │
│ ├─ SmartCrusher (JSON) │
│ ├─ CodeCompressor (AST) │
│ └─ Kompress-base (text) │
│ CCR store (reversible) │
└──────────────────────────────┘
│ compressed messages + headroom_retrieve
▼
Ollama / llama.cpp / MLX API
README-Bench (python -m headroom.evals suite):
| Workload | Vorher | Nachher | Ersparnis |
|---|---|---|---|
| Code search (100 results) | 17,765 | 1,408 | 92% |
| SRE incident debugging | 65,694 | 5,118 | 92% |
| GitHub issue triage | 54,174 | 14,761 | 73% |
CCR: Originale auf Disk; headroom_retrieve bei Bedarf—aggressive Kompression ohne Löschen.
Entscheidungsmatrix Mac mini
| Ansatz | Token-Kürzung | Reversibel | Am besten für |
|---|---|---|---|
head -n 50 | Hoch | Nein | Hack |
Hermes compression.* | Mittel | Teilweise | Hermes Agent |
| Headroom-Proxy | 60–95 % | Ja (CCR) | OpenAI-kompatibel lokal |
| Headroom MCP | Gleiche Engines | Ja | MCP/OpenClaw |
| Nur kleinerer Quant | 0 % bei Logs | N/A | Falsches Hebel |
OpenClaw am Mac mini: Headroom unterstützt Wrap und ContextEngine-Plugin.
Wenn X, dann Y: Prefill > 10 s auf 7B nach cat → Headroom vor größerer GPU/Cloud.
Szenario A — Ollama + Headroom-Proxy (kein Code-Change)
OpenAI-Base-URL auf Headroom; Weiterleitung zu Ollama.
Stack: Mac mini M2/M3/M4, qwen2.5-coder:7b oder deepseek-r1:8b, Proxy 8787.
Erwartung: 45–90 s → 8–15 s auf 7B (variiert).
Szenario B — OpenClaw + Headroom MCP
MCP-Tools headroom_compress usw. Parallelitätslimits—2 Tasks auf 16 GB.
7-Schritte-Runbook: Headroom + Ollama
Schritt 1 — Headroom installieren
brew install python@3.12
pip install "headroom-ai[proxy,mcp]"
headroom --version
Schritt 2 — Ollama Coding-Modell
ollama pull qwen2.5-coder:7b-instruct-q4_K_M
ollama serve # default :11434
Schritt 3 — Proxy starten
export OLLAMA_HOST=http://127.0.0.1:11434
headroom proxy --port 8787 --backend ollama
(Proxy-Guide.)
Schritt 4 — Agent auf localhost:8787
OpenAI-kompatibles Beispiel:
export OPENAI_API_BASE=http://127.0.0.1:8787/v1
export OPENAI_API_KEY=ollama # placeholder for local
base URL http://127.0.0.1:8787/v1.
Schritt 5 — Baseline vs. komprimiert
Gleicher Prompt zweimal:
- Direkt Ollama — alle
TODO - Via Headroom
Schritt 6 — retrieve beim Debug
headroom_retrieve um ERROR bei fehlendem Stack.
Schritt 7 — LaunchAgent (optional)
Speicher-Guide für Node-Heap. Reihenfolge: Ollama, Headroom, Agent.
Fehlerbehebung
Nach Headroom noch langsam
Muster: Niedrige Ratio bei Binär/protobuf.
Fix: JSON/Text-Formatter; CodeCompressor; weniger parallele Reads.
FAIL-Zeile „verloren“
Muster: Aggressives Log-Crush.
Fix: headroom_retrieve; Fehler-Keywords; rg --json ERROR.
Proxy OK, 404 auf /v1/chat/completions
Muster: Falsches Backend; Ollama aus.
Fix: curl tags; Proxy mit richtigem --backend.
Empfohlener Pfad
| Setup | Empfehlung |
|---|---|
| Cursor + Ollama | proxy 8787 + 7B-Quant |
| OpenClaw-Gateway | MCP + Parallelität 1–2 |
| Hermes 8B | Headroom + 8B-Tuning |
| MLX | Headroom Tools; MLX-Hybrid |