Letzten Monat habe ich meinen eigenen AI-Gateway gebaut. Nicht aus Theorie — sondern weil ich es leid war, für jedes LLM separate API-Keys zu kaufen und zu verwalten.
Das Problem
KI-Entwicklung kostet Geld. GPT-4, Claude, Gemini — jeder Provider will sein Geld. Und wenn du mehrere Modelle testen willst, explodiert die Rechnung.
Ich habe nach einer Lösung gesucht, die:
250+ Provider in einem System bündelt
Freie Tiers automatisch nutzt (bis zu 1,4 Milliarden kostenlose Tokens pro Monat)
Intelligent routet — wenn ein Provider down ist, geht es zum nächsten
Tokens spart — durch intelligente Kompression
Die Lösung: OmniRoute
OmniRoute ist ein Open-Source AI-Gateway, den ich auf meinem Hetzner-Server deployed habe. Es läuft als Docker-Container auf Port 30100 und bietet eine OpenAI-kompatible API.
Was kann es?
18 Routing-Strategien — von priority bis cost-optimized
Smart Fallback — wenn Provider A 429 liefert, geht automatisch zu B
Token Compression — RTK + Caveman Kompression spart durchschnittlich 89% der Tokens
Free-Tier Aggregation — alle kostenlosen Kontingente gebündelt
Die Zahlen
Derzeit habe ich ~90 Provider mit freien Tiers angebunden. Das ergibt zusammen über 1,4 Milliarden kostenlose Tokens pro Monat. Plus alle bezahlten Accounts als Fallback.
Die Kompression macht den Unterschied:
Lite: ~15% Einsparung
Standard: ~45% Einsparung
Aggressive: ~70% Einsparung
Stacked (RTK+Caveman): bis zu 95% Einsparung
Wie ich es einsetze
OmniRoute ist das Rückgrat meiner gesamten KI-Infrastruktur:
Daily LLM Benchmark — testet jeden Morgen 4 Modelle mit 9 Benchmarks
Multi-Agenten-Systeme — alle Agenten gehen über einen Gateway
Gamma-API Bilderzeugung — günstiger durch Smart Routing
Hermes Agent — mein persönlicher KI-Assistent
Warum das für Kanzleien relevant ist
Viele meiner Mandanten fragen mich: „Wie setze ich KI sinnvoll ein, ohne dabei viel Geld auszugeben?“
Die Antwort: Intelligentes Routing + Kompression. Ein Gateway wie OmniRoute kostet dich nichts — du startest es selbst und zahlst nur, was du wirklich brauchst.
Technische Details
OmniRoute läuft in einem Docker-Container, wird durch Caddy reversed-proxied und persistiert seine Daten in SQLite. Die API ist OpenAI-kompatibel, also funktioniert jeder Client, der die OpenAI-Spec spricht.
Admin-UI: omniroute.[deine-ip].nip.io
Fazit
Ich habe 2 Wochen gebraucht, um OmniRoute zu verstehen und zu deployen. Aber seitdem spare ich mindestens 80% meiner API-Kosten. Und ich habe vollständige Kontrolle über meine Daten — kein Cloud-Provider sieht, was ich abfrage.
Das ist Life 4.0: Eigene Infrastruktur, eigene Regeln.
Andreas Galatas ist Rechtsanwalt für Arbeitsrecht in Bochum und baut parallel daran, wie Kanzleien digital werden können. Sein Server-Setup läuft auf einem Hetzner CX42.


![CSRD 2026: Neue Berichtspflicht für Unternehmen [Pflichten & Fristen]](https://andreas.galatas.de/wp-content/uploads/sites/10/2026/01/ai-and-green-transformation-2026.jpg)