AI Operations · 12 Min.
Model Routing wird news-sensitiv: Warum dein AI Stack sich an neue Modelle anpassen muss
Wenn jede Woche neue Modelle erscheinen, darf ein AI-System nicht fest auf eine Modellentscheidung eingefroren sein.
SYSTEMS Grafik zu News-sensitives Model Routing: Trace -> Metric -> Decision. Fokus: Wie Unternehmen Model Routing bauen, das auf neue Modelle, Kosten und Qualitätsdaten reagieren kann.
Kurzfassung
Neue Modelle verändern Kosten, Geschwindigkeit und Qualität laufend. Ein AI Stack braucht Routing statt feste Modellbindung. Evals entscheiden, wann ein Modellwechsel sinnvoll ist.
Strategischer Lesepfad
Baue das Thema im passenden Cluster weiter aus und verknüpfe es mit den nächsten Architekturentscheidungen.
Warum feste Modellwahl veraltet Heute ist ein Modell stark für Recherche, morgen ist ein anderes günstiger für Klassifizierung. Wer alles hart verdrahtet, kann nicht schnell reagieren.
Model Routing macht den Stack beweglich.
Stand Mai 2026: Modelle, Preise und Policy-Funktionen bewegen sich laufend OpenAI, Anthropic und Google aktualisieren Modelle, Preislogiken, Kontextfenster, Tool-Unterstützung, Prompt-Caching und Safety-/Data-Control-Optionen laufend. Gleichzeitig bieten Gateways wie Vercel AI Gateway oder Cloudflare AI Gateway Routing, Observability , Fallbacks, Kosten- und teilweise ZDR-nahe Steuerung.
Das macht Model Routing notwendig, aber auch riskant. Ein Router darf nicht einfach "immer billigstes Modell" oder "immer neuestes Modell" wählen. Er muss nach Aufgabe, Risiko, Datenklasse, Eval-Ergebnis, Latenz, Kosten und Compliance entscheiden.
Was geroutet werden sollte Routing kann nach Aufgabe, Risiko, Kosten, Kontextlänge, Sprache, Latenz und Datenklasse entscheiden. Nicht jede Aufgabe braucht das teuerste Modell.
Das spart Geld und verbessert Stabilität.
Routing-Dimensionen:
Ein gutes Gateway routet nicht nur Modelle. Es routet Verantwortung.
Aufgabe: Klassifikation, Extraktion, Research, Coding, Voice, Vision, Tool-Orchestrierung. Risiko: intern, kundennah, rechtlich, finanziell, sicherheitskritisch. Datenklasse: public, intern, vertraulich, personenbezogen, kundenspezifisch. Kontext: kurze Anfrage, langer Vertrag, Codebase, Multimodal, RAG. Latenz: interaktiv, Batch, Hintergrundjob, Realtime. Kosten: Input, Output, Caching, Web Search, File Search, Tool Calls, Container. Residency/ZDR: darf diese Anfrage nur an bestimmte Anbieter oder Regionen? Fallback: welches Modell übernimmt bei Ausfall, Rate Limit oder Policy-Block?
Evals als Schaltzentrale Ein neues Modell wird nicht wegen Marketing gewechselt. Es wird getestet: Besteht es die wichtigsten Fälle besser, schneller oder günstiger?
Nur dann wird es in Produktion geroutet.
Der Release-Prozess:
1. Neues Modell oder neue Preisänderung erfassen. 2. Betroffene Workflows identifizieren. 3. Golden Set und Trace-Evals laufen lassen. 4. Kosten pro erfolgreichem Lauf vergleichen. 5. Safety-, Tool-Use- und Hallucination-Fälle prüfen. 6. Canary-Routing für kleine Traffic-Anteile. 7. Fallback und Rollback testen. 8. Entscheidung dokumentieren.
Ohne Evals ist Model Routing nur A/B-Gluecksspiel.
News-sensitiv heisst nicht hektisch Neue Modelle erzeugen Druck: besser, schneller, günstiger, längerer Kontext. Trotzdem sollte der AI Stack nicht täglich blind wechseln.
Ein sinnvoller Rhythmus:
So bleibt der Stack aktuell, ohne produktive Prozesse in Unruhe zu bringen.
täglich: News und Release Notes beobachten. wöchentlich: Kandidaten für Evals markieren. zweiwöchentlich: relevante Benchmarks intern nachtesten. monatlich: Routing-Regeln und Kostenreport reviewen. sofort: Security-, Pricing- oder Deprecation-Warnungen bewerten.
Routing-Regeln als Policy Beispiele:
Model Routing ist damit Teil der Governance, nicht nur Infrastruktur.
Kundendaten nur an Anbieter mit passender DPA, Region und Retention. Legal/Finance keine experimentellen Modelle. Web Search nur bei Aktualitätsbedarf und mit Kostenbudget. Coding-Agent nur mit Sandbox, Tests und Review. Voice nur mit Latenz- und Handoff-Evals. Low-Risk-Klassifikation auf günstiges schnelles Modell. High-Risk-Entscheidung nie vollautomatisch, egal welches Modell.
Der SYSTEMS-Blick Wir bauen AI Stacks mit LLM Gateway , Evals und Fallbacks. So kann das System auf neue Modelle reagieren, ohne jeden Prozess neu zu bauen.
Das ist entscheidend in einem Markt, der sich täglich bewegt: ein Stack, der neue Modelle prüft, Kosten kontrolliert, Datenklassen respektiert und Wechsel ohne Prozessbruch erlaubt.