Fehler 429: was tun, wenn grok-4.5 fehlschlägt

Ein 429 bedeutet, dass eine Ratenbegrenzung gegriffen hat: Die Anzahl der Anfragen oder Tokens pro Zeitfenster hat das Kontingent Ihres Tarifs überschritten.

429 Too Many Requests ist eine Drosselungsantwort, kein Fehler. Die Anfrage selbst ist gültig, überschreitet aber die für Ihren Tarif erlaubte Anfragerate oder Parallelität. Wiederholen Sie mit Wartezeit im vom Antwortheader vorgegebenen Fenster; der Request-Body muss nicht geändert werden.

grok-4.5 wird von xAI bereitgestellt. Alles auf dieser Seite — Ursachen, Lösungen und gemessene Daten — basiert auf dem tatsächlichen Laufzeitverhalten dieses Modells auf der Gatewayschicht.

An diesem Gateway ist die häufigste Ursache: Zu viele parallele Anfragen. Empfohlene erste Maßnahme: Parallelität begrenzen und mit exponentiellem Backoff wiederholen.

Häufige Ursachen

  • Zu viele parallele Anfragen
  • Kontingent des aktuellen Tarifs erschöpft
  • Wiederholung ohne Pause

So beheben Sie es

  • Parallelität begrenzen und mit exponentiellem Backoff wiederholen
  • Zu einem Tarif mit größerem Kontingent wechseln
  • Wiederholte Anfragen zwischenspeichern

Wiederholung mit exponentiellem Backoff

Der folgende Code wiederholt den Aufruf, wenn grok-4.5 429 liefert: bis zu 5 Versuche, mit wachsender Wartezeit und zufälligem Jitter, damit parallele Anfragen nicht gleichzeitig wiederholen. Base-URL und API-Key werden aus Umgebungsvariablen gelesen — nicht hart codieren.

import os, time, random
import requests

BASE  = os.getenv("OPENAI_BASE_URL")   # e.g. https://<your-gateway>/v1
KEY   = os.getenv("OPENAI_API_KEY")
MODEL = 'grok-4.5'


def chat(messages, retries=5):
    """Retry with exponential backoff + jitter."""
    for i in range(retries):
        try:
            r = requests.post(
                BASE + "/chat/completions",
                headers={"Authorization": "Bearer " + KEY},
                json={"model": MODEL, "messages": messages, "stream": True},
                timeout=60,
            )
            if r.status_code == 429 or r.status_code >= 500:
                time.sleep(min(2 ** i + random.uniform(0, 1), 30))
                continue
            r.raise_for_status()
            return r.json()
        except requests.exceptions.Timeout:
            time.sleep(min(2 ** i + random.uniform(0, 1), 30))
    raise RuntimeError("gave up after " + str(retries) + " retries")


print(chat([{"role": "user", "content": "hello"}]))

Wichtige Daten zu diesem Modell

API-Endpunkthttps://api.airai.cc/v1
OpenAI-kompatibelOpenAI-compatible
AnbieterxAI
Kontext500K
FunktionenReasoning, Tools, Files, Vision
API-Formateopenai, openai-response, openai-response-compact, anthropic, gemini, openai-alpha-search
Abrechnungsformelp * 2 + cr * 0.3 + c * 6) : tier("200k_plus", p * 4 + cr * 0.6 + c * 12

Häufige Fragen

Wird mir etwas berechnet, wenn grok-4.5 429 liefert?

Keine Berechnung: Nur tatsächlich erzeugter Output zählt zum Verbrauch. Berechnet wird nur der bereits erzeugte Output, der fehlgeschlagene Teil nicht. Bei Abrechnung nach p * 2 + cr * 0.3 + c * 6) : tier("200k_plus", p * 4 + cr * 0.6 + c * 12 stammen die Kosten langer Ausgaben vor allem aus Output-Tokens. Bei der Abrechnung p * 2 + cr * 0.3 + c * 6) : tier("200k_plus", p * 4 + cr * 0.6 + c * 12 werden fehlgeschlagene Anfragen nicht angerechnet. Prüfen Sie zuerst Guthaben und Rate-Limits in der Konsole, dann den Code. Wenn Sie Kosten nach p * 2 + cr * 0.3 + c * 6) : tier("200k_plus", p * 4 + cr * 0.6 + c * 12 schätzen, rechnen Sie das Retry-Budget mit ein.

Erhöht ein gemeinsamer Key über mehrere Services die 429-Wahrscheinlichkeit?

Es geht vor allem um das Kontingent, nicht um einen Defekt des Modells. Sowohl ein höheres Tariflimit als auch eine niedrigere Aufruffrequenz helfen. Die Abrechnung folgt p * 2 + cr * 0.3 + c * 6) : tier("200k_plus", p * 4 + cr * 0.6 + c * 12, ohne Ausgabe also keine Kosten. Wenn Sie Kosten nach p * 2 + cr * 0.3 + c * 6) : tier("200k_plus", p * 4 + cr * 0.6 + c * 12 schätzen, rechnen Sie das Retry-Budget mit ein.

Wechselt das Gateway bei mehreren Upstream-Knoten bei 429 automatisch?

Dieser Fehler hängt nicht mit der Modellfähigkeit zusammen, er liegt auf Gateway-Ebene. Die Fähigkeits-Tags dieses Modells sind Reasoning, Tools, Files, Vision. Besteht der Fehler mehrere Minuten, kontaktieren Sie den Plattform-Support zum Upstream-Status. Klären Sie zuerst Account-Ebene oder Modell-Ebene; beides wird völlig unterschiedlich behandelt.

Wie sollte ich Batch-Jobs planen, wenn grok-4.5 429 liefert?

Parallelität und Timeouts sind hier die eigentlichen Variablen, nicht das Modell. Dieses Modell hat ein Kontextfenster von 500K und stammt von xAI. Ein 500K-Kontext bedeutet, dass lange Eingaben die First-Token-Latenz deutlich erhöhen. Bei langen Ausgaben erhöhen Sie den Timeout auf 60 Sekunden oder mehr.

Weitere Fehler bei diesem Modell

Andere Modelle mit demselben Fehler

Daten aktualisiert: 2026-10-11 19:15

Technischer SupportLive-Support
Nach oben