Fehler 502: was tun, wenn gemini-3.1-pro-preview fehlschlägt

Ein 502 bedeutet, dass das Gateway eine ungültige Antwort vom vorgelagerten Modelldienst erhalten hat: Die Anfrage erreichte das Gateway, aber der Sprung zum vorgelagerten Dienst ist fehlgeschlagen.

502 Bad Gateway bedeutet, dass das Gateway eine ungültige Antwort vom Upstream-Modellservice erhalten hat. Die Anfrage erreichte das Gateway; der Fehler passierte auf dem Hop vom Gateway zum Upstream, meist durch einen Neustart oder eine getrennte Verbindung.

gemini-3.1-pro-preview wird von Google bereitgestellt. Alles auf dieser Seite — Ursachen, Lösungen und gemessene Daten — basiert auf dem tatsächlichen Laufzeitverhalten dieses Modells auf der Gatewayschicht.

An diesem Gateway ist die häufigste Ursache: Der vorgelagerte Modelldienst ist nicht verfügbar oder antwortet fehlerhaft. Empfohlene erste Maßnahme: Versuchen Sie es einmal erneut — 502 sind meist vorübergehend.

Häufige Ursachen

  • Der vorgelagerte Modelldienst ist nicht verfügbar oder antwortet fehlerhaft
  • Ein vorgelagerter Knoten startet neu
  • Die Verbindung vom Gateway zum vorgelagerten Dienst wurde unterbrochen
  • Das Modell wurde vorübergehend offline genommen

So beheben Sie es

  • Versuchen Sie es einmal erneut — 502 sind meist vorübergehend
  • Wechseln Sie zu einem gleichwertigen Modell eines anderen Anbieters
  • Tritt 502 nur bei einem Modell auf, ist dessen vorgelagerter Dienst gestört
  • Versuchen Sie es später erneut oder kontaktieren Sie uns

Wiederholung mit exponentiellem Backoff

Der folgende Code wiederholt den Aufruf, wenn gemini-3.1-pro-preview 502 liefert: bis zu 5 Versuche, mit wachsender Wartezeit und zufälligem Jitter, damit parallele Anfragen nicht gleichzeitig wiederholen. Base-URL und API-Key werden aus Umgebungsvariablen gelesen — nicht hart codieren.

import os, time, random
import requests

BASE  = os.getenv("OPENAI_BASE_URL")   # e.g. https://<your-gateway>/v1
KEY   = os.getenv("OPENAI_API_KEY")
MODEL = 'gemini-3.1-pro-preview'


def chat(messages, retries=5):
    """Retry with exponential backoff + jitter."""
    for i in range(retries):
        try:
            r = requests.post(
                BASE + "/chat/completions",
                headers={"Authorization": "Bearer " + KEY},
                json={"model": MODEL, "messages": messages, "stream": True},
                timeout=60,
            )
            if r.status_code == 429 or r.status_code >= 500:
                time.sleep(min(2 ** i + random.uniform(0, 1), 30))
                continue
            r.raise_for_status()
            return r.json()
        except requests.exceptions.Timeout:
            time.sleep(min(2 ** i + random.uniform(0, 1), 30))
    raise RuntimeError("gave up after " + str(retries) + " retries")


print(chat([{"role": "user", "content": "hello"}]))

Wichtige Daten zu diesem Modell

TPS3738.12
Durchschn. Latenz26006 ms
Erfolgsrate100%
API-Endpunkthttps://api.airai.cc/v1
OpenAI-kompatibelOpenAI-compatible
AnbieterGoogle
Kontext1M
FunktionenReasoning, Tools, Files, Vision, Audio
API-Formateopenai, openai-response, openai-response-compact, anthropic, gemini, openai-alpha-search
Abrechnungsformelp * 2 + cr * 0.2 + c * 12) : tier("200k_plus", p * 4 + cr * 0.4 + c * 18

Häufige Fragen

Welche Felder im Response-Body sind bei 502 von gemini-3.1-pro-preview entscheidend?

Behalten Sie die Request-ID und den rohen Antworttext, sonst lässt sich nichts zuordnen. Die Erfolgsrate 100% wird über Knoten gemittelt, ein schwacher Knoten drückt den Gesamtwert. Protokollieren Sie bei jedem Fehler die Request-ID — sie hilft mehr als der Statuscode. Reproduzieren Sie es zuerst in der Testumgebung mit demselben Request-Body.

Muss ich den Tarif upgraden, um 502 bei gemini-3.1-pro-preview zu beheben?

Es geht vor allem um das Kontingent, nicht um einen Defekt des Modells. Sowohl ein höheres Tariflimit als auch eine niedrigere Aufruffrequenz helfen. Die Abrechnung folgt p * 2 + cr * 0.2 + c * 12) : tier("200k_plus", p * 4 + cr * 0.4 + c * 18, ohne Ausgabe also keine Kosten. Der Eingabepreis liegt bei etwa $2.00 pro Million Tokens. Prüfen Sie zuerst Guthaben und Rate-Limits in der Konsole, dann den Code. Wenn Sie Kosten nach p * 2 + cr * 0.2 + c * 12) : tier("200k_plus", p * 4 + cr * 0.4 + c * 18 schätzen, rechnen Sie das Retry-Budget mit ein.

Führt ein Retry dazu, dass die Anfrage doppelt ausgeführt wird?

Business-Code muss meist nicht geändert werden, nur der Aufruftakt. Ein Retry ist der wirksamste erste Schritt. Bei der Abrechnung p * 2 + cr * 0.2 + c * 12) : tier("200k_plus", p * 4 + cr * 0.4 + c * 18 werden fehlgeschlagene Anfragen nicht angerechnet. Setzen Sie die Obergrenze auf 3–5 Versuche und ergänzen Sie Jitter. Wiederholbare Fehler mit exponentiellem Backoff, der Rest sofort als Fehler zurückgeben.

Lässt sich 502 bei gemini-3.1-pro-preview durch ein anderes Modell umgehen?

Halten Sie zusätzlich ein Ausweichmodell bereit. Ein Fallback in der Architektur ist verlässlicher als jede Fehlermeldung einzeln zu flicken. Dieses Modell von Google hat mehrere Upstream-Knoten, zwischen denen das Gateway wechseln kann. Halten Sie ein leichteres Ersatzmodell bereit, damit der Hauptfluss nicht abbricht. Legen Sie den Modellnamen in die Konfiguration, dann braucht ein Upstream-Wechsel keine Codeänderung.

Weitere Fehler bei diesem Modell

Andere Modelle mit demselben Fehler

Daten aktualisiert: 2026-10-10 15:45

Technischer SupportLive-Support
Nach oben