Fehler 401: was tun, wenn glm-4.6 fehlschlägt

Ein 401 bedeutet, dass die Authentifizierung fehlgeschlagen ist: Die Anfrage enthält keinen API-Key, oder der Key ist ungültig, gelöscht oder abgelaufen.

401 Unauthorized bedeutet, dass die Anfrage keine gültigen Zugangsdaten enthält. Das Gateway konnte den Aufrufer nicht identifizieren, daher erreicht die Anfrage das Upstream-Modell nie. Die Prüfung von Authorization-Header und Key-Status ist der einzige Weg.

glm-4.6 wird von Z.AI bereitgestellt. Alles auf dieser Seite — Ursachen, Lösungen und gemessene Daten — basiert auf dem tatsächlichen Laufzeitverhalten dieses Modells auf der Gatewayschicht.

An diesem Gateway ist die häufigste Ursache: Der Authorization-Header fehlt. Empfohlene erste Maßnahme: Senden Sie den Header als Authorization: Bearer gefolgt von Ihrem Key.

Häufige Ursachen

  • Der Authorization-Header fehlt
  • Der Key ist falsch geschrieben oder enthält Leerzeichen
  • Der Key wurde auf der Tokens-Seite gelöscht oder deaktiviert
  • Versehentlich wurde ein Key einer anderen Plattform verwendet

So beheben Sie es

  • Senden Sie den Header als Authorization: Bearer gefolgt von Ihrem Key
  • Erzeugen Sie auf der Tokens-Seite einen neuen Key
  • Prüfen Sie, dass Sie keinen Key eines anderen Dienstes verwenden
  • Verifizieren Sie den Key mit einer minimalen curl-Anfrage

Wiederholung mit exponentiellem Backoff

Der folgende Code wiederholt den Aufruf, wenn glm-4.6 401 liefert: bis zu 5 Versuche, mit wachsender Wartezeit und zufälligem Jitter, damit parallele Anfragen nicht gleichzeitig wiederholen. Base-URL und API-Key werden aus Umgebungsvariablen gelesen — nicht hart codieren.

import os, time, random
import requests

BASE  = os.getenv("OPENAI_BASE_URL")   # e.g. https://<your-gateway>/v1
KEY   = os.getenv("OPENAI_API_KEY")
MODEL = 'glm-4.6'


def chat(messages, retries=5):
    """Retry with exponential backoff + jitter."""
    for i in range(retries):
        try:
            r = requests.post(
                BASE + "/chat/completions",
                headers={"Authorization": "Bearer " + KEY},
                json={"model": MODEL, "messages": messages, "stream": True},
                timeout=60,
            )
            if r.status_code == 429 or r.status_code >= 500:
                time.sleep(min(2 ** i + random.uniform(0, 1), 30))
                continue
            r.raise_for_status()
            return r.json()
        except requests.exceptions.Timeout:
            time.sleep(min(2 ** i + random.uniform(0, 1), 30))
    raise RuntimeError("gave up after " + str(retries) + " retries")


print(chat([{"role": "user", "content": "hello"}]))

Wichtige Daten zu diesem Modell

API-Endpunkthttps://api.airai.cc/v1
OpenAI-kompatibelOpenAI-compatible
AnbieterZ.AI
Kontext204.8K
FunktionenReasoning, Tools, Open Weights
API-Formateopenai, openai-response, openai-response-compact, anthropic, gemini, openai-alpha-search
Abrechnungsformelp * 0.6 + cr * 0.11 + cc * 0 + c * 2.2

Häufige Fragen

Sollten Retries zufälligen Jitter enthalten?

Business-Code muss meist nicht geändert werden, nur der Aufruftakt. Bei der Abrechnung p * 0.6 + cr * 0.11 + cc * 0 + c * 2.2 werden fehlgeschlagene Anfragen nicht angerechnet. Wiederholbare Fehler mit exponentiellem Backoff, der Rest sofort als Fehler zurückgeben.

Hängt 401 bei glm-4.6 von Region oder Knoten ab?

Behalten Sie die Request-ID und den rohen Antworttext, sonst lässt sich nichts zuordnen. Das Modell wird von Z.AI bereitgestellt, der Upstream-Status richtet sich nach den Ankündigungen des Anbieters. Protokollieren Sie bei jedem Fehler die Request-ID — sie hilft mehr als der Statuscode. Reproduzieren Sie es zuerst in der Testumgebung mit demselben Request-Body.

Wie sollte ich Batch-Jobs planen, wenn glm-4.6 401 liefert?

Parallelität und Timeouts sind hier die eigentlichen Variablen, nicht das Modell. Dieses Modell hat ein Kontextfenster von 204.8K und stammt von Z.AI. Ein 204.8K-Kontext bedeutet, dass lange Eingaben die First-Token-Latenz deutlich erhöhen. Bei langen Ausgaben erhöhen Sie den Timeout auf 60 Sekunden oder mehr. Fügen Sie eine Cache-Schicht ein, damit wiederholte Anfragen nicht alle das Modell treffen.

Hängt 401 mit der Abrechnung von glm-4.6 zusammen?

Keine Berechnung: Nur tatsächlich erzeugter Output zählt zum Verbrauch. Berechnet wird nur der bereits erzeugte Output, der fehlgeschlagene Teil nicht. Die Abrechnung folgt p * 0.6 + cr * 0.11 + cc * 0 + c * 2.2, ohne Ausgabe also keine Kosten. Der Eingabepreis liegt bei etwa $0.60 pro Million Tokens. Prüfen Sie zuerst Guthaben und Rate-Limits in der Konsole, dann den Code. Wenn Sie Kosten nach p * 0.6 + cr * 0.11 + cc * 0 + c * 2.2 schätzen, rechnen Sie das Retry-Budget mit ein.

Weitere Fehler bei diesem Modell

Andere Modelle mit demselben Fehler

Daten aktualisiert: 2026-10-10 12:10

Technischer SupportLive-Support
Nach oben