Errore 429: cosa fare quando gpt-5 fallisce

Un 429 significa che è scattato un limite di frequenza: il numero di richieste o token in una finestra temporale ha superato la quota del tuo piano.

429 Too Many Requests è una risposta di rate limiting, non un errore. La richiesta è valida, ma supera la frequenza o la concorrenza consentite dal tuo piano. Basta ritentare rispettando la finestra indicata negli header; il body non va modificato.

gpt-5 è fornito da OpenAI. Tutto in questa pagina — cause, soluzioni e dati misurati — è ricavato dal comportamento reale di questo modello al livello del gateway.

Su questo gateway, la causa più comune è: Troppe richieste simultanee. La prima azione consigliata è: Limitare la concorrenza e ritentare con backoff esponenziale.

Cause comuni

  • Troppe richieste simultanee
  • Quota del piano attuale esaurita
  • Nuovo tentativo senza attesa

Come risolvere

  • Limitare la concorrenza e ritentare con backoff esponenziale
  • Passare a un piano con quota maggiore
  • Mettere in cache le richieste ripetute

Retry con backoff esponenziale

Il codice qui sotto ritenta quando gpt-5 restituisce 429: fino a 5 tentativi, con attesa crescente e jitter casuale per evitare che le chiamate concorrenti ritentino insieme. Leggi base URL e API key dalle variabili d’ambiente, non inserirle hardcoded.

import os, time, random
import requests

BASE  = os.getenv("OPENAI_BASE_URL")   # e.g. https://<your-gateway>/v1
KEY   = os.getenv("OPENAI_API_KEY")
MODEL = 'gpt-5'


def chat(messages, retries=5):
    """Retry with exponential backoff + jitter."""
    for i in range(retries):
        try:
            r = requests.post(
                BASE + "/chat/completions",
                headers={"Authorization": "Bearer " + KEY},
                json={"model": MODEL, "messages": messages, "stream": True},
                timeout=60,
            )
            if r.status_code == 429 or r.status_code >= 500:
                time.sleep(min(2 ** i + random.uniform(0, 1), 30))
                continue
            r.raise_for_status()
            return r.json()
        except requests.exceptions.Timeout:
            time.sleep(min(2 ** i + random.uniform(0, 1), 30))
    raise RuntimeError("gave up after " + str(retries) + " retries")


print(chat([{"role": "user", "content": "hello"}]))

Dati chiave di questo modello

Endpoint APIhttps://api.airai.cc/v1
Compatibile con OpenAIOpenAI-compatible
FornitoreOpenAI
Contesto400K
FunzionalitàReasoning, Tools, Files, Vision
Formati APIopenai, openai-response, openai-response-compact, anthropic, gemini, openai-alpha-search
Formula di fatturazionep * 1.25 + cr * 0.125 + c * 10

Domande frequenti

Le richieste fallite rientrano nella quota di rate limit?

Viene fatturato solo l’output già prodotto, non la parte fallita. La fatturazione segue p * 1.25 + cr * 0.125 + c * 10: senza output nessun addebito. Con la fatturazione p * 1.25 + cr * 0.125 + c * 10, le richieste fallite non rientrano nel consumo. Stimando il costo da p * 1.25 + cr * 0.125 + c * 10, includi anche il budget per i ritenti.

Cosa registrare quando 429 si presenta spesso?

Raggruppa gli errori per orario e per nodo; lo schema di solito è evidente. Questo modello è servito da OpenAI, quindi lo stato upstream segue gli annunci del fornitore. Registra l’id della richiesta a ogni fallimento: serve più del codice di stato. Riproduci il caso prima in ambiente di test con lo stesso corpo della richiesta.

429 può causare perdita di dati?

Questo errore non dipende dalle capacità del modello, è a livello di gateway. I tag di capacità di questo modello sono Reasoning, Tools, Files, Vision. Se l’errore continua per diversi minuti, contatta il supporto della piattaforma per confermare lo stato upstream. Stabilisci prima se è a livello di account o di modello: i due casi si gestiscono in modo completamente diverso.

429 su gpt-5 è legato alla quota del mio account?

È soprattutto una questione di quota, non un guasto del modello. Il prezzo di input è circa $1.25 per milione di token. Con fatturazione p * 1.25 + cr * 0.125 + c * 10, il costo degli output lunghi deriva soprattutto dai token di output. Controlla prima saldo e limiti di velocità nella console, poi il codice. Stimando il costo da p * 1.25 + cr * 0.125 + c * 10, includi anche il budget per i ritenti.

Altri errori su questo modello

Altri modelli con lo stesso errore

Dati aggiornati: 2026-10-10 15:40

Supporto tecnicoAssistenza online
Torna in alto