Ошибка 503: что делать, если gemini-2.5-flash-lite не отвечает
Код 503 означает, что сервис временно недоступен — обычно из-за обслуживания или перегрузки. В отличие от 429, дело не в вашей квоте, а в ёмкости на стороне сервера.
503 Service Unavailable означает, что сервис сейчас не может обработать запрос — обычно из-за перегрузки или обслуживания. Разница с 429 важна: 429 — закончилась ваша квота, 503 — не хватает мощности сервера. Увеличьте интервал повтора, а не меняйте ключ.
gemini-2.5-flash-lite предоставляется компанией Google. Всё на этой странице — причины, решения и измеренные данные — собрано по реальной работе этой модели на уровне шлюза.
В этом шлюзе самая частая причина — Вышестоящая модель перегружена. Рекомендуемое первое действие: Повторите позже с большей задержкой.
Возможные причины
- Вышестоящая модель перегружена
- Сервис на обслуживании или обновляется
- Узел в вашем регионе недоступен
- Резкий всплеск трафика
Как исправить
- Повторите позже с большей задержкой
- Переключитесь на менее загруженную аналогичную модель
- Не запускайте пакетные задачи в часы пик
- Следите за нашими объявлениями
Повтор с экспоненциальной задержкой
Ниже — пример повтора, когда gemini-2.5-flash-lite возвращает 503: до 5 попыток, ожидание растёт и добавляется случайный джиттер, чтобы параллельные запросы не повторялись одновременно. Base URL и API key читаются из переменных окружения — не хардкодьте их.
import os, time, random
import requests
BASE = os.getenv("OPENAI_BASE_URL") # e.g. https://<your-gateway>/v1
KEY = os.getenv("OPENAI_API_KEY")
MODEL = 'gemini-2.5-flash-lite'
def chat(messages, retries=5):
"""Retry with exponential backoff + jitter."""
for i in range(retries):
try:
r = requests.post(
BASE + "/chat/completions",
headers={"Authorization": "Bearer " + KEY},
json={"model": MODEL, "messages": messages, "stream": True},
timeout=60,
)
if r.status_code == 429 or r.status_code >= 500:
time.sleep(min(2 ** i + random.uniform(0, 1), 30))
continue
r.raise_for_status()
return r.json()
except requests.exceptions.Timeout:
time.sleep(min(2 ** i + random.uniform(0, 1), 30))
raise RuntimeError("gave up after " + str(retries) + " retries")
print(chat([{"role": "user", "content": "hello"}]))Ключевые данные этой модели
| TPS | 443.14 |
|---|---|
| Средняя задержка | 1298 мс |
| Успешных запросов | 100% |
| API-эндпоинт | https://api.airai.cc/v1 |
| Совместимо с OpenAI | OpenAI-compatible |
| Производитель | |
|---|---|
| Контекст | 1M |
| Возможности | Reasoning, Tools, Files, Vision, Audio |
| Форматы API | openai, openai-response, openai-response-compact, anthropic, gemini, openai-alpha-search |
| Формула биллинга | p * 0.1 + cr * 0.01 + ai * 0.3 + c * 0.4 |
Частые вопросы
Приведёт ли повтор к тому, что запрос выполнится дважды?
Обычно не нужно менять код, достаточно скорректировать темп вызовов. Измеренная доля успеха — 100%, поэтому первый повтор обычно даёт наибольшую отдачу. При тарифе p * 0.1 + cr * 0.01 + ai * 0.3 + c * 0.4 неудачные запросы не идут в использование. Установите лимит повторов 3–5 и добавьте jitter. Для повторяемых ошибок используйте экспоненциальную задержку, для остальных возвращайте ошибку сразу.
Нужно ли повышать тариф, чтобы устранить 503 на gemini-2.5-flash-lite?
Помогает и повышение лимита тарифа, и снижение темпа вызовов. Тарификация: p * 0.1 + cr * 0.01 + ai * 0.3 + c * 0.4, поэтому без вывода нет списания. Цена ввода — около $0.10 за миллион токенов. Сначала проверьте баланс и лимиты скорости в консоли, потом ищите в коде. Оценивая стоимость по p * 0.1 + cr * 0.01 + ai * 0.3 + c * 0.4, учитывайте и бюджет на повторы.
Помогает ли переход на потоковый вывод уменьшить 503?
Нужно менять параметры запроса, один повтор не поможет. Это проблема конфигурации клиента, на сервере менять ничего не нужно. Теги возможностей — Reasoning, Tools, Files, Vision, Audio, от них зависят пределы параметров. Окно контекста 1M задаёт максимальный ввод за запрос; всё, что больше, отклоняется сразу. Обрезайте или сжимайте длинный ввод — это заметно снижает вероятность 503.
Связан ли 503 с тарификацией gemini-2.5-flash-lite?
Списания не будет: в استخدام идёт только реально сгенерированный вывод. Оплачивается только уже сгенерированный вывод, неудачная часть — нет. Тарификация: p * 0.1 + cr * 0.01 + ai * 0.3 + c * 0.4, поэтому без вывода нет списания. Сначала проверьте баланс и лимиты скорости в консоли, потом ищите в коде. Оценивая стоимость по p * 0.1 + cr * 0.01 + ai * 0.3 + c * 0.4, учитывайте и бюджет на повторы.
Другие ошибки этой модели
- gemini-2.5-flash-lite: ошибка 429 — причины и решение
- gemini-2.5-flash-lite: ошибка timeout — причины и решение
- gemini-2.5-flash-lite: ошибка 500 — причины и решение
- gemini-2.5-flash-lite: ошибка 502 — причины и решение
- gemini-2.5-flash-lite: ошибка 504 — причины и решение
- gemini-2.5-flash-lite: ошибка 401 — причины и решение
- gemini-2.5-flash-lite: ошибка 403 — причины и решение
- gemini-2.5-flash-lite: ошибка 400 — причины и решение
Другие модели с той же ошибкой
- gpt-5
- claude-opus-5
- gemini-2.5-pro
- deepseek-v4-pro
- grok-4.3
- llama-3.3-70b-instruct
- qvq-max
- qwq-32b
- glm-5
- MiniMax-M3
- kimi-k3
- hy3
- doubao-seed-evolving
- mimo-v2.5
- gpt-4o
- claude-opus-4-6
Данные обновлены: 2026-10-10 18:35