الخطأ timeout: ماذا تفعل عندما يفشل llama-3.3-70b-instruct

انتهاء المهلة يعني أن العميل استسلم قبل وصول الاستجابة. طلبات البث إلى نماذج اللغة هي الأكثر عرضة لذلك، لأن النموذج يفكر قبل الرمز الأول وتلك المرحلة لا تنتج أي بايت.

انتهاء المهلة ليس رمز حالة HTTP، بل حد انتظار من جانب العميل. عادةً ما يصل الطلب إلى البوابة ويُحوّل إلى المورّد، لكن النموذج لم يُنتج نتيجة خلال الوقت الذي حددته. السياق الطويل، والمخرجات الطويلة، والاستدعاء بدون بث مباشر هي الأسباب الثلاثة الأكثر شيوعاً.

llama-3.3-70b-instruct مقدمة من Meta. كل ما في هذه الصفحة — الأسباب والحلول والبيانات المقاسة — مستقى من السلوك التشغيلي الفعلي لهذا النموذج على مستوى البوابة.

في هذه البوابة، السبب الأكثر شيوعًا هو: مهلة العميل مضبوطة على قيمة صغيرة جداً. والإجراء الأول الموصى به هو: ارفع مهلة العميل إلى 300 ثانية أو أكثر.

الأسباب الشائعة

  • مهلة العميل مضبوطة على قيمة صغيرة جداً
  • طُول النص التوجيهي أو السياق يرفع زمن الرمز الأول
  • النموذج يعالج مهمة استدلال طويلة
  • تذبذب الشبكة

كيفية الإصلاح

  • ارفع مهلة العميل إلى 300 ثانية أو أكثر
  • فعّل البث حتى لا تنتظر الاستجابة كاملة
  • قصّر السياق أو استخدم نموذجاً أسرع
  • قلّل max_tokens

مثال على إعادة المحاولة مع تأخير أُسّي

الكود أدناه يعيد المحاولة عندما يُرجع llama-3.3-70b-instruct الخطأ timeout، حتى 5 محاولات، مع وقت انتظار متزايد وتشويش عشوائي حتى لا تُعيد الطلبات المتوازية المحاولة في اللحظة نفسها. اقرأ base URL ومفتاح API من متغيرات البيئة ولا تثبّتها داخل الكود.

import os, time, random
import requests

BASE  = os.getenv("OPENAI_BASE_URL")   # e.g. https://<your-gateway>/v1
KEY   = os.getenv("OPENAI_API_KEY")
MODEL = 'llama-3.3-70b-instruct'


def chat(messages, retries=5):
    """Retry with exponential backoff + jitter."""
    for i in range(retries):
        try:
            r = requests.post(
                BASE + "/chat/completions",
                headers={"Authorization": "Bearer " + KEY},
                json={"model": MODEL, "messages": messages, "stream": True},
                timeout=60,
            )
            if r.status_code == 429 or r.status_code >= 500:
                time.sleep(min(2 ** i + random.uniform(0, 1), 30))
                continue
            r.raise_for_status()
            return r.json()
        except requests.exceptions.Timeout:
            time.sleep(min(2 ** i + random.uniform(0, 1), 30))
    raise RuntimeError("gave up after " + str(retries) + " retries")


print(chat([{"role": "user", "content": "hello"}]))

بيانات أساسية لهذا النموذج

نقطة نهاية APIhttps://api.airai.cc/v1
متوافق مع OpenAIOpenAI-compatible
المزوّدMeta
السياق128K
القدراتTools, Files, Open Weights
صيغ APIopenai, openai-response, openai-response-compact, anthropic, gemini, openai-alpha-search
صيغة الفوترةp * 0 + c * 0

الأسئلة الشائعة

كيف أمنع timeout على llama-3.3-70b-instruct مسبقاً؟

احتفظ أيضاً بنموذج احتياطي جاهز. وجود بديل على مستوى بنية النظام أوثق من إصلاح كل خطأ على حدة. لهذا النموذج من Meta عدة عقد upstream يمكن للبوابة التبديل بينها. ضع اسم النموذج في الإعدادات، فلا يحتاج تغيير المصدر إلى تعديل الكود.

هل أحتاج لترقية الخطة لحل timeout على llama-3.3-70b-instruct؟

رفع سقف الخطة أو تقليل معدل الاستدعاء، كلاهما يخفف المشكلة. مع احتساب التكلفة بـ p * 0 + c * 0، لا تُحسب الطلبات الفاشلة ضمن الاستخدام. عند تقدير التكلفة من p * 0 + c * 0، أدخل ميزانية إعادة المحاولة أيضاً.

هل تُصف الطلبات المتزامنة أم تُقيَّد مباشرة؟

المتغيّران الحقيقيان هنا هما التزامن والمهلة، وليس النموذج نفسه. نافذة السياق لهذا النموذج 128K وهو من Meta. سياق 128K يعني أن المدخلات الطويلة تزيد زمن أول رمز بشكل ملحوظ. للمخرجات الطويلة، ارفع المهلة إلى 60 ثانية أو أكثر. ابدأ بتزامن منخفض، وراقب لدقائق، ثم زد تدريجياً.

ما الرموز التي تستحق إعادة المحاولة، وأيها لا فائدة منها؟

إعادة المحاولة هي الخطوة الأولى الأكثر فعالية. مع احتساب التكلفة بـ p * 0 + c * 0، لا تُحسب الطلبات الفاشلة ضمن الاستخدام. اجعل حد المحاولات من 3 إلى 5 وأضف تشويشاً عشوائياً.

أخطاء أخرى في هذا النموذج

نماذج أخرى تواجه الخطأ نفسه

تحديث البيانات: 2026-10-10 18:30

الدعم الفنيالدعم المباشر
العودة إلى الأعلى