llama-2-70b — giá, ngữ cảnh và hiệu năng

llama-2-70b là mô hình của Meta, dùng được trên AirAI. Đầu vào $2.00, đầu ra $2.00 mỗi 1 triệu token.

Tổng quan

Nhà cung cấpMeta
Định dạng APIopenai, openai-response, openai-response-compact, anthropic, gemini, openai-alpha-search

Giá

GóiHệ sốĐầu vàoĐầu raGhi chú
Giá cơ bản1×$2.00$2.00
Pro2×$4.00$4.00Enterprise — full reasoning, high stability.
Max4×$8.00$8.00Premium — max reasoning & stability.

Chỉ liệt kê các nhóm được bật cho mô hình này.

Hiệu năng

Điểm cuối APIhttps://api.airai.cc/v1
Tương thích OpenAIOpenAI-compatible

Câu hỏi thường gặp

llama-2-70b có giá bao nhiêu?
Đầu vào $2.00, đầu ra $2.00 mỗi 1 triệu token.
Cửa sổ ngữ cảnh của llama-2-70b là bao nhiêu?
llama-2-70b có cửa sổ ngữ cảnh không xác định: giới hạn token tổng cộng của đầu vào và đầu ra trong một yêu cầu.
Gọi llama-2-70b từ mã như thế nào?
Đặt base_url là https://api.airai.cc/v1 và model là llama-2-70b. API tương thích hoàn toàn với OpenAI.
Tại sao llama-2-70b trả về lỗi 429?
429 là phản hồi giới hạn tốc độ. Giảm đồng thời, thử lại có chờ, hoặc chuyển sang gói có hạn ngạch lớn hơn.

So sánh mô hình

ModelNhà cung cấpĐầu vàoĐầu raNgữ cảnh
llama-2-70bMeta$2.00$2.00không xác định
llama-3.1-405bMeta$6.00$12.00không xác định
llama-3-8bMeta$2.00$2.00không xác định
llama-2-7bMeta$2.00$2.00không xác định
llama-3-70bMeta$4.00$8.00không xác định
llama-3.1-8bMeta$2.00$2.00không xác định
llama-3.2-1b-instructMeta$0.50$0.13không xác định
llama-3.1-70bMeta$4.00$8.00không xác định
llama-3.3-70b-instructMeta-—128K
llama-3.2-90b-vision-instructMeta$6.00$18.00không xác định
llama-3.2-11b-vision-instructMeta$2.00$2.00không xác định
llama-3.2-3b-instructMeta$0.03$0.05không xác định

Xử lý lỗi

429 là phản hồi giới hạn tốc độ. Giảm đồng thời, thử lại có chờ, hoặc chuyển sang gói có hạn ngạch lớn hơn.

Nguyên nhân thường gặp

  • Quá nhiều yêu cầu đồng thời
  • Hết hạn ngạch của gói hiện tại
  • Thử lại ngay không chờ

Cách khắc phục

  • Giới hạn đồng thời và thử lại với thời gian chờ tăng dần
  • Chuyển sang gói hạn ngạch lớn hơn
  • Lưu cache các yêu cầu lặp lại

Cách kết nối

curl https://api.airai.cc/v1/chat/completions \
  -H "Authorization: Bearer <YOUR_API_KEY>" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "llama-2-70b",
    "messages": [{"role": "user", "content": "Hello"}]
  }'
from openai import OpenAI

client = OpenAI(
    api_key="<YOUR_API_KEY>",
    base_url="https://api.airai.cc/v1"
)

response = client.chat.completions.create(
    model="llama-2-70b",
    messages=[{"role": "user", "content": "Hello"}]
)
print(response.choices[0].message.content)
import OpenAI from "openai";

const client = new OpenAI({
  apiKey: "<YOUR_API_KEY>",
  baseURL: "https://api.airai.cc/v1"
});

const response = await client.chat.completions.create({
  model: "llama-2-70b",
  messages: [{ role: "user", content: "Hello" }]
});
console.log(response.choices[0].message.content);
const OpenAI = require("openai");

const client = new OpenAI({
  apiKey: "<YOUR_API_KEY>",
  baseURL: "https://api.airai.cc/v1"
});

client.chat.completions.create({
  model: "llama-2-70b",
  messages: [{ role: "user", content: "Hello" }]
}).then((r) => console.log(r.choices[0].message.content));

Thay <YOUR_API_KEY> bằng API Key trong cài đặt token của bạn.

Endpoint tương thích

openaiopenai-responseopenai-response-compactanthropicgeminiopenai-alpha-search

Gemini SDK · TypeScript

import { GoogleGenerativeAI } from "@google/generative-ai";

const genAI = new GoogleGenerativeAI("<YOUR_API_KEY>");
const model = genAI.getGenerativeModel({ model: "llama-2-70b" });

const result = await model.generateContent(
  "Explain quantum entanglement in one paragraph."
);
console.log(result.response.text());

Xác thực

Mọi yêu cầu phải mang header Authorization: Bearer <TOKEN>. Các endpoint định dạng Anthropic cũng chấp nhận header x-api-key. Tạo API Key tại trang Token, nơi bạn có thể giới hạn theo mô hình, nhóm, IP và tốc độ.

Tham số được hỗ trợ

Tham sốKiểuMặc địnhPhạm viMô tả
temperaturefloat10–2Nhiệt độ lấy mẫu; thấp hơn thì ổn định hơn
top_pfloat10–1Xác suất tích lũy của nucleus sampling
max_tokensinteger——Số token tối đa trong phản hồi
frequency_penaltyfloat0−2–2Phạt việc lặp lại token tần suất cao
presence_penaltyfloat0−2–2Khuyến khích đưa vào chủ đề mới
stopstring[]null≤ 4Tối đa 4 chuỗi dừng sinh
seedintegernull—Hạt giống để lấy mẫu có thể tái tạo hơn
ninteger1—Số ứng viên được tạo
streambooleanfalse—Truyền token qua SSE
response_formatobject——Buộc đầu ra JSON hoặc kết quả khớp schema
toolsarray——Khai báo công cụ / hàm mà mô hình có thể gọi
tool_choicestring | objectauto—Chiến lược chọn công cụ hoặc tên công cụ cụ thể
logprobsbooleanfalse—Trả về log-xác suất của từng token
top_logprobsintegernull0–20Số xác suất cao nhất trả về mỗi token
logit_biasmap——Ánh xạ logit bias theo token
userstring——Định danh người dùng cuối để kiểm toán rủi ro

Giới hạn tốc độ

CấpRPMTPMRPD
Eco990398K20K
Test980393K20K

Dữ liệu cập nhật: 2026-10-10 08:15

Hỗ trợ kỹ thuậtHỗ trợ trực tuyến
Về đầu trang