qwq-32b — giá, ngữ cảnh và hiệu năng
qwq-32b là mô hình của 阿里巴巴, ngữ cảnh 131.1K, hỗ trợ Reasoning, Tools, Open Weights. Đầu vào $0.29, đầu ra $0.86 mỗi 1 triệu token.
Tổng quan
| Nhà cung cấp | 阿里巴巴 |
|---|---|
| Ngữ cảnh | 131.1K |
| Khả năng | Reasoning, Tools, Open Weights |
| Định dạng API | openai, openai-response, openai-response-compact, anthropic, gemini, openai-alpha-search |
| Công thức tính phí | p * 0.287 + c * 0.861 |
Qwen reasoning model for deliberate problem solving, math, and codingGiá
| Gói | Hệ số | Đầu vào | Đầu ra | Ghi chú |
|---|---|---|---|---|
| Giá cơ bản | 1× | $0.29 | $0.86 | |
| Pro | 2× | $0.57 | $1.72 | Enterprise — full reasoning, high stability. |
| Max | 4× | $1.15 | $3.44 | Premium — max reasoning & stability. |
Chỉ liệt kê các nhóm được bật cho mô hình này.
Hiệu năng
| Điểm cuối API | https://api.airai.cc/v1 |
|---|---|
| Tương thích OpenAI | OpenAI-compatible |
Câu hỏi thường gặp
qwq-32b có giá bao nhiêu?
Đầu vào $0.29, đầu ra $0.86 mỗi 1 triệu token.
Cửa sổ ngữ cảnh của qwq-32b là bao nhiêu?
qwq-32b có cửa sổ ngữ cảnh 131.1K: giới hạn token tổng cộng của đầu vào và đầu ra trong một yêu cầu.
Gọi qwq-32b từ mã như thế nào?
Đặt base_url là https://api.airai.cc/v1 và model là qwq-32b. API tương thích hoàn toàn với OpenAI.
Tại sao qwq-32b trả về lỗi 429?
429 là phản hồi giới hạn tốc độ. Giảm đồng thời, thử lại có chờ, hoặc chuyển sang gói có hạn ngạch lớn hơn.
So sánh mô hình
| Model | Nhà cung cấp | Đầu vào | Đầu ra | Ngữ cảnh |
|---|---|---|---|---|
| qwq-32b | 阿里巴巴 | $0.29 | $0.86 | 131.1K |
| qwen3-vl-235b-a22b-thinking | 阿里巴巴 | $0.98 | $3.95 | không xác định |
| qwen3-30b-a3b-instruct-2507 | 阿里巴巴 | $0.10 | $0.30 | không xác định |
| qwen-image-max | 阿里巴巴 | Mỗi yêu cầu $0.08 | — | không xác định |
| qwen3-max-preview | 阿里巴巴 | Chưa công bố giá | — | không xác định |
| qwen3.5-plus-2026-02-15 | 阿里巴巴 | $0.40 | $2.40 | không xác định |
| qwen3.6-plus-2026-04-02 | 阿里巴巴 | $0.50 | $3.00 | không xác định |
| qwen-image-3.0-pro | 阿里巴巴 | Mỗi yêu cầu $0.001471 | — | không xác định |
| qwen-image-3.0 | 阿里巴巴 | Mỗi yêu cầu $0.001471 | — | không xác định |
| qwen3-tts-flash | 阿里巴巴 | Mỗi yêu cầu $0.80 | — | không xác định |
| Qwen/Qwen3-Reranker-0.6B | 阿里巴巴 | $0.01 | $0.01 | không xác định |
| qwen3-vl-8b-instruct | 阿里巴巴 | $0.18 | $0.70 | không xác định |
| qwen-plus-2025-12-01 | 阿里巴巴 | $0.40 | $1.20 | không xác định |
Xử lý lỗi
429 là phản hồi giới hạn tốc độ. Giảm đồng thời, thử lại có chờ, hoặc chuyển sang gói có hạn ngạch lớn hơn.
Nguyên nhân thường gặp
- Quá nhiều yêu cầu đồng thời
- Hết hạn ngạch của gói hiện tại
- Thử lại ngay không chờ
Cách khắc phục
- Giới hạn đồng thời và thử lại với thời gian chờ tăng dần
- Chuyển sang gói hạn ngạch lớn hơn
- Lưu cache các yêu cầu lặp lại
Cách kết nối
curl https://api.airai.cc/v1/chat/completions \
-H "Authorization: Bearer <YOUR_API_KEY>" \
-H "Content-Type: application/json" \
-d '{
"model": "qwq-32b",
"messages": [{"role": "user", "content": "Hello"}]
}'from openai import OpenAI
client = OpenAI(
api_key="<YOUR_API_KEY>",
base_url="https://api.airai.cc/v1"
)
response = client.chat.completions.create(
model="qwq-32b",
messages=[{"role": "user", "content": "Hello"}]
)
print(response.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
apiKey: "<YOUR_API_KEY>",
baseURL: "https://api.airai.cc/v1"
});
const response = await client.chat.completions.create({
model: "qwq-32b",
messages: [{ role: "user", content: "Hello" }]
});
console.log(response.choices[0].message.content);const OpenAI = require("openai");
const client = new OpenAI({
apiKey: "<YOUR_API_KEY>",
baseURL: "https://api.airai.cc/v1"
});
client.chat.completions.create({
model: "qwq-32b",
messages: [{ role: "user", content: "Hello" }]
}).then((r) => console.log(r.choices[0].message.content));Thay <YOUR_API_KEY> bằng API Key trong cài đặt token của bạn.
Endpoint tương thích
openaiopenai-responseopenai-response-compactanthropicgeminiopenai-alpha-search
Gemini SDK · TypeScript
import { GoogleGenerativeAI } from "@google/generative-ai";
const genAI = new GoogleGenerativeAI("<YOUR_API_KEY>");
const model = genAI.getGenerativeModel({ model: "qwq-32b" });
const result = await model.generateContent(
"Explain quantum entanglement in one paragraph."
);
console.log(result.response.text());Xác thực
Mọi yêu cầu phải mang header Authorization: Bearer <TOKEN>. Các endpoint định dạng Anthropic cũng chấp nhận header x-api-key. Tạo API Key tại trang Token, nơi bạn có thể giới hạn theo mô hình, nhóm, IP và tốc độ.
Tham số được hỗ trợ
| Tham số | Kiểu | Mặc định | Phạm vi | Mô tả |
|---|---|---|---|---|
temperature | float | 1 | 0–2 | Nhiệt độ lấy mẫu; thấp hơn thì ổn định hơn |
top_p | float | 1 | 0–1 | Xác suất tích lũy của nucleus sampling |
max_tokens | integer | — | — | Số token tối đa trong phản hồi |
frequency_penalty | float | 0 | −2–2 | Phạt việc lặp lại token tần suất cao |
presence_penalty | float | 0 | −2–2 | Khuyến khích đưa vào chủ đề mới |
stop | string[] | null | ≤ 4 | Tối đa 4 chuỗi dừng sinh |
seed | integer | null | — | Hạt giống để lấy mẫu có thể tái tạo hơn |
n | integer | 1 | — | Số ứng viên được tạo |
stream | boolean | false | — | Truyền token qua SSE |
response_format | object | — | — | Buộc đầu ra JSON hoặc kết quả khớp schema |
tools | array | — | — | Khai báo công cụ / hàm mà mô hình có thể gọi |
tool_choice | string | object | auto | — | Chiến lược chọn công cụ hoặc tên công cụ cụ thể |
logprobs | boolean | false | — | Trả về log-xác suất của từng token |
top_logprobs | integer | null | 0–20 | Số xác suất cao nhất trả về mỗi token |
logit_bias | map | — | — | Ánh xạ logit bias theo token |
user | string | — | — | Định danh người dùng cuối để kiểm toán rủi ro |
Giới hạn tốc độ
| Cấp | RPM | TPM | RPD |
|---|---|---|---|
| Eco | 990 | 398K | 20K |
| Test | 980 | 393K | 20K |
Dữ liệu cập nhật: 2026-10-10 12:10