gemini-3-flash-preview — giá, ngữ cảnh và hiệu năng

gemini-3-flash-preview là mô hình của Google, ngữ cảnh 1M, hỗ trợ Reasoning, Tools, Files, Vision, Audio. Đầu vào $0.50, đầu ra $3.00 mỗi 1 triệu token.

Tổng quan

Nhà cung cấpGoogle
Ngữ cảnh1M
Khả năngReasoning, Tools, Files, Vision, Audio
Định dạng APIopenai, openai-response, openai-response-compact, anthropic, gemini, openai-alpha-search
Công thức tính phíp * 0.5 + cr * 0.05 + ai * 1 + c * 3
New Gemini flash lane bringing frontier-style multimodal reasoning to cheaper runs

Giá

GóiHệ sốĐầu vàoĐầu raCache (đầu vào)Ghi chú
Giá cơ bản1×$0.50$3.00$0.05
Eco0.3×$0.15$0.90$0.02Standard — standard reasoning, moderate stability.
default0.6×$0.30$1.80$0.03Standard — standard reasoning, moderate stability.
Plus1×$0.50$3.00$0.05High — strong reasoning, stable.
Pro2×$1.00$6.00$0.10Enterprise — full reasoning, high stability.
Max4×$2.00$12.00$0.20Premium — max reasoning & stability.

Chỉ liệt kê các nhóm được bật cho mô hình này.

Hiệu năng

Điểm cuối APIhttps://api.airai.cc/v1
Tương thích OpenAIOpenAI-compatible

Câu hỏi thường gặp

gemini-3-flash-preview có giá bao nhiêu?
Đầu vào $0.50, đầu ra $3.00 mỗi 1 triệu token.
Cửa sổ ngữ cảnh của gemini-3-flash-preview là bao nhiêu?
gemini-3-flash-preview có cửa sổ ngữ cảnh 1M: giới hạn token tổng cộng của đầu vào và đầu ra trong một yêu cầu.
Gọi gemini-3-flash-preview từ mã như thế nào?
Đặt base_url là https://api.airai.cc/v1 và model là gemini-3-flash-preview. API tương thích hoàn toàn với OpenAI.
Tại sao gemini-3-flash-preview trả về lỗi 429?
429 là phản hồi giới hạn tốc độ. Giảm đồng thời, thử lại có chờ, hoặc chuyển sang gói có hạn ngạch lớn hơn.

So sánh mô hình

ModelNhà cung cấpĐầu vàoĐầu raNgữ cảnh
gemini-3-flash-previewGoogle$0.50$3.001M
gemini-2.5-flash-imageGoogle$0.30$30.0032.8K
gemini-3.5-flashGoogle$1.50$9.001M
gemini-2.5-flash-preview-ttsGoogle$0.50$10.008.2K
gemini-embedding-001Google$0.15—2K
gemini-flash-lite-latestGoogle$0.30$2.501M
gemini-3.1-flash-liteGoogle$0.25$1.501M
gemini-3-pro-previewGoogle$0.57$3.43không xác định
gemini-embedding-2-previewGoogle$0.20$0.80không xác định
gemini-3.1-pro-preview-customtoolsGoogle$2.00$12.001M
gemini-3.1-flash-tts-previewGoogle$1.00$20.008.2K
gemini-pro-latestGoogle$2.00$12.00không xác định
gemini-3-pro-image-previewGoogle$2.00$120.00131.1K

Xử lý lỗi

429 là phản hồi giới hạn tốc độ. Giảm đồng thời, thử lại có chờ, hoặc chuyển sang gói có hạn ngạch lớn hơn.

Nguyên nhân thường gặp

  • Quá nhiều yêu cầu đồng thời
  • Hết hạn ngạch của gói hiện tại
  • Thử lại ngay không chờ

Cách khắc phục

  • Giới hạn đồng thời và thử lại với thời gian chờ tăng dần
  • Chuyển sang gói hạn ngạch lớn hơn
  • Lưu cache các yêu cầu lặp lại

Cách kết nối

curl https://api.airai.cc/v1/chat/completions \
  -H "Authorization: Bearer <YOUR_API_KEY>" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3-flash-preview",
    "messages": [{"role": "user", "content": "Hello"}]
  }'
from openai import OpenAI

client = OpenAI(
    api_key="<YOUR_API_KEY>",
    base_url="https://api.airai.cc/v1"
)

response = client.chat.completions.create(
    model="gemini-3-flash-preview",
    messages=[{"role": "user", "content": "Hello"}]
)
print(response.choices[0].message.content)
import OpenAI from "openai";

const client = new OpenAI({
  apiKey: "<YOUR_API_KEY>",
  baseURL: "https://api.airai.cc/v1"
});

const response = await client.chat.completions.create({
  model: "gemini-3-flash-preview",
  messages: [{ role: "user", content: "Hello" }]
});
console.log(response.choices[0].message.content);
const OpenAI = require("openai");

const client = new OpenAI({
  apiKey: "<YOUR_API_KEY>",
  baseURL: "https://api.airai.cc/v1"
});

client.chat.completions.create({
  model: "gemini-3-flash-preview",
  messages: [{ role: "user", content: "Hello" }]
}).then((r) => console.log(r.choices[0].message.content));

Thay <YOUR_API_KEY> bằng API Key trong cài đặt token của bạn.

Endpoint tương thích

openaiopenai-responseopenai-response-compactanthropicgeminiopenai-alpha-search

Gemini SDK · TypeScript

import { GoogleGenerativeAI } from "@google/generative-ai";

const genAI = new GoogleGenerativeAI("<YOUR_API_KEY>");
const model = genAI.getGenerativeModel({ model: "gemini-3-flash-preview" });

const result = await model.generateContent(
  "Explain quantum entanglement in one paragraph."
);
console.log(result.response.text());

Xác thực

Mọi yêu cầu phải mang header Authorization: Bearer <TOKEN>. Các endpoint định dạng Anthropic cũng chấp nhận header x-api-key. Tạo API Key tại trang Token, nơi bạn có thể giới hạn theo mô hình, nhóm, IP và tốc độ.

Tham số được hỗ trợ

Tham sốKiểuMặc địnhPhạm viMô tả
temperaturefloat10–2Nhiệt độ lấy mẫu; thấp hơn thì ổn định hơn
top_pfloat10–1Xác suất tích lũy của nucleus sampling
max_tokensinteger——Số token tối đa trong phản hồi
frequency_penaltyfloat0−2–2Phạt việc lặp lại token tần suất cao
presence_penaltyfloat0−2–2Khuyến khích đưa vào chủ đề mới
stopstring[]null≤ 4Tối đa 4 chuỗi dừng sinh
seedintegernull—Hạt giống để lấy mẫu có thể tái tạo hơn
ninteger1—Số ứng viên được tạo
streambooleanfalse—Truyền token qua SSE
response_formatobject——Buộc đầu ra JSON hoặc kết quả khớp schema
toolsarray——Khai báo công cụ / hàm mà mô hình có thể gọi
tool_choicestring | objectauto—Chiến lược chọn công cụ hoặc tên công cụ cụ thể
logprobsbooleanfalse—Trả về log-xác suất của từng token
top_logprobsintegernull0–20Số xác suất cao nhất trả về mỗi token
logit_biasmap——Ánh xạ logit bias theo token
userstring——Định danh người dùng cuối để kiểm toán rủi ro

Giới hạn tốc độ

CấpRPMTPMRPD
Eco990398K20K
Test980393K20K

Dữ liệu cập nhật: 2026-10-10 18:30

Hỗ trợ kỹ thuậtHỗ trợ trực tuyến
Về đầu trang