Pro/BAAI/bge-reranker-v2-m3 — 价格、上下文与性能
概览
| API 格式 | openai, openai-response, openai-response-compact, anthropic, gemini, openai-alpha-search |
|---|
价格
| 套餐 | 倍率 | 输入 | 输出 | 说明 |
|---|---|---|---|---|
| 基准价 | 1× | $0.02 | $0.02 | |
| Max | 4× | $0.08 | $0.08 | Premium — max reasoning & stability. |
仅列出该模型已开放的套餐。
性能实测
| API 端点 | https://api.airai.cc/v1 |
|---|---|
| OpenAI 兼容 | OpenAI-compatible |
常见问题
Pro/BAAI/bge-reranker-v2-m3 的价格是多少?
输入 $0.02,输出 $0.02,均为每百万 tokens。
Pro/BAAI/bge-reranker-v2-m3 的上下文窗口有多大?
Pro/BAAI/bge-reranker-v2-m3 的上下文窗口为 未标注,即单次请求中输入与输出合计的 token 上限。
如何在代码中调用 Pro/BAAI/bge-reranker-v2-m3?
把 base_url 指向 https://api.airai.cc/v1,model 填 Pro/BAAI/bge-reranker-v2-m3 即可,接口与 OpenAI 完全兼容。
Pro/BAAI/bge-reranker-v2-m3 为什么会返回 429?
429 是限流响应。降低并发、加退避重试,或切换到配额更高的套餐即可。
错误排查
429 是限流响应。降低并发、加退避重试,或切换到配额更高的套餐即可。
常见原因
- 并发请求过多
- 当前套餐配额已用完
- 失败后立即重试没有退避
解决办法
- 限制并发并用指数退避重试
- 切换到配额更高的套餐
- 对重复请求做缓存
如何接入
curl https://api.airai.cc/v1/chat/completions \
-H "Authorization: Bearer <YOUR_API_KEY>" \
-H "Content-Type: application/json" \
-d '{
"model": "Pro/BAAI/bge-reranker-v2-m3",
"messages": [{"role": "user", "content": "Hello"}]
}'from openai import OpenAI
client = OpenAI(
api_key="<YOUR_API_KEY>",
base_url="https://api.airai.cc/v1"
)
response = client.chat.completions.create(
model="Pro/BAAI/bge-reranker-v2-m3",
messages=[{"role": "user", "content": "Hello"}]
)
print(response.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
apiKey: "<YOUR_API_KEY>",
baseURL: "https://api.airai.cc/v1"
});
const response = await client.chat.completions.create({
model: "Pro/BAAI/bge-reranker-v2-m3",
messages: [{ role: "user", content: "Hello" }]
});
console.log(response.choices[0].message.content);const OpenAI = require("openai");
const client = new OpenAI({
apiKey: "<YOUR_API_KEY>",
baseURL: "https://api.airai.cc/v1"
});
client.chat.completions.create({
model: "Pro/BAAI/bge-reranker-v2-m3",
messages: [{ role: "user", content: "Hello" }]
}).then((r) => console.log(r.choices[0].message.content));将 <YOUR_API_KEY> 替换为令牌设置中的 API Key。
兼容端点
openaiopenai-responseopenai-response-compactanthropicgeminiopenai-alpha-search
Gemini SDK · TypeScript
import { GoogleGenerativeAI } from "@google/generative-ai";
const genAI = new GoogleGenerativeAI("<YOUR_API_KEY>");
const model = genAI.getGenerativeModel({ model: "Pro/BAAI/bge-reranker-v2-m3" });
const result = await model.generateContent(
"Explain quantum entanglement in one paragraph."
);
console.log(result.response.text());身份验证
所有请求必须携带 Authorization: Bearer <TOKEN> 请求头;Anthropic 格式端点也接受 x-api-key 请求头。在「令牌」页面生成 API Key,可按模型、分组、IP、速率等维度精细化授权。
支持的参数
| 参数 | 类型 | 默认值 | 范围 | 说明 |
|---|---|---|---|---|
temperature | float | 1 | 0–2 | 采样温度;越低越稳定 |
top_p | float | 1 | 0–1 | 核采样累计概率 |
max_tokens | integer | — | — | 响应中最大 token 数 |
frequency_penalty | float | 0 | −2–2 | 惩罚高频 token 的重复出现 |
presence_penalty | float | 0 | −2–2 | 鼓励引入新话题 |
stop | string[] | null | ≤ 4 | 最多 4 个停止生成的字符串 |
seed | integer | null | — | 尽量保证可复现的采样种子 |
n | integer | 1 | — | 生成的候选条数 |
stream | boolean | false | — | 通过 SSE 流式返回 token |
response_format | object | — | — | 强制输出 JSON 对象或符合 Schema 的结果 |
tools | array | — | — | 模型可调用的工具 / 函数声明 |
tool_choice | string | object | auto | — | 工具选择策略或具体工具名 |
logprobs | boolean | false | — | 返回每个 token 的对数概率 |
top_logprobs | integer | null | 0–20 | 每个 token 返回的 top 概率数量 |
logit_bias | map | — | — | 按 token 的 logit 偏置映射 |
user | string | — | — | 用于风险审计的终端用户标识 |
速率限制
| 分组 | RPM | TPM | RPD |
|---|---|---|---|
| Eco | 990 | 398K | 20K |
| Test | 980 | 393K | 20K |
数据更新于: 2026-10-10 08:15