Reduje la facturación de la API LLM en un 70 %: Notas prácticas sobre AirAi, incluyendo enrutamiento y caché
0. Contexto: ¿Cómo se produjo el desastre financiero con las facturas?
Estoy trabajando en varios proyectos secundarios y, en las etapas iniciales, o tenía que pagar la suscripción oficial de $20 al mes, o enfrentaba rechazos de mis tarjetas de crédito internacionales. Al final del mes, al hacer el balance, descubrí dos cosas muy desagradables:
El 80% de las solicitudes eran tareas sencillas como resumen, clasificación y formato; usar el modelo más caro para estas tareas era simplemente un desperdicio;
La suscripción es un costo fijo: cuando se realizan pocas llamadas, resulta en pérdidas, y cuando se realizan muchas, no es suficiente.
Entonces me dirigí a AirAi: tomé mi propio clave API, opté por el pago por uso, y redirigí el cliente a su interfaz compatible con OpenAI.
Aquí también hay un pequeño incidente. Siempre he tenido problemas para usar tarjetas de crédito internacionales decentes; cada vez que llegaba el momento de pagar, el proceso era rechazado. Durante un tiempo, usé la tarjeta de un familiar, pero eso desencadenó una revisión de riesgos y mi cuenta fue bloqueada. Tuve que presentar una queja y esperar casi dos semanas para que se desbloqueara. Después de eso, decidí buscar alternativas que no dependieran de tarjetas internacionales. El gateway que finalmente elegí solo acepta USDT, lo que para alguien como yo, que no tiene tarjeta internacional, es la opción con menos requisitos: se puede cargar dinero y usarlo de inmediato, sin necesidad de pagar una tarifa mensual ni pasar por un proceso de verificación de identidad (KYC). Lo más importante es el precio: según mis cálculos, el costo unitario es aproximadamente la mitad del de los servicios oficiales. Esa fue la razón principal por la que decidí usarlo.
1. Cambio de línea: Dirige a cualquier gateway compatible.
Casi todos los clientes que soportan puntos de terminación personalizados (Claude Code, Cursor, Open WebUI, LibreChat, Cline, etc.) pueden cambiarse con una sola variable de entorno, sin necesidad de modificar el código. Simplemente dirija las siguientes dos variables hacia su propio gateway:
export OPENAI_BASE_URL="https://api.airai.cc/v1" export ANTHROPIC_BASE_URL="https://api.airai.cc/v1"
Elegir qué gateway utilizar es otro asunto; este artículo solo trata sobre los métodos de implementación.
2. Práctica de código: Rutas + Caché
No es suficiente solo con cambiar la luz; lo que realmente ahorra dinero es “hacer que el modelo correcto haga el trabajo correcto + cachear las solicitudes repetidas”. A continuación, te muestro el esqueleto que uso en la producción (compatible con el OpenAI SDK). Tanto base_url como api_key se obtienen de las variables de entorno, y no están escritos fijamente en el código:
import openai, hashlib, os
client = openai.OpenAI(
base_url=os.getenv("OPENAI_BASE_URL"),
api_key=os.getenv("OPENAI_API_KEY"),
)
# Routing: small model for light tasks, flagship only for complex reasoning
CHEAP = "gpt-5.6-luna" # classification / summarization / formatting
STRONG = "gpt-5.6-sol" # only called for complex reasoning
_cache: dict[str, str] = {} # swap for Redis in production
def ask(prompt: str) -> str:
model = STRONG if len(prompt) > 400 else CHEAP
key = hashlib.md5(prompt.encode()).hexdigest()
if key in _cache: # cache hit, 0 cost
return _cache[key]
resp = client.chat.completions.create(
model=model,
messages=[{"role": "user", "content": prompt}],
)
answer = resp.choices[0].message.content
_cache[key] = answer
return answerAjusta los parámetros CHEAP y STRONG de acuerdo con tu presupuesto y los resultados deseados. El nombre del modelo debe seguir las instrucciones del documento del gateway que estés utilizando. Recuerda utilizar la interfaz Batch para las tareas en línea, ya que generalmente puedes ahorrar la mitad de los costos.
3. Comparación de costos (esquemática)
Antes y después de la modificaciónEsquemaDatos (los números reales deben corresponder a tus facturas):
Proyecto | Suscripción oficial / Conexión directa | AirAi + Caché de enrutamiento |
Modo de facturación | Tarifa mensual fija / Precio oficial | Facturación por uso |
Modelo ligero | Modelo de lujo (más costoso) | Pequeños modelos (más económicos) |
Solicitudes repetidas | Recálculo del precio completo | Acceso a la caché: 0 costos |
Costo de experiencia del usuario | Referencia: 100% | Alrededor del 10–30% (dependiendo del volumen de solicitudes) |
4. Límites de honestidad (hablemos con sinceridad)
No todos ahorran más dinero: Cuando el volumen mensual de solicitudes es muy bajo, una suscripción fija puede ser más económica; el pago por uso puede ser más ventajoso cuando el volumen de solicitudes es alto. Calcule primero su propio volumen de uso.
Retraso y estabilidad: Agregar una capa adicional de gateway puede causar un ligero retraso, especialmente en las rutas clave, lo que puede llevar a tiempos de espera más largos y a una disminución en el rendimiento.
Seguridad de las claves: Guarde las claves en variables de entorno, no las escriba de forma fija en el frontend ni en repositorios públicos.
5. Resumen
La esencia del ahorro de costos con los modelos LLM se puede resumir en una frase: hacer que los modelos más económicos realicen la mayor parte del trabajo, utilizar los más caros solo cuando sea necesario, y eliminar los tokens que no son necesarios; además, cambiar de “conectar con N empresas” a “modificar una sola línea de código”.base_urlLas rutas y el caché son dos componentes gratuitos; empecemos por instalarlos primero.
Enlace del artículo:https://www.airai.cc/es/ai-news/48/
¿Te ha resultado útil?