Tôi đã giảm chi phí cho API LLM xuống 70%: Ghi chú thực tế về AirAi liên quan đến định tuyến và lưu trữ đệm
0. Hình
Tôi đã thực hiện một số dự án phụ, trước đó hoặc cắn răng để mua đăng ký chính thức $20 / tháng hoặc phải chịu đựng việc từ chối thẻ tín dụng quốc tế. Cuối tháng, tôi nhận ra hai điều đáng buồn:
80% các yêu cầu là các công việc nhẹ như tóm tắt, phân loại, định dạng, chạy với các mô hình đắt nhất là lãng phí;
Đăng ký là chi phí cố định - khi gọi ít thì mất, khi gọi nhiều thì không đủ.
Vì vậy, tôi chuyển sang AirAi: lấy khóa API của mình, tính phí theo số lượng và hướng máy khách đến giao diện tương thích OpenAI của nó.
Và đây là một đoạn ngắn. Trên tay tôi vẫn chưa có thẻ tín dụng quốc tế như thế nào, chính thức trực tiếp mỗi lần đi đến bước thanh toán đó đều bị từ chối; có một thời gian mượn thẻ của gia đình, kết quả kích hoạt kiểm soát rủi ro, tài khoản trực tiếp bị đóng băng, khiếu nại gần hai tuần mới giải quyết. Sau đó, tôi quyết tâm chỉ tìm kênh "không phụ thuộc vào thẻ quốc tế". Cổng cuối cùng này chỉ nhận USDT - đối với những người không có thẻ quốc tế như tôi, ngược lại là mức thấp nhất: nạp tiền ngay khi sử dụng, không có phí hàng tháng ràng buộc, cũng không cần đi bộ KYC. Quan trọng hơn chính là giá cả: Tôi cảm nhận được, đơn giá chỉ giảm khoảng 1 phần trăm liên kết trực tiếp chính thức, đây mới là lý do nó thực sự khiến tôi ở lại.
1. Chuyển đổi một dòng: trỏ đến bất kỳ cổng tương thích nào
Hầu như tất cả các máy khách hỗ trợ các điểm cuối tùy chỉnh (Claude Code, Cursor, Open WebUI, LibreChat, Cline...) đều có thể chuyển đổi với một dòng biến môi trường mà không cần thay đổi mã. Chỉ cần trỏ hai biến sau đây vào cổng của riêng bạn:
export OPENAI_BASE_URL="https://api.airai.cc/v1" export ANTHROPIC_BASE_URL="https://api.airai.cc/v1"
Chọn cổng nào là một chuyện khác, bài viết này chỉ nói về phương pháp hạ cánh.
2. Mã chiến đấu thực tế: Đường tuyến + bộ nhớ cache
Chuyển đổi đơn giản là không đủ, thực sự tiết kiệm tiền là "để mô hình đúng làm đúng công việc + bộ nhớ đệm yêu cầu lặp lại". Dưới đây là bộ xương mà tôi sử dụng trong sản xuất (tương thích với OpenAI SDK), base_url và api_key đều được đọc từ các biến môi trường, không được viết vào mã:
import openai, hashlib, os
client = openai.OpenAI(
base_url=os.getenv("OPENAI_BASE_URL"),
api_key=os.getenv("OPENAI_API_KEY"),
)
# Routing: small model for light tasks, flagship only for complex reasoning
CHEAP = "gpt-5.6-luna" # classification / summarization / formatting
STRONG = "gpt-5.6-sol" # only called for complex reasoning
_cache: dict[str, str] = {} # swap for Redis in production
def ask(prompt: str) -> str:
model = STRONG if len(prompt) > 400 else CHEAP
key = hashlib.md5(prompt.encode()).hexdigest()
if key in _cache: # cache hit, 0 cost
return _cache[key]
resp = client.chat.completions.create(
model=model,
messages=[{"role": "user", "content": prompt}],
)
answer = resp.choices[0].message.content
_cache[key] = answer
return answerCHEAP / STRONG tùy theo ngân sách và hiệu quả của bạn. Tên mô hình dựa trên tài liệu của cổng mà bạn đang sử dụng. Các nhiệm vụ ngoại tuyến hãy nhớ đi giao diện Batch, thường có thể tiết kiệm thêm một nửa.
3. So sánh chi phí (được minh họa)
trước và sau khi cải tạodấu hiệu / dấu hiệuSố liệu (thực tế là số liệu của bạn):
dự án / dự án / dự án | Đăng ký chính thức / Kết nối trực tiếp | AirAi + bộ nhớ đệm định tuyến |
phương thức tính phí | Giá cố định / giá chính thức | tính phí theo số lượng |
mô hình nhẹ nhàng | Hạm đội (Lãng phí) | Mô hình nhỏ hơn (rẻ hơn) |
Lặp lại yêu cầu | Đánh giá lại toàn bộ giá | Bộ nhớ đệm hit 0 chi phí |
chi phí cảm giác | Đề cập đến 100% | Khoảng 10 - 30% (tùy thuộc vào số lượng cuộc gọi) |
4. Biên giới trung thực (nói sự thật)
Không phải ai cũng tiết kiệm hơn: Khi số lượng cuộc gọi hàng tháng rất thấp, đăng ký cố định có thể tiết kiệm nhiều hơn; tính phí theo số lượng chỉ có lợi thế khi số lượng cuộc gọi lớn. Hãy tính toán số lượng của mình trước.
Độ trễ và ổn địnhMột cổng nhiều lớp sẽ có nhiều độ trễ hơn một chút, đường dẫn quan trọng thêm thời gian vượt quá và giảm cấp.
Chìa khóa bảo mật:key Đặt các biến môi trường, không viết chết ở front-end hoặc kho mở.
5. kết luận nhỏ
Bản chất của chi phí tiết kiệm LLM là một câu: để cho các mô hình rẻ tiền làm hầu hết các công việc, đắt tiền chỉ xuất hiện khi cần thiết, sau đó cắt bỏ các token lãng phí; biến "đậu N nhà" thành "đổi một dòng base_url". Routing và bộ nhớ đệm là hai viên gạch miễn phí, hãy di chuyển trước và nói sau.
Liên kết bài viết:https://www.airai.cc/vi/ai-news/48/
Thông tin này có hữu ích không?