Menu

Chúng tôi đã sử dụng GPT-4o để nâng tỷ lệ đáp ứng chính xác của dịch vụ khách hàng đa phương thức lên 92%, nhưng việc vượt qua 3 trở ngại này thực sự rất khó khăn.

Tháng trước, nhóm kỹ thuật gồm 3 người chuyên về thương mại điện tử xuyên biên giới tại Đông Nam Á của chúng tôi đã làm việc liên tục suốt 3 ngày đêm để chuyển hệ thống chăm sóc khách hàng thông minh từ mô hình văn bản lớn cũ sang GPT-4o. Ban đầu, chúng tôi chỉ nghĩ rằng việc thêm chức năng nhận diện hình ảnh sẽ làm thay đổi nhỏ trong hệ thống, nhưng hóa ra những thay đổi mang lại lớn hơn nhiều so với dự đoán, và chúng tôi cũng gặp phải không ít trục trặc không ngờ tới.

Để giải thích rõ cho những người chưa từng tiếp xúc trước đây: GPT-4o thực chất là gì?

Bản chất của nó là một mô hình tạo ra nội dung đa phương thức (multimodal generation model) của OpenAI, và sự khác biệt cốt lõi nhất so với các thế hệ trước là...Một vòng xử lý có thể xử lý cùng lúc ba loại đầu vào: văn bản, hình ảnh, và âm thanh, mà không cần phải chia nhỏ yêu cầu để gọi các mô hình khác nhau.Không cần bạn tự thực hiện bất kỳ xử lý định dạng đầu vào nào, các tham số giao diện giảm gần 60% so với việc gọi các hàm kết hợp.

Tại sao chúng ta lại phải thay đổi nó vào đúng thời điểm năm 2026?

Trước đây, hệ thống dịch vụ khách hàng của chúng tôi chỉ có thể xử lý tư vấn văn bản, người dùng chụp ảnh hàng hóa bị hư hỏng, gửi sai hàng, trước tiên phải chuyển thành mô tả văn bản sau đó cho mô hình, trong thời gian quảng bá lớn, chỉ liên kết này đã chặn gần 20% đơn công việc, tỷ lệ khiếu nại của người dùng đã tăng gấp đôi trực tiếp. Chúng tôi cũng đã thử nghiệm mô hình nhận dạng hình ảnh và mô hình văn bản ghép, tỷ lệ chính xác chỉ là 76%, và các yêu cầu sau bán hàng bị thiệt hại còn cao hơn chi phí mô hình.

Ba lợi ích trực quan nhất sau khi thực hiện việc này hoàn toàn vượt qua kỳ vọng ban đầu của chúng tôi.

Chart displaying global export goods data, highlighting key countries and trends.

  • Tỷ lệ xử lý tự động các đơn hàng sau bán hàng đã tăng từ 47% lên 92%; hai nhân viên hỗ trợ khách hàng làm việc bán thời gian trước đây chuyên chuyển đổi hình ảnh giờ được điều động sang xử lý các khiếu nại phức tạp hơn của khách hàng, giúp tiết kiệm chi phí nhân sự hàng tháng gần 1800 đô la Mỹ.
  • Người dùng không cần phải sử dụng giao diện ASR (Automatic Speech Recognition) riêng biệt để xử lý những cuộc gọi thoại bằng ngôn ngữ địa phương nữa; thông tin đó có thể được truyền trực tiếp đến mô hình và được nhận diện ngay lập tức, sau đó mô hình sẽ đưa ra phản hồi. Hầu hết các yêu cầu được xử lý trong vòng 15 mili giây, giúp tăng tốc độ phản hồi tổng thể lên gấp 3 lần.
  • Khi xử lý cùng một yêu cầu hậu mãi chứa hình ảnh và văn bản, mức tiêu thụ token giảm 32% so với việc gọi riêng biệt các mô hình nhận diện hình ảnh và xử lý văn bản. Như vậy, chi phí vận hành mô hình trong thời gian cao điểm của các chương trình khuyến mãi thậm chí còn thấp hơn so với trước đây.

Đừng chỉ nhìn vào những ưu điểm; những “cạm bẫy” ẩn này khiến chúng ta phải chịu những tổn thất thực sự khi sử dụng chúng.

Hố đầu tiên là ngưỡng giới hạn dòng chảy cho đầu vào đa phương thức nghiêm ngặt hơn nhiều so với các yêu cầu văn bản đơn giản. Ngày đầu tiên vừa trực tuyến vừa vặn gặp phải hoạt động ăn mừng cửa hàng của các trang web Đông Nam Á, 17% yêu cầu có hình ảnh trực tiếp báo 429, người dùng không nhìn thấy phản hồi cho rằng dịch vụ khách hàng chạy đường, ngày đó đã thêm hơn 300 bài đánh giá tiêu cực. Sau đó, chúng tôi chỉ có thể thêm một hàng đợi giảm cấp riêng cho yêu cầu có hình ảnh, trong thời gian cao điểm đầu tiên trả về lời nhắc "đã nhận được hình ảnh, đang xử lý", mới giải quyết được vấn đề.

Lỗi thứ hai là tỷ lệ nhận diện chính xác văn bản trên hình ảnh bằng các ngôn ngữ nhỏ không phải tiếng Anh thấp hơn nhiều so với những gì được quảng cáo. Chúng tôi đã gặp trường hợp người dùng gửi đơn hàng viết tay bằng tiếng Indonesia, và mô hình nhận diện sai 3 ký tự địa chỉ, khiến chúng tôi phải sắp xếp địa chỉ hoàn trả hàng sai cho người dùng, dẫn đến tổn thất gần 200 đô la tiền vận chuyển. Hiện tại, chúng tôi đã thêm một lớp giao diện OCR địa phương vào quá trình nhận diện hình ảnh bằng các ngôn ngữ nhỏ để kiểm tra, và chỉ sau đó tỷ lệ sai lầm mới được giảm xuống mức chấp nhận được.

Lỗi thứ ba là quy tắc đếm các token trong đầu ra đa phương thức hoàn toàn khác với đầu ra văn bản thuần túy; bạn không thể sử dụng công thức trước đó để ước lượng chi phí. Trong tuần đầu tiên hệ thống được triển khai, chúng tôi không thay đổi ngưỡng cảnh báo ngân sách, và chi phí trong một ngày cuối tuần đã vượt quá 40% ngân sách hàng tháng; mãi đến khi bộ phận tài chính nhắc nhở chúng tôi chúng tôi mới phát hiện ra điều này.

Liệu chúng ta có nên thay đổi ngay bây giờ không? Chúng tôi đã xây dựng những tiêu chí đánh giá rõ ràng để quyết định.

Trường hợp bạn có thể xử lý trực tiếp:

Smartphone displaying AI app with book on AI technology in background.

  • Nghiệp vụ của bạn bản thân đã yêu cầu xử lý đồng thời hai loại hoặc nhiều loại đầu vào như văn bản, hình ảnh, và âm thanh.
  • Trước đây, chúng tôi đã sử dụng nhiều mô hình để thực hiện xử lý đa phương thức (multi-modal processing) bằng cách kết hợp chúng lại với nhau, nhưng chi phí tích hợp cao và độ chính xác không đạt yêu cầu.
  • Người dùng của bạn chủ yếu sử dụng tiếng Anh, hoặc các ngôn ngữ phổ biến mà GPT-4o hỗ trợ tốt.

Những trường hợp bạn hoàn toàn không cần phải lãng phí tiền:

  • Doanh nghiệp của bạn chỉ có nhu cầu xử lý văn bản thuần túy, và mô hình thế hệ trước đã có thể đáp ứng được yêu cầu về độ chính xác.
  • Doanh nghiệp của bạn chủ yếu hướng tới các thị trường ngôn ngữ nhỏ, với nhiều yêu cầu về nhận dạng văn bản viết tay bằng ngôn ngữ địa phương và giọng nói tiếng địa phương.
  • Đội của bạn không có nguồn lực dư thừa để phát triển các chiến lược nâng cấp và công cụ giám sát chi phí.

2 lời khuyên thực hành dành cho nhóm người mới bắt đầu

Đầu tiên, trước khi triển khai hệ thống, hãy chạy thử dòng lưu lượng ảo trong 7 ngày; đừng chuyển 100% lượng yêu cầu ngay lập tức. Hãy gửi cả các yêu cầu từ người dùng thực tế đến cả hệ thống cũ của bạn và GPT-4o, so sánh độ chính xác và chi phí giữa hai bên, và chỉ chuyển dòng lưu lượng sau khi đảm bảo rằng mọi thứ đáp ứng kỳ vọng. Chúng tôi đã gặp rất nhiều rắc rối chỉ vì không thực hiện bước này.

Thứ hai, hãy thiết lập cảnh báo ngân sách riêng biệt cho các yêu cầu đa phương thức, với ngưỡng có thể được đặt ở mức 120% của chi phí dự kiến, để tránh tình trạng chi phí vượt quá ngân sách.

Câu hỏi thường gặp và trả lời

Câu hỏi: Liệu có nên đợi đến khi thế hệ mô hình tiếp theo được phát triển xong rồi mới thay đổi không?

Trả lời: Ít nhất trong bối cảnh tích hợp đa phương thức, mức độ trưởng thành của GPT-4o hiện tại đã đủ để giải quyết các vấn đề thực tế; thế hệ mô hình tiếp theo sẽ còn mất ít nhất hơn một năm nữa mới ra mắt. Không cần phải lãng phí những chi phí có thể tiết kiệm được ngay bây giờ vì những cập nhật chưa chắc chắn.

Câu hỏi: So với các mô hình đa modal mã nguồn mở, tỷ lệ giá cả so với chất lượng như thế nào?

Trả lời: Nếu nhóm của bạn có khả năng tự điều chỉnh và triển khai các mô hình mã nguồn mở, đồng thời có yêu cầu cao về bảo mật dữ liệu, thì việc sử dụng các mô hình mã nguồn mở sẽ tiết kiệm chi phí hơn. Ngược lại, chi phí sử dụng GPT-4o thường thấp hơn nhiều so với việc bạn tự xây dựng và vận hành hệ thống máy chủ.

Thông tin này có hữu ích không?

Hỗ trợ kỹ thuậtHỗ trợ trực tuyến
侧栏
Về đầu trang
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR