Abbiamo aumentato con successo l’accuratezza del servizio di assistenza clienti multimodale utilizzando GPT-4o al 92%, ma abbiamo incontrato tre problemi molto difficili da risolvere.
Lo scorso mese, il nostro team tecnico di 3 persone specializzato nel commercio elettronico transfrontaliero nel Sud-est asiatico ha lavorato per 3 giorni e 3 notti per passare il sistema di assistenza clienti intelligente dal vecchio modello di testo a GPT-4o. Pensavamo che si trattasse semplicemente di aggiungere una funzionalità di riconoscimento di immagini, ma i cambiamenti ottenuti sono stati molto più significativi del previsto, e abbiamo incontrato anche diversi problemi inaspettati.
Per spiegarlo chiaramente a chi non ne ha mai sentito parlare: cos’è esattamente il GPT-4o?
L'essenza è un modello di generazione multimodale di OpenAI, e la differenza più significativa rispetto alle versioni precedenti è...Un singolo round di elaborazione può gestire contemporaneamente tre tipi di input: testo, immagini e audio, senza la necessità di suddividere le richieste per chiamare modelli diversi.Non è necessario effettuare alcun pre-elaboramento del formato dell’input; i parametri dell’interfaccia sono addirittura del 60% in meno rispetto ai call combinati.
Perché dobbiamo cambiarlo proprio nel 2026?
Prima, il nostro sistema di assistenza clienti poteva gestire solo le richieste in formato testuale. Quando gli utenti inviavano foto di prodotti danneggiati o di merci spedite sbagliate, era necessario convertire manualmente le foto in descrizioni testuali prima di fornirle al modello di analisi. Durante le promozioni, questo processo bloccava quasi il 20% delle richieste, e il tasso di reclami da parte degli utenti è aumentato del doppio. Abbiamo anche provato una soluzione che combinava un modello di riconoscimento di immagini con un modello di analisi testuale, ma l’accuratezza era solo del 76%. Inoltre, gli errori nelle richieste di assistenza post-vendita hanno causato perdite economiche superiori al costo stesso dei modelli utilizzati.
I tre benefici più evidenti superano di gran lunga le nostre aspettative iniziali.

- L’efficienza dell’elaborazione automatica delle richieste di assistenza post-vendita è aumentata direttamente dal 47% al 92%; i due addetti al servizio clienti part-time che in precedenza erano incaricati di tradurre le immagini sono stati trasferiti a occuparsi di questioni più complesse relative alle lamentele dei clienti, permettendo di risparmiare quasi 1800 dollari al mese in termini di costi umani.
- Le consultazioni vocali in dialetto inviate dagli utenti non devono più passare attraverso un interfacce ASR (Automatic Speech Recognition) separata: vengono trasmesse direttamente al modello, che le riconosce e fornisce una risposta. La maggior parte delle richieste viene elaborata in meno di 15 millisecondi, il che significa che la velocità complessiva di risposta è aumentata di tre volte.
- Nel trattamento di una singola richiesta di assistenza post-vendita che includeva sia immagini che testo, il consumo di token è stato del 32% inferiore rispetto all’utilizzo separato dei modelli di riconoscimento delle immagini e di analisi del testo. Di conseguenza, il costo del modello durante i periodi di massima attività promozionale è risultato addirittura più basso rispetto al passato.
Non guardare solo i vantaggi: questi 3 problemi nascosti ci hanno causato perdite reali quando li abbiamo incontrati.
Il primo problema è che il limite di traffico per le richieste multimediali è molto più rigoroso rispetto a quello per le richieste di testo puro. Il primo giorno di lancio abbiamo incontrato proprio un evento promozionale di un sito asiatico del Sud-est: il 17% delle richieste che includevano immagini ha ricevuto un errore 429, e gli utenti, non vedendo alcuna risposta, hanno pensato che il servizio clienti non funzionasse correttamente, il che ha portato a oltre 300 recensioni negative in quel giorno. Alla fine abbiamo dovuto creare una coda di attesa separata per le richieste con immagini, restituendo un messaggio che indicava “L’immagine è stata ricevuta, la stiamo elaborando” durante i periodi di punta, per risolvere il problema.
Il secondo problema è che la precisione del riconoscimento dei testi presenti nelle immagini in lingue minoritarie non inglesi non è affatto alta come promesso. Abbiamo incontrato casi in cui modelli hanno riconosciuto erroneamente dei caratteri di indirizzo in testi scritti a mano in indonesiano; di conseguenza, abbiamo inviato agli utenti indirizzi di restituzione o cambio errati, causando perdite di quasi 200 dollari in spese di spedizione. Ora abbiamo aggiunto un ulteriore strato di interfaccia OCR locale per il riconoscimento delle immagini in lingue minoritarie al fine di verificare i risultati, riducendo così il tasso di errori a un livello accettabile.
Il terzo problema riguarda le regole di conteggio dei token per l’output multimodale, che sono completamente diverse da quelle per il testo puro; quindi non è possibile utilizzare le formule precedenti per stimare i costi. Nella prima settimana di lancio non abbiamo modificato i valori di soglia per gli avvisi di budget, e il costo di un solo fine settimana ha superato il 40% del budget mensile, solo quando la contabilità ci ha avvisato ce ne siamo accorti.
Dovremmo cambiare ora o no? Abbiamo elaborato criteri chiari per prendere questa decisione.
Le situazioni in cui puoi agire direttamente sono:

- La tua attività richiede di gestire contemporaneamente due o più tipi di input, tra cui testi, immagini e audio.
- Prima si utilizzavano già diversi modelli per l’elaborazione multimodale, ma il costo di integrazione era elevato e l’accuratezza non era sufficiente.
- I tuoi utenti utilizzano principalmente l’inglese, oppure le lingue principali sono quelle per cui GPT-4o offre un supporto piuttosto completo.
Situazioni in cui non c’è assolutamente bisogno di sprecare soldi:
- La tua attività richiede solo il trattamento di testi puri, e il modello precedente era già in grado di soddisfare i requisiti di accuratezza.
- Il tuo business si rivolge principalmente ai mercati di lingue minoritarie, con un'ampia gamma di requisiti per il riconoscimento di testi scritti a mano in lingue locali e di pronunce in dialetti.
- Il tuo team non dispone di risorse umane in eccesso per lo sviluppo delle strategie di degradazione e del monitoraggio dei costi.
2 consigli pratici per le squadre che stanno per iniziare
Prima di lanciare il servizio, è necessario eseguire un test con il 70% del traffico simulato (shadow traffic) per 7 giorni, senza passare immediatamente al 100% delle richieste. Inviate le richieste degli utenti reali sia al vostro sistema originale che a GPT-4o, e confrontate l’accuratezza e i costi di entrambi i sistemi. Solo dopo aver verificato che i risultati soddisfano le aspettative potete iniziare a trasferire gradualmente il traffico a GPT-4o. Noi abbiamo commesso un grosso errore proprio per non aver seguito questo passaggio.
In secondo luogo, è possibile impostare avvisi di budget per le richieste multimodali in modo separato, con soglie fissate al 120% delle spese stimate, al fine di evitare sovradimensionamenti dei costi.
Domande frequenti e risposte
Domanda: Dovremmo aspettare l’uscita del prossimo modello prima di effettuare il cambio?
Risposta: Almeno nel contesto dell'integrazione multimodale, il livello di maturità attuale di GPT-4o è sufficiente per risolvere problemi pratici; il prossimo modello sarà disponibile almeno tra un anno, quindi non c'è bisogno di sprecare risorse che potrebbero essere utilizzate ora per miglioramenti incerti.
Domanda: Qual è il rapporto qualità-prezzo rispetto ai modelli multimodali open source?
Se il tuo team ha la capacità di personalizzare e distribuire i modelli open source, e le esigenze di privacy dei dati sono elevate, allora i modelli open source rappresentano una scelta più conveniente. Altrimenti, l’uso diretto di GPT-4o è più economico rispetto al costo di installare e gestire i server da soli.
Link dell’articolo:https://www.airai.cc/it/ai-news/30/
È stato utile?