Utilizzando l’API di OpenAI per la verifica degli indirizzi logistici in Europa: abbiamo risparmiato il 32% sui costi manuali e abbiamo anche evitato due errori fatali.
La scorsa settimana si è conclusa la grande promozione “Black Week”, e durante la riunione di analisi del nostro team tecnico abbiamo scoperto che il tasso di successo dell’autovvalidazione degli indirizzi è aumentato del 41% rispetto all’anno scorso. Inoltre, rispetto al passato, quando eravamo costretti ad assumere tre collaboratori part-time per gestire gli indirizzi anomali, quest’anno ne basta uno solo.
Ma nessuno vuole parlare del problema con l’errore 429 che è emerso lo scorso mese: durante le 3 ore più impegnative del primo giorno della grande promozione,Il 13% delle richieste di risoluzione degli indirizzi viene rifiutato direttamente.Il servizio clienti è andato in tilt, e il team operativo per un soffio non è venuto a rovesciare i nostri tavoli.
Per chi non ne ha mai sentito parlare, diciamo la verità: cos’è esattamente l’API di OpenAI?
Significa che non è necessario addestrare modelli grandi da soli: basta semplicemente richiamare le interfacce di modelli già addestrati da OpenAI, come GPT-4o o GPT-3.5-turbo, inviare una richiesta e ottenere il risultato in return. Il pagamento avviene in base alla quantità di token utilizzati. La versione che supporta un contesto di massimo 128k per singola richiesta è ora completamente disponibile.
Il motivo per cui l’abbiamo scelto all’inizio era molto semplice: i formati degli indirizzi nei vari paesi europei erano troppo disordinati; i codici postali del Regno Unito erano completamente diversi da quelli della Germania, e c’erano anche molti errori di ortografia nelle diverse lingue. La nostra precedente libreria di regole era stata aggiornata 8 volte in sei mesi, ma comunque continuava a commettere errori. Utilizzando un API per l’analisi semantica, basta fornire il giusto “prompt” e il tasso di accuratezza sale direttamente al 96% e oltre.
Tre vantaggi concreti che abbiamo ottenuto, nessuno è falso.
- Non è stato necessario mantenere un team di sviluppatori di algoritmi dedicato al tuning dei modelli: in soli 1 settimana, 3 server backend hanno completato l’integrazione delle interfacce. Nel primo mese di attività, è stato risparmiato il 32% dei costi laboratoriali relativi ai 3 collaboratori a tempo parziale precedenti.
- Gli errori di ortografia e gli indirizzi abbreviati che in precedenza non venivano rilevati dal database delle regole ora vengono corretti automaticamente in oltre il 90% dei casi; di conseguenza, il tasso di annullamento degli ordini a causa di indirizzi errati inseriti dagli utenti è diminuito del 28%.
- Supporta l'input misto di più lingue: gli utenti polacchi possono inserire indirizzi in polacco, gli utenti spagnoli in spagnolo, e non è necessario effettuare adattamenti localizzati separatamente; basta inviarli all'interfaccia e verranno interpretati direttamente nel formato standard per la logistica.
Non guardare solo i vantaggi: per colpa di questi due problemi, siamo quasi morti…

Il primo problema è il limitazione di traffico basata su un solo modello predefinita. In precedenza utilizzavamo solo il GPT-4o-mini, e il limite di traffico impostato per ogni minuto era sufficiente per le normali attività. Tuttavia, durante le giornate di promozioni, il numero di richieste è aumentato di tre volte, causando direttamente l’attivazione del meccanismo di limitazione. Il 13% delle richieste ha ricevuto il codice di errore 429. Per risolvere il problema, abbiamo aggiunto una logica di degradazione che reindirizzava le richieste non in periodo di punta al GPT-3.5-turbo, permettendo così di ripristinare il corretto funzionamento del sistema.
Il secondo problema è il errore nella valutazione degli indirizzi sensibili. Una volta, un utente ha inserito un indirizzo che conteneva termini legati a “basi militari”, il quale è stato immediatamente bloccato dal sistema di revisione del contenuto fornito dall’API. Non abbiamo implementato alcun meccanismo di recupero in caso di fallimento, il che ha causato il ritardo nell’invio dell’ordine di due giorni; di conseguenza, l’utente ha lasciato una recensione negativa.
Chi dovrebbe usarlo? Davvero, non sprecate soldi.
Se lavori come noi, occupandoti di processi semantici in più lingue in scenari in cui le regole da applicare sono infinite (ad esempio, la verifica degli indirizzi, le risposte automatiche alle domande degli utenti, la generazione di contenuti in diverse lingue), e nel tuo team non c’è una squadra dedicata allo sviluppo di algoritmi, utilizzare le API di OpenAI è molto più conveniente che allenare i modelli da soli.
Ma se si tratta di un business in cui i dati core non possono assolutamente essere trasferiti fuori dall’organizzazione, come l’elaborazione di dati finanziari essenziali, l’analisi di dati privati sanitari, o scenari semplici con un volume di richieste particolarmente stabile e regole ben definite, allora non vale la pena partecipare a questa “festa” (ovvero non vale la pena utilizzare soluzioni basate su tecnologie distribuite). Scrivere le proprie regole o distribuire modelli localmente può essere più economico e anche più sicuro.
3 consigli per chi utilizza il prodotto per la prima volta, basati sugli errori che abbiamo commesso noi
- Non limitarti a utilizzare un solo modello: prepara almeno due modelli di diverso livello di qualità per il caso in cui uno dovesse non funzionare correttamente. Utilizza il modello di qualità più alta per le richieste di priorità elevata, e il modello più economico per le richieste di minor importanza o durante i periodi di picco di traffico. In questo modo puoi risparmiare almeno il 40% sui costi e evitare problemi legati al limitazione del traffico causata dall’uso di un solo modello.
- Tutte le richieste devono essere soggette a tentativi di ripetizione e a logiche di fallback; le situazioni legate alla revisione del contenuto, al controllo del traffico e ai tempi di attesa devono essere prevedute in anticipo, con piani di azione pronti. Non aspettare che l’interfaccia smetta di funzionare per iniziare a gestirle manualmente.
- Non è necessario partire subito con i modelli più avanzati; prova prima con il modello più economico, GPT-3.5-turbo, per vedere i risultati. Se non sono soddisfacenti, puoi passare a modelli più avanzati. Per la maggior parte delle situazioni semplici, i modelli più piccoli sono più che sufficienti.
Infine, risponderò a due domande che spesso vengono poste.
Domanda: Ci saranno grandi ritardi nelle chiamate nella regione europea?
Utilizziamo il nodo di Francoforte; la maggior parte delle richieste viene completata in 15 millisecondi, e solo l’1% di esse raggiunge improvvisamente tempi di esecuzione superiori ai 200 millisecondi. Aggiungendo una cache possiamo risolvere questo problema, senza alcun impatto sul funzionamento del servizio.
Domanda: Potrebbero verificarsi situazioni in cui il risultato della analisi non sia corretto?
Sì, ora stiamo trasferendo i risultati con un livello di affidabilità inferiore al 80% all’approvazione manuale. Dopo l’implementazione di questa regola, il tasso di errori è praticamente trascurabile.
Link dell’articolo:https://www.airai.cc/it/ai-news/39/
È stato utile?