Nous avons maximisé le taux de correspondance des adresses logistiques avec OpenAI o1, mais nous avons rencontré trois problèmes inattendus.
Just après le pic du Black Friday de la semaine dernière, notre équipe de développement backend européenne de trois personnes a enfin pu souffler : l'année dernière, 13 % des demandes d'analyse d'adresses ont rencontré des problèmes de limitation de trafic en raison des restrictions imposées par le modèle utilisé, ce qui a entraîné des erreurs (code 429). Cette année, non seulement il n'y a pas eu une seule telle erreur de limitation de trafic, mais le taux d'erreurs dans la correspondance des adresses a également diminué de 82 %. Le changement clé réside dans le fait que nous avons remplacé le modèle de raisonnement principal par o1.
Pour ceux qui ne sont pas familiers avec le sujet, expliquons clairement : qu’est-ce que l’o1, au juste ?
Il s'agit du grand modèle d'inférence amélioré lancé par OpenAI, qui diffère de GPT-4o. Il met plus de temps à "réfléchir" aux problèmes logiques complexes, et les scores obtenus dans les tests de capacité d'inférence de base sont 87 % plus élevés que ceux de GPT-4o, selon les données officielles. C'est ce paramètre qui nous a motivés pour le choisir dès le début.
Pour nos petites et moyennes équipes, les avantages de l’outil o1 sont vraiment concrets.
Le premier avantage résout directement le problème le plus difficile pour nous, qui est la correspondance des adresses. Auparavant, avec GPT-4o, nous avions souvent des erreurs dans la reconnaissance de rues portant le même nom ou de codes postaux identiques dans différents pays en Europe, surtout lorsque les utilisateurs saisissaient des adresses avec des erreurs de orthographe. Nous devions mettre en place trois niveaux de vérification pour atteindre un taux de précision de 92 %. Maintenant, avec o1, ce taux de précision a été porté à 98,7 %, et nous avons supprimé tout le code de règles la semaine dernière.
Le deuxième avantage est qu’il n’est plus nécessaire de mettre en place de complexes projets de création de prompts. Auparavant, pour que le modèle produise des résultats d’analyse conformes à notre format interne, nous avons écrit des prompts de près de 2000 mots, et il arrivait fréquemment que le format de sortie soit incorrect. Maintenant, une seule instruction suffit pour résoudre le problème, ce qui réduit directement les coûts de maintenance des prompts à zéro.
Le troisième point est que la stabilité des demandes concurrentielles est meilleure que nous le pensions. Nous étions inquiets que le temps de raisonnement long entraîne des files d'attente, mais les données de surveillance montrent que la plupart des demandes sont traitées en moins de 15 ms. Seules quelques demandes particulièrement complexes concernant des adresses internationales prennent plus de 200 ms, ce qui est entièrement dans nos limites acceptables.
Mais ses pièges peuvent vraiment te prendre par surprise.

Le premier problème est que la consommation de tokens est beaucoup plus élevée que celle de GPT-4o. Pendant les premiers 3 jours après le passage, le coût de raisonnement a augmenté de 2,3 fois. Nous avons ensuite découvert que o1 incluait automatiquement son processus de réflexion dans la consommation de tokens. Si vous n’avez pas besoin de voir le logique de raisonnement, vous devez absolument désactiver l’affichage de ce processus dans les paramètres de l’appel. Une fois que nous l’avons fait, le coût est retombé à 1,2 fois le niveau initial, ce qui est tout à fait acceptable.
Le deuxième problème est que la solution n’est pas adaptée aux demandes simples et fréquentes. Au début, pour simplifier les choses, nous avons redirigé toutes les requêtes de recherche d’adresses vers o1. Cependant, nous avons constaté que pour les adresses qui ne contenaient aucune erreur de saisie et qui étaient bien formattées, l’exactitude des résultats était identique qu’avec o1 ou avec GPT-4o, mais cela nous coûtait plus cher. Aujourd’hui, nous avons ajouté une vérification préliminaire simple : seules les requêtes qui ne respectent pas le format standard sont redirigées vers o1, ce qui a permis de réduire les coûts de 30 %.
Le troisième problème est que le support pour les langues non latines telles que le chinois et l'arabe n'est pas encore suffisamment stable. Nous avons un petit nombre d'utilisateurs du Moyen-Orient qui, lorsqu'ils saisissent des adresses en arabe, rencontrent parfois des erreurs de résolution. Après avoir signalé ce problème à OpenAI, nous attendons toujours une correction. Pour l'instant, nous utilisons des règles locales pour effectuer des vérifications supplémentaires.
Qui devrait utiliser o1 ? Qui ne doit pas y toucher pour l’instant ?
Si vous devez gérer des tâches qui nécessitent de la réflexion logique – comme la correspondance de règles complexes, la vérification de plusieurs conditions, ou la génération de code simple – et que vous avez déjà atteint un plafond de précision avec GPT-4o, alors passer à o1 pourrait être une excellente option, car le rapport coût-bénéfice en sera très élevé.
Mais si vous faites de la simple classification de texte, de la génération de contenu ou des demandes standardisées fréquentes, il n'est absolument pas nécessaire d'utiliser o1 ; c'est purement une perte d'argent. GPT-4o, voire GPT-3.5, suffisent amplement.
Deux conseils pour ceux qui utilisent l'outil pour la première fois
- Utilisez d’abord les 1000 enregistrements historiques que vous avez traités avec l’ancien modèle pour effectuer des tests. Ne procédez pas à un changement complet d’un coup ; vous pourrez ainsi rapidement voir si l’amélioration de la précision compense l’augmentation des coûts. Nous avons effectué des tests pendant 2 jours et avons décidé de passer à un nouveau modèle.
- Lors de l'appel, la version o1-mini est privilégiée. Pour 90 % des scénarios de petites et moyennes équipes, les fonctionnalités de o1-mini sont amplement suffisantes, et le prix est même 60 % moins élevé que celui de la version complète o1.
Pour conclure, voici une des questions les plus fréquemment posées : o1 sera-t-il bientôt remplacé par d'autres modèles ? Du moins dans le domaine de la résolution d'adresses que nous travaillons, nous avons testé tous les grands modèles de raisonnement actuellement sur le marché, et aucun n'a atteint un taux de précision supérieur à celui d'o1. Au moins pour les six prochains mois, il restera notre choix préféré.
Lien de l’article :https://www.airai.cc/fr/ai-news/35/
Cela vous a-t-il aidé ?