Le marché de l'IA vocale, en plein essor, a vu l'apparition d'une start-up nommée Hojo.
L'IA vocale est une autre voie de développement parallèle aux grands modèles généraux. Alors que tout le monde se concentre sur les grands modèles généraux, ce domaine relativement calme de l'IA vocale commence également à voir apparaître de nouveaux modèles intéressants. Le clavier perd progressivement son "hégémonie". Au cours des deux dernières années, OpenAI a lancé la Realtime API, Google a développé Gemini Live, et presque toutes les entreprises chinoises spécialisées dans les grands modèles ont également commencé à se concentrer sur l'IA vocale. De plus en plus de personnes croient que, lorsque les agents intelligents entreront réellement dans les flux de travail, la voix deviendra une entrée dans le contexte plus naturelle que le clavier. Si les agents intelligents veulent vraiment s'intégrer aux flux de travail, ils doivent d'abord apprendre à comprendre ces voix. La première compétence essentielle à cet égard est l'ASR (reconnaissance vocale automatique). Pour évaluer le niveau d'ASR, le tableau de classement Open ASR de Hugging Face est le plus souvent utilisé dans l'industrie, et l'indicateur clé est le taux d'erreur de mot (WER). Plus ce chiffre est bas, plus la reconnaissance est précise.
Depuis longtemps, cette liste est principalement dominée par les grandes entreprises et les laboratoires de pointe. Les données d'entraînement, les ressources de calcul et l'expérience en ingénierie représentent des barrières importantes, et peu d'équipes petites osent concurrencer directement sur ces plans. Récemment, une équipe de start-up nommée Hojo a publié les résultats de ses tests de reconnaissance vocale, montrant des signes d'être en train de devenir une « surprise ». Selon les données officielles, Hojo-ASR-V1 a obtenu de bons résultats sur plusieurs ensembles de données de reconnaissance vocale en anglais publiés.
Dans ces données, le taux d'erreurs de mots (WER) sur LibriSpeech Clean n'est que de 1,74 %, et sur des ensembles de données plus proches des scénarios réels tels que GigaSpeech et VoxPopuli, il a également été réduit à moins de 8 %. Ils n'ont pas soumis leurs résultats à la liste des classements, mais s'ils étaient inclus dans le tableau de comparaison Open ASR Leaderboard, ils se classeraient très haut. Dans l'ensemble, il s'agit d'un modèle d'ASR (Reconnaissance Automatique de la Voix) compétitif qui a montré ses capacités dans des tests de référence publics. De plus, il est open source sur GitHub et Hugging Face, sous la licence Apache-2.0, ce qui signifie que les utilisateurs n'ont pas de restrictions majeures pour l'utiliser à des fins secondaires. 🚥 Ainsi, nous avons déployé Hojo-ASR-V1 pour l'essayer concrètement et voir à quel niveau se situe ce modèle de reconnaissance vocale développé par cette équipe de start-up discrète. Cela nous a également permis d'aborder une nouvelle tendance en plein essor : l'ère des agents vocaux (Voice AI). Qu'est-ce que Hojo-ASR, exactement ? Nous l'avons testé nous-mêmes. Tout d'abord, Hojo-ASR-V1 est open source sur HuggingFace et GitHub : Liens Hugging Face : https://huggingface.co/HojoAI/Hojo-ASR-V1[1] Liens GitHub : https://github.com/HojoAI/Hojo-ASR[2] Pour commencer, il est important de clarifier ce qu'est Hojo-ASR-V1. Après avoir examiné son code et sa configuration, nous avons constaté que sa structure diffère des modèles de reconnaissance vocale traditionnels.
L'audio est d'abord traité par l'extracteur de caractéristiques de Whisper pour être converti en caractéristiques acoustiques utilisables par le modèle, puis il est entré dans l'encodateur audio Qwen3-Omni. Une structure Conformer est utilisée entre les deux étapes pour l'adaptation et la compression.
Enfin, le résultat est transmis à un modèle linguistique Qwen3-4B, qui rédige le texte final. En d'autres termes : Hojo-ASR-V1 est une combinaison d'un « encodeur + adaptateur + grand modèle linguistique ». L'idée d'utiliser un grand modèle linguistique pour le décodage de l'ASR n'est pas propre à Hojo. C'est la tendance dominante actuelle en tête du classement OpenASR. Parmi les modèles les plus réputés du classement, tels que le Canary-Qwen-2.5B de NVIDIA, le Granite-Speech-3.3-8B d'IBM et le Phi-4-Multimodal de Microsoft, l'intégration des capacités du modèle linguistique dans le système de reconnaissance vocale a permis de réduire le taux d'erreur moyen (WER) entre 5,6 % et 5,9 %. L'avantage de l'utilisation d'un modèle linguistique est que la reconnaissance ne se limite pas à « entendre des sons et écrire des mots » ; le modèle peut également utiliser la sémantique pour faire des déductions. Lorsqu'il s'agit de bruit, d'expressions orales, d'un mélange de français et d'anglais, ou de termes spécialisés d'un domaine particulier, un modèle doté de compréhension sémantique est mieux à même de comprendre ce que l'interlocuteur veut exprimer. Voici la partie des tests pratiques : nous avons déployé le modèle localement et avons effectué de nombreuses itérations avant et après l'intégration.
Cas d'utilisation réel, divisé en deux parties : 【1】Les capacités de reconnaissance vocale (ASR) du modèle Hojo-ASR-V1. 【2】Hojo-TTS. Reconnaissance vocale (ASR) L'ASR est l'acronyme de Automatic Speech Recognition, c'est-à-dire la reconnaissance automatique de la parole. Il s'agit de la première étape dans tout le processus d'intelligence artificielle vocale. Que ce soit pour les dictateurs vocaux sur téléphone, les résumés de réunions, les sous-titres en temps réel ou les agents intelligents de plus en plus populaires aujourd'hui, l'ASR est indispensable. Auparavant, j'utilisais principalement des outils d'entrée vocale intelligente tels que Wispr Flow et Typeless. Ces produits offraient une bonne expérience, mais il y avait parfois des retards en cas d'instabilité du réseau, et leur adaptation aux scénarios en chinois pouvait être améliorée. Plus tard, je me suis tourné vers des solutions déployées localement, parmi lesquelles Whisper, un logiciel open-source développé par OpenAI, était le plus utilisé. Lors de la sortie de Hojo-ASR-V1, j'ai remplacé Whisper par Hojo-ASR-V1 pour en faire l'essai pratique. Dans l'ensemble, la vitesse de reconnaissance et la précision étaient satisfaisantes, ce qui est suffisant pour une utilisation quotidienne de l'entrée vocale. Bien sûr, cela nécessite des ressources matérielles locales et impose des exigences en matière de mémoire. La solution globale n'est pas compliquée : elle utilise Hojo-ASR-V1 comme moteur de reconnaissance de base, puis prend en charge l'entrée vocale via des autorisations au niveau du système. Une fois configurée, elle peut fonctionner dans presque tous les contextes d'entrée de texte, tels que les navigateurs, ChatGPT, Claude, Notion, etc. Lors du test, j'ai dicté directement une description d'un « carrefour », y compris l'emplacement des voies, la direction du contenu et l'origine du nom. Je n'avais pas préparé de texte à l'avance et je n'ai pas ralenti ma vitesse de parole délibérément. Ce qui m'a particulièrement intéressé, c'est que ce type de flux de travail peut être encore étendu. Après la reconnaissance, il est possible d'intégrer des modèles tels que DeepSeek ou GPT pour embellir le texte, le mettre en forme, corriger les erreurs de frappe et optimiser sa structure.
Voici la traduction en français du texte donné : <<MG_SEG(AF9D88C445A4_SOURCE>>> En gros, le processus se déroule comme suit : Entrée de la voix → Transcription par ASR (Automatic Speech Recognition) → Optimisation par un grand modèle → Accès direct au flux de travail. Pour ceux qui écrivent fréquemment, participent à des réunions ou collaborent avec des agents, cette expérience est plus confortable que celle des méthodes d'entrée traditionnelles. En plus de Hojo-ASR-V1, nous avons également remarqué que Hojo investit dans le domaine de la TTS (Text-to-Speech). Nous avons testé son modèle de synthèse vocale TTS, et l'équipe a également open-sourcé une version plus légère appelée Hojo-TTS-Light. Ces éléments ensemble constituent la réponse de Hojo pour les flux de travail avec des agents. Un autre aspect de Voice AI : la TTS. La voie pour tester les capacités du modèle TTS se trouve sur leur site web : hojoai.com **Synthèse vocale multilingue – Femme dynamique** Nous avons d'abord testé la synthèse vocale multilingue, une fonction assez courante chez les modèles TTS. Avec la Coupe du Monde qui approche, nous avons demandé au modèle de lire un texte présentant les joueurs de l'équipe japonaise en utilisant une voix de femme plus dynamique : Ce texte de 30 secondes en chinois est assez fluide à écouter ; la prononciation et les détails sont bien gérés, et il est difficile de sentir la présence de l'IA. On peut distinguer le ton de la voix féminine ainsi que son ton enjoué. En général, pour juger si une voix est artificielle, on écoute la prononciation et le ton à la fin de chaque mot, et dans ce cas, le résultat correspond bien au style initial défini. Hojo prend en charge de nombreuses langues : japonais, français, cantonais, etc. Voici le même texte présentant l'équipe japonaise en japonais ; l'effet est également satisfaisant, et on a vraiment l'impression d'entendre une présentation de la NHK. **Synthèse vocale multilingue – Homme charismatique et sérieux** Ce modèle TTS peut également adopter différents tons de voix masculins, et le résultat est également acceptable. Voici le même texte présentant la Coupe du Monde 2026, lu avec un ton masculin charismatique et sérieux ; cela correspond bien à ce que nous avions prévu. **Synthèse vocale multilingue – Livres audio** Le modèle TTS peut utiliser de nombreux tons de voix. Cette fois, nous avons demandé au modèle de lire un texte de présentation de *Naruto* avec un ton de livre audio. Cela sonne assez naturel. Lorsque le mot “jeune” est prononcé, la fin de la syllabe est bien gérée, ce qui assure une transition fluide entre les mots. De même, pour des conjonctions comme “et” que nous utilisons dans la vie quotidienne, les pauses sont bien placées, ce qui contribue à la fluidité de l'ensemble. **Synthèse vocale multilingue – Chuchotement** Lors des tests, nous avons également testé le ton de chuchotement. Voici un extrait présentant le film *The Silent Lamb*, lu avec un ton de chuchotement féminin : On peut entendre clairement ce qui est dit, et le modèle reproduit également le souffle léger, les respirations subtiles et les sons doux qu'on aurait en parlant à l'oreille. Le chuchotement produit par le modèle TTS n'est pas simplement un réduction du volume ; le ton, le rythme et les émotions sont également bien maîtrisés. Ce type de ton est très approprié pour les commentaires de suspense, les narrations d'histoires ou l'ASMR (Autonomous Sensory Meridian Response). En plus des tons de présentation standard, nous avons également testé des tons de voix plus caractéristiques de personnages. **Kang Hui** Actuellement, c'est la saison des examens d'entrée à l'université, et on entend de nombreux messages de bonnes volontés ainsi que des reportages à la télévision, à la radio et sur les vidéos courtes. La voix du présentateur de CCTV est assez représentative en chinois, avec une prononciation standard et une articulation claire. C'est pourquoi nous avons utilisé un extrait audio de Kang Hui comme référence ; voici l'audio original de Kang Hui. <<MG_SEG(AF9D88C445A4_END>>> Copie des timbres de fichier - Kanghui J'ai envoyé cet audio original à un modèle TTS pour qu'il reproduise les timbres présents à l'intérieur et lise un texte d'environ 40 secondes, souhaitant aux étudiants prenant l'examen d'entrée à l'université tout le succès possible.
Sur le plan des résultats, le modèle TTS a plutôt bien conservé les caractéristiques de la voix originale, en particulier le ton, les pauses et le rythme de narration de Kang Hui. Dès la première phrase, on peut entendre qu’il ressemble beaucoup à Kang Hui lui-même. Lorsqu’il prononce des phrases comme « Ne pas trahir la jeunesse, courir vers l’avenir », on reconnaît son style de présentation habituel et son sens de la mise en scène pour les grands événements. **Nezha** La reproduction de la couleur de la voix est une des capacités les plus représentatives des modèles TTS. J’ai utilisé ce modèle pour reproduire la voix de plusieurs personnages de séries télévisées, en commençant par Nezha dans « Nezha : Le Monstre enfant ». L’effet est assez proche de l’image de Nezha, avec son caractère indomptable et son air nonchalant ; les pauses correspondent également à son style de narration. **Peppa Pig** Le modèle TTS a également réussi à reproduire correctement la couleur de la voix des personnages de dessins animés. Les voix de ces personnages sont différentes de celles des personnes réelles ou des acteurs de films, et il faut donc les traiter différemment. Voici un extrait de la voix de Peppa Pig synthétisée par le modèle TTS : **MacArthur** J’ai même enregistré exprès une voix de commentateur très populaire sur TikTok, celle de MacArthur, pour qu’il le lise : « Le carrefour » est une plateforme de médias technologiques chinoise qui se concentre sur la vague de l’IA. Sa forme principale est un podcast, mais elle s’est également étendue à des vidéos, des versions écrites sur les comptes officiels des réseaux sociaux et des activités en ligne. « Le carrefour » est une métaphore utilisée par Steve Jobs pour décrire Apple comme une entreprise située à l’intersection de la technologie et de la culture ; de grands produits naissent souvent ici. La plateforme suit l’évolution et les opportunités que l’IA apporte à différents secteurs d’activité, cherche, interviewe et rassemble des « acteurs positifs » de l’ère de l’IA, pour explorer et embrasser ensemble de nouvelles possibilités. **Qui est l’équipe Hojo ?** En revenant à l’équipe Hojo, elle n’est pas une entreprise qui se concentre uniquement sur les grands modèles de reconnaissance vocale.
Hojo a été fondé il y a environ deux ans, et avant cette divulgation d'informations, peu de gens en savaient vraiment quelque chose. C'est pourquoi nous avons contacté son équipe pour obtenir des informations de première main. Selon la propre définition de Hojo, son objectif principal est de développer un système d'agent personnel (Personal Agent OS) destiné aux travailleurs du savoir. En d'autres termes, il s'agit de permettre à ces agents d'intégrer réellement les flux de travail quotidiens tels que le travail en bureau, la communication, la création et la collaboration. L'ASR (Reconnaissance Automatique du Parler) et le TTS (Synthèse de Parole) constituent les deux éléments clés de ce système. C'est aussi essentiel pour comprendre la vision de Hojo. En effet, l'ASR n'est qu'une première étape pour que l'agent puisse comprendre les situations de travail réelles. Il est nécessaire de capturer de manière fiable les informations provenant des réunions, des appels, des notes vocales et des discussions de groupe avant de pouvoir procéder à la compréhension, à la planification et à l'exécution des tâches suivantes. Un point particulier concernant l'équipe de Hojo est que ses membres ont une longue expérience dans le domaine des scénarios vocaux réels. La plupart d'entre eux viennent de équipes spécialisées dans l'interaction vocale, les cockpits intelligents et l'interaction vocale, notamment chez Xpeng, NIO Nomi et SenseTime. Pour être plus précis, le fondateur, Zhao Hengyi, a travaillé auparavant chez LeEco, Xpeng, NIO et SenseTime sur des projets liés à l'interaction vocale, aux cockpits intelligents, aux systèmes d'agents personnels (AgentOS), à l'interaction multilingue, aux applications autonomes basées sur l'IA et aux services interconnectés entre différents appareils. Le directeur des produits, Li Ou, a également travaillé chez SenseTime et NIO sur la planification des systèmes d'agents personnels, des cockpits intelligents et des produits numériques, en se concentrant sur la manière dont les capacités vocales peuvent être intégrées pour offrir une expérience utilisateur complète, plutôt que de se limiter à des modèles isolés. Le directeur des opérations, Sun Xiaogang, possède de l'expérience dans la commercialisation de solutions d'agents personnels et dans l'application de l'interaction vocale dans différents secteurs, notamment l'automobile, la restauration et les services de transport. En résumé, l'expérience commune de l'équipe de Hojo dans le traitement des problèmes vocaux dans des contextes réels est un atout majeur. Cela s'explique par le fait que ces membres se concentrent principalement sur des environnements réels où l'ASR est confronté à des conditions difficiles : du bruit dans les voitures, des dialectes, plusieurs personnes parlant en même temps, des interruptions, ainsi que des expressions orales souvent incomplètes.
Les utilisateurs ne parlent pas selon les prompts standard, ni n’attendent que le système réagisse lentement. Ceux qui ont déjà travaillé dans de telles situations comprennent mieux les véritables difficultés des modèles vocaux : l’ASR (Reconnaissance Automatique du Parler) doit être capable de comprendre de manière fiable les intentions des personnes dans des environnements complexes. L’expérience de Sudan, le scientifique en chef de Hojo, est également plus facile à comprendre dans ce contexte. Il a participé au développement de la reconnaissance vocale chez Baidu dans ses premières années et a vécu la phase où l’apprentissage profond a permis de commercialiser l’ASR. Par la suite, il a dirigé les activités liées à la reconnaissance vocale au sein du Tencent AI Lab, au moment où les grands modèles ont réécrit les règles de l’interaction vocale. La valeur de son parcours réside dans le fait qu’il a vécu plusieurs changements dans la technologie vocale : de la compétition basée sur la précision de la reconnaissance à la mise en œuvre dans des scénarios réels, puis à la reconstruction de l’interaction vocale à l’ère des grands modèles. Pour une entreprise qui souhaite développer un Personal Agent OS, une telle expérience est essentielle, car cela signifie qu’elle ne considère pas la reconnaissance vocale simplement comme un composant d’entrée, mais qu’elle la réintègre dans un flux de travail concret pour une réelle rénovation. Sur le plan financier, Hojo a déjà levé près de 100 millions de yuans en quatre tours de financement avant même le lancement officiel de son produit, et est actuellement en phase de pré-A. De telles informations ne prouvent pas nécessairement le succès du produit, mais elles montrent au moins que le marché initial commence à prendre en compte l’accumulation de connaissances de l’entreprise dans les domaines de l’IA vocale et des OS d’agents. En termes de commercialisation, selon Hojo, sa combinaison de « grands modèles + OS agents » fournit déjà des capacités vocales de base à des millions d’appareils intelligents. Si ce chiffre est exact, cela indique que l’entreprise ne se contente pas de publications académiques, de démonstrations ou de classements, mais qu’elle est déjà présente dans des appareils réels et dans des scénarios d’utilisation réels. Selon les plans de Hojo, l’ASR n’est que la première étape. L’entreprise travaille également sur la synthèse vocale (TTS) et prévoit de lancer un modèle vocal full-duplex à la fin du mois de juin. L’objectif réel est de construire un ensemble complet d’infrastructures d’interaction vocale autour du Personal Agent OS : permettre à l’agent d’entendre, de comprendre et de répondre, et de s’intégrer ainsi dans le flux de travail réel des professionnels. La réalisation de ces plans reste à prouver par les produits futurs. Cependant, d’après les performances de Hojo-ASR-V1, l’entreprise a déjà démontré des résultats suffisamment remarquables dans le premier maillon du flux de travail de l’IA vocale. Alors, pourquoi les données divulguées par Hojo-ASR ont-elles attiré autant d’attention ? Ou, plutôt, dans quel contexte se situe Hojo-ASR ? L’IA vocale représente une autre voie de développement parallèle aux grands modèles généraux. Lorsque les agents commencent à être intégrés dans des flux de travail réels, le contexte qu’ils doivent prendre en compte devient de plus en plus complexe : les discussions lors de réunions, les demandes au téléphone, les bruits environnants, des phrases ajoutées spontanément par les utilisateurs, ou même les instructions qui changent constamment lors de collaborations multiples. Auparavant, ces informations étaient principalement saisies par écrit, mais dans de nombreux contextes de travail, les informations importantes sont prononcées plutôt que rédigées.
C'est aussi la raison pour laquelle les grandes entreprises ont intensifié leurs investissements dans l'IA vocale ces deux dernières années. OpenAI a lancé la Realtime API, Google a développé Gemini Live, et des entreprises chinoises telles que iFlytek, DouBao, MiniMax et JieYue ont également investi dans ce domaine. L'engouement pour cette technologie peut être mesuré par les sommes considérables de capital investi. Selon les statistiques d'AssemblyAI, les entreprises de start-up dans le domaine de l'IA vocale ont reçu environ 2,1 milliards de dollars en investissements de risque en 2025 ; entre juin 2025 et mai 2026, il y a eu 36 levées de fonds déclarées dans le domaine de l'IA conversationnelle, pour un total d'environ 2,58 milliards de dollars. En un mot, c'est très dynamique. Pour prendre des exemples concrets d'entreprises : ElevenLabs, qui se spécialise dans la synthèse vocale, a reçu 500 millions de dollars au tour D, avec une valorisation de 11 milliards de dollars ; PolyAI, qui s'occupe du service client par téléphone, a obtenu 86 millions de dollars au tour D ; Retell AI, qui gère des appels AI en temps réel, traite plus de 40 millions d'appels par mois, avec une croissance trimestrielle de plus de 300 %. Il y a également des équipes comme Cartesia, qui s'efforcent de réduire le temps de latence vocale à moins de 100 millisecondes pour rendre les conversations plus fluides. Les grandes entreprises sont également très actives dans ce domaine. OpenAI a lancé la Realtime API, offrant une solution complète pour la gestion du son, qui permet de passer directement de l'entrée du son à sa sortie, sans passer par les étapes de conversion en texte, de traitement par le modèle et de synthèse. La démarche de Google avec Gemini Live est similaire : elle permet de reprendre la conversation même si elle est interrompue. Récemment, une nouvelle version de Voice AI, Gamma4, a été lancée. On peut voir que la voix est en train de devenir un moyen d'interaction « plus naturel » pour les agents intelligents afin d'obtenir du contexte. Ce trend est encore plus marqué dans les environnements de travail collaboratifs populaires comme Vibe Working. Il n'est plus nécessaire de structurer chaque demande en une phrase complète : on peut penser, parler et ajuster en même temps, permettant à l'agent d'interpréter les intentions, de compléter le contexte et d'avancer dans la tâche de manière plus naturelle. Dans cette chaîne, l'ASR (Reconnaissance Automatique du Parole) est la première étape clé. Elle détermine si l'agent peut comprendre le monde réel. Si la reconnaissance du son est imprecise, les étapes suivantes de compréhension, de planification et d'exécution seront déformées ; si elle est précise, la voix pourra vraiment devenir partie intégrante du flux de travail. En somme, lorsque les agents commenceront à être intégrés à la vie quotidienne, la voix, c'est-à-dire l'IA vocale, sera probablement la première interface par laquelle ils entreront en contact avec les utilisateurs. Il existe de nombreuses manières de connecter les humains aux IA, comme taper des textes, naviguer sur des interfaces ou utiliser des API, mais parler est de loin la méthode la plus proche d'une conversation quotidienne entre personnes. C'est aussi pourquoi de plus en plus de gens considèrent la voix comme l'entrée dans le contexte pour les agents intelligents. Si les grands modèles sont responsables de la compréhension du monde, alors la voix est le canal par lequel l'information du monde extérieur est constamment acheminée vers le modèle. Dans ce contexte, l'ASR joue un rôle essentiel en tant que couche de perception : elle détermine si l'agent peut capturer correctement les informations de l'environnement extérieur et transformer les sons du monde réel en un contexte compréhensible et utilisable par le modèle. Du point de vue de l'ASR, la compétition s'est donc elevée à un niveau supérieur : il s'agit de se disputer l'entrée permettant aux agents intelligents de se connecter au monde réel. C'est aussi pour cette raison que les données divulguées par Hojo-ASR-V1 méritent plus d'attention. Ce qu'elles reflètent ne se limite pas simplement à un changement dans les performances d'un modèle.
La technologie d'IA vocale évolue de une capacité auxiliaire vers une infrastructure essentielle, devenant une base de plus en plus importante à l'ère des agents intelligents. 🚥 Revenons à l'IA vocale. Alors que la plupart des fabricants se concentrent sur les grands modèles généraux, le domaine de la reconnaissance vocale, relativement moins médiatisé, évolue rapidement. Même dans un secteur longtemps dominé par des entreprises de premier plan telles qu'OpenAI, Microsoft, Nvidia et IBM, des équipes start-up commencent à obtenir des résultats compétitifs. L'apparition de Hojo-ASR-V1 ne signifie pas nécessairement un changement majeur dans la structure du marché, mais elle montre au moins que l'IA vocale passe d'une fonctionnalité secondaire à une position plus importante et attire de plus en plus d'attention. La reconnaissance vocale n'est que la première étape de l'IA vocale. L'important, c'est que les machines puissent non seulement entendre correctement, mais aussi comprendre et répondre de manière proche de celle d'un humain. C'est là que réside l'histoire la plus longue, la plus précieuse et la plus prometteuse. Références : [1] https://huggingface.co/HojoAI/Hojo-ASR-V1: https://huggingface.co/HojoAI/Hojo-ASR-V1 [2] https://github.com/HojoAI/Hojo-ASR: https://github.com/HojoAI/Hojo-ASR L'article est publié sur le compte WeChat officiel “Crossing”, écrit par “Crossing”.
Lien de l’article :https://www.airai.cc/fr/news/6/
Cela vous a-t-il aidé ?