القائمة

ساحة تكنولوجيا الذكاء الاصطناعي الصوتي التي تشهد نموًا متسارعًا، شهدت ظهور فريق ناشئ يُدعى Hojo

الذكاء الاصطناعي الصوتي هو خط قصة آخر بجانب النماذج العامة الكبيرة. بينما كان الجميع يركزون على النماذج العامة الكبيرة، بدأت أيضًا تظهر بعض النماذج الجديدة الجديرة بالاهتمام في مجال الذكاء الاصطناعي الصوتي، وهو مجال نسبيًا هادئ. لقد بدأت لوحات المفاتيح في فقدان "مكانتها المهيمنة". خلال العامين الماضيين، أطلقت OpenAI خدمة Realtime API، وقامت Google بتطوير Gemini Live، وبدأت الشركات الكبرى المتخصصة في النماذج العامة في الصين أيضًا في التركيز على تطوير تقنيات الذكاء الاصطناعي الصوتي. يبدأ المزيد والمزيد من الناس في الاعتقاد بأن الصوت سيصبح وسيلة دخول أكثر طبيعية للتفاعل مع الأنظمة مقارنة بلوحات المفاتيح، عندما تدخل الوكلاء (Agents) بشكل فعلي في سير العمل (workflows). إذا أراد الوكيل أن يدخل بشكل فعلي في سير العمل، فيجب أولاً أن يتعلم فهم هذه الأصوات. والقدرة الأساسية التي تكمن وراء ذلك هي تقنية التعرف الصوتي الآلي (ASR - Automatic Speech Recognition). لقياس مستوى تقنية ASR، يتم غالبًا الاستشهاد بلوحة تصنيف Hugging Face Open ASR Leaderboard، حيث المؤشر الرئيسي هو معدل الأخطاء الكلمية (WER - Word Error Rate)؛ كلما كان الرقم أقل، كان التعرف أكثر دقة.

لفترة طويلة، كان هذا التصنيف يُعد ميدانًا رئيسيًا للشركات الكبرى ومختبرات البحثية المشهورة، حيث توجد عقبات كبيرة فيما يتعلق ببيانات التدريب، والقدرة الحسابية، والخبرة الهندسية، مما جعل من النادر أن تجرؤ الفرق الصغيرة على المنافسة بشكل مباشر في هذا المجال. مؤخرًا، كشفت فريق ريادي يُدعى Hojo عن نتائج اختبارات التعرف على الصوت، ويبدو أنهم يمتلكون إمكانية أن يصبحوا "المفاجأة السارة" في هذا المجال. وفقًا للبيانات الرسمية، حقق Hojo-ASR-V1 نتائج جيدة في عدة مجموعات بيانات عامة للتعرف على الصوت باللغة الإنجليزية.

فيما يتعلق بمعدلات الأخطاء في الترجمة (WER)، فإن معدل الأخطاء في LibriSpeech Clean كان فقط 1.74٪، وقد تم تقليله أيضًا إلى أقل من 8٪ في مجموعات البيانات مثل GigaSpeech وVoxPopuli التي تقترب أكثر من السيناريوهات الواقعية. لم يتم تقديم هذه البيانات في التصنيفات الرسمية، ولكن إذا تم مقارنتها مع لوحة متابعة Open ASR Leaderboard، فستكون من بين البيانات الرائدة بالتأكيد. بشكل عام، هذا نموذج لتحويل الكلام إلى نص (ASR) يظهر قدرات تنافسية في الاختبارات المعيارية العامة. بالإضافة إلى ذلك، تم فتح المصدر الكامل للنموذج على GitHub وHugging Face تحت رخصة Apache-2.0، مما يعني أن هناك قيودًا قليلة جدًا على إعادة استخدامه. 🚥 لذلك، قمنا بتنفيذ Hojo-ASR-V1 لتجربته بأنفسنا، لنرى ما مستوى هذا النموذج الصوتي الذي طورته هذه الشركة الناشئة المتواضعة، ولنناقش أيضًا القصة الجديدة التي تتسارع وتيرتها في عصر الوكلاء الصوتيين (Voice AI). ما هو بالضبط Hojo-ASR؟ لقد قمنا بإجراء اختبارات عملية عليه. أولاً، تم فتح مصدر Hojo-ASR-V1 على Hugging Face وGitHub: رابط Hugging Face: https://huggingface.co/HojoAI/Hojo-ASR-V1[1] رابط GitHub: https://github.com/HojoAI/Hojo-ASR[2] دعونا نوضح ما هو نموذج Hojo-ASR-V1 أولاً؛ بعد أن قمنا بمراجعة كوده وإعداداته، وجدنا أن هيكله مختلف عن نماذج التعرف على الصوت التقليدية.

يتم أولاً معالجة الصوت باستخدام مستخرج الخصائص من Whisper لتحويله إلى خصائص صوتية يمكن للنموذج استخدامها، ثم يتم إدخاله إلى مشفر الصوت Qwen3-Omni. يتم استخدام هيكل Conformer في المنتصف للتكييف والضغط.

في النهاية، يتم تسليم البيانات إلى نموذج لغوي من نوع Qwen3-4B، والذي يقوم بكتابة النص النهائي. بعبارة أخرى: Hojo-ASR-V1 هو مزيج من "مشفر + محول + نموذج لغوي كبير". فكرة استخدام النماذج اللغوية الكبيرة لتحليل الصوت وفك ترميزه ليست فكرة خاصة بشركة Hojo وحدها. هذا هو الاتجاه السائد حاليًا في قائمة OpenASR. النماذج التي تحتل مراكز عالية في القائمة، مثل Canary-Qwen-2.5B من نفيديا، وGranite-Speech-3.3-8B من IBM، وPhi-4-Multimodal من مايكروسوفت، جميعها تدمج قدرات النماذج اللغوية في عملية التعرف على الكلام، مما يقلل من متوسط معدل الأخطاء (WER) إلى ما بين 5.6% و5.9%. الفائدة من دمج النماذج اللغوية تكمن في أن عملية التعرف لا تقتصر فقط على "سماع الأصوات وكتابة الكلمات"، بل يمكن للنموذج أيضًا استخدام المعنى للتحليل. عند مواجهة ضوضاء، تعبيرات شفهية، خليط من اللغتين الصينية والإنجليزية، أو مصطلحات متخصصة في مجال معين، يكون من الأسهل على النموذج الذي يفهم المعنى تحديد ما يريد المتحدث التعبير عنه. فيما يلي جزء الاختبارات العملية، حيث قمنا بنشر النموذج محليًا وأجرينا العديد من الجولات من التجارب.

حالات تجريبية، مقسمة إلى طبقتين: 【1】قدرات نظام التعرف الصوتي (ASR) لنموذج Hojo-ASR-V1. 【2】نظام التحويل الصوتي إلى نص (TTS) Hojo-TTS. نظام التعرف الصوتي (ASR)، والمعروف اختصارًا بـ Automatic Speech Recognition، هو النظام الذي يقوم بتحويل الصوت إلى نصوص. إنه الخطوة الأولى في سلسلة تقنيات الذكاء الاصطناعي الصوتي (Voice AI). سواء كان ذلك في محركات البحث الصوتي للهواتف المحمولة، أو محاضرات المؤتمرات، أو الترجمات الصوتية الفورية، أو الوكلاء الذكائيين (AI Agents) التي أصبحت شائعة جدًا في الوقت الحالي، كلها تعتمد على تقنيات التعرف الصوتي. كنت في السابق أستخدم أدوات مثل Wispr Flow وTypeless للإدخال الصوتي باستخدام الذكاء الاصطناعي. كانت تجربة استخدام هذه الأدوات جيدة، لكن قد تحدث بعض التأخيرات في حالة عدم استقرار الاتصال بالإنترنت، وكان هناك مجال لتحسين قدرتها على التعامل مع النصوص باللغة الصينية. لاحقًا، بدأت أتجه نحو الحلول الموزعة محليًا، ومن بينها كانت أداة Whisper المفتوحة المصدر من OpenAI هي الأكثر استخدامًا بالنسبة لي. بعد إطلاق Hojo-ASR-V1، قمت بتغيير أداة Whisper الخاصة بي إلى Hojo-ASR-V1 لتجربتها بشكل عملي. بشكل عام، كانت سرعة التعرف ودقة النتائج جيدة جدًا، وكانت كافية للاستخدام اليومي في الإدخال الصوتي. بالطبع، هناك حاجة إلى موارد هاردوير محلية معينة، وهناك متطلبات معينة للذاكرة. الحل بأكمله ليس معقدًا؛ في الأساس، يتم استخدام Hojo-ASR-V1 كمحرك أساسي للتعرف على الصوت، ثم يتم التحكم في عملية الإدخال الصوتي من خلال صلاحيات على مستوى النظام. بعد إكمال الإعدادات، يمكن للنظام العمل في معظم سيناريوهات الإدخال النصي مثل المتصفحات، وChatGPT، وClaude، وNotion، وغيرها. أثناء الاختبار، قمت بالتحدث شفهيًا عن موضوع يتعلق بـ "تقاطع الطرق"، بما في ذلك تحديد موقع العمود، واتجاه المحتوى، وأصل الاسم، وما إلى ذلك. لم أقم بتنظيم النص مسبقًا، ولم أحاول تبطيئة سرعة كلامي عمدًا. ما وجدته مثيرًا للاهتمام هو أن هذا النوع من سير العمل يمكن توسيعه أكثر. بعد اكتمال عملية التعرف، يمكن ربط النظام بموديلات أخرى مثل DeepSeek أو GPT لتحسين النص، وتنظيم تنسيقه، وتصحيح الأخطاء الإملائية، وتحسين هيكله.

وعلى الأرجح العملية العامة هي كما يلي: الإدخال الصوتي → ASR النقل → تحسين النموذج الكبير → مباشرة إلى سير العمل.بالنسبة للأشخاص الذين يكتبون بشكل منتظم أو يعقدون اجتماعات أو يعملون مع وكلاء ، فإن هذه التجربة أكثر راحة من طريقة الإدخال التقليدية.بالإضافة إلى Hojo-ASR-V1 ، لاحظنا أيضًا أن Hojo استثمر بنفس القدر في اتجاه TTS.لقد اختبرنا نموذج تركيب الصوت TTS لهذه المرة ، بالإضافة إلى ذلك ، قام الفريق أيضًا بمفتوح المصدر لإصدار خفيف الوزن من Hojo-TTS-Light.تشكل هذه إجابة Hojo الموجهة إلى سير عمل الوكيل.قطعة أخرى من اللغز في Voice AI: TTS طريقنا لتجربة قدرات نموذج TTS هو موقعها الرسمي: هوجواي . com تركيب الصوت متعدد اللغات - المرأة السريعة تم اختبار تركيب الكلام متعدد اللغات ، وهو وظيفة شائعة في نموذج TTS.في الآونة الأخيرة كأس العالم على وشك أن تبدأ، وطلبت له مع صوت أنثى أكثر خفيفة، قراءة نص تعليق عن كأس العالم لاعبين اليابان: هذه الفقرة من حوالي 30 ثانية من اللغة الصينية تسمع بشكل سلس جدا، وعلاج الكلمات وبعض التفاصيل على ما يرام، والشعور بالذكاء الاصطناعي ليست واضحة جدا.نغمة صوت المرأة والنبرة الخفيفة يمكن سماعها.في الواقع، نحن عادة الحكم على صوت من غير الطبيعي، وعادة ما نستمع إلى كلمته، وهناك نبرة في نهاية كل كلمة، وهذا الأسلوب الأساسي وتعيين في البداية يمكن أن تتماشى.تم اختبار العديد من اللغات التي يدعمها Hojo ، واليابانية والفرنسية والكانتدوينية.وفيما يلي أو نفس الفقرة من الفريق الياباني تقديم النص، واستبدالها في اليابانية لقراءة، والتأثير يمكن أيضا، والاستماع حقا قليلا مثل NHK البث، وهناك شعور بصري جدا: تركيب الصوت متعدد اللغات - المغناطيسية مستقرة الذكور يمكن لهذا النموذج TTS أيضًا تغيير أصوات الأدوار المختلفة ، والصوت الذكوري لا بأس به.في الفقرة التالية ، أو تقديم مسودة كأس العالم 2026 ، قمت بتعيين الصوت على صوت رجلي مغناطيسي وثابت.وهذا يتفق بشكل أساسي مع ما أوضحته في خطابي.الصوت متعدد الألوان - الكتاب الصوتي يمكن استخدام نموذج TTS أكثر من الألوان.هذه المرة أطلب منه أن يقرأ صوت الكتاب الصوتيهذا النص هو عرض موضوعي من ناروتو ، تم تجميعه مع صوت الذكور من الكتاب الصوتي.يبدو الأمر طبيعيًا.عند قراءة كلمة "الشباب" ، فإن معالجة الصوت النهائي تجعل الاتصال سلاسة للغاية.وهناك أيضا مثل "و" هذا الارتباط الذي نستخدم في الحديث عادة، فإنه يتوقف أيضا أكثر دقة، وهذا هو أيضا سبب للاستماع إلى كامل الفقرة.تركيب الصوت المتعدد الألوان - الهمس هناك صوت واحد يريد أن يقول منفردا، وهو الهمس.في هذه المقالة أقرأ نص الفيلم "صمت الخروف" في صوتهمس أنثى: يمكنك سماع ما يتحدث، وفي الوقت نفسه، فإنه يحاكي التدفق الهوائي الخفيف، والتنفس الدقيق، والأصوات الخفيفة عندما يتحدث الشخص إلى أذنه.الاستماع إلى ذلك ، الهمس لنموذج TTS ليس مجرد خفض مستوى الصوت ، والنبرة والإيقاع والمزاج جيد أيضًا.هذا النوع من الصوت هو أكثر ملاءمة للشرح المثير للاهتمام ، وروي القصة ، ASMR.بالإضافة إلى نغمات البث القياسية ، اختبرت أيضًا بعض نغمات الشخصيات الأكثر تميزًا.السيد كينغ هوي في الآونة الأخيرة هو موسم امتحانات الجامعة ، على التلفزيون والإذاعة والفيديو القصير ، يمكنك سماع الكثير من التهنئة والبث الإخباري.صوت مرساة التلفزيون المركزي في البث الصيني هو أكثر تمثيلا، معايير النطق، والكلمات واضحة.لذلك هذه المرة اخترت جزءا من الصوت كانغ هوى كمرجع، وهذه الفقرة أدناه هي الصوت الأصلي كانغ هوى. نسخة الصوت لعملية نسخ الملفات - كانغهوي لقد أرسلت هذا الصوت الأصلي إلى نموذج TTS ليقوم بنسخ النبرة الصوتية الموجودة فيه، ويقرأ نصًا يستمر حوالي 40 ثانية يتمنى فيه النجاح لطلاب الامتحانات الوطنية.

من الناحية العملية ، يحتفظ نموذج TTS بخصائص الخط الصوتي الأصلي بشكل جيد ، وخاصة لهجة Kanghui والتوقف وإيقاع البث.عندما تظهر الجملة الأولى ، يمكنك سماعها تشبه كينغوي نفسه.وكما قال تعالى: (وَمَنْ يَسْتَعْدُونَ مَنْ يَسْتَعْدُونَ). نياجا تعتبر إعادة التدوين الصوتي قدرة نموذج TTS أكثر تمثيلا.وَأَنْ تَعْدَرُ عَلَيْهُمْ عَيْهُمْ. استمع إلى الشعور بالقرب جدا من عدم الاحتواء والكسل ، والتوقف هو أيضا تقريبا هذه الحالة. الخنزير الصغار بيج صوت شخصيات الكرتون ، نموذج TTS إعادة رسم لا بأس بها.صوت شخصيات الرسوم المتحركة ليست مثل شخصيات الفيلم الحقيقية ، والمعاملة مختلفة قليلا. هذه هي الصفحة الخنزير التي قمت بتصنيعها باستخدام نموذج TTS: ماك آرثر حتى أنني قمت بتسجيل صوت ماك آرثر المثير للاهتاش ، وطلبت منه أن يقرأ مرة أخرى: "مفترق الطرق" هو وسائل الإعلام الذاتية التكنولوجية المحلية التي تركز على موجة الذكاء الاصطناعي ، والشكل الأساسي هو البودكاست ، في حين تمتد إلى الفيديو والنصوص العامة والأنشطة المجتمعية خارج الإنترنت. "مفترق الطرق" هو استعارة جوبز لشركة أبل، التي تقف على مفترق طرق بين التكنولوجيا والعلوم الإنسانية، حيث غالباً ما تولد المنتجات العظيمة.تابع التغييرات والفرص التي يجلبها الذكاء الاصطناعي لجميع الصناعات ، وابحث عن "الجهات الفاعلة الإيجابية" في عصر الذكاء الاصطناعي ومقابلتها وجمعها لاستكشاف واحتضان إمكانيات جديدة معهم. من هو الفريق؟ بالعودة إلى فريق هوجو نفسه ، فهو ليس شركة تصنع نماذج صوتية كبيرة فقط.

تأسست Hojo منذ حوالي عامين ، ولم يكن يعرف سوى القليل عنها قبل هذا الكشف.لقد اتصلنا بفريقهم للحصول على بعض المعلومات مباشرة. وفقًا لموقع Hojo الخاص ، فإنه يفضل أن يكون نظام التشغيل الشخصي موجهًا للعاملين في مجال المعرفة.ببساطة، هو السماح للوكلاء بالدخول حقا في سير العمل اليومي مثل المكتب، والاتصال، والإبداع، والتعاون، و ASR و TTS هي قطعتين رئيسية في اللغز في النظام. هذا هو أيضا مفتاح فهم هوجو. ASR هي في الواقع مجرد الطبقة الأولى من الأساس التي يفهم فيها الوكيل سيناريو العمل الحقيقي.لا يمكن التوصل إلى فهم وتخطيط وتنفيذ لاحق إلا إذا تم قبول المعلومات في الاجتماعات والمكالمات الهاتفية والمذكرات الصوتية والمناقشات المتعددة الأطراف بشكل مستقر. من خلفية الفريق ، فإن ما يميز هوجو هو أن أعضائه الأساسيين يتعاملون مع "المشهد الصوتي الحقيقي" لفترة طويلة.معظم أعضاء الفريق من الفريق المتعلق بالصوت على متن السيارة والقمرة الذكية والتفاعل الصوتي ، بما في ذلك Xiaopeng و Wei Lai Nomi و Shangtang. على وجه التحديد ، كان المؤسس Zhao Hengyi مسؤولاً عن التفاعل الصوتي والمقصورة الذكية والعمل المتعلق بـ AgentOS في فرق مثل LeTV و Xiaopeng و Weilai و Shangtang ، حيث قام بالصوت على متن السيارة والمقصورة الذكية والتفاعل متعدد اللغات وتطبيقات التشغيل الذاتي الذكاء الاصطناعي والخدمات عبر الأجهزة. وكان لي أو، كبير مسؤولي المنتجات، مسؤولاً سابقاً عن تخطيط AgentOS، وقمرة القيادة الذكية، والمنتجات الرقمية في شركات مثل Shangtang وWeilai، مع التركيز على كيفية تنظيم القدرات الصوتية في تجربة منتج كاملة، بدلاً من البقاء على قدرات نموذج نقطة واحدة.لدى مدير العمليات سون شياوغانغ خبرة في حلول الوكيل والتسويق التفاعلي الصوتي والهبوط في الصناعة ، وقد شارك في برامج التفاعل الصوتي في السيارات والمطاعم والسفر وغيرها من المشاهد. إذا نظرنا إلى هذه السير الذاتية معًا ، فإن الخبرة المشتركة لفريق هوجو تدعمها الخلفية للتعامل مع مشاكل الصوت في المشهد الحقيقي على المدى الطويل. ويرجع ذلك أساسا إلى أن أعضاء الفريق يركزون بشكل أساسي على البيئة الواقعية لـ ASR ، وهي مشاهد مختلفة عن الصوت النظيف في المختبر.وكان هناك ضوضاء في السيارة، وكان هناك لهجة، وكان هناك عدد من الناس يتحدثون، وكان هناك مقاطعات مؤقتة، وكان هناك عدد كبير من التعبيرات غير الكاملة، اللغة المنطوقة.

لا يتحدث المستخدمون وفقًا للمطالبة القياسية ، ولا ينتظرون أن يستجيب النظام ببطء.من الأسهل للأشخاص الذين قاموا بهذا النوع من السيناريوهات فهم ما هو صعب حقًا في نموذج الصوت ، حيث يحتاج ASR إلى فهم مستقر لنوايا الإنسان في بيئات معقدة. وتجربة السودان، كبير العلماء في هوجو، وضعت أيضا في هذا السياق من الأسهل فهمها.شارك في السنوات الأولى من التعرف على الصوت في بايدو في البحث والتطوير ذات الصلة ، ومر مرحلة التعلم العميق لدفع ASR إلى مرحلة الهبوط التجاري ؛ في وقت لاحق في مختبر Tencent AI مسؤول عن الاتجاهات ذات الصلة بالصوت ، واللحاق بمرحلة إعادة كتابة النموذج الكبير للتفاعل الصوتي. إن قيمة هذه السيرة الذاتية هي أنه عانى من عدة تغييرات متتالية في تكنولوجيا الصوت من المنافسة في دقة التعرف ، إلى الهبوط في المشهد الحقيقي ، وإعادة هيكلة التفاعل الصوتي في عصر النموذج الكبير.بالنسبة للشركة التي ترغب في أن تصنع نظام التشغيل العميل الشخصي ، فإن هذه التجربة تقرر أنها لا تعتبر الصوت مجرد مكون مدخل ، ولكن إعادة التصميم في سير العمل الحقيقي هو المفتاح. على مستوى رأس المال، Hojo في حالة المنتجات التي لم يتم إطلاقها رسميا على نطاق واسع، وقد أنجزت حتى الآن ما يقرب من 100 مليون يوان 4 جولات من التمويل، وتجري حاليا جولة ما قبل A.هذه المعلومات لا تدل بشكل مباشر على نجاح المنتج ، ولكنها تشير على الأقل إلى أن السوق الأولية قد بدأت تولي اهتمامًا لتراكم التكنولوجيا للشركة في اتجاه Voice AI و Agent OS. من الناحية التجارية ، وفقا لـ Hojo ، فإن مزيج "النموذج الكبير + Agentic OS" الذي تم تطويره بنفسه قد قدم بالفعل قدرات الصوت الأساسية لأجهزة الصوت الذكية الاصطناعية على مستوى عشرات الملايين.إذا كان هذا الرقم صحيحًا ، فهذا يعني أنه لا يبقى فقط في الأوراق أو التجريب أو القائمة ، ولكنه قد دخل بالفعل في الأجهزة الحقيقية وسيناريوهات المستخدمين الحقيقيين. من خطط هوجو الخاصة ، فإن ASR هي مجرد خطوة أولى.وهي تعمل أيضًا على TTS وتخطط لإطلاق نموذج الصوت المزدوج بالكامل في نهاية يونيو.القصة الحقيقية التي أريد أن أقولها هي بناء مجموعة كاملة من التفاعلات الصوتية حول نظام التشغيل الوكيل الشخصي: تمكين الوكيل من السمع، والفهم، والاستجابة، وفي نهاية المطاف، الدخول في سير العمل الحقيقي للعامل المعرفة. وهذه الخطط يمكن أن تنفذ، وهناك حاجة أيضا إلى المنتجات المتابعة للتحقق من صحتها.ولكن على الأقل من خلال أداء Hojo-ASR-V1 هذه المرة ، قدم بالفعل نتيجة ملحوظة بما فيه الكفاية في الحلقة الأولى من سير عمل Voice AI. فلماذا تجذب هذه المجموعة من بيانات Hojo-ASR اهتمامًا؟أو في أي سياق يقع هوجو-اسر؟ Voice AI هو خط قصة آخر خارج النموذج الكبير لشركة General ومع بدء الوكيل في سير العمل الحقيقي، سيصبح السياق الذي يحتاج إلى تلقيه أكثر تعقيداً: المناقشات في المؤتمرات، والطلبات على الهاتف، والأصوات في بيئة الموقع، وجملة إضافية مؤقتة من قبل المستخدمين، وحتى التعليمات المتغيرة باستمرار عندما يتعاون عدة أشخاص في وقت واحد. في الماضي ، كانت هذه المعلومات تعتمد بشكل رئيسي على إدخالها بالطباعة ، ولكن في العديد من سيناريوهات العمل ، لم تكن المعلومات التي تحدث بالفعل مكتوبة ، ولكن يتم التحدث عنها.

هذا هو السبب في أن الشركات الكبرى تضيف صوت AI على مدى العامين الماضيين.أطلقت OpenAI واجهة برمجة تطبيقات التطبيقات في الوقت الحقيقي ، وجوجل Gemini Live ، وجامعة العلوم والتكنولوجيا الوطنية ، وBoy Bag ، وMiniMax ، والخطوة كلها استثمرت في اتجاه الصوت.يمكن قياس حرارة هذا الحلبة في العامين الماضيين بمبلغ من المال الساخن.وفقًا لإحصاءات AssemblyAI ، حصلت الشركات الناشئة في مجال الذكاء الاصطناعي الصوتي على حوالي 2.1 مليار دولار في عام 2025 ؛ من يونيو 2025 إلى مايو 2026 ، تم الكشف عن 36 تمويلًا عامًا في مجال الذكاء الاصطناعي الحواري ، أي ما مجموعه حوالي 25. 800 مليون دولار.وباختصار الكلمة هي حار جدا.على وجه التحديد للشركة ، حصلت ElevenLabs ، التي تقوم بتركيب الصوت ، على 500 مليون دولار في الجولة D ، وتقييمها إلى 11 مليار دولار ؛ حصلت PolyAI ، التي تقوم بخدمة العملاء الهاتفية ، على 86 مليون دولار من الجولة D ؛ Retell AI ، التي تركز على المكالمات في الوقت الحقيقي ، يجب معالجة أكثر من 40 مليون مكالمة AI كل شهر ، بزيادة ربعية تزيد عن 300٪.وهناك فرق مثل كارتيسيا التي تعمل على تقليل تأخير الصوت إلى أقل من 100 مللي ثانية لجعل المحادثة تبدو أقل كارتونية.وهناك أيضا الكثير من العمل في هذا الصناع.أطلقت OpenAI واجهة برمجة تطبيقات التطبيقات في الوقت الحقيقي ، لجعل الصوت في خطة من النهاية إلى النهاية ، الصوت في الصوت ، الصوت خارج ، لم يعد ينقسم إلى ثلاثة أقسام "تحويل النص ، النموذج ، إعادة تركيب" ، والقيام بعملية كاملة في وقت واحد. Gemini Live من Google هو فكرة مماثلة ، يمكن أن تقاطع في منتصف الكلام وتستمر في الاستجابة ، كما تم تطوير Voice AI الجديد الذي يدعم Gamma4 في اليومين الأخيرين: كما يمكن أن نرى أن الصوت يتحول من "طريقة تفاعلية أكثر طبيعية" إلى مدخل للوكيل للحصول على السياق.عند وضعها في Vibe Working الشهيرة في الآونة الأخيرة ، سيكون هذا الاتجاه أكثر وضوحًا.ليس من الضروري أن يكون كل خطوة متطلبة إلى Prompt كامل.يمكنك التفكير والقول والتعديل أثناء الحوار ، مما يجعل الوكيل يلتقط النية في المحادثة ، ويستكمل السياق ، ويدفع المهام قد يكون أكثر طبيعية.في هذا الارتباط ، ASR هي القدرة من الطبقة الأولى.يقرر ما إذا كان العميل قادرًا على فهم العالم الحقيقي أولاً.إذا لم يتم الاستماع بشكل صحيح ، فإن الفهم والتخطيط والتنفيذ يمكن أن يشوه ؛ إذا تم الاستماع بشكل صحيح ، فإن الصوت يمكن أن يصبح جزءًا من سير العمل.وبصفة عامة، عندما يبدأ الوكيل في دخول الحياة اليومية ، من المحتمل أن يكون الصوت ، أو Voice AI ، هو المدخل الأول الذي يصل إليه الناس.هناك العديد من الطرق للاتصال بين الإنسان والذكاء الاصطناعي ، مثل الكتابة ، والنقطة على الواجهة ، وكتابة التعليمات البرمجية لضبط واجهة برمجة التطبيقات ، ولكن الأقرب إلى المحادثة اليومية بين الإنسان والإنسان ، أو فتح الفم.هذا هو السبب في أن الكثير من الناس يطلقون على الصوت اسم دخول السياق الخاص بالوكيل ، أو مدخل السياق.إذا كان النموذج الكبير مسؤولا عن فهم العالم ، فإن الصوت هو القناة التي يتدفق بها العالم بشكل مستمر إلى النموذج.في هذه القناة ، يلعب ASR دور الطبقة الإدراكية.وهو يحدد ما إذا كان الوكيل قادرًا على التقاط المعلومات في البيئة الخارجية بدقة ، وما إذا كان قادرًا على تحويل الأصوات في العالم الحقيقي إلى سياق يمكن للنموذج فهمه واستخدامه.من هذا المنظور ، تم تحسين نقاط المنافسة في ASR: تنافس على مدخل للجيل القادم من وكلاء الاتصال مع العالم الحقيقي. هذا أيضًا السبب في أن بيانات الكشف عن Hojo-ASR-V1 تستحق المزيد من الاهتمام. ما يعكسها ليس مجرد تغيير في نتائج النموذج.

الذكاء الاصطناعي الصوتي يتحول من كونه قدرة مساعدة إلى بنية تحتية أساسية، ويصبح طبقة أساسية مهمة جدًا في عصر الوكلاء (Agents). 🚥 عدنا إلى الذكاء الاصطناعي الصوتي. بينما تركز معظم الشركات على النماذج العامة الكبيرة، فإن مجال التعرف على الصوت، الذي يبدو هادئًا نسبيًا، يتطور بسرعة فعلاً. حتى في مجال التعرف الصوتي (ASR)، الذي طالما كان يهيمن عليه شركات كبيرة مثل OpenAI ومايكروسوفت ونيفيدا وIBM، بدأت فرق ريادية تحقق نتائج تنافسية ملحوظة. ظهور Hojo-ASR-V1 قد لا يعني تغييرًا كبيرًا في الوضع الراهن، ولكنه على الأقل يدل على أن الذكاء الاصطناعي الصوتي يتحول من كونه قدرة ثانوية إلى مكانة أكثر أهمية، ويجذب اهتمامًا متزايدًا من الناس. التعرف على الصوت هو مجرد الخطوة الأولى في تطور الذكاء الاصطناعي الصوتي؛ الأمر الأكثر أهمية والقيمة والإمكانات هو ما إذا كانت الآلات يمكنها فهم ما يتم قوله والرد بطريقة تقترب من طريقة البشر. مراجع: [1] https://huggingface.co/HojoAI/Hojo-ASR-V1: https://huggingface.co/HojoAI/Hojo-ASR-V1 [2] https://github.com/HojoAI/Hojo-ASR: https://github.com/HojoAI/Hojo-ASR المقال من حساب ويتشات العام “Crossing”, تأليف “Crossing”.

هل كان هذا مفيدًا؟

الدعم الفنيالدعم المباشر
侧栏
العودة إلى الأعلى
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR