На разогревающейся арене конкуренции в области голосового искусственного интеллекта появилась стартап-команда Hojo.
Голосовой искусственный интеллект (Voice AI) представляет собой отдельную линию развития, отличную от общих больших моделей (general large models). В то время как все сосредоточены на общих больших моделях, на относительно тихой нивелине развития голосового искусственного интеллекта также появляются новые модели, заслуживающие внимания. Клавиатура теряет свое «доминирующее положение». За последние два года OpenAI выпустила Realtime API, Google создала Gemini Live, а китайские компании, работающие с большими моделями, также начали активно развивать технологии голосового искусственного интеллекта. Все больше людей считают, что после того, как агенты (agents) действительно начнут использоваться в рабочих процессах, голос станет более естественным способом взаимодействия с системами, чем клавиатура. Чтобы агенты могли эффективно работать в рабочих процессах, им сначала необходимо научиться понимать человеческий голос. Основной навык для этого — автоматическое распознавание речи (ASR — Automatic Speech Recognition). Для оценки уровня развития технологий ASR в отрасли часто используется рейтинг Open ASR от Hugging Face, главным показателем которого является уровень ошибок распознавания слов (Word Error Rate, WER). Чем ниже этот показатель, тем точнее распознавание речи.
На протяжении долгого времени этот рейтинг был преимущественно доменом крупных компаний и ведущих исследовательских лабораторий: тренировочные данные, вычислительные ресурсы и инженерный опыт представляли собой значительные барьеры для вступления на этот рынок, и мало команд осмеливалось конкурировать с ними в этих аспектах. Недавно стартап под названием Hojo обнародовал результаты тестов по распознаванию речи, что, по-видимому, указывает на возможность его становления «черным конем» на этом рынке. Согласно официально предоставленным данным, Hojo-ASR-V1 показал хорошие результаты на нескольких публичных наборах данных для распознавания речи на английском языке.
В LibriSpeech Clean коэффициент ошибки слова (WER) составляет всего 1,74%, а в таких наборах данных, как GigaSpeech и VoxPopuli, которые более близки к реальным сценариям, он также сокращается до 8%.Они не представили списка, но если бы они поместили данные в Open ASR Leaderboard, то это было бы очень первоочередно. В целом, это модель ASR, которая продемонстрировала свою конкурентоспособность в публичных бенч-тестах.И он действительно имеет открытый исходный код на GitHub и Hugging Face, Apache-2.0 лицензии, и не существует больших ограничений на вторичное использование. 🚥 Итак, мы развернули Hojo-ASR-V1, чтобы увидеть, на каком уровне голосовая модель была создана командой малофинансового стартапа, а также рассказать о новой сюжетной линии, которая быстро нагревается в эпоху агентов: Voice AI. Что такое Hojo-ASR, мы проверили. Во-первых, Hojo-ASR-V1 открыт для HuggingFace и GitHub: Hugging Face ссылки: https://huggingface.co/HojoAI/Hojo-ASR-V1[1] Ссылки на GitHub: https://github.com/HojoAI/Hojo-ASR[2] Для начала, чтобы уточнить, что такое модель Hojo-ASR-V1, мы действительно просмотрели его код и конфигурацию, и обнаружили, что его структура сильно отличается от традиционной модели распознавания речи.
Аудиоданные сначала обрабатываются с помощью экстрактора признаков от Whisper, чтобы преобразовать их в акустические характеристики, подходящие для использования моделью, затем они вводятся в аудиокодер Qwen3-Omni. В процессе применяется структура Conformer для адаптации и сжатия данных.
В конце концов, результаты обработки передаются языковой модели Qwen3-4B, которая и формирует окончательный текст. Другими словами: Hojo-ASR-V1 представляет собой комбинацию «кодера, адаптера и крупной языковой модели». Идея использования крупной языковой модели для распознавания речи не является уникальной для компании Hojo. Это основное направление в текущем рейтинге OpenASR. Некоторые из моделей, занимающих высокие позиции в рейтинге, такие как Nvidia’s Canary-Qwen-2.5B, IBM’s Granite-Speech-3.3-8B и Microsoft’s Phi-4-Multimodal, объединяют возможности языковых моделей с системами распознавания речи, что позволяет снизить средний показатель ошибок распознавания (WER) до диапазона от 5.6% до 5.9%. Преимущество использования языковой модели заключается в том, что процесс распознавания речи не ограничивается простым преобразованием слышимых звуков в текст; модель также может использовать семантику для более точного понимания смысла сказанного. Это особенно важно при наличии шума, в устной речи, при смешивании русского и английского языков или при использовании специфической терминологии в определенной области. Модель, понимающая семантику, лучше справляется с такими задачами. Ниже приведены результаты практических тестов: мы развернули модель на локальном хосте и провели множество повторных тестов.
Практические примеры использования системы делятся на два уровня: 【1】Способности модели Hojo-ASR-V1 к автоматическому распознаванию речи (ASR – Automatic Speech Recognition). 【2】Система Hojo-TTS (Text-to-Speech). Автоматическое распознавание речи (ASR) – это процесс преобразования звука в текст. Это первый этап в целой цепочке технологий голосового искусственного интеллекта (Voice AI). Без ASR невозможны функции, такие как голосовые вводные системы в телефонах, создание стенограмм собраний, реальное время субтитрирование, а также все более популярные AI-агенты. Раньше я пользовался такими инструментами голосового ввода, как Wispr Flow и Typeless. Они обеспечивали хороший пользовательский опыт, но иногда возникали задержки из-за нестабильного соединения с интернетом, к тому же их адаптация к китайскому языку могла быть улучшена. Позже я перешел к решениям с локальным развертыванием, среди которых наиболее популярным стал открытый исходный код от OpenAI – Whisper. После выхода Hojo-ASR-V1 я заменил свой предыдущий инструмент на Hojo-ASR-V1 для личного использования. В целом, скорость распознавания и точность оказались достаточно высокими, что позволяет использовать эту систему для ежедневного голосового ввода без проблем. Конечно, для работы требуются определенные ресурсы локального оборудования, в частности, достаточное количество памяти. Вся схема несложна: в основе лежит использование Hojo-ASR-V1 в качестве движка для распознавания речи, после чего системные права позволяют управлять процессом ввода голосовых данных. После настройок система может работать практически во всех сценариях ввода текста – в браузерах, при работе с ChatGPT, Claude, Notion и других приложениях. Во время тестирования я диктовал описание «перекрестка», включая информацию о его расположении, направлении движения и происхождении названия. Весь процесс проходил без предварительной подготовки текста и без умышленного замедления темпа речи. Мне кажется интересным то, что такой рабочий процесс можно дальше расширять: после распознавания речи можно подключить другие модели, такие как DeepSeek или GPT, для доработки текста, его форматирования, исправления ошибок и оптимизации структуры.
Примерно вот как работает весь процесс: Ввод звука → Транскрипция с помощью ASR (Automatic Speech Recognition) → Оптимизация с использованием больших моделей → Прямой переход в рабочий поток. Для тех, кто часто пишет, участвует в совещаниях или сотрудничает с агентами, такой способ ввода данных более удобен, чем традиционные методы. Помимо Hojo-ASR-V1, мы также заметили, что компания Hojo вкладывает усилия в развитие технологий TTS (Text-to-Speech). На этот раз мы опробовали их модель синтеза речи, а команда также выпустила более легкую версию этой модели под названием Hojo-TTS-Light. Все это вместе составляет инструменты, предназначенные для работы с агентами. Еще одной частью серии продуктов Voice AI является система TTS. Путь к тестированию возможностей модели TTS можно найти на их официальном сайте: hojoai.com **Мультиязычный синтез речи – женский голос, легкий и бодрый** Сначала мы проверили функцию мультиязычного синтеза речи, которая является довольно распространенной среди таких моделей. Поскольку чемпионат мира по футболу скоро начнется, мы попросили модель прочитать текст с описанием игроков японской сборной на более женственном, легком голосе: Этот отрывок длиной около 30 секунд звучит довольно естественно; произношение и некоторые детали обработаны хорошо, и эффект использования искусственного интеллекта практически не заметен. Тон голоса и бодрый стиль произношения хорошо переданы. Обычно мы судим о натуральности голоса по произношению слов и тону на конце каждого слова, и в данном случае все соответствует заданному стилю. Hojo поддерживает множество языков – японский, французский, кантонский. Тот же текст, прочитанный на японском языке, звучит тоже неплохо; звучание действительно напоминает комментарии с канала NHK. **Мультиязычный синтез речи – мужской голос, магнетичный и уверенный** Эта модель TTS также позволяет изменять голосовой тон персонажа; мужской голос звучит неплохо. В следующем отрывке текста рассказывается о чемпионате мира по футболу 2026 года, и голос настроен на магнетичный, уверенный тон. Звучание полностью соответствует заданному стилю. **Мультиязычный синтез речи – аудиокниги** Модель TTS может использовать различные голосовые тони для создания аудиокниг. В этом случае текст из серии „Ниндзя из Куноити“ был прочитан мужским голосом, подходящим для аудиокниг. Звучание кажется очень естественным; при произношении таких слов, как „молодой человек“, окончания слов обработаны так, чтобы переходы между ними звучали плавно. Также правильно соблюдаются паузы между словами, что делает текст более приятным для прослушивания. **Мультиязычный синтез речи – шепот** Во время тестирования мы также проверили возможности модели для создания звука шепота. В следующем отрывке текст о фильме „Молчаливый агнец” был прочитан женским голосом, имитирующим шепот. Звучание очень реалистично: слышны даже легкий поток воздуха, дыхание и другие небольшие звуки, которые создаются при шепоте. Тон и ритм шепота хорошо сбалансированы, что делает этот вариант подходящим для создания саспенс-комментариев, рассказов или аудиоподкладок в стиле ASMR. Помимо стандартных голосовых тонов, мы также протестировали голоса персонажей с более выраженными характеристиками. Например, голос Кан Хуэя – ведущего китайских новостей. В связи с сезоном вступительных экзаменов на университеты на телевидении, радио и в социальных сетях часто можно услышать его комментарии; его произношение считается стандартным и четким. Поэтому мы взяли его аудио в качестве эталона для сравнения. Копирование тембра звука файла - Канхуэй Я отправил этот оригинальный аудиофайл в модель TTS, чтобы она воспроизвела его согласно заданному тембру и прочитала текст длиной примерно 40 секунд с пожеланиями удачи учащимся, сдающим вступительные экзамены в университет.
Эффект от использования модели TTS довольно хороший: она сохраняет особенности оригинального голоса, особенно тон, паузы и ритм речи Канхуя. С первых слов становится ясно, что голос очень похож на его собственный. Когда модель произносит фразы в духе «Не тратьте молодость впустую, стремитесь в будущее», слышен знакомый стиль новостного диктора и характер ведущего крупных мероприятий. **Нэчжа** Воссоздание тембра голоса Нэчжа является одной из наиболее заметных способностей этой модели TTS. Я использовал ее, чтобы воссоздать голос нескольких персонажей из фильма «Нэчжа: Пришествие демонического ребенка». Получившийся результат действительно похож на непокорный и ленивый характер Нэчжа; паузы в речи тоже соответствуют его образу. **Поросенок Пэгги** Тембр голоса мультяшного персонажа Поросенка Пэгги модель TTS воссоздала довольно удачно. Голос мультяшных персонажей отличается от голосов реальных людей или киноактеров, поэтому для его обработки требуются особые подходы. Вот пример речи Поросенка Пэгги, синтезированной с помощью этой модели: **МакАртур** Я даже специально записал голос комментатора по имени МакАртур, который очень популярен на платформе TikTok, и попросил его прочитать текст: «„Крестовина“ — это китайский технологический медиа-проект, посвященный волне развития искусственного интеллекта. Его основной формат — подкасты, а также есть видео, текстовые версии для публичных аккаунтов в социальных сетях и офлайн-мероприятия. „Крестовина“ — это метафора, которую Джобс использовал для описания компании Apple, говоря, что она находится на перекрестке технологий и гуманитарных ценностей, и именно здесь рождаются великие продукты. Проект следит за изменениями и возможностями, которые ИИ приносит в различные отрасли, ищет, интервьюирует и объединяет „активных действующих лиц“ эпохи ИИ, чтобы вместе исследовать и осваивать новые возможности.** **Кто такая команда Hojo?** Что касается самой команды Hojo, то это не компания, которая занимается только разработкой голосовых моделей.
Компания Hojo была основана примерно два года назад, и до этого разглашения информации о ней было мало известно. Мы связались с ее командой, чтобы получить некоторые первоисточники информации. Согласно собственному определению, Hojo стремится создать операционную систему для персональных агентов, ориентированную на работников, занимающихся созданием знаний. Проще говоря, цель состоит в том, чтобы агенты действительно стали частью повседневных рабочих процессов – работы в офисе, общения, создания контента и сотрудничества, а ASR (автоматический распознавание речи) и TTS (голосовой синтез) являются двумя ключевыми компонентами этой системы. Это также важно для понимания природы работы Hojo. ASR – это лишь первый шаг на пути к тому, чтобы агенты могли понимать реальные рабочие ситуации. Только после стабильного сбора информации с конференций, телефонных звонков, голосовых заметок и многократных дискуссий возможны последующие этапы: понимание ситуации, планирование и выполнение действий. Особенностью команды Hojo является то, что ее ключевые сотрудники долгое время работали с реальными сценариями использования голосовых технологий. Большинство участников команды пришли из компаний, занимающихся автомобильными голосовыми системами, интеллектуальными кабинами и голосовым взаимодействием, включая Xpeng, NIO Nomi и SenseTime. Что касается конкретных квалификаций сотрудников: основатель компании, Чжао Хэнъи, ранее работал в компаниях LeEco, Xpeng, NIO и SenseTime над проектами, связанными с голосовым взаимодействием, интеллектуальными кабинами, операционными системами для агентов, автомобильными голосовыми системами, мультиязычным взаимодействием, AI-приложениями и межустройственными сервисами. Главный продуктовый директор, Ли Оу, также работал в SenseTime и NIO над разработкой операционных систем для агентов, интеллектуальных кабин и планированием цифровых продуктов, сосредотачиваясь на том, как голосовые функции могут быть интегрированы в полноценный пользовательский опыт, а не ограничиваясь отдельными моделями. Генеральный директор по операциям, Сунь Сяоган, имеет опыт коммерциализации решений на основе технологий голосового взаимодействия и их внедрения в различных отраслях, включая автомобилестроение, ресторанное дело и транспорт. Совокупный опыт команды Hojo обеспечивает хорошую основу для долгосрочного решения проблем, связанных с использованием голосовых технологий в реальных сценариях. Это связано с тем, что сотрудники в основном работали с реальными условиями использования голосовых систем, которые сильно отличаются от идеальных условий лабораторных испытаний: в автомобилях присутствует шум, разные диалекты, множество говорящих людей, возможны внезапные перебивания, а также много неполных и разговорных выражений.
Користуители не говорят в соответствии со стандартными инструкциями и не ждут медленной реакции системы. Те, кто имеет опыт работы в подобных сценариях, лучше понимают, в чем заключаются настоящие трудности моделей распознавания речи: системам ASR необходимо стабильно понимать намерения людей в сложных условиях. Опыт Судана, главного научного сотрудника компании Hojo, также легче понять в этом контексте. В начале своей карьеры он участвовал в разработках систем распознавания речи в компании Baidu и стал свидетелем того, как глубокое обучение помогло перевести технологии ASR на коммерческий уровень; позже он работал в Tencent AI Lab, где занимался разработками в области речевых технологий и стал участником процесса переосмысления интерфейсов взаимодействия с пользователем с помощью больших моделей. Ценность его опыта заключается в том, что он лично стал свидетелем нескольких этапов развития технологий распознавания речи: от соревнований по точности распознавания до их применения в реальных сценариях, а затем к переосмыслению интерфейсов взаимодействия с пользователем с использованием больших моделей. Для компании, стремящейся создать Personal Agent OS, такой опыт важен, поскольку позволяет не рассматривать речевые функции просто как один из компонентов входных данных, а включать их в реальные рабочие процессы при их переработке. С точки зрения финансирования, компания Hojo уже привлекла почти 100 миллионов юаней в четырех раундах инвестиций до официального запуска своего продукта и в настоящее время находится на этапе подготовки к Pre-A раунду финансирования. Такая информация сама по себе не гарантирует успех продукта, но, по крайней мере, показывает, что первичный рынок уже обращает внимание на технологический потенциал компании в области Voice AI и Agent OS. Что касается коммерциализации, то, по словам представителей Hojo, их собственная комбинация технологий «больших моделей + Agentic OS» уже обеспечивает функции распознавания речи для десятков миллионов устройств на основе искусственного интеллекта. Если эти данные соответствуют действительности, это означает, что компания не ограничивается лишь научными исследованиями, демонстрациями или рейтингами, а действительно внедряет свои технологии в реальных устройствах и средах использования. Согласно планам компании Hojo, ASR — это лишь первый шаг. Компания также работает над технологиями TTS и планирует выпустить полностью двусторонний модель речевого взаимодействия к концу июня. Главная цель — создать полноценную систему речевого взаимодействия для Personal Agent OS, которая позволит агентам слышать, понимать и отвечать на запросы пользователей, включая их в реальные рабочие процессы. Смогут ли эти планы быть реализованы, покажут последующие продукты. Однако уже сейчас результаты работы Hojo-ASR-V1 вызывают значительный интерес на рынке Voice AI. Так почему же данные, представленные компанией Hojo, привлекли внимание? И в каких условиях развивается проект Hojo-ASR? Voice AI представляет собой еще один направление развития технологий, отдельное от общих больших моделей. Когда агенты начинают использоваться в реальных рабочих процессах, им необходимо обрабатывать все более сложный контекст: обсуждения на собраниях, запросы по телефону, звуки в реальной среде, временные дополнения пользователей и постоянно меняющиеся инструкции при совместной работе нескольких людей. Раньше для передачи этой информации использовался текстовый ввод, но во многих рабочих ситуациях важная информация передается устно, а не путем написания.
Это также объясняет, почему крупные компании увеличивают свои инвестиции в область голосового искусственного интеллекта (Voice AI) в последние два года. OpenAI выпустил Realtime API, Google разработал Gemini Live, а китайские компании iFlytek, DouBao, MiniMax и JieYue также вкладывают средства в эту сферу. Интерес к этой технологии за последние два года можно измерить по объему привлеченных инвестиций. Согласно данным AssemblyAI, в 2025 году стартапы в области голосового искусственного интеллекта привлекли примерно 2,1 миллиарда долларов в виде венчурных инвестиций; с июня 2025 по май 2026 года было объявлено о 36 финансированиях в сфере диалогового искусственного интеллекта на общую сумму около 2,58 миллиарда долларов. Одним словом, ситуация очень активная. Конкретные примеры: компания ElevenLabs, занимающаяся синтезом голоса, привлекла 500 миллионов долларов на четвертом раунде финансирования, и ее оценка достигла 11 миллиардов долларов; PolyAI, специализирующаяся на голосовом обслуживании клиентов по телефону, получила 86 миллионов долларов на четвертом раунде; Retell AI, обрабатывающая более 40 миллионов звонков в месяц, показывает рост на 300% по сравнению с предыдущим кварталом. Есть также команды, как Cartesia, которые стремятся снизить задержку передачи голосовых данных до 100 миллисекунд, чтобы разговоры звучали более плавно. Крупные компании также активно действуют в этой области: OpenAI представил Realtime API, позволяющий обрабатывать голосовые данные целиком, без необходимости разделения процесса на три этапа (перевод в текст, обработка моделью и синтез звука). Google’s Gemini Live работает по аналогичной схеме и может продолжать ответы даже если разговор прерывается. В последние дни была выпущена новая версия Voice AI под названием Gamma4. Можно видеть, что голосовой искусственный интеллект превращается из «более естественного способа взаимодействия» в инструмент, позволяющий агентам (Agents) получать необходимую информацию. Эта тенденция становится еще более заметной на фоне популярности таких инструментов, как Vibe Working. Людям не обязательно формулировать каждый запрос в виде полного запроса (prompt); они могут думать, говорить и корректировать свои запросы в процессе разговора, позволяя агентам понимать их намерения, дополнять контекст и выполнять задачи. В этом процессе ASR (Automatic Speech Recognition) играет ключевую роль – он определяет, может ли агент правильно понять реальный мир. Если агент не может точно распознать речь, последующее понимание, планирование и выполнение задач будут искажены; только точное распознавание голоса позволит голосовому искусственному интеллекту стать частью рабочего процесса. В целом, когда агенты начнут активно использоваться в повседневной жизни, голосовой искусственный интеллект, вероятно, станет первым способом их взаимодействия с людьми. Существует множество способов связи человека с искусственным интеллектом – например, печать текста, использование интерфейсов или написание кода для обращения к API, но самый естественный способ – это разговор. Именно поэтому все чаще голосовой искусственный интеллект называют инструментом для получения контекста (context entry) для агентов. Если большие модели отвечают за понимание окружающего мира, то голосовой искусственный интеллект служит каналом, через который информация из реального мира постоянно поступает в модель. В этом канале ASR играет роль сенсорного уровня: он определяет, может ли агент точно воспринимать информацию из внешней среды и преобразовывать звуковые сигналы в контекст, понятный для модели. С этой точки зрения конкуренция в области ASR повышается до нового уровня – все стремятся завоевать право на первый контакт между следующим поколением агентов и реальным миром. Это также одна из причин, по которой данные, раскрытые о Hojo-ASR-V1, заслуживают особого внимания. За ними стоит не просто изменение результатов работы модели.
Голосовой искусственный интеллект (Voice AI) переходит от роли вспомогательного инструмента к инфраструктурному компоненту, становясь все более важной основой для эпохи агентов (Agents). 🚥 Вернемся к голосовому искусственному интеллекту. В то время как большинство производителей сосредоточены на общих больших моделях (general large models), сфера голосовых технологий, которая казалась относительно тихой, на самом деле быстро развивается. Даже в такой области, как распознавание речи (ASR), долгое время доминируемой компаниями вроде OpenAI, Microsoft, NVIDIA и IBM, появляются стартапы, демонстрирующие конкурентоспособные результаты. Появление Hojo-ASR-V1 еще не означает изменения общей ситуации, но, по крайней мере, показывает, что голосовой искусственный интеллект переходит с второстепенных позиций на более важные места и привлекает все больше внимания. Распознавание речи — это лишь первый шаг в развитии голосового искусственного интеллекта. Важнее то, сможет ли машина правильно понять сказанное и ответить способом, близким к человеческому. Ссылки для дополнительной информации: [1] https://huggingface.co/HojoAI/Hojo-ASR-V1: https://huggingface.co/HojoAI/Hojo-ASR-V1 [2] https://github.com/HojoAI/Hojo-ASR: https://github.com/HojoAI/Hojo-ASR Статья опубликована в WeChat-публикации “Крестовина пересечений” (Crossing) автором “Крестовина пересечений” (Crossing).
Ссылка на статью:https://www.airai.cc/ru/news/6/
Было ли это полезно?