急成長しているVoice AIの分野に、スタートアップ企業Hojoが登場しました。
Voice AIは、汎用大モデルとは別の発展路線です。 皆が汎用大モデルに注目している中で、比較的静かなVoice AIの分野でも、注目に値する新しいモデルが登場し始めています。 キーボードはその「支配的地位」を失いつつあります。 過去2年間で、OpenAIはRealtime APIを発表し、GoogleはGemini Liveをリリースしました。国内の大規模モデル企業もほとんどがVoice AIに注力し始めています。ますます多くの人々が、エージェントが実際にワークフローに組み込まれるようになると、音声がキーボードよりも自然なコンテキスト入力手段になると信じるようになりました。 エージェントが本当にワークフローに組み込まれるためには、まずこれらの音声を理解することが必要です。そのための最初の能力として、ASR(自動音声認識)が重要です。 ASRのレベルを測る際に業界でよく引用されるのはHugging FaceのOpen ASR Leaderboardで、主要な指標はワードエラーレート(WER)です。この数値が低いほど、認識の精度が高いとされます。
長い間、このランキングは大手企業や有名な研究機関の専売特許であり、トレーニングデータ、計算能力、技術的な蓄積など、各項目にかなりのハードルがあり、小規模なチームがこの分野で直接競争することはほとんどありませんでした。 最近、Hojoというスタートアップチームが音声認識のテスト結果を公開し、まるで「ダークホース」となる傾向にあるようです。 公式に公開されたデータによると、Hojo-ASR-V1は複数の公開されている英語音声認識データセットで良い成績を収めています。
その中で、LibriSpeech Cleanの単語誤り率(WER)はわずか1.74%であり、より実際のシナリオに近いGigaSpeechやVoxPopuliなどのデータセットでも8%以下に抑えられています。彼らはランキングには参加していませんが、Open ASR Leaderboardで比較すれば非常に上位に位置するデータになるでしょう。 全体として、これは公開ベンチマークテストで競争力を示したASRモデルです。さらに、GitHubとHugging Faceでオープンソース化されており、Apache-2.0ライセンスの下で利用できるため、二次利用に大きな制限はありません。 🚥 そこで、私たちはHojo-ASR-V1を実際にデプロイして体験してみました。この控えめなスタートアップチームが作り上げた音声モデルがどのようなものかを確かめるとともに、エージェント時代が急速に盛り上がっている新しいトレンドであるVoice AIについても話していきたいと思います。 Hojo-ASRとは何か、実際にテストしてみました。 まず、Hojo-ASR-V1はHugging FaceとGitHubでオープンソース化されています: Hugging Faceのリンク: https://huggingface.co/HojoAI/Hojo-ASR-V1[1] GitHubのリンク: https://github.com/HojoAI/Hojo-ASR[2] Hojo-ASR-V1がどのようなモデルなのかを明確にするために、実際にそのコードと設定を見てみましたが、その構造は従来の音声認識モデルとは少し異なっていることがわかりました。
音声データはまずWhisperの特徴抽出器を使用して処理し、モデルが使用できる音響特徴に変換されます。その後、Qwen3-Omniの音声エンコーダに入力されます。その間にConformer構造が適応と圧縮のために使用されます。
最後に、Qwen3-4Bという言語モデルに渡され、それによって最終的なテキストが生成されます。 つまり、Hojo-ASR-V1は「エンコーダー + アダプター + 大規模言語モデル」の組み合わせです。 大規模言語モデルを使用してASR(自動音声認識)のデコードを行うというアプローチは、Hojoだけのものではありません。これは現在のOpenASRランキングのトップに位置するモデルたち、例えばNVIDIAのCanary-Qwen-2.5B、IBMのGranite-Speech-3.3-8B、MicrosoftのPhi-4-Multimodalなどが採用している主流の方法です。これらのモデルにより、平均WER(ワードエラー率)が5.6%から5.9%の範囲にまで低下しました。 言語モデルを組み込む利点は、単に「聞こえた音を文字に書き出す」だけでなく、モデルが意味を利用して判断できることです。ノイズがある場合や、口語的な表現、中国語と英語が混在している場合、あるいは特定の分野の専門用語が使われている場合でも、意味を理解しているモデルの方が話し手が何を伝えたいのかをより正確に判断できます。 以下は実際のテスト結果です。私たちはモデルをローカルにデプロイし、何度もテストを行いました。
実測ケースは2つの層に分かれています: 【1】Hojo-ASR-V1モデルのASR(自動音声認識)能力。 【2】Hojo-TTS。 ASR(Automatic Speech Recognition)とは、音声をテキストに変換する技術です。これはVoice AIチェーンの最初のステップであり、スマートフォンの音声入力機能、会議のメモ作成、リアルタイム字幕、そして今ますます人気を博しているAIエージェントなど、すべてにASRが関わっています。 以前はWispr FlowやTypelessのようなAI音声入力ツールを使用していました。これらの製品は使い心地が良かったのですが、ネットワーク状態が不安定なときには時々遅延が発生し、中国語のシナリオに対する適応も改善の余地がありました。その後、徐々にローカルデプロイメントのソリューションに移行し、中でもOpenAIがオープンソースで提供するWhisperをよく使用していました。 今回Hojo-ASR-V1がリリースされたので、実際に使用してみるために元のWhisperをHojo-ASR-V1に置き換えました。全体としての体験では、認識速度と精度がともに良好で、日常的な音声入力には十分にスムーズです。もちろん、一定のローカルハードウェアリソースが必要であり、メモリにも要求があります。 このソリューション自体は複雑ではなく、基本的にはHojo-ASR-V1を基盤とする認識エンジンとして使用し、システムレベルの権限を通じて音声入力を制御します。設定を完了すると、ブラウザ、ChatGPT、Claude、Notionなど、ほぼすべてのテキスト入力シナリオで動作します。 テスト時には、「十字路」についての説明を口頭で行いました。これにはカテゴリの位置付け、内容の方向性、名称の由来などが含まれていました。このプロセスでは事前にテキストを整理したり、意図的に話す速度を遅くしたりすることはありませんでした。 個人的に興味深いのは、このようなワークフローをさらに拡張できるという点です。認識が完了した後、DeepSeekやGPT、その他のモデルを接続して、テキストの润色(洗練)、フォーマットの整理、誤字の修正、構造の最適化を行うことができます。
おおよその流れは以下の通りです: 音声入力 → ASR(自動音声認識)によるテキストへの変換 → 大規模モデルによる最適化 → 直接にワークフローに投入されます。頻繁に文章を書いたり、会議をしたり、エージェントと協力したりする人にとって、このような使い心地は従来の入力方法よりも快適です。Hojo-ASR-V1に加えて、HojoがTTS(テキスト-to-スピーチ)分野にも力を入れていることに気づきました。今回はそのTTS音声合成モデルを体験しました。さらに、チームはより軽量なバージョンであるHojo-TTS-Lightをオープンソース化しました。これらが合わさって、エージェント向けワークフローにおけるHojoの機能を構成しています。Voice AIのもう一つの側面がTTSです。 TTSモデルの能力を体験するには、公式ウェブサイトをご覧ください: hojoai.com **多言語音声合成 – 軽快な女性の声** まず試したのは多言語音声合成で、これはTTSモデルのよく使われる機能の一つです。最近ワールドカップが始まるので、軽快な女性の声でワールドカップの日本代表選手に関する解説を読んでもらいました。 この約30秒の中国語の音声は聞きやすく、発音や細部の処理もまずまずで、AIの感じはあまりしませんでした。女性の声のトーンや軽快な口調がはっきりと聞き取れます。実際、私たちは声が自然かどうかを判断する際には、発音や各単語の終わりのトーンを聞くことが多いですが、この音声は最初に設定されたスタイルとほぼ一致していました。Hojoは日本語、フランス語、広東語など多くの言語をサポートしています。次に、同じ日本代表選手に関する解説を日本語で読んでもらいましたが、効果はまずまずで、NHKのアナウンスのように聞こえました。 **多言語音声合成 – 磁性のある落ち着いた男性の声** このTTSモデルでは異なるキャラクターの声色にも対応でき、男性の声もなかなか良かったです。次に2026年のワールドカップに関する解説を磁性のある落ち着いた男性の声で読んでもらいました。この音声は私が設定したイメージとほぼ一致していました。 **多音色音声合成 – オーディオブック** TTSモデルでは多くの声色を使用できます。今回はオーディオブックの声色で解説を読んでもらいました。このテキストは「Naruto」のテーマに関するもので、オーディオブックの男性の声で合成されています。聞き心地はとても自然で、「少年」といった単語の発音処理もスムーズでした。また、「与」といった日常会話で使う接続詞の停止も適切で、全体として聞きやすかったです。 **多音色音声合成 – ささやき** 試す際に特に注目したのはささやきの声色です。女性のささやきの声色で「Silent Lamb」という映画の紹介を読んでもらいました。この音声では、何を言っているのかははっきりと聞き取れるだけでなく、人が耳元で話すような軽い息遣いや微細な呼吸音も再現されていました。TTSモデルによるささやきは単に音量を下げるだけでなく、トーンやリズム、感情もしっかりと表現されていました。このような声色はサスペンス解説や物語のナレーション、ASMRにも適しています。 標準的なアナウンスの声色以外にも、より識別しやすいキャラクターの声色をいくつかテストしました。例えば康辉の声も試しました。 最近は大学入試の季節で、テレビやラジオ、短編動画で多くの祝福の言葉やニュースのアナウンスが聞かれます。康辉のアナウンサーの声は中国語のアナウンスでは代表的で、発音が標準的で明瞭です。そのため、康辉の音声を参考にしてテストを行いました。以下は康辉のオリジナル音声です。 ファイルのコピー音色 - 康辉 このオリジナルの音声ファイルをTTS(テキストから音声への変換)モデルに送り、その中の音色をそのまま再現してもらい、高校入試を受ける生徒たちの成功を祈る約40秒のテキストを読んでもらいました。
効果的には、TTSモデルは元の声の特徴をかなりよく保持しています。特に康辉の話し方、停止のタイミング、ニュースの読み方のリズムがよく再現されています。最初の文を聞くだけで、康辉本人に似ているとすぐにわかります。「不负青春,奔赴未来」といった言葉を読むときには、馴染みのあるニュースアナウンサーの口調や大規模イベントの司会者の感じが伝わってきます。 哪吒(ナタ) 音色の再現はTTSモデルの代表的な能力の一つです。私はいくつかのIPキャラクターの声をこのモデルで再現しましたが、まずは「哪吒之魔童降世」(ナタの魔童降臨)のナタの声から始めました。 聞くと、ナタの自由奔放で怠惰な感じがよく表現されており、停止のタイミングもほぼその状態です。 小猪佩奇(ペッパーピッグ) カートゥーンキャラクターの音色もTTSモデルでかなりうまく再現されています。カートゥーンキャラクターの声は実在の人や映画のキャラクターとは少し違うため、処理にも違いがあります。 以下はTTSモデルで合成した小猪佩奇の声です: 麦克阿瑟(マッカーサー) さらに、私は抖音(TikTok)で非常に人気のある「麦克阿瑟」の解説音声を特別に録音してもらい、彼に読んでもらいました。 「十字路口」は、AIの波に焦点を当てた国内のテクノロジーメディアで、主な形態はポッドキャストですが、ビデオや公式アカウントのテキスト版、オフラインのコミュニティイベントも展開しています。「十字路口」とはジョブズがアップル社に対して使った比喩で、テクノロジーと人文の交差点に立っていると表現しています。偉大な製品はここから生まれることが多いのです。AIが各業界にもたらす変化と機会に注目し、AI時代の「積極的な行動者」を探し、インタビューし、集めて、新しい可能性を一緒に探求し、受け入れています。 Hojoとはどのようなチームですか? Hojoチーム自体についてですが、彼らは音声大規模モデルだけを扱う会社ではありません。
ホジョは設立から約2年が経ち、今回の情報公開まで、外部からの認知はほとんどありませんでした。そこで、私たちは彼らのチームに連絡を取り、いくつかの第一手の情報を得ました。 ホジョ自身の位置づけによると、彼らが目指しているのは知識労働者向けのパーソナルエージェントOS(Personal Agent OS)です。簡単に言えば、エージェントをオフィス業務、コミュニケーション、創作、協力といった日常のワークフローに実際に組み込むことであり、ASR(自動音声認識)とTTS(テキスト読み上げ)はこのシステムの中で重要な要素です。 これがホジョを理解する鍵です。ASRは、エージェントが実際の仕事の場面を理解するための第一歩に過ぎません。会議、電話、音声メモ、複数人の議論などの情報を安定して受け取ることができなければ、その後の理解、計画、実行は成り立ちません。 チームの背景を見ると、ホジョの特徴的な点は、その核心メンバーが長期にわたって「実際の音声環境」に取り組んできたことです。チームメンバーは主に、小鵬(Xpeng)、蔚来Nomi(NIO)、商湯(SenseTime)などの車載音声やインテリジェントコックピット、音声インタラクション関連のチーム出身です。 具体的には、創業者の趙恒藝(Zhao Hengyi)は以前、楽視(LeEco)、小鵬、蔚来、商湯などのチームで音声インタラクション、インテリジェントコックピット、AgentOSに関連する仕事を担当し、車載音声、インテリジェントコックピット、多言語インタラクション、AIによる自動操作アプリケーション、クロスデバイスサービスなどに携わっていました。 チーフプロダクトオフィサーの李欧(Li Ou)は以前、商湯などのチームでAgentOS、インテリジェントコックピット、デジタル製品の計画を担当し、音声機能をどのように完全な製品体験に組み込むかに注力していました。COOの孫晓刚(Sun Xiaogang)はエージェントソリューションの商業化や業界での実装に経験があり、車載、飲食、移動などのシナリオでの音声インタラクションソリューションに参加しています。 これらの経歴を合わせて見ると、ホジョチームの共通の経験は、実際の環境での音声問題を長期にわたって扱う上での信頼性のあるバックグラウンドを持っています。 これは主に、これらのチームメンバーがASRをより現実的な環境で使ってきたからです。車内にはノイズがあり、方言があり、複数人が話し、途中で話が遮られたり、不完全で口語的な表現が多いといった、実験室のクリーンな音声環境とは異なる状況があります。
ユーザーは標準的なプロンプトに従って話すことはなく、システムがゆっくりと反応するのを待つこともありません。このようなシナリオを経験した人なら、音声モデルが本当に直面している困難をより理解できるでしょう。ASR(自動音声認識)は、複雑な環境の中で人の意図を安定して理解する必要があります。 Hojoのチーフサイエンティストであるスダンの経歴も、この文脈の中でより理解しやすくなります。彼は若い頃に百度で音声認識の研究開発に携わり、深層学習を用いてASRを商業化する段階を経験しました。その後、腾讯AI Labで音声関連の分野を担当し、大規模なモデルが音声インタラクションを再構築する時代に遭遇しました。 この経歴の価値は、彼が音声技術が認識精度の競争から実際のシナリオへの適用、そして大規模モデル時代の音声インタラクションの再構築という、いくつかの変化を経験してきたことにあります。Personal Agent OSを目指す企業にとって、このような経験は、音声を単なる入力コンポーネントとして扱うのではなく、実際のワークフローに組み込んで再設計することが重要であることを意味しています。 資本面では、Hojoは製品が正式に大規模にリリースされる前に、これまでに約1億元の4回の資金調達を完了しており、現在はPre-Aラウンドを進めています。このような情報だけでは製品の成功を直接証明することはできませんが、少なくとも一次市場がこの企業のVoice AIおよびAgent OS分野での技術的な蓄積に注目していることを示しています。 商業化の観点から見ると、Hojoが独自に開発した「大規模モデル+Agentic OS」の組み合わせは、すでに数千万台のAI音声デバイスに基盤となる音声機能を提供しています。もしこの数字が事実であれば、それは単なる論文やデモ、ランキングにとどまらず、実際のデバイスやユーザーのシナリオに進出していることを意味します。 Hojo自身の計画によると、ASRはまだ第一歩に過ぎません。彼らはTTS(テキストから音声への変換)も開発中であり、6月末には全双方向の音声モデルをリリースする予定です。彼らが本当に伝えたいのは、Personal Agent OSを中心に一連の音声インタラクションの基盤を構築することです。つまり、エージェントが聞くことができ、理解でき、応答できるようにし、最終的には知識労働者の実際のワークフローに組み込むことです。 これらの計画が実現するかどうかは、今後の製品によって検証される必要があります。しかし、少なくともHojo-ASR-V1のパフォーマンスから見ると、Voice AIワークフローの第一段階で十分に注目に値する結果を出しています。 では、なぜHojo-ASRのこれらのデータが注目を集めたのでしょうか?また、Hojo-ASRはどのような背景の下にあるのでしょうか? Voice AIは、汎用の大規模モデルとは別の物語です。 エージェントが実際のワークフローに入るにつれて、受け取るコンテキストはますます複雑になります。会議での議論、電話での要求、現場の音声、ユーザーが突然追加する一言、さらには複数人が同時に協力する際に絶えず変化する指示などです。 過去にはこれらの情報は主にタイピングによって入力されていましたが、多くのワークシナリオでは、実際に発生する情報は書かれたものではなく、話されたものです。
これが大手企業がここ2年間、Voice AIに力を入れている理由です。OpenAIはRealtime APIを発表し、GoogleはGemini Liveを開発し、国内の科大訊飛(iFlytek)、豆包(DouBao)、MiniMax、階跃(JieYue)も音声分野に投資を続けています。この分野の熱さは、ここ2年間に投じられた熱い資金で測ることができます。AssemblyAIの統計によると、2025年には音声関連のAIスタートアップが約21億ドルのベンチャーキャピタルを調達しました。2025年6月から2026年5月の1年間で、対話型AI分野で公開された資金調達は36件あり、合計で約25.8億ドルでした。一言で表せば、「非常に熱い」状況です。具体的な企業例としては、音声合成を行うElevenLabsはDラウンドで5億ドルを調達し、評価額は110億ドルに達しました。電話カスタマーサービス用の音声を提供するPolyAIは8600万ドルのDラウンドを調達しました。リアルタイム通話を専門とするRetell AIは、毎月4000万件以上のAI通話を処理し、四半期ごとの成長率は300%を超えています。また、Cartesiaのようなチームは、音声の遅延を100ミリ秒以下に抑え、会話のカクつきを減らす技術を開発しています。大手企業も積極的な動きを見せており、OpenAIはRealtime APIを発表し、音声をエンドツーエンドのソリューションとして提供しています。音声の入力から出力までを「テキストへの変換、モデルへの送信、再合成」という3つのステップに分けずに、一度に処理します。GoogleのGemini Liveも同様のアプローチで、話し途中で中断されても続けて応答できます。最近ではGamma4をサポートする新しいVoice AIもリリースされました。 これにより、音声は「より自然なインタラクション方法」として、エージェントがコンテキストを取得するための手段になりつつあります。最近流行しているVibe Workingの文脈では、この傾向がさらに明らかになります。ユーザーは必ずしも各ステップの要求を完全なプロンプトに整理する必要はありません。考えながら話し、調整しながら話すことができれば、エージェントは会話の中で意図を捉え、コンテキストを補完し、タスクを進めることができ、より自然なやり取りが可能になります。このプロセスにおいて、ASR(自動音声認識)は最初のステップです。ASRが現実世界の音声を正確に理解できるかどうかが、後続の理解、計画、実行の正確さを決定します。正確に聞き取れなければ、音声はワークフローの一部になり得ません。要するに、 エージェントが日常生活に浸透するにつれて、音声、つまりVoice AIは人々がエージェントと接触する最初の手段になる可能性が高いです。人とAIの接続方法にはタイピング、インターフェースの操作、コードの記述などがありますが、人と人との日常会話に最も近いのはやはり話すことです。これが、ますます多くの人々が音声をエージェントの「コンテキストエントリー(context entry)」、つまりコンテキストの入り口と呼ぶ理由です。大規模なモデルが世界を理解する役割を果たすならば、音声は世界からモデルへの情報の流入チャネルです。そしてこのチャネルにおいて、ASRは感知層としての役割を果たします。ASRが外部環境の情報を正確に捉え、現実世界の音声をモデルが理解し利用できるコンテキストに変換できるかどうかが重要です。この観点から見ると、ASRの競争は新たな次元に進んでいます: 次世代のエージェントが現実世界と接続するための入り口を争っています。 これもまた、Hojo-ASR-V1の公開データがより注目に値する理由です。それには単にモデルの成績の変化だけが反映されているわけではありません。
Voice AIは補助機能からインフラストラクチャへと進化しており、エージェント時代においてますます重要な基盤となっています。 🚥 Voice AIについて話しましょう。多くの企業が汎用の大規模モデルに注目している中で、比較的静かだった音声分野も実は急速に進化しています。長期にわたりOpenAI、Microsoft、NVIDIA、IBMなどの大手企業が主導してきたASR(音声認識)の分野で、スタートアップチームが競争力のある成果を上げ始めています。 Hojo-ASR-V1の登場は、市場の構造が変わったことを必ずしも意味するわけではありませんが、少なくともVoice AIが周辺的な機能からより重要な位置へと移行しており、ますます多くの人々がこの分野に注目を集め始めていることを示しています。 音声認識はVoice AIの第一歩に過ぎません。機械が正確に音声を認識した後、人間に近い方法で理解し、応答できるかどうかが、より長期的で価値があり、大きな可能性を秘めた課題です。 参考資料: [1] https://huggingface.co/HojoAI/Hojo-ASR-V1:https://huggingface.co/HojoAI/Hojo-ASR-V1 [2] https://github.com/HojoAI/Hojo-ASR:https://github.com/HojoAI/Hojo-ASR この記事は微信公式アカウント「十字路口Crossing」からのもので、著者は「十字路口Crossing」です。
役に立ちましたか?