菜單

正在升溫的 Voice AI 賽道,出現了一家初創團隊 Hojo

Voice AI,是通用大模型之外的另一條故事線。 當所有人都在盯著通用大模型時,Voice AI 這條相對安靜的賽道里,也開始出現一些值得注意的新模型。 鍵盤正在失去它的「統治地位」。 過去兩年,OpenAI 推出了 Realtime API,Google 做出了 Gemini Live,國內的大模型公司也幾乎都開始佈局 Voice AI。越來越多的人開始相信,當 Agent 真正進入工作流之後,語音會成為比鍵盤更自然的上下文入口。 如果 Agent 想真正進入工作流,它首先要學會聽懂這些聲音。而這背後對應的第一層能力,就是 ASR(自動語音識別)。 衡量 ASR 水平,業內最常引用的是 Hugging Face 的 Open ASR Leaderboard,核心指標是詞錯誤率(WER),數字越低,識別越准。

長期以來,這個榜單基本是大廠和明星實驗室的主場,訓練數據、算力、工程積累,每一項都有比較大的門檻,很少有小團隊敢在這個維度上正面競爭。 最近,一家名為 Hojo 的創業團隊公開披露了一組語音識別測試結果,似乎有成為「黑馬」的趨勢。 根據官方公佈的數據,Hojo-ASR-V1 在多個公開英文語音識別數據集上取得了不錯的成績。

其中,LibriSpeech Clean 上詞錯誤率(WER)只有 1.74%,在更接近真實場景的 GigaSpeech、VoxPopuli 等數據集上,也都壓縮進了 8% 以內。他們沒有提交榜單,但如果把數據放進 Open ASR Leaderboard 對比,會是一個非常前列的數據。 總的來看,這是一款在公開基準測試中展現出競爭力的 ASR 模型。而且它確實開源在了 GitHub 和 Hugging Face,Apache-2.0 許可證,二次使用沒有太大限制。 🚥 於是,我們把 Hojo-ASR-V1 部署起來實際體驗一遍,看看這家低調創業團隊做出來的語音模型到底是甚麼水平,也順著它聊聊 Agent 時代正在快速升溫的一條新故事線:Voice AI。 Hojo-ASR 到底是甚麼,我們實測了一下 首先,Hojo-ASR-V1 開源到了 HuggingFace 和 GitHub : Hugging Face 鏈接: https://huggingface.co/HojoAI/Hojo-ASR-V1[1] GitHub 鏈接: https://github.com/HojoAI/Hojo-ASR[2] 先說清楚 Hojo-ASR-V1 是個甚麼模型,我們實際看過了它的代碼和配置後,發現它的結構和傳統的語音識別模型不太一樣。

 音頻先用 Whisper 的特徵提取器處理一遍,轉成模型能用的聲學特徵,接著輸入到 Qwen3-Omni 的音頻編碼器,中間用一個 Conformer 結構做適配和壓縮;

最後,被交給一個 Qwen3-4B 的語言模型,由它來寫出最終的文字。 換句話說: Hojo-ASR-V1 是一個「編碼器 + 適配器 + 大語言模型」的組合。 用大語言模型來做 ASR 解碼的思路,並不是 Hojo 一家獨有。這正是當下 OpenASR 榜單頂部的主流方向。目前榜單上排名很靠前的幾個模型,比如英偉達的 Canary-Qwen-2.5B、IBM 的 Granite-Speech-3.3-8B、微軟的 Phi-4-Multimodal 都是把語言模型的能力接進語音識別里,平均 WER 降低到了 5.6% 到 5.9% 這個區間。 把語言模型放進來的好處在於,識別不光是「聽到甚麼音、寫下甚麼字」,模型還能借助語義去判斷。遇到噪聲、口語化的表達、中英文混著說、或者某個領域的專業詞,一個懂語義的模型更容易判斷出說話人想表達甚麼。 下面是實測部分,我們把模型部署到了本地,前後跑了好多輪。 

 實測案例,分為兩層: 【1】Hojo-ASR-V1 模型的 ASR 能力。 【2】Hojo-TTS。 ASR ASR 的全稱是 Automatic Speech Recognition,也就是自動語音識別。 它負責把聲音轉換成文字,是整個 Voice AI 鏈路里的第一步。無論是手機語音輸入法、會議紀要、實時字幕,還是今天越來越火的 AI Agent,背後都離不開 ASR。 我之前一直是 Wispr Flow、Typeless 這類 AI 語音輸入工具的用戶。 這類產品體驗不錯,但網絡狀態不穩定時偶爾會有延遲,對中文場景的適配也還有提升空間。後來我逐漸轉向本地部署方案,其中用得最多的是 OpenAI 開源的 Whisper。 這次 Hojo-ASR-V1 發佈後,為了實際體驗下,我把原來的 Whisper 替換成了 Hojo-ASR-V1。 整體體驗下來,識別速度和準確率都不錯,作為日常語音輸入已經足夠流暢。當然,代價是需要一定的本地硬件資源,對內存有一定要求。 整個方案並不複雜,本質上就是用 Hojo-ASR-V1 作為底層識別引擎,再通過系統級權限接管語音輸入。完成配置後,它可以在瀏覽器、ChatGPT、Claude、Notion 等幾乎所有文本輸入場景中工作。 測試時,我直接口述了一段關於「十字路口」的介紹,包括欄目定位、內容方向以及名稱由來等內容。整個過程沒有提前整理文本,也沒有刻意放慢語速: 我個人覺得有意思的是,這類工作流還可以繼續擴展。識別完成後,可以再接入 DeepSeek、GPT 或其他模型,對文本進行潤色、格式整理、錯別字修正和結構優化。

 大概整體的流程是這樣的: 聲音輸入 → ASR 轉寫 → 大模型優化 → 直接進入工作流。 對於經常寫作、開會或者與 Agent 協作的人來說,這種體驗比傳統輸入法更舒服些。 除了 Hojo-ASR-V1,我們也注意到 Hojo 在 TTS 方向同樣有所投入。我們這次體驗了它的 TTS 語音合成模型,另外,團隊還開源了一個更輕量的版本 Hojo-TTS-Light。這些共同構成了 Hojo 面向 Agent 工作流的回答。 Voice AI 的另一塊拼圖:TTS 我們體驗 TTS 模型能力的路徑是其官網: hojoai.com 多語言語音合成-輕快女性 先測的是多語言語音合成,這算是 TTS 模型一個比較常用的功能。 最近世界杯快開打了,我就讓其用一個輕快點的女聲,念了一段介紹世界杯日本隊球員的解說稿: 這段大概 30 秒的中文聽下來挺順的,咬字和一些細節都處理得還行,AI 感不太明顯。女聲的聲調、輕快的口吻,都能聽出來。其實我們平時判斷一個聲音自不自然,一般就聽它的咬字,還有每個詞收尾時的聲調,這段基本和一開始設定的風格是能對齊的。 測下來 Hojo 支持的語言不少,日語、法語、粵語都行。 下面還是同一段日本隊的介紹稿,換成日語來念,效果也還可以,聽著確實有點像 NHK 的播報,挺有既視感: 多語言語音合成-磁性穩重男性 這個 TTS 模型也能換不同的角色音色,男聲聽下來也還行。 下面這段還是介紹 2026 年世界杯的稿子,我把音色設成了磁性、穩重的男聲。 這段聽下來,和我提示詞里設的基本一致。 多音色語音合成-有聲書  TTS 模型能用的音色比較多。這回我讓它用有聲書的音色念一段。這段文字是火影忍者的一段主題介紹,用有聲書的男聲來合成的。 聽下來挺自然的。念到「少年」這類詞的時候,尾音處理得讓前後銜接很順暢。還有像「與」這種我們平時說話會用的連詞,它停頓也卡得比較准,這也是整段聽著順的一個原因。 多音色語音合成-耳語 測的時候還有個音色想單獨說一下,就是耳語。 下面這段我用女性耳語的音色,念了一段《沈默的羔羊》的電影介紹: 這段你能聽清在說甚麼,同時它還把人湊到耳邊說話時很輕的氣流、細微的呼吸聲和輕音都模擬出來了。聽下來, TTS 模型的耳語不是單純把音量調小,語氣、節奏和情緒也都還不錯。這種音色拿來做懸疑解說、故事旁白、ASMR 都比較合適。 除了標準播報音色之外,我還測試了一些辨識度更高的角色音色。 康輝 最近是高考季,電視、廣播還有短視頻上,能聽到不少祝福語和新聞播報。央視主播的聲音在中文播報里算是比較有代表性的,發音標準、吐字清楚。 所以這回我挑了一段康輝的音頻當參考,下面這段就是康輝的原音頻。 文件複製音色-康輝 我把這段原音頻發給 TTS 模型,讓它照著裡面的音色復刻,念一段大概 40 秒、祝高考學子順利的稿子。

 效果上, TTS 模型把原來聲線的特點保留得還不錯,尤其是康輝的語氣、停頓和播報節奏。第一句一出來,就能聽出來跟康輝本人挺像。像念到「不負青春,奔赴未來」這類話的時候,熟悉的新聞播報腔和大型活動的主持感,都能聽出來。 哪吒 音色復刻算是 TTS 模型比較有代表性的能力。我拿它復刻了幾個 IP 角色的聲音,先是《哪吒之魔童降世》里的哪吒。 聽下來挺接近哪吒不羈、慵懶的感覺,停頓也差不多是這個狀態。 小豬佩奇 卡通角色的音色, TTS 模型復刻得也還行。卡通角色的聲音跟真人、電影角色不太一樣,處理起來也有點區別。 下面這段就是我用 TTS 模型合成的小豬佩奇: 麥克阿瑟 甚至,我還專門錄了一段抖音上很火的「麥克阿瑟」解說語音,讓他念了一遍: 「十字路口」是國內一檔聚焦 AI 浪潮的科技自媒體,核心形態是播客,同時延伸出視頻、公眾號文字版和線下社群活動。「十字路口」是喬布斯對蘋果公司的一個比喻,形容它站在科技與人文的十字路口,偉大的產品往往誕生在這裡。關注 AI 給各行各業帶來的變革與機會,尋找、訪談和凝聚 AI 時代的「積極行動者」,和他們一起探索和擁抱新的可能性。 Hojo 這個團隊是誰 回到 Hojo 團隊本身,它並不是一家只做語音大模型的公司。

Hojo 成立大約兩年,在這次披露信息之前,外界對它的瞭解很少。因為,我們聯繫了其團隊,獲取了一些一手信息。 按照 Hojo 自己的定位,它更想做的是面向知識工作者的 Personal Agent OS。簡單說,就是讓 Agent 真正進入辦公、溝通、創作、協作這些日常工作流,而 ASR 和 TTS 則是這套系統里的 2 塊關鍵拼圖。 這也是理解 Hojo 的關鍵。ASR 其實只是 Agent 聽懂真實工作場景的第一層底座。只有先把會議、電話、語音備忘、多人討論里的信息穩定地接受到位,後面的理解、規劃、執行才有可能成立。 從團隊背景看,Hojo 比較特殊的一點是,它的核心成員長期和「真實語音場景」打交道。團隊成員多來自車載語音、智能座艙和語音交互相關團隊,包括小鵬、蔚來 Nomi、商湯等。 具體點說的話,創始人趙恆藝此前曾在樂視、小鵬、蔚來和商湯等團隊負責語音交互、智能座艙和 AgentOS 相關工作,做過車載語音、智能座艙、多語言交互、AI 自主操作應用和跨設備服務。 首席產品官李歐此前在商湯、蔚來等團隊負責 AgentOS、智能座艙和數字產品規劃,關注的是語音能力如何被組織成完整產品體驗,而不是停留在單點模型能力上。COO 孫曉剛則有 Agent 解決方案、語音交互商業化和行業落地經驗,參與過車載、餐飲、出行等場景中的語音交互方案。 把這些履歷放在一起看,Hojo 團隊的共同經驗對於長期處理真實場景中的語音問題是有背景背書的。 這主要也是因為這些團隊成員基本都聚焦於 ASR 比較現實的環境里,這些場景和實驗室里的乾淨音頻很不一樣。車里有噪聲,有方言,有多人說話,有臨時打斷,也有大量不完整、口語化的表達。

用戶不會按照標準 Prompt 說話,也不會等系統慢慢反應。做過這類場景的人,更容易理解語音模型真正難的地方,ASR 需要在複雜環境里穩定理解人的意圖。 Hojo 的首席科學家蘇丹的經歷也放在這個脈絡里更容易理解。他早年在百度參與語音識別相關研發,經歷過深度學習把 ASR 推向商業化落地的階段;後來在騰訊 AI Lab 負責語音相關方向,又趕上了大模型重新改寫語音交互的階段。 這條履歷的價值所在是他本人連續經歷了語音技術從識別準確率競爭,到真實場景落地,再到大模型時代語音交互重構的幾次變化。對一家想做 Personal Agent OS 的公司來說,這種經驗決定了它不會只把語音看成一個輸入組件,放進真實工作流里重新設計才是關鍵。 資本層面,Hojo 在產品還沒有正式大規模面世的情況下,成立至今已經完成接近一億元人民幣的 4 輪融資,目前正在進行 Pre-A 輪。這類信息不能直接證明產品一定成功,但至少說明一級市場已經開始關注這家公司在 Voice AI 和 Agent OS 方向上的技術積累。 商業化方面,據 Hojo 介紹,它自研的「大模型 + Agentic OS」組合,已經為千萬量級的 AI 聲音設備提供底層語音能力。如果這個數字屬實,說明它不是只停留在論文、Demo 或榜單上,而是已經進入了真實設備和真實用戶場景。 從 Hojo 自己的規劃看,ASR 只是第一步。它同時還在做 TTS,並計劃在 6 月底推出全雙工語音模型。真正想講的故事,是圍繞 Personal Agent OS 搭建一整套語音交互底座:讓 Agent 能聽見、能理解、能回應,並最終進入知識工作者的真實工作流。 這些規劃能不能兌現,還需要後續產品來驗證。但至少從這次 Hojo-ASR-V1 的表現看,它已經在 Voice AI 工作流的第一環上,交出了一份足夠引人注意的結果。 那,Hojo-ASR 的這組披露數據為甚麼會吸引到關注?或者說 Hojo-ASR 處在一種怎樣的背景之下? Voice AI,是通用大模型之外的另一條故事線 當 Agent 開始進入真實工作流,它需要接收的上下文會越來越複雜:會議里的討論、電話里的需求、現場環境里的聲音、用戶臨時補充的一句話,甚至多人同時協作時不斷變化的指令。 過去這些信息主要靠打字輸入,但在很多工作場景里,真正發生的信息並不是寫出來的,而是說出來的。

 這也是為甚麼大廠這兩年都在加碼 Voice AI。OpenAI 推出 Realtime API,Google 做 Gemini Live,國內的科大訊飛、豆包、MiniMax、階躍也都在語音方向投入。 這條賽道這兩年的熱度,可以用一筆筆熱錢來衡量。根據 AssemblyAI 統計,2025 年語音類 AI 創業公司拿到的風險投資大約有 21 億美元;從 2025 年 6 月到 2026 年 5 月這一年里,對話式 AI 領域公開披露的融資有 36 筆,合計約 25.8 億美元。 一個詞總結,就是非常熱。 具體到公司,做語音合成的 ElevenLabs 在 D 輪拿了 5 億美元,估值到了 110 億美元;做電話客服語音的 PolyAI 拿了 8600 萬美元的 D 輪;主打實時通話的 Retell AI,每個月要處理 4000 多萬通 AI 電話,季度環比增長超過 300%。還有像 Cartesia 這樣的團隊,專門去把語音的延遲降到 100 毫秒以內,讓對話聽起來卡頓感更低。 大廠這邊動作也非常多。OpenAI 推出了 Realtime API,把語音做成端到端的方案,聲音進、聲音出,中間不再分成「轉文字、過模型、再合成」三段,一次走完全流程。 Google 的 Gemini Live 是類似思路,能在你話說到一半時被打斷,再接著回應,這兩天也上新了 Gamma4 支持的 Voice AI : 可以看得出來,語音正在從一個「更自然的交互方式」,變成 Agent 獲取上下文的入口。 放到最近流行的 Vibe Working 里,這個趨勢會更明顯。人不一定要把每一步需求都整理成完整 Prompt。可以邊想、邊說、邊調整,讓 Agent 在對話中接住意圖、補全上下文、推進任務,這種可能才會更自然些。 在這條鏈路里,ASR 是第一層能力。它決定 Agent 能不能先聽懂真實世界。聽不准,後面的理解、規劃、執行都會失真;聽得准,語音才可能真正成為工作流的一部分。 總的來說: 當 Agent 開始進入日常生活,語音,也就是 Voice AI 很可能是它接觸人的第一道入口。人和 AI 連接的方式有很多種,比如打字、點界面、寫代碼就去調 API,但最接近人與人日常對話的,還是開口說話。 這也是為甚麼越來越多人把語音稱為 Agent 的 context entry,也就是上下文入口。如果說大模型負責理解世界,那麼語音就是世界持續流入模型的通道。 而在這條通道里,ASR 扮演著感知層的角色。它決定 Agent 能否準確捕捉外部環境中的信息,能否把現實世界里的聲音轉化為模型可以理解和利用的上下文。 從這個角度看,ASR 的競爭點已經升維了: 爭奪下一代 Agent 與真實世界連接的入口。 這也是 Hojo-ASR-V1 的披露數據更值得關注的原因。它背後反映的並不單單只是一個模型成績的變化。 

 Voice AI 正在從輔助能力走向基礎設施,成為 Agent 時代越來越重要的一層底座。 🚥 回到 Voice AI。當大部分廠商的注意力都集中在通用大模型上時,語音這條相對安靜的賽道其實已經在快速演進。就在 ASR 這樣一個長期由 OpenAI、微軟、英偉達、IBM 等大廠主導的領域里,開始有創業團隊交出頗具競爭力的成績。 Hojo-ASR-V1 的出現,未必意味著格局已經改變,但至少說明 Voice AI 正在從邊緣能力走向更重要的位置,並吸引越來越多的人重新關注這條賽道。 語音識別只是 Voice AI 的第一步,機器聽准了之後,能不能理解、能不能用接近人的方式回應,才是更長、更有價值、更高潛的故事。 參考資料 [1]https://huggingface.co/HojoAI/Hojo-ASR-V1:https://huggingface.co/HojoAI/Hojo-ASR-V1 [2]https://github.com/HojoAI/Hojo-ASR:https://github.com/HojoAI/Hojo-ASR 文章來自於微信公眾號 「十字路口Crossing」,作者 「十字路口Crossing」

有用嗎?

技術支持在線客服
側欄
返回頂部
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR