Menu

Đường đua Voice AI đang nóng lên, xuất hiện một nhóm khởi nghiệp Hojo

Voice AI là một câu chuyện khác ngoài mô hình lớn của GM. Trong khi tất cả mọi người đều nhìn chằm chằm vào các mô hình lớn của GM, Voice AI cũng bắt đầu xuất hiện một số mô hình mới đáng chú ý trên đường đua tương đối yên tĩnh này. Bàn phím đang mất đi "trị thế thống trị" của nó. Hai năm qua, OpenAI đã ra mắt API thời gian thực, Google đã thực hiện Gemini Live, hầu như tất cả các công ty mô hình lớn trong nước cũng bắt đầu bố trí AI giọng nói. Ngày càng có nhiều người tin rằng một khi Agent thực sự đi vào dòng công việc, giọng nói sẽ trở thành một lối vào ngữ cảnh tự nhiên hơn so với bàn phím. Nếu một Agent muốn thực sự tham gia vào dòng công việc, trước tiên nó phải học cách hiểu những âm thanh này. Khả năng đầu tiên đằng sau nó là ASR (Automatic Speech Recognition). Để đo lường mức độ ASR, ngành công nghiệp thường được trích dẫn nhất là Open ASR Leaderboard của Hugging Face, chỉ số cốt lõi là tỷ lệ lỗi từ (WER), con số càng thấp, nhận dạng càng chính xác.

Từ lâu, danh sách này về cơ bản là sân nhà của nhà máy lớn và phòng thí nghiệm của ngôi sao, dữ liệu huấn luyện, sức toán, kỹ thuật tích lũy, mỗi một mục đều có ngưỡng cửa tương đối lớn, rất ít có đội nhỏ dám cạnh tranh trực tiếp trên chiều kích này. Gần đây, một nhóm khởi nghiệp có tên Hojo đã công bố một loạt các kết quả thử nghiệm nhận dạng giọng nói, dường như có xu hướng trở thành một con ngựa đen. Theo các dữ liệu chính thức, Hojo-ASR-V1 đã đạt được kết quả tốt trên một số bộ dữ liệu nhận dạng giọng nói tiếng Anh công khai.

Trong số đó, tỷ lệ lỗi từ (WER) trên LibriSpeech Clean chỉ là 1,74% và trên các tập dữ liệu gần với cảnh thực hơn như GigaSpeech và VoxPopuli, nó cũng được nén xuống dưới 8%. Họ không đưa ra bảng xếp hạng, nhưng nếu bạn đưa dữ liệu vào bảng xếp hạng Open ASR, nó sẽ là một số liệu rất dẫn đầu. Nhìn chung, đây là một mô hình ASR đã chứng minh khả năng cạnh tranh trong các bản so sánh công khai. Và nó có nguồn mở trên GitHub và Hugging Face, giấy phép Apache-2.0 và không có nhiều hạn chế về việc sử dụng thứ hai. 🚥 Vì vậy, chúng tôi đã triển khai Hojo-ASR-V1 để trải nghiệm thực tế, xem mô hình giọng nói của nhóm khởi nghiệp thấp này là gì, và nói chuyện với nó về một câu chuyện mới đang nóng lên nhanh chóng trong thời đại Agent: Voice AI. Hojo-ASR là gì, chúng ta đã thử nghiệm Đầu tiên, Hojo-ASR-V1 được mở nguồn cho HuggingFace và GitHub: Liên kết Hugging Face: https://huggingface.co/HojoAI/Hojo-ASR-V1[1] Liên kết GitHub: https://github.com/HojoAI/Hojo-ASR[2] Trước tiên, hãy nói rõ mô hình Hojo-ASR-V1 là gì, sau khi chúng tôi thực sự xem mã và cấu hình của nó, chúng tôi thấy cấu trúc của nó không giống với mô hình nhận dạng giọng nói truyền thống.

Âm thanh đầu tiên được xử lý bằng bộ trích xuất đặc điểm của Whisper, chuyển thành các đặc điểm âm thanh có thể được sử dụng bởi mô hình, sau đó được nhập vào bộ mã hóa âm thanh của Qwen3-Omni, giữa sử dụng một cấu trúc Conformer để điều chỉnh và nén;

Cuối cùng, họ được giao cho một mô hình ngôn ngữ Qwen3-4B để viết văn bản cuối cùng. Nói cách khác, đây là: Hojo-ASR-V1 là một sự kết hợp của bộ mã hóa + bộ chuyển đổi + mô hình ngôn ngữ lớn. Ý tưởng sử dụng mô hình ngôn ngữ lớn để giải mã ASR không phải là duy nhất của gia đình HojoĐây chính là xu hướng chính của danh sách OpenASR hiện tại. Hiện tại, một số mô hình đứng đầu trong danh sách, chẳng hạn như Canary-Qwen-2.5B của Nvidia, Granite-Speech-3.3-8B của IBM, Phi-4-Multimodal của Microsoft đều kết nối khả năng của mô hình ngôn ngữ vào nhận dạng giọng nói, giảm WER trung bình xuống khoảng 5,6% đến 5,9%. Lợi ích của việc đưa mô hình ngôn ngữ vào đó là nhận dạng không chỉ là "nghe thấy âm thanh gì, viết ra từ nào", mà mô hình còn có thể sử dụng ngữ nghĩa để phán đoán. Khi gặp tiếng ồn, biểu hiện bằng cách nói, tiếng Trung và tiếng Anh pha trộn, hoặc từ chuyên môn trong một lĩnh vực nào đó, một mô hình hiểu ngữ nghĩa sẽ dễ dàng nhận ra những gì người nói muốn thể hiện. Dưới đây là phần thử nghiệm, chúng tôi triển khai mô hình ở địa phương, chạy nhiều vòng trước và sau.

Các trường hợp thực tế được chia thành hai tầng: [1] Khả năng ASR của mô hình Hojo-ASR-V1. [1] Hojo-TTS. ASR (Tổng hợp tác) ASR là viết tắt của Automatic Speech Recognition, nhận dạng giọng nói tự động. Nó chuyển đổi giọng nói thành văn bản và là bước đầu tiên trong toàn bộ liên kết AI Voice. Cho dù đó là phương pháp nhập khẩu giọng nói di động, biên bản hội nghị, phụ đề thời gian thực, hay AI Agent ngày càng phổ biến ngày nay, đằng sau đều không thể tách rời ASR. Trước đây tôi đã từng là người dùng của các công cụ nhập khẩu giọng nói AI như Wispr Flow và Typeless. Những sản phẩm này có trải nghiệm tốt, nhưng tình trạng mạng không ổn định đôi khi có sự chậm trễ, thích ứng với các cảnh tiếng Trung cũng có không gian để nâng cao. Sau đó, tôi chuyển sang các giải pháp triển khai cục bộ, trong đó Whisper nguồn mở của OpenAI được sử dụng nhiều nhất. Sau khi Hojo-ASR-V1 được phát hành lần này, tôi đã thay thế Whisper ban đầu bằng Hojo-ASR-V1 để trải nghiệm thực tế. Trải nghiệm tổng thể, tốc độ nhận dạng và độ chính xác đều tốt, đủ mượt mà như một đầu vào giọng nói hàng ngày. Tất nhiên, cái giá là cần một số tài nguyên phần cứng cục bộ nhất định, yêu cầu nhất định về bộ nhớ. Toàn bộ giải pháp không phức tạp, về cơ bản là sử dụng Hojo-ASR-V1 làm công cụ nhận dạng cơ bản, sau đó tiếp quản đầu vào giọng nói thông qua quyền cấp hệ thống. Khi được cấu hình, nó có thể hoạt động trong hầu hết các kịch bản nhập văn bản trong trình duyệt, ChatGPT, Claude, Notion, v.v. Trong thử nghiệm, tôi trực tiếp đọc một đoạn giới thiệu về "ngã tư", bao gồm định vị cột, hướng nội dung và nguồn gốc tên. Toàn bộ quá trình không có sắp xếp văn bản trước, cũng không có cố tình làm chậm tốc độ nói: Cá nhân tôi thấy thú vị là dòng công việc này vẫn có thể tiếp tục mở rộng. Sau khi nhận dạng được hoàn tất, bạn có thể truy cập vào DeepSeek, GPT hoặc các mô hình khác để chỉnh sửa, định dạng, sửa lỗi chính tả và tối ưu hóa cấu trúc văn bản.

Có lẽ toàn bộ quy trình là như thế này: Đầu vào âm thanh → chuyển ASR → tối ưu hóa mô hình lớn → trực tiếp vào dòng công việc. Đối với những người thường xuyên viết, họp hoặc làm việc với Agent, trải nghiệm này dễ chịu hơn so với các phương pháp nhập truyền thống. Ngoài Hojo-ASR-V1, chúng tôi cũng nhận thấy sự đầu tư của Hojo trong hướng TTS. Lần này chúng tôi đã thử nghiệm mô hình tổng hợp giọng nói TTS của nó, và nhóm nghiên cứu cũng đã mở một phiên bản nhẹ hơn Hojo-TTS-Light. Cùng với nhau, chúng tạo thành câu trả lời của Hojo cho dòng công việc hướng Agent. Một mảnh ghép khác của AI giọng nói: TTS Con đường để chúng ta trải nghiệm khả năng của mô hình TTS là trang web chính thức của nó: hojoai.com Tổng hợp giọng nói đa ngôn ngữ - Phụ nữ nhanh chóng Đầu tiên là tổng hợp giọng nói đa ngôn ngữ, đây là một chức năng phổ biến của mô hình TTS. Gần đây World Cup sắp bắt đầu, tôi để cho nó dùng một giọng nữ nhẹ nhàng, đọc một đoạn giới thiệu cầu thủ của đội tuyển Nhật Bản World Cup: Đoạn tiếng Trung Quốc khoảng 30 giây này nghe khá thuận lợi, cắn chữ và một số chi tiết đều xử lý được, cảm giác AI không quá rõ ràng. Giọng nữ, giọng nói nhẹ nhàng, đều có thể nghe ra. Thực ra chúng ta bình thường phán đoán một âm thanh tự không tự nhiên, thông thường thì nghe nó cắn chữ, còn có mỗi từ ở cuối giai điệu, đoạn này cơ bản và ban đầu thiết lập phong cách là có thể căn chỉnh. Hojo hỗ trợ rất nhiều ngôn ngữ, tiếng Nhật, tiếng Pháp, tiếng Quảng Đông đều được. Dưới đây vẫn là cùng một đoạn bản thảo giới thiệu của đội Nhật Bản, đổi thành tiếng Nhật để đọc, hiệu quả cũng còn có thể, nghe quả thật có chút giống NHK phát sóng báo, khá có vừa cảm giác thị giác: Tổng hợp giọng nói đa ngôn ngữ - Nam tính ổn định Mô hình TTS này cũng có thể thay đổi âm sắc của các nhân vật khác nhau, giọng nam nghe ra cũng được. Đoạn dưới đây vẫn là bản thảo giới thiệu World Cup 2026, tôi đã đặt âm sắc thành giọng nam từ tính, ổn định. Điều này nghe qua, và tôi đề nghị trong lời đề nghị cơ bản phù hợp. Sách âm thanh đa âm sắc - Sách âm thanh Mô hình TTS có thể sử dụng nhiều màu âm hơn. Lần này tôi cho nó đọc một đoạn bằng âm sắc của sách có tiếng.Đoạn văn bản này là một đoạn giới thiệu chủ đề của Naruto, được tổng hợp bằng giọng nam của cuốn sách có tiếng. Nghe có vẻ rất tự nhiên. Khi đọc được loại từ như "thiếu niên", âm cuối được xử lý để cho sự nối kết trước sau rất thuận lợi. Còn có những từ liên kết như "với" mà chúng ta thường dùng khi nói chuyện, nó dừng lại cũng tương đối đúng, đây cũng là một nguyên nhân khiến cả đoạn nghe thuận lợi. Tổng hợp giọng nói đa tông - Tiếng thì thầm Khi thử còn có một âm sắc muốn nói riêng một chút, chính là thì thầm. Dưới đây là đoạn tôi dùng giọng nói thì thầm của phụ nữ, đọc một đoạn giới thiệu bộ phim "Cừu Con Im lặng": Đoạn này bạn có thể nghe rõ những gì đang nói, đồng thời nó cũng mô phỏng luồng khí rất nhẹ, hơi thở nhỏ và âm thanh nhẹ khi người ta nói chuyện. Nghe lại, mô hình TTS thì thầm không chỉ đơn giản là giảm âm lượng, mà giọng điệu, nhịp điệu và cảm xúc cũng khá tốt. Giọng sắc này dùng để giải thích câu chuyện, kể chuyện, ASMR đều tương đối thích hợp. Ngoài các giai điệu truyền hình tiêu chuẩn, tôi đã thử nghiệm một số giai điệu nhân vật dễ nhận biết hơn. Khang Huy / Khang Huy Gần đây là mùa thi đại học, trên truyền hình, đài phát thanh còn có đoạn video ngắn, có thể nghe thấy không ít lời chúc mừng và tin tức phát sóng. Giọng nói của người dẫn chương trình truyền hình trung ương ở trong bài phát sóng tiếng Trung Quốc coi là tương đối có đại diện, tiêu chuẩn phát âm, phát ra chữ rõ ràng. Cho nên lần này tôi chọn một đoạn âm thanh của Kang Hui làm tham khảo, đoạn dưới đây chính là đoạn âm thanh gốc của Kang Hui. Bản sao âm thanh - Khanghui Tôi gửi đoạn âm thanh gốc này cho mô hình TTS, để nó khắc lại theo âm sắc bên trong, đọc một đoạn khoảng 40 giây, chúc các học sinh thi đại học thuận lợi.

Về hiệu quả, mô hình TTS giữ lại khá tốt các đặc điểm của đường âm ban đầu, đặc biệt là giọng điệu, sự dừng lại và nhịp điệu của Kang Hui. Câu đầu tiên vừa nói ra, có thể nghe ra rất giống với bản thân Kang Hui. Khi đọc những câu như "Không xứng với tuổi trẻ, hướng về tương lai", giọng nói quen thuộc và cảm giác chủ trì các sự kiện lớn đều có thể nghe ra. Này nha nha / Này nha nha nha Khả năng tái tạo âm sắc được coi là khả năng đại diện của mô hình TTS. Tôi lấy nó khắc lại giọng nói của vài nhân vật IP, đầu tiên là Nezha trong "Nê Zha Chi Ma Đồng Giáng Thế". Nghe xuống rất gần Nè Trà không kiềm chế, lười biếng cảm giác, dừng lại cũng gần như là trạng thái này. Lợn nhỏ, Page Giọng sắc của nhân vật hoạt hình, mô hình TTS tái khắc cũng được. Giọng nói của nhân vật phim hoạt hình không giống với nhân vật thực, nhân vật điện ảnh, xử lý cũng có chút khác biệt. Dưới đây là một trang lợn nhỏ mà tôi đã tổng hợp với mô hình TTS: Tôi không muốn nói gì cả. Tôi muốn nói gì cả Thậm chí, tôi còn ghi lại một đoạn âm thanh rất nóng bỏng của "MacArthur" giải thích, để anh ấy đọc một lần: "Nua ngã tư" là một phương tiện truyền thông công nghệ trong nước tập trung vào làn sóng AI, hình thức cốt lõi là podcast, đồng thời mở rộng ra video, phiên bản văn bản của tài khoản công cộng và hoạt động cộng đồng ngoại tuyến. "Bộ giao lộ" là một ẩn dụ của Jobs về Apple, nơi công ty đứng ở ngã tư giữa công nghệ và nhân văn, nơi mà các sản phẩm tuyệt vời thường được sinh ra. Theo dõi sự thay đổi và cơ hội mà AI mang lại cho mọi ngành công nghiệp, tìm kiếm, phỏng vấn và tập hợp các "nhà hoạt động tích cực" trong thời đại AI để khám phá và nắm bắt các khả năng mới. Hojo, đội này là ai Trở lại với chính nhóm Hojo, họ không phải là một công ty chỉ làm mô hình lớn về giọng nói.

Hojo được thành lập khoảng hai năm và trước khi thông tin này được tiết lộ, người ta biết rất ít về nó. Vì vậy, chúng tôi đã liên hệ với nhóm của họ và có được một số thông tin trực tiếp. Theo định vị của chính Hojo, nó muốn làm một hệ điều hành Personal Agent cho người lao động kiến thức. Nói một cách đơn giản, đó là việc cho phép các Agent thực sự tham gia vào các luồng công việc hàng ngày như văn phòng, giao tiếp, sáng tạo và cộng tác, trong đó ASR và TTS là hai phần quan trọng trong hệ thống này. Đó cũng là chìa khóa để hiểu Hojo. ASR thực sự chỉ là lớp nền tảng đầu tiên để Agent hiểu các trường hợp làm việc thực. Chỉ khi thông tin trong cuộc họp, cuộc điện thoại, ghi nhớ bằng giọng nói, thảo luận nhiều người được tiếp nhận ổn định trước, sự hiểu biết, lập kế hoạch và thực hiện sau đó mới có thể thành lập. Điều đặc biệt của Hojo là các thành viên cốt lõi của nó đã phải đối phó lâu dài với "cảnh nói thực sự". Các thành viên trong nhóm chủ yếu đến từ các nhóm liên quan đến giọng nói trên xe, buồng lái thông minh và tương tác bằng giọng nói, bao gồm Xiao Peng, Weilai Nomi, Shangtang, v.v. Cụ thể nói, người sáng lập Triệu Hằng Nghệ trước đây từng phụ trách tương tác bằng giọng nói, buồng lái thông minh và các công việc liên quan đến AgentOS tại các nhóm như LeTV, Xiaopeng, Weilai và Shangtang, đã làm giọng nói trên xe, buồng lái thông minh, tương tác đa ngôn ngữ, ứng dụng vận hành tự động AI và dịch vụ xuyên thiết bị. Giám đốc sản phẩm Li O, trước đây chịu trách nhiệm về AgentOS, buồng lái thông minh và lập kế hoạch sản phẩm kỹ thuật số tại các nhóm như Shangtang và Weilai, tập trung vào cách khả năng nói được tổ chức thành trải nghiệm sản phẩm hoàn chỉnh thay vì dừng lại ở khả năng mô hình một điểm. COO Sun Xiaogang có giải pháp Agent, thương mại hóa tương tác bằng giọng nói và kinh nghiệm triển khai ngành công nghiệp, đã tham gia vào các giải pháp tương tác bằng giọng nói trong xe hơi, ẩm thực, đi lại và các kịch bản khác. Nhìn lại những lý lịch này với nhau, kinh nghiệm chung của nhóm Hojo là nền tảng để giải quyết các vấn đề giọng nói trong bối cảnh thực tế trong một thời gian dài. Điều này chủ yếu là bởi vì các thành viên trong nhóm này tập trung vào các môi trường thực tế của ASR, những cảnh rất khác với âm thanh sạch trong phòng thí nghiệm. Trong xe có tiếng ồn, có tiếng địa phương, có nhiều người nói chuyện, có ngắt lời tạm thời, cũng có rất nhiều biểu hiện không hoàn chỉnh, bằng ngôn ngữ nói.

Người dùng sẽ không nói theo Prompt tiêu chuẩn và không chờ đợi hệ thống phản ứng chậm. Những người đã thực hiện các kịch bản như vậy dễ dàng hiểu được những gì mô hình giọng nói thực sự khó khăn hơn, ASR cần phải hiểu được ý định của con người trong một môi trường phức tạp. Kinh nghiệm của Sudan, nhà khoa học hàng đầu của Hojo, cũng dễ hiểu hơn khi đặt trong bối cảnh này. Những năm đầu, ông đã tham gia nghiên cứu và phát triển liên quan đến nhận dạng giọng nói ở Baidu, trải qua giai đoạn học sâu đưa ASR đến thương mại hóa; sau đó tại Lab AI của Tencent phụ trách hướng liên quan đến giọng nói, lại bắt kịp mô hình lớn viết lại giai đoạn tương tác giọng nói. Giá trị của lý lịch này là bản thân anh đã trải qua một số thay đổi liên tục trong công nghệ giọng nói, từ cạnh tranh về độ chính xác nhận dạng, đến việc thực hiện các cảnh thực tế, đến việc tái cấu trúc tương tác giọng nói trong thời đại mô hình lớn.Đối với một công ty muốn làm một hệ điều hành Personal Agent, kinh nghiệm này đã quyết định rằng nó sẽ không chỉ xem giọng nói như một thành phần đầu vào và thiết kế lại nó vào dòng công việc thực sự. Ở cấp độ vốn, Hojo trong sản phẩm chưa chính thức ra mắt quy mô lớn, thành lập cho đến nay đã hoàn thành gần 100 triệu nhân dân tệ 4 vòng tài trợ, hiện đang tiến hành Pre-A vòng. Những thông tin này không thể trực tiếp chứng minh rằng sản phẩm này nhất định thành công, nhưng ít nhất là thị trường chính đã bắt đầu chú ý đến sự tích lũy công nghệ của công ty về hướng Voice AI và Agent OS. Về mặt thương mại hóa, theo Hojo, sự kết hợp "Big Model + Agentic OS" của họ đã cung cấp khả năng nói cơ bản cho các thiết bị âm thanh AI hàng triệu. Nếu con số này là sự thật, nó không chỉ dừng lại trên giấy tờ, bản demo hoặc danh sách, mà đã đi vào các thiết bị thực và kịch bản người dùng thực. Theo kế hoạch của chính Hojo, ASR chỉ là bước đầu tiên. Nó cũng đang làm TTS và có kế hoạch ra mắt mô hình giọng nói song công vào cuối tháng 6. Câu chuyện tôi thực sự muốn kể là xây dựng một nền tảng tương tác bằng giọng nói xung quanh hệ điều hành Personal Agent: cho phép Agent nghe, hiểu, phản hồi và cuối cùng đi vào dòng công việc thực sự của người lao động tri thức. Những kế hoạch này có thể thực hiện được hay không, còn cần các sản phẩm tiếp theo để xác minh. Nhưng ít nhất là từ hiệu suất của Hojo-ASR-V1 lần này, nó đã đưa ra một kết quả khá đáng chú ý trong vòng đầu tiên của dòng công việc Voice AI. Vậy tại sao những dữ liệu tiết lộ của Hojo-ASR lại thu hút sự chú ý? Hoặc Hojo-ASR nằm trong bối cảnh gì? Voice AI là một câu chuyện khác ngoài mô hình lớn của GM Khi một Agent bắt đầu tham gia vào dòng công việc thực tế, các bối cảnh mà nó cần phải nhận được sẽ trở nên phức tạp hơn: các cuộc thảo luận trong một cuộc họp, các yêu cầu trong một cuộc gọi điện thoại, các giọng nói trong môi trường trực tiếp, các câu nói bổ sung tạm thời của người dùng hoặc thậm chí các hướng dẫn thay đổi liên tục khi nhiều người làm việc cùng một lúc. Trong quá khứ, những thông tin này chủ yếu dựa vào việc gõ, nhưng trong nhiều trường hợp làm việc, thông tin thực sự xảy ra không phải là viết ra, mà là nói ra.

Đó cũng là lý do tại sao các nhà máy lớn đã thêm mã Voice AI trong hai năm qua. OpenAI ra mắt API thời gian thực, Google làm Gemini Live, trong nước Khoa học đại học tin phi, Bean Bao, MiniMax, bước cũng trong hướng thoại đầu tư. Mức độ nóng của đường đua này hai năm nay, có thể đo lường bằng một khoản tiền nóng. Theo thống kê của AssemblyAI, vào năm 2025, các công ty khởi nghiệp AI giọng nói đã nhận được khoảng 2,1 tỷ USD vốn đầu tư mạo hiểm; từ tháng 6 năm 2025 đến tháng 5 năm 2026, đã có 36 khoản tài trợ được công bố công khai trong lĩnh vực AI đối thoại, tổng cộng khoảng 2,58 tỷ USD. Tóm lại một từ, nó rất nóng. Cụ thể đến công ty, ElevenLabs làm tổng hợp giọng nói đã nhận được 500 triệu đô la trong vòng D, định giá lên đến 11 tỷ đô la; PolyAI làm giọng nói dịch vụ khách hàng qua điện thoại đã nhận được 86 triệu đô la trong vòng D; Retell AI chủ yếu là cuộc gọi trực tiếp, mỗi tháng phải xử lý hơn 40 triệu cuộc gọi AI, tăng trưởng so với quý hơn 300%. Có những nhóm như Cartesia, chuyên giảm độ trễ của giọng nói xuống dưới 100 mili giây, để các cuộc trò chuyện nghe có vẻ ít nhạt hơn. Bên nhà máy này cũng có rất nhiều hoạt động. OpenAI đã đưa ra API thời gian thực, đưa giọng nói thành một phương án đầu đến đầu, âm thanh vào, âm thanh ra, giữa không còn chia thành ba đoạn "chuyển văn bản, mô hình hóa, tổng hợp lại", một lần thực hiện quy trình hoàn chỉnh. Gemini Live của Google cũng có thể bị gián đoạn khi bạn đang nói chuyện, sau đó bạn sẽ trả lời, và hai ngày qua, AI giọng nói mới hỗ trợ Gamma4 cũng được phát hành: Bạn có thể thấy rằng giọng nói đang chuyển từ một "phương thức tương tác tự nhiên hơn" trở thành lối vào để Agent có được ngữ cảnh. Khi đặt vào Vibe Working phổ biến gần đây, xu hướng này sẽ rõ ràng hơn. Bạn không nhất thiết phải sắp xếp từng bước yêu cầu thành một Prompt hoàn chỉnh. Bạn có thể suy nghĩ, nói và điều chỉnh, để Agent nắm bắt ý định, bổ sung ngữ cảnh và thúc đẩy nhiệm vụ trong cuộc trò chuyện, điều này có thể sẽ tự nhiên hơn. Trong liên kết này, ASR là khả năng cấp đầu tiên. Nó quyết định liệu Agent có thể hiểu được thế giới thực trước hay không. Nếu bạn không nghe đúng, sự hiểu biết, lập kế hoạch và thực hiện sẽ bị biến dạng; nếu bạn nghe đúng, giọng nói có thể trở thành một phần của dòng công việc. Nhìn chung, chúng ta có thể nói: Khi Agent bắt đầu bước vào cuộc sống hàng ngày, giọng nói, hay còn gọi là Voice AI, có thể là lối vào đầu tiên của nó để tiếp xúc với con người. Có rất nhiều cách kết nối giữa con người và AI, chẳng hạn như đánh máy, điểm vào giao diện, viết mã để điều chỉnh API, nhưng gần nhất với cuộc trò chuyện hàng ngày giữa con người và người, vẫn là mở miệng nói chuyện. Đó là lý do tại sao ngày càng có nhiều người gọi giọng nói là entry ngữ cảnh của Agent. Nếu mô hình lớn chịu trách nhiệm hiểu thế giới, thì giọng nói là kênh mà thế giới liên tục chảy vào mô hình. Và trong kênh này, ASR đóng vai trò của lớp nhận thức. Nó quyết định liệu Agent có thể nắm bắt chính xác thông tin từ môi trường bên ngoài hay không, và liệu nó có thể chuyển đổi âm thanh trong thế giới thực thành bối cảnh mà mô hình có thể hiểu và sử dụng. Từ góc độ này, điểm cạnh tranh của ASR đã tăng lên: Cạnh tranh để có được lối vào để các đại lý thế hệ tiếp theo kết nối với thế giới thực. Đó là lý do tại sao dữ liệu tiết lộ của Hojo-ASR-V1 đáng chú ý hơn. Nó không chỉ phản ánh sự thay đổi trong thành tích của một mô hình.

Voice AI đang chuyển từ khả năng hỗ trợ sang cơ sở hạ tầng, trở thành một lớp nền tảng ngày càng quan trọng trong thời đại Agent. 🚥 Trở lại với Voice AI. Trong khi hầu hết sự chú ý của các nhà sản xuất tập trung vào các mô hình lớn của GM, con đường đua tương đối yên tĩnh của giọng nói đã phát triển nhanh chóng. Trong một lĩnh vực như ASR, vốn từ lâu bị các công ty lớn như OpenAI, Microsoft, Nvidia, IBM thống trị, các nhóm khởi nghiệp bắt đầu đưa ra thành tích khá cạnh tranh. Sự xuất hiện của Hojo-ASR-V1 không nhất thiết có nghĩa là mô hình đã thay đổi, nhưng ít nhất là AI Voice đang chuyển từ khả năng rìa sang vị trí quan trọng hơn và thu hút ngày càng nhiều người chú ý đến đường đua. Nhận dạng giọng nói chỉ là bước đầu tiên của Voice AI, sau khi máy nghe chính xác, liệu có thể hiểu hay không, liệu có thể phản ứng bằng cách tiếp cận con người hay không, mới là câu chuyện dài hơn, có giá trị hơn và tiềm năng hơn. tài liệu tham khảo / tài liệu tham khảo [1]https://huggingface.co/HojoAI/Hojo-ASR-V1: https://huggingface.co/HojoAI/Hojo-ASR-V1 [2]https://github.com/HojoAI/Hojo-ASR: https://github.com/HojoAI/Hojo-ASR Bài viết đến từ tài khoản công cộng WeChat "Crossroad Crossing", tác giả "Crossroad Crossing"

Thông tin này có hữu ích không?

Hỗ trợ kỹ thuậtHỗ trợ trực tuyến
侧栏
Về đầu trang
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR