Lapangan kompetisi AI suara yang semakin panas, muncul sebuah tim start-up bernama Hojo
Voice AI merupakan jalur perkembangan teknologi yang berbeda dari model besar (general large models). Sementara semua orang fokus pada model besar tersebut, di jalur yang relatif tenang ini (Voice AI), juga mulai muncul beberapa model baru yang patut diperhatikan. Klavier (keyboard) sedang kehilangan “posisi dominannya”. Dalam dua tahun terakhir, OpenAI telah meluncurkan Realtime API, Google mengeluarkan Gemini Live, dan perusahaan-perusahaan besar di dalam negeri juga hampir semuanya mulai mengembangkan teknologi Voice AI. Semakin banyak orang yang percaya bahwa ketika Agent benar-benar digunakan dalam proses kerja, suara akan menjadi pintu masuk konteks yang lebih alami daripada klavier. Jika Agent ingin benar-benar digunakan dalam proses kerja, pertama-tama ia harus belajar memahami suara-suara tersebut. Kemampuan utama yang diperlukan untuk itu adalah ASR (Automatic Speech Recognition). Untuk mengukur kualitas ASR, yang paling sering digunakan di industri adalah Hugging Face’s Open ASR Leaderboard, dengan indikator utama berupa tingkat kesalahan kata (Word Error Rate/WER). Semakin rendah angkanya, semakin akurat hasil pengenalan suara tersebut.
Selama ini, daftar ini pada dasarnya didominasi oleh perusahaan besar dan laboratorium-laboratorium terkemuka. Untuk memiliki data pelatihan yang berkualitas, kekuatan komputasi yang memadai, serta pengalaman teknis yang luas, diperlukan beberapa syarat yang cukup tinggi, sehingga sangat sedikit tim kecil yang berani bersaing secara langsung dalam hal tersebut. Baru-baru ini, sebuah tim startup bernama Hojo mengungkapkan hasil pengujian pengenalan suara mereka, dan tampaknya mereka memiliki potensi untuk menjadi “kuda hitam” di bidang ini. Menurut data yang diumumkan secara resmi, Hojo-ASR-V1 telah mencapai hasil yang cukup baik pada beberapa kumpulan data pengenalan suara bahasa Inggris yang tersedia untuk umum.
Di antaranya, tingkat kesalahan kata (Word Error Rate/WER) pada LibriSpeech Clean hanya sebesar 1,74%, dan pada dataset seperti GigaSpeech dan VoxPopuli yang lebih mendekati situasi nyata, tingkat kesalahan tersebut juga berhasil dikurangi hingga di bawah 8%. Mereka tidak mengirimkan data mereka ke daftar peringkat, tetapi jika data tersebut dimasukkan ke dalam Open ASR Leaderboard untuk dibandingkan, akan menjadi data yang sangat menonjol. Secara keseluruhan, ini merupakan model ASR (Automatic Speech Recognition) yang menunjukkan kompetitivitas dalam pengujian benchmark yang terbuka. Selain itu, model ini benar-benar dibuka sumber codenya di GitHub dan Hugging Face, dengan lisensi Apache-2.0, sehingga tidak ada banyak batasan dalam penggunaan kembali. 🚥 Oleh karena itu, kami mengimplementasikan Hojo-ASR-V1 untuk mengalami langsung bagaimana kualitas model suara yang dibuat oleh tim startup yang rendah profil ini, dan juga membahas tentang tren baru yang sedang berkembang pesat, yaitu era Agent: Voice AI. Apa sebenarnya Hojo-ASR? Kami telah melakukan pengujian secara langsung. Pertama-tama, Hojo-ASR-V1 telah dibuka sumber codenya di HuggingFace dan GitHub: Tautan Hugging Face: https://huggingface.co/HojoAI/Hojo-ASR-V1[1] Tautan GitHub: https://github.com/HojoAI/Hojo-ASR[2] Mari kita jelaskan apa sebenarnya Hojo-ASR-V1. Setelah kami melihat kode dan konfigurasinya, kami menemukan bahwa strukturnya berbeda dari model pengenalan suara tradisional.
Penggunaan audio dimulai dengan memprosesnya menggunakan extractor karakteristik Whisper terlebih dahulu, untuk mengubahnya menjadi karakteristik akustik yang dapat digunakan oleh model. Setelah itu, data tersebut dimasukkan ke dalam encoder audio Qwen3-Omni. Di antaranya, struktur Conformer digunakan untuk melakukan penyesuaian dan kompresi.
Pada akhirnya, hasilnya diberikan ke model bahasa Qwen3-4B untuk menghasilkan teks akhir. Dengan kata lain: Hojo-ASR-V1 merupakan kombinasi dari “encoder (pengkode), adapter (pengadaptasi), dan model bahasa besar”. Gagasan menggunakan model bahasa besar untuk proses decoding ASR (Automatic Speech Recognition) bukanlah hal yang hanya dimiliki oleh Hojo. Ini merupakan arah utama yang sedang tren di puncak daftar OpenASR saat ini. Beberapa model yang berada di posisi teratas daftar, seperti Canary-Qwen-2.5B dari NVIDIA, Granite-Speech-3.3-8B dari IBM, dan Phi-4-Multimodal dari Microsoft, semuanya mengintegrasikan kemampuan model bahasa ke dalam sistem pengenalan suara, sehingga rata-rata nilai WER (Word Error Rate) dapat diturunkan ke kisaran 5.6% hingga 5.9%. Keuntungan dari penggunaan model bahasa adalah bahwa proses pengenalan tidak hanya terbatas pada “mendengar suara apa dan menuliskan kata apa yang diucapkan”; model juga dapat menggunakan makna untuk membuat penilaian yang lebih akurat. Ketika menghadapi gangguan suara, ekspresi lisan, campuran bahasa Indonesia dan Inggris, atau istilah khusus dari suatu bidang, model yang memahami makna akan lebih mampu memahami apa yang ingin diungkapkan oleh penutur. Berikut adalah bagian pengujian praktis: kami mengimplementasikan model tersebut di lingkungan lokal dan menjalankannya berkali-kali.
Kasus pengujian ini terbagi menjadi dua bagian: 【1】Kemampuan ASR (Automatic Speech Recognition) dari model Hojo-ASR-V1. 【2】Hojo-TTS. ASR (Automatic Speech Recognition) bertanggung jawab untuk mengubah suara menjadi teks, dan merupakan langkah pertama dalam seluruh rantai AI suara. Baik itu aplikasi perekaman suara di ponsel, catatan rapat, teks tertulis secara real-time, maupun AI Agent yang semakin populer saat ini, semuanya tidak lepas dari teknologi ASR. Sebelumnya, saya selalu menggunakan alat perekaman suara AI seperti Wispr Flow dan Typeless. Produk-produk tersebut memberikan pengalaman yang baik, tetapi terkadang terjadi keterlambatan saat koneksi internet tidak stabil, dan masih ada ruang untuk peningkatan dalam adaptasi terhadap konteks bahasa Mandarin. Kemudian, saya beralih ke solusi yang di-deploy secara lokal, di mana yang paling sering saya gunakan adalah Whisper yang bersifat open-source dari OpenAI. Setelah Hojo-ASR-V1 dirilis, saya mengganti Whisper yang saya gunakan sebelumnya dengan Hojo-ASR-V1 untuk mengalaminya secara langsung. Secara keseluruhan, kecepatan pengenalan dan tingkat akurasi cukup baik, sehingga cukup lancar untuk digunakan sebagai alat perekaman suara sehari-hari. Tentu saja, hal ini memerlukan sumber daya perangkat keras lokal tertentu, dan memiliki persyaratan tertentu terhadap kapasitas memori. Solusi keseluruhannya tidak rumit; pada dasarnya, Hojo-ASR-V1 digunakan sebagai mesin pengenalan dasar, kemudian sistem mengambil alih proses perekaman suara melalui hak akses tingkat sistem. Setelah konfigurasi selesai, alat ini dapat digunakan di hampir semua situasi pemasukan teks, seperti browser, ChatGPT, Claude, Notion, dan lainnya. Saat menguji, saya langsung menyampaikan sebuah penjelasan tentang “persimpangan jalan”, termasuk lokasi kolom, arah konten, dan asal-usul namanya. Seluruh proses dilakukan tanpa menyiapkan teks terlebih dahulu, dan saya juga tidak sengaja memperlambat kecepatan bicara saya. Menurut saya, hal yang menarik adalah bahwa alur kerja semacam ini masih bisa diperluas. Setelah proses pengenalan selesai, teks dapat dihubungkan dengan model seperti DeepSeek, GPT, atau model lainnya untuk penyempurnaan, pengaturan format, koreksi kesalahan ejaan, dan optimisasi struktur.
Prosesnya secara keseluruhan adalah seperti ini: Masukan suara → Transkripsi ASR (Automatic Speech Recognition) → Optimisasi oleh model besar → Langsung masuk ke dalam alur kerja. Bagi orang-orang yang sering menulis, mengadakan pertemuan, atau bekerja sama dengan Agent, pengalaman ini lebih nyaman dibandingkan dengan metode pemasukan tradisional. Selain Hojo-ASR-V1, kami juga melihat bahwa Hojo telah berinvestasi dalam bidang TTS (Text-to-Speech). Kali ini kami telah menguji model sintesis suara TTS-nya, dan tim juga telah merilis versi yang lebih ringan, yaitu Hojo-TTS-Light. Semua ini bersama-sama membentuk fitur Hojo yang ditujukan untuk alur kerja Agent. Bagian lain dari Voice AI adalah TTS. Cara untuk menguji kemampuan model TTS adalah melalui situs resminya: hojoai.com. **Sintesis Suara Multibahasa – Wanita yang Ceria** Yang pertama kami uji adalah fitur sintesis suara multibahasa, yang merupakan salah satu fungsi yang sering digunakan oleh model TTS. Karena Piala Dunia akan segera dimulai, kami meminta model tersebut menggunakan suara wanita yang lebih ceria untuk membacakan naskah pengenalan pemain tim Jepang: Naskah tersebut berdurasi sekitar 30 detik, dan terdengar cukup lancar; pengejaan serta detailnya juga ditangani dengan baik, sehingga tidak terasa terlalu banyak campur tangan AI. Nada suara wanita dan gaya bicaranya yang ceria terdengar jelas. Biasanya, kami menilai apakah suara terdengar tidak alami dengan mendengarkan pengejaannya dan nada suara pada akhir setiap kata, dan naskah ini cukup sesuai dengan gaya yang telah ditetapkan sejak awal. Hojo mendukung berbagai bahasa, termasuk Jepang, Prancis, dan Kanton. Selanjutnya, naskah pengenalan tim Jepang yang sama dibacakan dalam bahasa Jepang, dan hasilnya juga cukup baik; terdengar mirip dengan narasi dari NHK. **Sintesis Suara Multibahasa – Pria yang Berwibawa dan Mantap** Model TTS ini juga dapat mengubah nada suara menjadi berbeda, dan suara pria yang dihasilkan juga terdengar cukup baik. Naskah yang sama tentang Piala Dunia 2026 dibacakan dengan nada suara pria yang berwibawa dan mantap, dan hasilnya sesuai dengan yang kami harapkan. **Sintesis Suara Multibahasa – Buku Audio** Model TTS memiliki banyak pilihan nada suara yang dapat digunakan. Kali ini kami meminta model tersebut menggunakan nada suara untuk buku audio untuk membacakan sebuah pengenalan tentang Naruto. Terdengar sangat alami. Saat membacakan kata-kata seperti “shonen” (remaja), penanganan nada suara pada akhir kata membuat transisi antar kalimat terdengar lancar. Begitu pula dengan kata-kata sambung seperti “to” (dengan), di mana penahannya tepat, yang juga merupakan salah satu alasan mengapa keseluruhan pembacaan terdengar lancar. **Sintesis Suara Multibahasa – Berbisik** Ada satu nada suara lain yang ingin kami sebutkan secara khusus, yaitu nada suara berbisik. Dalam contoh berikut, kami menggunakan nada suara wanita yang berbisik untuk membacakan pengenalan film “The Silent Lamb”: Pada bagian ini, Anda dapat dengan jelas mendengar apa yang dibacakan, dan model TTS juga berhasil meniru suara desiran napas yang lembut, suara napas halus, serta nada suara saat seseorang berbicara di telinga pendengar. Nada suara berbisik dari model TTS tidak hanya menurunkan volume suara saja, tetapi juga menyesuaikan nada, irama, dan emosi dengan baik. Nada suara ini sangat cocok untuk narasi misteri, narasi cerita, atau ASMR (Autonomous Sensory Meridian Response). Selain nada suara siaran standar, kami juga menguji beberapa nada suara karakter lain yang lebih mudah dikenali. **Kang Hui** Belakangan ini adalah musim ujian masuk universitas, dan di televisi, radio, serta video singkat, sering terdengar ucapan selamat dan berita yang dibacakan oleh pembawa acara. Nada suara pembawa acara CCTV dianggap cukup representatif dalam bahasa Mandarin, dengan pengejaan yang standar dan jelas. Oleh karena itu, kami menggunakan audio Kang Hui sebagai referensi; berikut adalah audio asli Kang Hui. Penyalinan Suara untuk Proses Penggandaan File - Kanghui Saya mengirimkan audio asli ini ke model TTS (Text-to-Speech) agar model tersebut dapat meniru suara dalam audio tersebut dan membacakan teks yang berisi ucapan selamat kepada para siswa yang akan mengikuti ujian masuk perguruan tinggi, dengan durasi sekitar 40 detik.
Dari segi efek, model TTS berhasil mempertahankan karakteristik suara asli dengan cukup baik, terutama nada bicara, penghentian, dan irama penyampaian dari Kang Hui. Begitu kalimat pertama diucapkan, sudah terdengar sangat mirip dengan Kang Hui sendiri. Saat membacakan kalimat seperti “Tidak mengkhianati masa muda, menuju masa depan”, nuansa penyampaian berita yang akrab dan gaya pembawa acara acara besar pun terasa jelas. **Nezha** Kemampuan model TTS dalam mereplikasi suara karakter Nezha merupakan salah satu yang paling menonjol. Saya menggunakan model ini untuk mereplikasi suara beberapa karakter dari IP tertentu, pertama adalah Nezha dari film “Nezha: The Demonic Child”. Suara yang dihasilkan cukup mendekati karakter Nezha yang liar dan santai, termasuk penghentian bicaranya yang juga sesuai dengan karakter tersebut. **Peppa Pig** Model TTS juga mampu mereplikasi suara karakter kartun dengan cukup baik. Suara karakter kartun memang berbeda dari suara manusia atau karakter film, sehingga membutuhkan pendekatan yang berbeda dalam pemrosesannya. Berikut adalah contoh suara Peppa Pig yang dihasilkan oleh model TTS: **MacArthur** Bahkan, saya juga merekam suara narasi “MacArthur” yang sangat populer di TikTok, dan memintanya untuk membacakannya: “Crossroads” adalah sebuah media teknologi swasta di Cina yang fokus pada tren AI. Bentuk utamanya adalah podcast, namun juga memiliki konten video, versi teks di akun resmi, dan kegiatan komunitas offline. “Crossroads” merupakan metafora yang digunakan oleh Steve Jobs untuk menggambarkan perusahaan Apple, yang berada di persimpangan antara teknologi dan humanisme; produk-produk hebat sering kali lahir di sini. Media ini mengikuti perkembangan dan peluang yang dibawa oleh AI di berbagai industri, mencari, mewawancarai, dan mengumpulkan “para pelaku positif” di era AI, serta bersama-sama mengeksplorasi dan merangkul kemungkinan-kemungkinan baru. **Siapa tim Hojo?** Kembali ke tim Hojo sendiri, mereka bukanlah perusahaan yang hanya fokus pada pembuatan model suara besar.
Hojo didirikan sekitar dua tahun yang lalu, dan sebelum informasi ini diungkapkan ke publik, sangat sedikit yang diketahui tentang perusahaan tersebut. Karena kami telah menghubungi timnya, kami mendapatkan beberapa informasi langsung. Menurut posisi Hojo sendiri, mereka lebih fokus pada pengembangan Personal Agent OS yang ditujukan untuk para pekerja berpengetahuan. Dengan kata lain, mereka ingin membuat Agent benar-benar menjadi bagian dari proses kerja sehari-hari seperti bekerja, berkomunikasi, menciptakan karya, dan berkolaborasi. ASR (Automatic Speech Recognition) dan TTS (Text-to-Speech) merupakan dua komponen kunci dalam sistem ini. Ini juga merupakan kunci untuk memahami Hojo. ASR sebenarnya hanyalah dasar pertama agar Agent dapat memahami situasi kerja yang nyata. Hanya dengan menangkap informasi dari pertemuan, panggilan telepon, catatan suara, dan diskusi multi-pribadi dengan stabil, pemahaman, perencanaan, dan eksekusi yang lebih lanjut dapat terwujud. Dari segi latar belakang tim, Hojo memiliki keunikan karena anggotanya telah lama berkecimpung dalam “situasi suara yang nyata”. Sebagian besar anggota tim berasal dari tim yang terkait dengan teknologi suara mobil, kabin pintar, dan interaksi suara, termasuk dari perusahaan seperti Xpeng, NIO Nomi, dan SenseTime. Lebih spesifik lagi, pendiri Hojo, Zhao Hengyi, sebelumnya bekerja di tim Xpeng, NIO, dan SenseTime, di mana ia bertanggung jawab atas interaksi suara, kabin pintar, dan AgentOS, serta mengembangkan aplikasi operasi AI mandiri dan layanan lintas perangkat. Chief Product Officer (CPO) Li Ou sebelumnya bekerja di SenseTime dan NIO, di mana ia mengembangkan AgentOS, kabin pintar, dan perencanaan produk digital, dengan fokus pada bagaimana kemampuan suara dapat diintegrasikan menjadi pengalaman produk yang lengkap, bukan hanya pada kemampuan model tunggal. COO Sun Xiaogang memiliki pengalaman dalam komersialisasi solusi Agent dan implementasi industri interaksi suara, serta telah terlibat dalam pengembangan solusi interaksi suara untuk berbagai skenario seperti mobil, restoran, dan transportasi. Jika kita melihat riwayat kerja ini bersama-sama, pengalaman bersama tim Hojo memberikan dukungan yang kuat dalam menangani masalah suara dalam situasi yang nyata. Hal ini terutama karena anggota tim tersebut fokus pada lingkungan ASR yang lebih realistis, yang sangat berbeda dari audio yang bersih di laboratorium. Di dalam mobil, ada kebisingan, dialek, banyak orang yang berbicara, ada penginterupan mendadak, serta banyak ekspresi yang tidak lengkap dan bersifat lisan.
Pengguna tidak akan berbicara sesuai dengan prompt standar, dan juga tidak akan menunggu sistem bereaksi dengan lambat. Orang-orang yang pernah berurusan dengan situasi seperti ini lebih mudah memahami kesulitan sebenarnya dari model suara; ASR (Automatic Speech Recognition) perlu secara stabil memahami niat manusia dalam lingkungan yang kompleks. Pengalaman Sultan, kepala ilmuwan di Hojo, juga lebih mudah dipahami dalam konteks ini. Dia berpartisipasi dalam penelitian dan pengembangan teknologi pengenalan suara di Baidu di tahun-tahun awal, mengalami bagaimana pembelajaran mendalam mendorong ASR ke tahap komersialisasi; kemudian di Tencent AI Lab, dia bertanggung jawab atas bidang terkait suara dan bertepatan dengan masa di mana model besar mulai mengubah cara interaksi suara. Nilai dari riwayat kerjanya terletak pada fakta bahwa dia secara langsung mengalami beberapa perubahan dalam teknologi suara, dari persaingan dalam hal akurasi pengenalan, hingga penerapan dalam skenario nyata, dan kemudian restrukturisasi interaksi suara di era model besar. Bagi sebuah perusahaan yang ingin membuat Personal Agent OS, pengalaman seperti ini menentukan bahwa mereka tidak hanya akan menganggap suara sebagai komponen masukan, tetapi merancangnya kembali ke dalam alur kerja yang nyata adalah kuncinya. Dari segi modal, Hojo telah menyelesaikan hampir 100 juta yuan dalam empat putaran pendanaan sejak didirikan, bahkan sebelum produknya resmi diluncurkan secara besar-besaran, dan saat ini sedang dalam putaran Pre-A. Informasi seperti ini tidak langsung membuktikan keberhasilan produk, tetapi setidaknya menunjukkan bahwa pasar primer sudah mulai memperhatikan akumulasi teknologi perusahaan di bidang Voice AI dan Agent OS. Dari segi komersialisasi, menurut Hojo, kombinasi “model besar + Agentic OS” yang mereka kembangkan telah menyediakan kemampuan suara dasar untuk jutaan perangkat AI. Jika angka ini benar, itu berarti mereka tidak hanya berada di tingkat penelitian, demo, atau daftar peringkat, tetapi sudah memasuki skenario penggunaan dan perangkat yang nyata. Dari rencana Hojo sendiri, ASR hanyalah langkah pertama. Mereka juga sedang mengembangkan TTS (Text-to-Speech) dan berencana meluncurkan model suara full-duplex pada akhir Juni. Cerita sebenarnya yang ingin mereka sampaikan adalah membangun satu set lengkap infrastruktur interaksi suara di sekitar Personal Agent OS: memungkinkan Agent untuk mendengar, memahami, dan merespons, serta akhirnya masuk ke dalam alur kerja pekerja yang sebenarnya. Apakah rencana-rencana ini akan terwujud masih perlu dibuktikan oleh produk selanjutnya. Namun, setidaknya dari kinerja Hojo-ASR-V1, mereka telah menunjukkan hasil yang cukup menarik di tahap pertama dari alur kerja Voice AI. Lalu, mengapa data yang diungkapkan oleh Hojo-ASR menarik perhatian? Atau dengan kata lain, dalam konteks apa Hojo-ASR berada? Voice AI adalah jalur cerita lain selain model besar umum. Ketika Agent mulai masuk ke dalam alur kerja yang nyata, konteks yang perlu mereka pahami akan semakin kompleks: diskusi dalam pertemuan, permintaan di telepon, suara di lingkungan nyata, kalimat tambahan yang diucapkan pengguna secara spontan, bahkan instruksi yang terus berubah saat beberapa orang bekerja sama. Di masa lalu, informasi ini sebagian besar dimasukkan melalui ketikan, tetapi dalam banyak skenario kerja, informasi yang sebenarnya terjadi bukanlah yang ditulis, melainkan yang diucapkan.
Inilah sebabnya mengapa pabrik-pabrik besar telah menambahkan Voice AI selama dua tahun terakhir. OpenAI meluncurkan API realtime, Google melakukan Gemini Live, dan Universitas Sains dan Teknologi China Xinfang, Beobao, MiniMax dan Step juga berinvestasi dalam arah suara. "Saya tidak tahu apa yang terjadi, tapi saya tahu apa yang terjadi, " katanya kepada wartawan. Menurut statistik AssemblyAI, pada tahun 2025, startup AI suara menerima sekitar $2,1 miliar modal ventura; dari Juni 2025 hingga Mei 2026, ada 36 pendanaan yang diungkapkan secara publik di bidang AI percakapan, dengan total sekitar 25 miliar. 800 juta dolar. Singkatnya, itu sangat panas. Khusus untuk perusahaan, ElevenLabs, yang melakukan sintesis suara, mengambil $500 juta di Putaran D, dengan penilaian $11 miliar; PolyAI, yang melakukan suara layanan pelanggan telepon, mengambil $86 juta di Putaran D; Retell AI, yang berfokus pada panggilan real-time, memproses lebih dari 40 juta panggilan AI setiap bulan, dengan pertumbuhan kuartalan-ke - kuartalan melebihi 300%. Ada juga tim seperti Cartesia, yang bekerja untuk mengurangi latensi suara menjadi kurang dari 100 milidetik, sehingga percakapan terdengar lebih sedikit. Ada banyak gerakan di pabrik-pabrik besar ini. Ada banyak gerakan di pabrik-pabrik besar ini. OpenAI meluncurkan API Realtime, membuat suara menjadi skema end-to - end, suara masuk, suara keluar, di tengah tidak lagi dibagi menjadi tiga bagian "transformasi teks, model, dan sintesis ulang," berjalan melalui proses lengkap sekaligus. Gemini Live dari Google adalah ide yang sama, yang dapat diganggu di tengah-tengah pembicaraan Anda, dan kemudian merespon, dan dua hari ini juga ada Voice AI yang didukung Gamma4: Seperti yang Anda lihat, suara berubah dari "cara interaksi yang lebih alami " menjadi pintu masuk ke dalam konteks agen. Jika Anda memasukkan ke dalam Vibe Working yang populer baru-baru ini, tren ini akan menjadi lebih jelas. Seseorang tidak harus memilah-milah setiap langkah permintaan menjadi prompt lengkap. Anda dapat berpikir, berbicara, dan menyesuaikan, sehingga Agen dapat menangkap maksud, melengkapi konteks, dan memajukan tugas dalam percakapan, yang mungkin lebih alami. Dalam hubungan ini, ASR adalah kemampuan lapisan pertama. Ini menentukan apakah agen dapat memahami dunia nyata terlebih dahulu. Jika Anda tidak mendengarkan dengan benar, pemahaman, perencanaan, dan eksekusi di belakang akan terdistorsi; jika Anda mendengarkan dengan benar, suara dapat benar-benar menjadi bagian dari alur kerja. Secara umum: Ketika Agen mulai memasuki kehidupan sehari-hari, suara, yaitu Voice AI, kemungkinan akan menjadi pintu masuk pertamanya untuk menghubungi orang. Ada banyak cara untuk menghubungkan manusia dan AI, seperti mengetik, mengklik antarmuka, menulis kode untuk menyesuaikan API, tetapi yang paling dekat dengan dialog sehari-hari antara manusia dan manusia, atau berbicara. Itulah sebabnya semakin banyak orang menyebut suara sebagai entrance konteks agen, atau entri konteks. Jika model besar bertanggung jawab untuk memahami dunia, maka suara adalah saluran di mana dunia terus mengalir ke dalam model. Dan di dalam saluran ini, ASR memainkan peran sebagai lapisan persepsi. Dan di dalam saluran ini, ASR memainkan peran sebagai lapisan persepsi. Ini menentukan apakah agen dapat menangkap informasi di lingkungan eksternal secara akurat dan mengubah suara dunia nyata menjadi konteks yang dapat dipahami dan dimanfaatkan oleh model. Dari sudut pandang ini, titik persaingan ASR telah ditingkatkan: 1. titik persaingan ASR telah ditingkatkan: 1. titik persaingan ASR telah ditingkatkan: Berlombalah untuk mendapatkan pintu masuk ke agen generasi berikutnya untuk terhubung ke dunia nyata. Inilah juga alasan mengapa data yang diungkapkan oleh Hojo-ASR-V1 lebih patut mendapat perhatian. Yang terlihat di baliknya bukan hanya perubahan dalam kinerja model semata.
Voice AI kini bergerak dari sekadar kemampuan pendukung menjadi bagian dari infrastruktur, menjadi dasar yang semakin penting di era Agent. 🚥 Kembali ke Voice AI. Saat sebagian besar perusahaan fokus pada model besar yang serbaguna, bidang teknologi suara yang relatif tenang ini sebenarnya telah berkembang dengan cepat. Bahkan di bidang ASR (Automatic Speech Recognition) yang selama ini didominasi oleh perusahaan besar seperti OpenAI, Microsoft, NVIDIA, dan IBM, tim-tim startup mulai menunjukkan hasil yang kompetitif. Kemunculan Hojo-ASR-V1 mungkin belum berarti perubahan besar dalam struktur pasar, tetapi setidaknya menunjukkan bahwa Voice AI sedang bergerak dari posisi yang “pinggiran” menjadi bagian yang lebih penting, dan menarik perhatian semakin banyak orang kembali ke bidang ini. Pengenalan suara hanyalah langkah pertama dalam teknologi Voice AI. Setelah mesin dapat mendengar dengan benar, pertanyaan pentingnya adalah apakah mesin tersebut dapat memahami apa yang didengarnya dan dapat merespons dengan cara yang mirip dengan manusia—itu adalah bagian dari cerita yang lebih panjang, lebih berharga, dan memiliki potensi yang lebih besar. Referensi: [1] https://huggingface.co/HojoAI/Hojo-ASR-V1: https://huggingface.co/HojoAI/Hojo-ASR-V1 [2] https://github.com/HojoAI/Hojo-ASR: https://github.com/HojoAI/Hojo-ASR Artikel ini berasal dari akun WeChat resmi “Crossing”, ditulis oleh “Crossing”.
Tautan artikel:https://www.airai.cc/id/news/6/
Apakah ini membantu?