메뉴

성장세를 보이는 음성 AI 분야에서 스타트업 팀인 Hojo가 등장했습니다.

Voice AI는 일반적인 대규모 모델들과는 다른 발전 경로를 가지고 있습니다. 모두가 일반적인 대규모 모델에 주목하는 동안, 비교적 조용했던 Voice AI 분야에서도 주목할 만한 새로운 모델들이 등장하기 시작했습니다. 키보드는 점차 그 ‘지배적인 위치’를 잃어가고 있습니다. 지난 2년 동안 OpenAI는 Realtime API를 출시했고, Google은 Gemini Live를 선보였으며, 국내의 대규모 모델 회사들도 Voice AI 분야에 진출하기 시작했습니다. 점점 더 많은 사람들이 에이전트(Agent)가 실제로 작업 흐름에 통합될 때, 음성이 키보드보다 더 자연스러운 상호작용 수단이 될 것이라고 믿고 있습니다. 에이전트가 작업 흐름에 진정으로 통합되려면, 먼저 이러한 음성을 이해하는 법을 배워야 합니다. 그리고 이를 위한 첫 번째 단계가 바로 ASR(자동 음성 인식, Automatic Speech Recognition)입니다. ASR의 수준을 평가할 때 업계에서 가장 흔히 사용되는 지표는 Hugging Face의 Open ASR Leaderboard이며, 핵심 지표는 단어 오류율(WER, Word Error Rate)입니다. 숫자가 낮을수록 인식 정확도가 높다는 것을 의미합니다.

오랫동안 이 순위는 대기업과 유명 연구소들의 전유물이었으며, 훈련 데이터, 연산 능력, 엔지니어링적 노하우 등 모든 측면에서 상당한 진입 장벽이 존재했기 때문에 소규모 팀들이 이 분야에서 직접 경쟁하는 것은 드물었습니다. 최근에 Hojo라는 스타트업 팀이 음성 인식 테스트 결과를 공개했으며, ‘암마’가 되어가는 추세를 보이고 있습니다. 공식적으로 발표된 데이터에 따르면, Hojo-ASR-V1는 여러 공개된 영어 음성 인식 데이터셋에서 좋은 성과를 거두었습니다.

그 중에서 LibriSpeech Clean의 단어 오류율(WER)은 단지 1.74%에 불과하며, 실제 상황에 더 가까운 GigaSpeech, VoxPopuli와 같은 데이터셋에서도 8% 이내로 줄어들었습니다. 그들은 순위표에는 이름을 올리지 않았지만, Open ASR Leaderboard와 비교하면 매우 높은 순위에 올랄 것입니다. 전반적으로 이 모델은 공개 벤치마크 테스트에서 경쟁력을 보여주는 ASR(자동 음성 인식) 모델입니다. 게다가 이 모델은 GitHub와 Hugging Face에 오픈소스로 공개되어 있으며, Apache-2.0 라이선스를 사용하여 재사용하는 데 큰 제한이 없습니다. 🚥 그래서 우리는 Hojo-ASR-V1를 실제로 배포하여 이 저명하지 않은 스타트업 팀이 만든 음성 모델의 실력을 직접 경험해보았으며, Agent 시대가 빠르게 성장하고 있는 새로운 이야기인 Voice AI에 대해서도 이야기해보았습니다. Hojo-ASR가 무엇인지 실제로 테스트해보았습니다. 먼저, Hojo-ASR-V1는 Hugging Face와 GitHub에 오픈소스로 공개되었습니다: Hugging Face 링크: https://huggingface.co/HojoAI/Hojo-ASR-V1[1] GitHub 링크: https://github.com/HojoAI/Hojo-ASR[2] Hojo-ASR-V1가 어떤 모델인지 먼저 설명드리자면, 실제로 코드와 설정을 살펴본 결과, 이 모델의 구조가 전통적인 음성 인식 모델과는 다르다는 것을 알았습니다.

오디오는 먼저 Whisper의 특징 추출기를 사용하여 처리하여 모델이 사용할 수 있는 음향 특징으로 변환한 다음, Qwen3-Omni의 오디오 인코더에 입력합니다. 그 사이에 Conformer 구조를 사용하여 적응과 압축을 수행합니다;

마지막으로, Qwen3-4B라는 언어 모델에게 전달되어 최종적인 텍스트가 생성됩니다. 다시 말해, Hojo-ASR-V1는 “인코더 + 어댑터 + 대형 언어 모델”의 조합입니다. 대형 언어 모델을 사용하여 ASR(자동 음성 인식)을 수행하는 접근 방식은 Hojo만의 것이 아닙니다. 이것이 바로 현재 OpenASR 순위에서 상위를 차지하는 모델들의 주류 방향입니다. 현재 순위가 높은 모델들, 예를 들어 엔비디아의 Canary-Qwen-2.5B, IBM의 Granite-Speech-3.3-8B, 마이크로소프트의 Phi-4-Multimodal 등은 모두 언어 모델의 능력을 음성 인식에 통합하여 평균 WER(오류율)를 5.6%에서 5.9% 사이로 낮추었습니다. 언어 모델을 도입하는 장점은 단순히 “들은 소리를 그대로 글로 적는” 것을 넘어서, 모델이 의미를 이해하여 판단할 수 있다는 점입니다. 소음이 많은 환경, 구어체 표현, 중국어와 영어가 섞여 있는 경우, 또는 특정 분야의 전문 용어가 사용될 때, 의미를 이해하는 모델은 화자가 무엇을 표현하고자 하는지 더 쉽게 파악할 수 있습니다. 다음은 실제 테스트 결과입니다. 우리는 모델을 로컬에 배포하여 여러 번 테스트를 진행했습니다.

실제 테스트 사례는 두 가지 층으로 나뉩니다: 【1】Hojo-ASR-V1 모델의 ASR(자동 음성 인식) 능력. 【2】Hojo-TTS. ASR(Automatic Speech Recognition)은 음성을 텍스트로 변환하는 기술로, 전체 Voice AI 체인의 첫 번째 단계입니다. 스마트폰의 음성 입력기, 회의록, 실시간 자막, 그리고 최근에 인기를 얻고 있는 AI 에이전트 등 모든 것에 ASR이 필수적입니다. 저는 이전에 Wispr Flow, Typeless와 같은 AI 음성 입력 도구를 사용했습니다. 이러한 제품들의 사용 경험은 좋았지만, 인터넷 연결 상태가 불안정할 때 가끔 지연이 발생했으며, 중국어에 대한 적응도 개선이 필요했습니다. 그 후 저는 점차 로컬 배포 솔루션으로 전환했으며, 그중에서도 OpenAI가 오픈소스로 제공하는 Whisper를 가장 많이 사용했습니다. 이번에 Hojo-ASR-V1가 출시되자, 실제로 사용해보기 위해 기존의 Whisper를 Hojo-ASR-V1로 교체했습니다. 전반적으로 인식 속도와 정확도가 모두 만족스러웠으며, 일상적인 음성 입력에 충분히 유용했습니다. 물론, 일정한 로컬 하드웨어 리소스가 필요하며 메모리 요구량도 있습니다. 전체 솔루션은 복잡하지 않으며, 기본적으로 Hojo-ASR-V1를 기반 인식 엔진으로 사용하고 시스템 수준의 권한을 통해 음성 입력을 처리합니다. 설정을 완료하면 브라우저, ChatGPT, Claude, Notion 등 거의 모든 텍스트 입력 환경에서 사용할 수 있습니다. 테스트할 때, 저는 “교차로”에 대한 설명을 직접 말했는데, 여기에는 콘텐츠의 위치, 방향, 이름의 유래 등이 포함되었습니다. 전체 과정에서 사전에 텍스트를 준비하거나 의도적으로 말속도를 늦추지 않았습니다. 개인적으로 흥미로운 점은 이러한 워크플로우를 더 확장할 수 있다는 것입니다. 인식이 완료된 후에는 DeepSeek, GPT 또는 다른 모델을 연동하여 텍스트를 다듬고, 형식을 정리하며, 오타를 수정하고, 구조를 최적화할 수 있습니다.

대략적인 프로세스는 다음과 같습니다: 음성 입력 → ASR(자동 음성 인식) 전사 → 대형 모델 최적화 → 직접 워크플로우로 진입합니다. 자주 글을 쓰거나 회의를 하거나 에이전트와 협업하는 사람들에게 이러한 경험은 기존의 입력 방식보다 더 편안합니다. Hojo-ASR-V1 외에도, Hojo가 TTS(음성 합성) 분야에도 투자하고 있다는 것을 알게 되었습니다. 이번에는 Hojo의 TTS 음성 합성 모델을 체험해 보았으며, 팀은 더 가벼운 버전인 Hojo-TTS-Light도 오픈소스로 공개했습니다. 이러한 요소들이 함께 Hojo가 에이전트 워크플로우를 위한 서비스를 구성합니다. Voice AI의 또 다른 요소는 바로 TTS입니다. TTS 모델의 기능을 체험할 수 있는 곳은 공식 웹사이트입니다: hojoai.com **다국어 음성 합성 – 경쾌한 여성 목소리** 먼저 다국어 음성 합성 기능을 테스트해 보았는데, 이는 TTS 모델에서 비교적 흔하게 사용되는 기능입니다. 최근 월드컵이 곧 시작되어서, 경쾌한 여성 목소리로 월드컵 일본 대표팀 선수들에 대한 소개 문장을 읽어보게 했습니다. 약 30초 분량의 중국어 음성은 꽤 자연스럽게 들렸으며, 발음과 일부 세부 사항도 잘 처리되었습니다. AI의 흔적은 거의 느껴지지 않았습니다. 여성 목소리의 억양과 경쾌한 말투가 잘 드러났습니다. 우리가 음성이 자연스럽지 않은지 판단할 때는 일반적으로 발음과 각 단어의 끝에서의 억양을 듣는데, 이 문장은 처음 설정된 스타일과 잘 맞았습니다. Hojo는 일본어, 프랑스어, 광둥어 등 다양한 언어를 지원합니다. 같은 일본 대표팀 소개 문장을 일본어로 읽어보니 효과도 괜찮았으며, 듣기에 NHK의 방송처럼 느껴졌습니다. **다국어 음성 합성 – 매력적이고 안정적인 남성 목소리** 이 TTS 모델은 다양한 캐릭터의 목소리도 사용할 수 있으며, 남성 목소리도 괜찮았습니다. 2026년 월드컵에 대한 소개 문장을 매력적이고 안정적인 남성 목소리로 읽어보았는데, 제가 설정한 스타일과 거의 일치했습니다. **다양한 목소리 톤의 음성 합성 – 오디오북** TTS 모델은 다양한 목소리 톤을 사용할 수 있습니다. 이번에는 오디오북의 목소리로 문장을 읽어보게 했습니다. 이 문장은 ‘나루토’의 주제 소개로, 오디오북의 남성 목소리로 합성되었으며 자연스럽게 들렸습니다. “소년”과 같은 단어를 읽을 때, 음의 연결이 매끄러웠습니다. 또한 “와”와 같은 일상적으로 사용하는 연결사의 정지도 정확했기 때문에 전체적으로 듣기가 편안했습니다. **다양한 목소리 톤의 음성 합성 – 속삭임** 테스트할 때 특별히 언급하고 싶은 목소리 톤이 있었는데, 바로 속삭임입니다. 여성의 속삭임 목소리로 ‘침묵의 어린양’ 영화에 대한 소개를 읽어보았습니다. 이 소리는 무슨 말을 하는지 잘 들릴 뿐만 아니라, 마치 누군가가 귀에 속삭이는 듯한 가벼운 바람소리, 미세한 숨소리, 음량도 잘 재현되었습니다. TTS 모델의 속삭임은 단순히 음량을 줄이는 것이 아니라, 어조, 리듬, 감정도 모두 괜찮았습니다. 이러한 목소리 톤은 서스펜스 해설, 이야기 내레이션, ASMR에도 적합합니다. 표준 방송 목소리 외에도 더 인식하기 쉬운 캐릭터 목소리도 테스트해 보았습니다. **최근에는 대학 입시 시즌이라서, TV, 라디오, 짧은 동영상에서 많은 축복의 말과 뉴스 방송을 들을 수 있습니다. CCTV의 아나운서 목소리는 중국어 방송에서 상당히 대표적이며, 발음이 표준적이고 명확합니다. 그래서 이번에는 캉후이의 오디오를 참고로 사용했습니다.** 파일 복사 음색 - 캉후이 저는 이 원본 오디오 파일을 TTS(음성 합성) 모델에 보내서 그 안에 있는 음색을 그대로 복제하도록 했으며, 대학 입시를 준비하는 학생들에게 행운을 빕니다는 내용의 약 40초 분량의 문장을 읽도록 했습니다.

효과적으로, TTS 모델은 원래의 목소리 특성을 잘 보존하고 있습니다. 특히 캉후이의 어조, 멈춤, 방송 리듬이 그대로 재현되었습니다. 첫 문장만 들어도 캉후이 본인과 매우 비슷하다는 것을 알 수 있습니다. “청춘을 낭비하지 말고 미래로 나아가자”와 같은 말을 할 때, 익숙한 뉴스 진행자의 어조와 대형 행사의 사회자로서의 느낌이 분명하게 드러납니다. **나타즈** 음색 복제는 TTS 모델의 대표적인 능력 중 하나입니다. 저는 이 모델을 사용하여 몇 개의 IP 캐릭터의 목소리를 복제해 보았는데, 첫 번째로는 《나타즈: 마동강세》의 나타즈였습니다. 듣기에 나타즈의 자유분방하고 게으른 느낌이 잘 나타나며, 멈춤도 거의 원래와 같습니다. **피그파이** 만화 캐릭터의 음색도 TTS 모델이 꽤 잘 재현했습니다. 만화 캐릭터의 목소리는 실제 사람이나 영화 캐릭터와는 다르기 때문에 처리 방법에도 약간의 차이가 있습니다. 아래는 제가 TTS 모델을 사용하여 합성한 피그파이의 목소리입니다: **맥아더** 심지어, 저는 틱톡에서 매우 인기 있는 “맥아더” 해설 음성을 특별히 녹음해서 한 번 들려보게 했습니다: “십자로”는 국내에서 AI 트렌드에 초점을 맞춘 기술 미디어로, 주요 형태는 팟캐스트이며 동영상, 공식 계정의 텍스트 버전, 오프라인 커뮤니티 활동으로도 확장되어 있습니다. “십자로”는 스티브 잡스가 애플 회사를 묘사할 때 사용한 비유로, 기술과 인문학의 교차로에 서 있는 곳이며 위대한 제품들이 이곳에서 탄생한다고 합니다. AI가 각 산업에 가져다주는 변화와 기회에 주목하고, AI 시대의 “적극적인 행동가들”을 찾아 인터뷰하고 모으며, 그들과 함께 새로운 가능성을 탐구하고 받아들입니다. **호조(Hojo) 팀은 누구인가** 호조(Hojo) 팀 자체에 대해 말하자면, 이들은 단순히 음성 대형 모델만 만드는 회사가 아닙니다.

호조(Hojo)는 약 2년 전에 설립되었으며, 이번 정보가 공개되기 전까지는 외부에서 그에 대해 알려진 바가 거의 없었습니다. 저희가 팀과 연락하여 일부 일차적인 정보를 얻었습니다. 호조 자체의 포지셔닝에 따르면, 그들이 더 집중하고자 하는 것은 지식 근로자를 위한 개인 에이전트(Personal Agent) OS입니다. 간단히 말해, 에이전트가 사무 업무, 커뮤니케이션, 창작, 협업과 같은 일상적인 업무 흐름에 실제로 통합되도록 하는 것이며, ASR(자동 음성 인식)과 TTS(자동 음성 합성)는 이 시스템의 핵심 구성 요소입니다. 이것이 호조를 이해하는 데 중요한 포인트입니다. ASR은 사실 에이전트가 실제 업무 상황을 이해하는 데 필요한 첫 번째 기반입니다. 회의, 전화, 음성 메모, 다자간 대화의 정보를 안정적으로 수집하고 나서야 이후의 이해, 계획, 실행이 가능해집니다. 팀의 배경을 살펴보면, 호조의 특별한 점은 핵심 멤버들이 오랫동안 “실제 음성 상황”과 직접적으로 관련된 작업을 해왔다는 것입니다. 팀원들은 주로 자동차 음성, 스마트 캐빈, 음성 상호작용 분야의 팀에서 온 사람들로, 샤오푹(Xpeng), 니우리(NIO Nomi), 상탕(Shangtang) 등에서 근무한 경험이 있습니다. 구체적으로 말하자면, 창립자인 자오 헝이(Zhao Hengyi)는 이전에 레이쉬(LeEco), 샤오푹, 니우리, 상탕 등의 팀에서 음성 상호작용, 스마트 캐빈, AgentOS 관련 업무를 담당했으며, 자동차 음성, 스마트 캐빈, 다국어 상호작용, AI 자율 작동 애플리케이션, 크로스디바이스 서비스 분야에서 경험이 있습니다. 최고 제품 책임자인 리 오우(Li Ou)는 상탕, 니우리 등의 팀에서 AgentOS, 스마트 캐빈, 디지털 제품 기획을 담당했으며, 음성 기능이 어떻게 완전한 제품 경험으로 구성될 수 있는지에 중점을 두었습니다. COO인 손 샤오강(Sun Xiaogang)은 에이전트 솔루션의 상업화와 산업화 경험이 있으며, 자동차, 음식, 이동 등의 상황에서의 음성 상호작용 솔루션에 참여했습니다. 이러한 이력을 종합해 보면, 호조 팀의 공통된 경험은 실제 상황에서의 음성 문제를 장기적으로 해결하는 데 충분한 배경을 갖추고 있습니다. 이는 주로 이 팀원들이 모두 ASR이 실제 환경에서 어떻게 작동하는지에 집중하고 있기 때문입니다. 실제 환경은 실험실의 깨끗한 음성과는 매우 다릅니다. 차 안에는 소음이 있고, 방언이 존재하며, 여러 사람이 동시에 말하고, 갑작스러운 중단이 발생하며, 불완전하고 구어체적인 표현도 많습니다.

사용자들은 표준적인 프롬프트에 따라 말하지 않으며, 시스템이 반응하기를 기다리지도 않습니다. 이러한 상황을 경험한 사람들은 음성 모델이 직면하는 진짜 어려움을 더 잘 이해할 수 있습니다. ASR(자동 음성 인식)은 복잡한 환경에서도 사람의 의도를 안정적으로 이해해야 합니다. 호조(Hojo)의 수석 과학자인 수단(Sudan)의 경력도 이러한 맥락에서 더 잘 이해됩니다. 그는 초기에 바이두(Baidu)에서 음성 인식 관련 연구 개발에 참여하여 딥러닝을 통해 ASR을 상용화하는 단계를 경험했으며, 이후 텐센트 AI Lab에서 음성 관련 분야를 담당하며 대형 모델이 음성 상호작용을 재구성하는 시기를 맞이했습니다. 이러한 경력의 가치는 그가 음성 기술이 인식 정확도 경쟁에서 실제 시나리오에 적용되는 단계, 그리고 대형 모델 시대의 음성 상호작용 재구성에 이르기까지 여러 변화를 직접 경험했다는 점에 있습니다. 퍼스널 에이전트 OS(Personal Agent OS)를 만들고자 하는 회사에게 이러한 경험은 음성을 단순한 입력 구성 요소로만 보지 않고 실제 작업 흐름에 통합하여 재설계하는 것이 중요하다는 것을 의미합니다. 자본 측면에서, 호조는 제품이 아직 대규모로 출시되지 않았음에도 불구하고 지금까지 약 1억 위안에 달하는 4라운드의 투자를 완료했으며, 현재 Pre-A 라운드를 진행 중입니다. 이러한 정보만으로는 제품의 성공을 직접 증명할 수는 없지만, 적어도 일차 시장이 이 회사의 Voice AI 및 Agent OS 분야에서의 기술적 성과에 관심을 보이고 있음을 보여줍니다. 상업화 측면에서, 호조에 따르면 자체 개발한 “대형 모델 + 에이전트 OS” 조합은 이미 수천만 대의 AI 음성 장치에 기본적인 음성 기능을 제공하고 있습니다. 이 수치가 사실이라면, 이는 그들이 단지 논문이나 데모, 순위표에 그치지 않고 실제 장치와 사용자 시나리오에 진입했음을 의미합니다. 호조 자체의 계획에 따르면, ASR은 단지 첫 번째 단계에 불과합니다. 그들은 동시에 TTS(음성을 텍스트로 변환하는 기술)도 개발 중이며, 6월 말에는 완전한 양방향 음성 모델을 출시할 계획입니다. 그들이 진정으로 전하고자 하는 이야기는 퍼스널 에이전트 OS를 중심으로 음성 상호작용의 전체 인프라를 구축하는 것입니다: 에이전트가 듣고, 이해하고, 응답할 수 있도록 하여 결국 지식 근로자의 실제 작업 흐름에 통합하는 것입니다. 이러한 계획이 실현될지는 후속 제품을 통해 검증되어야 합니다. 하지만 적어도 이번 Hojo-ASR-V1의 성과를 보면, 그들은 Voice AI 작업 흐름의 첫 단계에서 이미 주목할 만한 결과를 내놓았습니다. 그렇다면, 호조-ASR이 이러한 데이터를 공개한 이유는 무엇일까요? 혹은 호조-ASR은 어떤 배경 하에 있는 걸까요? Voice AI는 일반적인 대형 모델과는 다른 이야기의 흐름입니다. 에이전트가 실제 작업 흐름에 들어갈수록 받아야 할 컨텍스트는 점점 더 복잡해집니다: 회의 중의 대화, 전화에서의 요청, 현장 환경의 소리, 사용자가 임시로 추가하는 말, 심지어 여러 사람이 동시에 협력할 때 변화하는 지시 등입니다. 과거에는 이러한 정보가 주로 타이핑을 통해 입력되었지만, 많은 작업 상황에서 실제로 발생하는 정보는 글로 쓰여지는 것이 아니라 말로 전달됩니다.

이것이 바로 대기업들이 지난 2년 동안 Voice AI에 더 많은 투자를 하고 있는 이유입니다. OpenAI는 Realtime API를 출시했고, Google은 Gemini Live를 개발했으며, 국내의 코다크송피(科大讯飞), 두바오(豆包), 미니맥스(MiniMax), 절역(阶跃) 등도 음성 기술 분야에 투자를 하고 있습니다. 이 분야의 인기는 지난 2년 동안 막대한 자금 유입으로 증명되었습니다. AssemblyAI의 통계에 따르면, 2025년에는 음성 관련 AI 스타트업들이 약 21억 달러의 벤처 자금을 유치했습니다. 2025년 6월부터 2026년 5월까지 대화형 AI 분야에서 공개적으로 발표된 투자 건수는 36건으로, 총액은 약 25.8억 달러에 달합니다. 한마디로 말해, 이 분야는 매우 활발합니다. 구체적인 예로, 음성 합성 기술을 개발하는 ElevenLabs는 D라운드에서 5억 달러를 유치하여 기업 가치가 110억 달러에 달했습니다. 전화 고객 서비스 음성 기술을 제공하는 PolyAI는 8,600만 달러의 D라운드 투자를 받았으며, 실시간 통화 기술을 강점으로 하는 Retell AI는 매달 4,000만 건 이상의 AI 통화를 처리하며 분기별 성장률이 300% 이상입니다. 또한 Cartesia와 같은 팀은 음성 지연 시간을 100밀리초 이내로 줄여 대화의 끊김을 최소화하는 데 집중하고 있습니다. 대기업들의 활동도 매우 활발합니다. OpenAI는 Realtime API를 통해 음성 처리 과정을 단일화하여 '음성 입력 → 음성 출력'까지의 전 과정을 한 번에 처리합니다. Google의 Gemini Live도 비슷한 방식으로, 사용자가 말을 하다가 중단되더라도 이어서 응답할 수 있습니다. 최근에는 Gamma4를 지원하는 새로운 Voice AI 기능도 출시되었습니다. 음성 기술은 '더 자연스러운 상호작용 방식'으로 발전하고 있으며, 최근 유행하는 Vibe Working과 같은 환경에서 이러한 추세는 더욱 두드러집니다. 사용자는 모든 요구사항을 완전한 프롬프트(Prompt)로 정리할 필요가 없습니다. 생각하면서 말하고, 말하면서 조정할 수 있으며, 이를 통해 에이전트(Agent)가 대화 중에 의도를 파악하고 상황을 보완하며 작업을 진행할 수 있습니다. 이러한 상호작용 방식이 더 자연스러워질 것입니다. 이 과정에서 ASR(자동 음성 인식, Automatic Speech Recognition)은 가장 기본적인 기술입니다. ASR은 에이전트가 현실 세계의 정보를 제대로 이해할 수 있는지를 결정합니다. 정확하게 인식하지 못하면 이후의 이해, 계획, 실행 모두 왜곡될 수 있습니다. 정확하게 인식하면 음성 기술이 진정으로 업무 흐름의 일부가 될 수 있습니다. 요약하자면: 에이전트가 일상생활에 점점 더 많이 사용되면서, 음성, 즉 Voice AI가 사람들과 소통하는 첫 번째 수단이 될 가능성이 높습니다. 사람과 AI가 연결되는 방법은 타이핑, 인터페이스 조작, 코드 작성을 통해 API를 호출하는 것 등 다양하지만, 가장 자연스러운 방법은 여전히 말로 소통하는 것입니다. 이것이 바로 점점 더 많은 사람들이 음성을 에이전트의 '컨텍스트 엔트리(context entry)' 즉, 상황 정보의 입력 수단으로 여기는 이유입니다. 대규모 모델이 세계를 이해하는 역할을 한다면, 음성은 세계의 정보가 모델로 지속적으로 유입되는 통로가 됩니다. 이 통로에서 ASR은 정보를 감지하는 역할을 합니다. ASR은 에이전트가 외부 환경의 정보를 정확하게 포착하고 현실 세계의 소리를 모델이 이해하고 활용할 수 있는 상황 정보로 변환할 수 있는지를 결정합니다. 이러한 관점에서 볼 때, ASR의 경쟁은 새로운 차원으로 올라섰습니다: 차세대 에이전트와 현실 세계가 연결되는 수단을 누가 장악할지에 대한 경쟁입니다. 이것이 바로 Hojo-ASR-V1의 공개 데이터가 더 주목받아야 하는 이유입니다. 그 뒤에는 단순한 모델 성능의 변화만이 아니라 더 많은 것이 반영되어 있습니다.

Voice AI는 보조 기능에서 인프라로 발전하고 있으며, Agent 시대에 점점 더 중요한 기반으로 자리매김하고 있습니다. 🚥 Voice AI에 대해 다시 이야기해보겠습니다. 대부분의 기업들이 일반적인 대형 모델에 주목하는 동안, 상대적으로 주목받지 못했던 음성 분야는 실제로 빠르게 진화하고 있습니다. ASR(자동 음성 인식)과 같은 분야에서도 OpenAI, 마이크로소프트, 엔비디아, IBM과 같은 대기업들이 주도해온 가운데, 스타트업들이 경쟁력 있는 성과를 내기 시작했습니다. Hojo-ASR-V1의 등장이 반드시 시장 구도의 변화를 의미하는 것은 아니지만, 적어도 Voice AI가 주변적인 기능에서 더 중요한 위치로 나아가고 있으며, 점점 더 많은 사람들의 관심을 끌고 있음을 보여줍니다. 음성 인식은 Voice AI의 첫 단계에 불과합니다. 기계가 정확하게 소리를 인식한 후, 그 정보를 이해하고 인간에 가까운 방식으로 반응할 수 있는지가 훨씬 더 길고 가치 있으며, 더 큰 잠재력을 가진 과제입니다. 참고 자료: [1] https://huggingface.co/HojoAI/Hojo-ASR-V1: https://huggingface.co/HojoAI/Hojo-ASR-V1 [2] https://github.com/HojoAI/Hojo-ASR: https://github.com/HojoAI/Hojo-ASR 이 글은 WeChat 공식 계정 “十字路口Crossing”에서 작성되었으며, 작성자는 “十字路口Crossing”입니다.

도움이 되었나요?

기술 지원온라인 상담
侧栏
맨 위로
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR