El creciente mercado de la IA de voz ha visto la aparición de una nueva startup llamada Hojo.
La IA de voz es otra línea de desarrollo aparte de los grandes modelos generales. Mientras todos prestan atención a los grandes modelos generales, en el campo relativamente tranquilo de la IA de voz también han comenzado a aparecer algunos modelos nuevos que merecen ser destacados. El teclado está perdiendo su “dominio”. En los últimos dos años, OpenAI lanzó la API en tiempo real (Realtime API), Google desarrolló Gemini Live, y casi todas las empresas chinas que trabajan con modelos grandes también han comenzado a invertir en la IA de voz. Cada vez más personas creen que, una vez que los agentes (agents) se integren realmente en los flujos de trabajo, el sonido se convertirá en una entrada al contexto más natural que el teclado. Si un agente quiere integrarse realmente en los flujos de trabajo, primero debe aprender a comprender estos sonidos. Y la primera capacidad necesaria para ello es el ASR (Reconocimiento Automático de Voz). Para medir el nivel de ASR, la industria suele utilizar la tabla de líderes Open ASR de Hugging Face, cuyo indicador clave es la tasa de errores de palabras (WER); cuanto más baja sea la tasa, más precisa es la reconocición.