AirAi 생태 협력 계획: 10,000달러의 예산을 마련하여 아직도 무언가를 만들고 있는 사람들을 후원합니다.
...
0. 배경: 결제 문제가 어떻게 발생했는가저는 몇 개의 사이드 프로젝트를 진행하고 있는데, 초기에는 공식적인 월간 구독 서비스(/mo)를 구매하거나 국제 신용카드 결제가 거절될 때를 감수해야 했습니다. 월말에 계산을 해보니 두 가지 심각한 문제가 있었습니다:요청의 80%가 요약, 분류, 포맷ting과 같은 간단한 작업이었는데, 가장 비싼 모델을 사용하는 것은 완전히 낭비였습니다;구독 비용은 고정된 비용이었기 때문에, 호출 횟수가 적을 때는 손해를 보고, 호출 횟수가 많을 때는 모델이 부족했습니다.
우리는 Claude 3 Opus를 사용하여 국경 간 세관 신고서를 처리하는 작업을 했고, 이를 통해 60%의 인력 검토 비용을 절약할 수 있었습니다. 하지만 그 과정에서 3가지 문제에 부딪혔습니다.
Claude Fable 5는 오늘날 AI 분야의 핵심 화제로, 이 “신화적인” 모델의 성능이 매우 뛰어나서 수많은 관심을 받고 있습니다.Andrej Karpathy는 이를 “매우 흥미진진하다”고 평가하며, “대규모 업그레이드에 걸맞는 도약적인 진전”이라고 말했습니다. 이는 지난 11월 Claude 4.5에서 이루어진 개선과 동일한 수준입니다. SWE-bench Pro 프로그래밍 벤치마크에서 Fable 5는 80.3%의 점수를 기록하여 Opus 4.8보다 11%나 높은 성능을 보였습니다. 5천만 줄의 코드를 가진 Ruby 코드베이스에서 Fable 5는 하루 만에 전체 코드베이스의 마이그레이션을 완료했는데, 같은 작업을 인간 팀에게 맡긴다면 2개월 이상의 시간이 걸릴 것입니다.
Voice AI는 일반적인 대형 모델과는 다른 이야기의 흐름입니다. 모두가 일반적인 대형 모델에 주목하는 동안, 비교적 조용했던 Voice AI 분야에서도 주목할 만한 새로운 모델들이 등장하기 시작했습니다. 키보드는 그것의 “지배적인 위치”를 잃어가고 있습니다. 지난 2년 동안, OpenAI는 Realtime API를 출시했고, Google은 Gemini Live를 개발했으며, 국내의 대형 모델 회사들도 거의 모두 Voice AI 분야에 진출하기 시작했습니다. 점점 더 많은 사람들이 Agent가 실제로 작업 흐름에 통합될 때, 음성이 키보드보다 더 자연스러운 상호작용 수단이 될 것이라고 믿기 시작했습니다. Agent가 실제로 작업 흐름에 통합되려면, 먼저 이러한 음성을 이해하는 법을 배워야 합니다. 그리고 이를 위한 첫 번째 능력은 ASR(자동 음성 인식)입니다. ASR의 수준을 측정할 때 업계에서 가장 자주 사용되는 것은 Hugging Face의 Open ASR Leaderboard이며, 핵심 지표는 단어 오류율(WER)입니다. 숫자가 낮을수록 인식 정확도가 높습니다.
더 이상 없습니다