AirAi Eco-Partnership Program: Membuat $10.000 untuk mensponsori orang-orang yang masih melakukan sesuatu
...
0. Latar Belakang: Bagaimana biaya bisa melonjak begitu tinggi?Saya mengerjakan beberapa proyek sampingan, dan di awalnya saya harus membeli langganan resmi seharga per bulan, atau mencoba menggunakan kartu kredit internasional yang sering ditolak. Saat menghitung biaya di akhir bulan, saya menemukan dua hal yang sangat menyakitkan:80% dari permintaan adalah tugas-tugas ringan seperti ringkasan, klasifikasi, dan pemformatan; menggunakan model yang paling mahal untuk tugas-tugas tersebut hanyalah pemborosan;Langganan merupakan biaya tetap—ketika jumlah panggilan sedikit, saya rugi, dan ketika jumlah panggilan banyak, model tersebut tidak cukup untuk memenuhi kebutuhan.
Seiring dengan semakin banyaknya model bahasa besar yang digunakan untuk tugas-tugas yang kompleks seperti penalaran, penelitian otomatisasi, dan keamanan jaringan, metode penilaian model tradisional menghadapi tantangan baru.Selama ini, peluncuran sebuah model biasanya disertai dengan tabel hasil yang terdiri dari berbagai jenis pengujian baseline, seperti matematika, pemrograman, pertanyaan ilmiah, keamanan jaringan, dan penalaran pengetahuan, serta dibandingkan secara horizontal dengan model generasi sebelumnya.
Voice AI merupakan jalur perkembangan teknologi yang berbeda dari model besar umum (general large models). Sementara semua orang fokus pada model besar umum, di jalur yang relatif tenang ini, yaitu Voice AI, juga muncul beberapa model baru yang patut diperhatikan. Klavier (keyboard) mulai kehilangan “posisi dominannya”. Dalam dua tahun terakhir, OpenAI telah meluncurkan Realtime API, Google mengeluarkan Gemini Live, dan perusahaan-perusahaan besar di dalam negeri juga hampir semuanya mulai mengembangkan teknologi Voice AI. Semakin banyak orang yang percaya bahwa ketika Agent benar-benar digunakan dalam proses kerja, suara akan menjadi pintu masuk konteks yang lebih alami daripada keyboard. Jika Agent ingin benar-benar digunakan dalam proses kerja, pertama-tama ia harus belajar memahami suara manusia. Kemampuan dasar yang diperlukan untuk ini adalah ASR (Automatic Speech Recognition). Untuk mengukur kualitas ASR, indikator yang paling sering digunakan di industri adalah Hugging Face’s Open ASR Leaderboard, dengan metrik utama berupa tingkat kesalahan kata (Word Error Rate/WER). Semakin rendah angkanya, semakin akurat hasil pengenalan suara.
Tidak ada lagi