• โครงการความร่วมมือด้านนิเวศวิทยาของ AirAi: มอบวงเงิน 10,000 เหรียญสหรัฐเพื่อสนับสนุนคนที่ยังคงทําสิ่งต่างๆ

    ...

  • ฉันลดค่าใช้จ่าย API LLM ลง 70%: บันทึกการใช้งานจริงของ AirAi ที่เกี่ยวข้องกับการเรียกเส้นทาง (routing) และการค้างคืนข้อมูล (caching)

    0. พื้นหลัง: ทำไมใบแจ้งหนี้ถึงบานปลายขนาดนี้ฉันทำโปรเจกต์เสริม (side projects) หลายโปรเจกต์ ในช่วงแรกก็ต้องซื้อการสมัครสมาชิกจากผู้ให้บริการอย่างเป็นทางการในราคา /เดือน หรือไม่ก็พยายามใช้บัตรเครดิตระหว่างประเทศ แต่ก็ถูกปฏิเสธบ่อยครั้ง เมื่อมาคำนวณค่าใช้จ่ายในตอนสิ้นเดือน ฉันพบสองเรื่องที่น่าหงุดหงิด:80% ของการร้องขอเป็นงานเล็กๆ น้อยๆ เช่น การสรุปข้อมูล การจัดหมวดหมู่ และการจัดรูปแบบ การใช้โมเดลที่แพงที่สุดกับงานเหล่านี้เป็นเพียงการสิ้นเปลืองเท่านั้น;การสมัครสมาชิกเป็นค่าใช้จ่ายที่คงที่ — ถ้ามีการเรียกใช้งานน้อยก็ขาดทุน แต่ถ้ามีการเรียกใช้งานมากก็ไม่เพียงพอ

  • นักวิทยาศาสตร์ OpenAI Noam Brown: ขีด จํากัด ที่แท้จริงของ AI อาจไม่มีใครสามารถวัดได้เลย

    เมื่อโมเดลภาษาขนาดใหญ่เริ่มเข้าสู่งานที่ซับซ้อน เช่น การอนุมาน การวิจัยอัตโนมัติ และความปลอดภัยทางไซเบอร์ วิธีการประเมินโมเดลแบบดั้งเดิมก็กำลังเผชิญกับความท้าทายใหม่ๆมาเป็นเวลานานแล้ว การเปิดตัวโมเดลมักจะมาพร้อมกับตารางผลลัพธ์ที่ประกอบด้วยการทดสอบมาตรฐานหลากหลายประเภท เช่น คณิตศาสตร์ การเขียนโปรแกรม คำถาม-คำตอบทางวิทยาศาสตร์ ความปลอดภัยทางไซเบอร์ และการอนุมานความรู้ และจะมีการเปรียบเทียบผลลัพธ์เหล่านั้นกับโมเดลรุ่นก่อนหน้า

    นักวิทยาศาสตร์ OpenAI Noam Brown: ขีด จํากัด ที่แท้จริงของ AI อาจไม่มีใครสามารถวัดได้เลย
  • ในสนามแข่งขัน Voice AI ที่กำลังร้อนแรงขึ้นเรื่อยๆ มีสตาร์ทอัพชื่อ Hojo ปรากฏตัวขึ้น

    Voice AI อีกหนึ่งเรื่องราวนอกเหนือจากโมเดลใหญ่ของจีเอ็ม ในขณะที่ทุกคนกําลังจ้องมองรุ่นใหญ่ของ Voice AI รุ่นใหม่ที่น่าสังเกตเริ่มปรากฏขึ้นในสนามที่ค่อนข้างเงียบสงบ แป้นพิมพ์กําลังสูญเสียการปกครองของมัน ในช่วงสองปีที่ผ่านมา OpenAI เปิดตัว API แบบ Realtime Google ทํา Gemini Live และ บริษัท โมเดลใหญ่ ๆ ในประเทศเกือบจะเริ่มวางรูปแบบ Voice AIมีความเชื่อมากขึ้นว่าเมื่อตัวแทนเข้ามาในเวิร์กโฟลว์เสียงจะกลายเป็นทางเข้าบริบทที่เป็นธรรมชาติมากกว่าแป้นพิมพ์ ถ้าตัวแทนต้องการเข้าสู่กระแสงานจริงๆ มันต้องเรียนรู้ที่จะเข้าใจเสียงเหล่านี้ก่อนและความสามารถชั้นแรกที่อยู่เบื้องหลังนี้คือ ASR (การจดจําเสียงอัตโนมัติ) สําหรับการวัดระดับ ASR ที่อุตสาหกรรมนิยมอ้างถึงมากที่สุดคือ Open ASR Leaderboard ของ Hugging Face ตัวชี้วัดหลักคืออัตราข้อผิดพลาดของคํา (WER) ยิ่งตัวเลขต่ําเท่าไหร่การระบุก็ยิ่งถูกต้องมากขึ้นเท่านั้น

ไม่มีเนื้อหาเพิ่มเติม