Google เปิดตัว Gemini 3.8 Live โมเดลเสียงพูดใหม่ รองรับการใช้เหตุผลแบบเรียลไทม์

Google กำลังพยายามจัดการปัญหาความหน่วงของเอเจนต์ AI ประเภทเสียงด้วยการเปิดตัว Gemini 3.8 Live และ Gemini 3.8 Live Extended Thinking

Credit: Google

โมเดลดังกล่าวถูกนำเสนอว่าเป็นโมเดลประมวลผลเสียงที่ก้าวหน้าที่สุดของบริษัทเท่าที่เคยเปิดตัวมา โดยมีความสามารถในการใช้เหตุผลแบบเกือบเรียลไทม์และประมวลผลคำพูดและความคิดไปพร้อม ๆ กัน นอกจากนี้ Google ยังระบุในบล็อกโพสต์ว่าโมเดลดังกล่าวยังสามารถเรียกใช้เครื่องมือซอฟต์แวร์ของบุคคลที่สามในเบื้องหลังได้อีกด้วย

หากเชื่อตามข้อมูลของ Google โมเดลรุ่นใหม่เหล่านี้มีผลการทดสอบมาตรฐานระดับสูง โดย Gemini 3.8 Live Extended Thinking ทำคะแนนสูงสุดใหม่ได้ที่ 82.6 บนดัชนี Artificial Analysis Speech to Speech Quality Index ซึ่งแซงหน้า GPT-Live-1-Astra และ Grok Voice Think Fast 2.0 ไปได้ ส่วน Gemini 3.8 Live อยู่อันดับสองในการทดสอบ Speech Agent Arena และเป็นอันดับหนึ่งบน EVA-Bench ของ ServiceNow นอกจากนี้ Gemini 3.8 Live Extended Thinking ยังทำคะแนนได้ 68.6% บน T-Voice, 35.1% บน T-Voice-banking และ 97.7% บน Big Bench Audio

Google อธิบายว่าโมเดลรุ่นใหม่ได้รับการออกแบบมาเพื่อเรียกใช้เครื่องมือและ API ในเบื้องหลังไปพร้อมกับการรักษาจังหวะการสนทนาที่เป็นธรรมชาติกับผู้ใช้งานที่เป็นมนุษย์ ซึ่งหมายความว่าเอเจนต์ AI สามารถพูดคุยกับผู้ใช้งานต่อไปได้ในขณะที่กำลังทำงานที่ได้รับมอบหมายไปพร้อม ๆ กัน ตามข้อมูลของ Google สิ่งนี้มอบประสบการณ์การใช้งานที่ดูเป็นธรรมชาติและเหมือนมนุษย์มากขึ้น โดยที่ผู้ใช้งานไม่ต้องพบกับการหยุดชะงักระหว่างที่เอเจนต์ไปดำเนินการค้นหาคำตอบในอินเทอร์เน็ต

Google กล่าวว่าโมเดลเหล่านี้ยังมีฟีเจอร์ขั้นสูงอื่น ๆ อีกด้วย ตัวอย่างเช่น ทั้ง Gemini 3.8 Live และ Gemini 3.8 Live Extended Thinking รองรับการตรวจจับภาษาอัตโนมัติและมีความสามารถในการสลับภาษาได้ในระหว่างการสนทนา โมเดลเหล่านี้สามารถเข้าใจและสร้างคำพูดได้ใน 97 ภาษา รองรับการเชื่อมโยงข้อมูลภาพแบบเรียลไทม์ และสามารถใช้คำพูดนำ เช่น “ขอฉันตรวจสอบเรื่องนั้นก่อนนะ” เพื่อตอบรับคำสั่งของผู้ใช้งานในลักษณะที่เป็นธรรมชาติและสมจริงยิ่งขึ้น

Google ระบุว่า Gemini 3.8 Live พร้อมให้ใช้งานแล้วผ่าน Gemini API และ Google AI Studio และยังสามารถเข้าถึงได้ในรูปแบบพรีวิวส่วนตัวสำหรับองค์กรผ่าน Gemini Enterprise และ Search Live สำหรับ Gemini 3.8 Live Extended Thinking นั้น มีให้บริการผ่านช่องทางเดียวกัน รวมถึงใน Google Workspace ผ่าน Docs, Gmail และ Keep (สำหรับผู้สมัครใช้บริการ) และในแอปพลิเคชัน Gemini Live

นอกจากนี้ Google ยังกล่าวว่านักพัฒนาจะสามารถบูรณาการโมเดลเหล่านี้เข้ากับแอปพลิเคชันของตนผ่านแพลตฟอร์มพันธมิตรของ Google เช่น Vercel, Agora, LiveKit, Pipecat, Fishjam และ Vision Agents โดยเมื่อมีการสร้างไฟล์เสียง ไฟล์เหล่านั้นจะมีลายน้ำ SynthID ที่มองไม่เห็นกำกับอยู่ ซึ่งสามารถนำไปใช้ในการตรวจจับข้อมูลที่ไม่ถูกต้องได้

ในส่วนของราคา Google ระบุว่าโมเดลมาตรฐาน Gemini 3.8 Live มีค่าใช้จ่ายอยู่ที่ 0.005 ดอลลาร์ต่อนาทีสำหรับอินพุตเสียง และ 0.018 ดอลลาร์ต่อนาทีสำหรับเอาต์พุต ส่วนโมเดล Extended Thinking จะมีการคิดค่าบริการสำหรับโทเค็นในการใช้เหตุผลและอินพุตเพิ่มเติม เช่น วิดีโอและเอกสาร

ที่มา: https://siliconangle.com/2026/09/15/googles-new-speech-model-gemini-3-8-live-supports-real-time-reasoning/

About นักเขียนฝึกหัดหมายเลขเก้า

Check Also

Tenable Webinar : พลิกโฉมระบบป้องกันแบบ Prompt AI สู่การทำงานแบบ Agentic ด้วย Tenable Hexa AI [28 ต.ค. 2569 — 14.00น.]

Tenable ขอเชิญ IT Manager, IT Security Consultant, SecOps, Network Operation, IT security operation, System Engineer, …

Namespace ระดมทุน 42 ล้านดอลลาร์ ดันคลาวด์ประมวลผลเพื่อนักพัฒนา

Namespace Labs สตาร์ทอัพด้านโครงสร้างพื้นฐานสำหรับนักพัฒนาซึ่งก่อตั้งขึ้นในเมืองซูริค ประเทศสวิตเซอร์แลนด์ ประกาศการระดมทุนรอบ Series B มูลค่า 42 ล้านดอลลาร์ ที่นำโดย Scale Venture Partners เพื่อมอบโครงสร้างพื้นฐานด้านการประมวลผลประสิทธิภาพสูงให้แก่นักพัฒนาเพื่อเร่งความเร็วของงานวิศวกรรมซอฟต์แวร์