Google เปิดตัว Gemini 3.8 Live โมเดลเสียงพูดใหม่ รองรับการใช้เหตุผลแบบเรียลไทม์

Google กำลังพยายามจัดการปัญหาความหน่วงของเอเจนต์ AI ประเภทเสียงด้วยการเปิดตัว Gemini 3.8 Live และ Gemini 3.8 Live Extended Thinking

Credit: Google

โมเดลดังกล่าวถูกนำเสนอว่าเป็นโมเดลประมวลผลเสียงที่ก้าวหน้าที่สุดของบริษัทเท่าที่เคยเปิดตัวมา โดยมีความสามารถในการใช้เหตุผลแบบเกือบเรียลไทม์และประมวลผลคำพูดและความคิดไปพร้อม ๆ กัน นอกจากนี้ Google ยังระบุในบล็อกโพสต์ว่าโมเดลดังกล่าวยังสามารถเรียกใช้เครื่องมือซอฟต์แวร์ของบุคคลที่สามในเบื้องหลังได้อีกด้วย

หากเชื่อตามข้อมูลของ Google โมเดลรุ่นใหม่เหล่านี้มีผลการทดสอบมาตรฐานระดับสูง โดย Gemini 3.8 Live Extended Thinking ทำคะแนนสูงสุดใหม่ได้ที่ 82.6 บนดัชนี Artificial Analysis Speech to Speech Quality Index ซึ่งแซงหน้า GPT-Live-1-Astra และ Grok Voice Think Fast 2.0 ไปได้ ส่วน Gemini 3.8 Live อยู่อันดับสองในการทดสอบ Speech Agent Arena และเป็นอันดับหนึ่งบน EVA-Bench ของ ServiceNow นอกจากนี้ Gemini 3.8 Live Extended Thinking ยังทำคะแนนได้ 68.6% บน T-Voice, 35.1% บน T-Voice-banking และ 97.7% บน Big Bench Audio

Google อธิบายว่าโมเดลรุ่นใหม่ได้รับการออกแบบมาเพื่อเรียกใช้เครื่องมือและ API ในเบื้องหลังไปพร้อมกับการรักษาจังหวะการสนทนาที่เป็นธรรมชาติกับผู้ใช้งานที่เป็นมนุษย์ ซึ่งหมายความว่าเอเจนต์ AI สามารถพูดคุยกับผู้ใช้งานต่อไปได้ในขณะที่กำลังทำงานที่ได้รับมอบหมายไปพร้อม ๆ กัน ตามข้อมูลของ Google สิ่งนี้มอบประสบการณ์การใช้งานที่ดูเป็นธรรมชาติและเหมือนมนุษย์มากขึ้น โดยที่ผู้ใช้งานไม่ต้องพบกับการหยุดชะงักระหว่างที่เอเจนต์ไปดำเนินการค้นหาคำตอบในอินเทอร์เน็ต

Google กล่าวว่าโมเดลเหล่านี้ยังมีฟีเจอร์ขั้นสูงอื่น ๆ อีกด้วย ตัวอย่างเช่น ทั้ง Gemini 3.8 Live และ Gemini 3.8 Live Extended Thinking รองรับการตรวจจับภาษาอัตโนมัติและมีความสามารถในการสลับภาษาได้ในระหว่างการสนทนา โมเดลเหล่านี้สามารถเข้าใจและสร้างคำพูดได้ใน 97 ภาษา รองรับการเชื่อมโยงข้อมูลภาพแบบเรียลไทม์ และสามารถใช้คำพูดนำ เช่น “ขอฉันตรวจสอบเรื่องนั้นก่อนนะ” เพื่อตอบรับคำสั่งของผู้ใช้งานในลักษณะที่เป็นธรรมชาติและสมจริงยิ่งขึ้น

Google ระบุว่า Gemini 3.8 Live พร้อมให้ใช้งานแล้วผ่าน Gemini API และ Google AI Studio และยังสามารถเข้าถึงได้ในรูปแบบพรีวิวส่วนตัวสำหรับองค์กรผ่าน Gemini Enterprise และ Search Live สำหรับ Gemini 3.8 Live Extended Thinking นั้น มีให้บริการผ่านช่องทางเดียวกัน รวมถึงใน Google Workspace ผ่าน Docs, Gmail และ Keep (สำหรับผู้สมัครใช้บริการ) และในแอปพลิเคชัน Gemini Live

นอกจากนี้ Google ยังกล่าวว่านักพัฒนาจะสามารถบูรณาการโมเดลเหล่านี้เข้ากับแอปพลิเคชันของตนผ่านแพลตฟอร์มพันธมิตรของ Google เช่น Vercel, Agora, LiveKit, Pipecat, Fishjam และ Vision Agents โดยเมื่อมีการสร้างไฟล์เสียง ไฟล์เหล่านั้นจะมีลายน้ำ SynthID ที่มองไม่เห็นกำกับอยู่ ซึ่งสามารถนำไปใช้ในการตรวจจับข้อมูลที่ไม่ถูกต้องได้

ในส่วนของราคา Google ระบุว่าโมเดลมาตรฐาน Gemini 3.8 Live มีค่าใช้จ่ายอยู่ที่ 0.005 ดอลลาร์ต่อนาทีสำหรับอินพุตเสียง และ 0.018 ดอลลาร์ต่อนาทีสำหรับเอาต์พุต ส่วนโมเดล Extended Thinking จะมีการคิดค่าบริการสำหรับโทเค็นในการใช้เหตุผลและอินพุตเพิ่มเติม เช่น วิดีโอและเอกสาร

ที่มา: https://siliconangle.com/2026/09/15/googles-new-speech-model-gemini-3-8-live-supports-real-time-reasoning/

About นักเขียนฝึกหัดหมายเลขเก้า

Check Also

OpenAI จับมือ Anthropic และ Google ยกระดับ AI Safety ท่ามกลางแรงกดดันกำกับดูแลด้านความมั่นคง

OpenAI เดินหน้าประสานความร่วมมือกับสองคู่แข่งสำคัญอย่าง Anthropic และ Google ในด้าน AI Safety เพื่อกำหนดกรอบแนวทางรับมือความเสี่ยงต่อระบบเศรษฐกิจและความมั่นคงระดับชาติ หลังประเด็นความเสี่ยงเชิงการมีอยู่ของของ AI ในปัจจุบัน ถูกผลักดันเข้าสู่กระแสหลักของอุตสาหกรรมเทคโนโลยีโลก จนเกิดความกังวลของหลายฝ่าย

วิจัยทั่วโลกเผยเอเชียตะวันออกเฉียงใต้ผงาดขึ้นแท่นผู้นำด้าน AI ที่มีความน่าเชื่อถือระดับโลก องค์กรต่างเร่งเครื่องใช้ Agentic AI [PR]

รายงานฉบับใหม่จาก SAS พร้อมด้วยผลวิจัยเชิงลึกจาก IDC เปิดเผยกลยุทธ์เบื้องหลังความสำเร็จขององค์กรที่กำลังก้าวขึ้นนำในศึกทำกำไรจากการลงทุนด้าน AI นั่นคือการนำมาตรการ AI ที่มีความน่าเชื่อถือมาประยุกต์ใช้ เอเชียตะวันออกเฉียงใต้ได้ก้าวขึ้นเป็นภูมิภาคที่โดดเด่นที่สุดในด้าน AI ที่มีความน่าเชื่อถือ โดยทำคะแนนเกินเกณฑ์มาตรฐานระดับโลกในทั้ง 5 มิติด้านความน่าเชื่อถือ …