Google เปิดตัว Gemini 3.8 Flash TTS และ Flash-Lite TTS โมเดลสร้างเสียงพูดที่ออกแบบเสียงเองได้

Google เปิดตัวโมเดล text-to-speech ใหม่ 2 ตัวในตระกูล Gemini ได้แก่ Gemini 3.8 Flash TTS และ Gemini 3.8 Flash-Lite TTS ที่สร้างเสียงพูดขึ้นใหม่ได้เองจาก natural language prompt พร้อมกำกับการอ่านได้ทีละบรรทัด

Credit: Google

Google วางบทบาทของโมเดลทั้งสองตัวแยกกันชัดเจน โดย Gemini 3.8 Flash TTS เน้นงานที่ต้องกำกับรายละเอียดและสร้างเสียงตัวละคร เหมาะกับเกม, audiobook, podcast และสื่อแบบ interactive ส่วน Gemini 3.8 Flash-Lite TTS รองรับงานปริมาณมากที่ต้องคุมต้นทุน เช่น การทำ dubbing จำนวนมาก, การผลิต audio content และ voice agent ที่ต้องการน้ำเสียงเป็นธรรมชาติ ทั้งคู่ต่อยอดจากตระกูล Gemini Audio ที่ทยอยเปิดตัวก่อนหน้านี้อย่าง 3.5 Live Translate, 3.5 Transcribe, 3.8 Live และ 3.8 Live Extended Thinking

โมเดลใหม่ขยายจากเสียงต้นฉบับ 30 เสียงไปสู่การสร้างเสียงเพิ่มได้ไม่จำกัด ความสามารถ generative voice design บน Gemini 3.8 Flash TTS ให้ผู้ใช้งานกำหนด role, สำเนียง และลักษณะน้ำเสียงผ่าน natural language prompt ครอบคลุมมากกว่า 100 ภาษาและสำเนียง ควบคู่กับ voice library ที่มีเสียงพร้อมใช้งานระดับ production มากกว่า 2,000 เสียง รวมถึงสำเนียงย่อยอย่าง Mexican Spanish, Quebec French และ Scots English ขณะที่ voice replication สร้างโปรไฟล์เสียงได้จากไฟล์ตัวอย่างเพียง 30 วินาที โดยมี consent verification, ลายน้ำ SynthID และ C2PA credentials กำกับไว้ ผู้ใช้งานยังบันทึกเสียงที่สร้างขึ้นเก็บไว้เพื่อนำกลับมาใช้ซ้ำในโปรเจกต์ต่อเนื่องได้โดยมี drift ต่ำ ส่วนฟีเจอร์ voice remixing ที่ให้ปรับ timbre, pitch, pace และสำเนียงของเสียงจาก voice library จะตามมาในภายหลัง

เมื่อเลือกเสียงได้แล้ว โมเดลทั้งสองตัวรองรับการกำกับการอ่านแบบรายบรรทัด ผู้ใช้งานสามารถเขียน stage direction เองหรือปล่อยให้ Gemini ตีความจากบทก็ได้ ด้าน long-form generation คงคุณภาพเสียงและจังหวะการพูดไว้ได้ตลอดไฟล์ความยาวหลายชั่วโมง เหมาะกับงาน podcast และ audiobook นอกจากนี้ยังรองรับบทสนทนาแบบ two-speaker จากสคริปต์เดียว โดยแยกน้ำเสียงทั้งสองฝั่งออกจากกันและสลับกันพูดอย่างเป็นธรรมชาติ รวมถึงใส่เสียงประกอบที่ไม่ใช่คำพูดอย่าง laugh, sigh, gasp และคำรับแบบ mhm หรือ yeah เพื่อคุมจังหวะการตอบโต้ ด้านผลทดสอบ Gemini 3.8 Flash TTS ขึ้นอันดับ 1 บน Voice Design Benchmark ของ Hume AI ที่คะแนน 71.4 และนำในหมวด accent modeling ที่ 60.8 ขณะที่ Flash TTS และ Flash-Lite TTS ครองอันดับ 1 และ 2 บน Overall Quality Index ตามลำดับ ส่วนการทดสอบแบบ blind human preference บน Voice Arena ทั้งสองโมเดลติดอันดับต้น ๆ ในภาษา Japanese, Brazilian Portuguese, Vietnamese, Modern Standard Arabic, Mexican Spanish และ Hindi

ในด้านความปลอดภัย การทำ voice replication บังคับให้ต้องแนบไฟล์บันทึกการให้ความยินยอมจากเจ้าของต้นฉบับ และระบบจะตรวจสอบว่าตรงกับ reference speaker ก่อนจึงจะสร้างโปรไฟล์ได้ ขณะที่ลายน้ำ SynthID ที่ฝังอยู่ในทุกคลิปนั้นหูมนุษย์ไม่ได้ยินแต่ตรวจจับได้ เพื่อให้ยังสามารถระบุได้ว่าเป็นไฟล์ที่สร้างจาก AI โดยรายละเอียดด้านความปลอดภัยเพิ่มเติมอยู่ใน model card ทั้งนี้โมเดลทั้งสองตัวเริ่มทยอยเปิดให้ใช้งานตั้งแต่วันที่ 23 กันยายน 2026 สำหรับนักพัฒนาผ่าน Gemini API และ Google AI Studio ส่วนฝั่งองค์กรจะเปิดผ่าน API บน Gemini Enterprise เร็ว ๆ นี้ ขณะที่ผู้ใช้งานทั่วไปจะได้ใช้ Flash TTS ใน Gemini Notebook และ Flash-Lite TTS ใน Google Vids นอกจากนี้ยังเรียกใช้ผ่านแพลตฟอร์มของพาร์ตเนอร์อย่าง Agora, LiveKit, Pipecat และ Vercel ที่เชื่อมต่อ Gemini API ไว้แล้ว รวมถึงมีองค์กรอย่าง Figma, HeyGen, Linguana, Wondercraft, 99.co และ Ollang ที่นำโมเดลไปใช้กับงาน dubbing และ voice agent ข้อจำกัดที่ผู้ดูแลระบบควรทราบคือ voice replication ผ่าน AI Studio ยังไม่เปิดให้ใช้งานในรัฐ Illinois และ Texas รวมถึง EEA, UK, Switzerland และ India

ที่มา: https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/

About เด็กฝึกงาน TechTalkThai หมายเลข 1

นักเขียนผู้มีความสนใจใน Enterprise IT ด้วยประสบการณ์กว่า 10 ปีในไทย ปัจจุบันใช้ชีวิตอยู่ที่สหรัฐอเมริกา แต่ยังคงมุ่งมั่นในการแบ่งปันความรู้และประสบการณ์ด้านเทคโนโลยีให้กับทุกคน

Check Also

Microsoft เปิดตัว Integrated Security Operations Center บน Defender ยกเครื่อง SOC รองรับ AI Agent

Microsoft เปิดตัว Integrated Security Operations Center (ISOC) บน Microsoft Defender พร้อมย้ายความสามารถด้าน SIEM จาก Microsoft Sentinel …

[วีดีโอย้อนหลัง] SendQuick Webinar : Identity Under Attack “ถอดบทเรียนการโจมตีในไทย และวิธีป้องกันด้วย MFA”

เรื่อง MFA กำลังเป็นประเด็นใหญ่ โดยเฉพาะกับหน่วยงานภาครัฐ และหน่วยงานโครงสร้างพื้นฐานของประเทศ ซึ่งวันนี้ได้เริ่มประกาศบังคับใช้เป็นข้อบังคับพื้นฐานแล้วในประกาศจาก สกมช. โดยใครที่พลาด SendQuick Webinar เรื่อง “Identity Under Attack : ถอดบทเรียนการโจมตีในไทย …