Google ยกระดับ EmbeddingGemma รองรับภาพ เสียง และวิดีโอแล้ว

Google ได้เปิดตัว EmbeddingGemma 2 ซึ่งเป็นโมเดลมัลติโมดัลโอเพนซอร์สที่มีขนาดเล็กพอที่จะประมวลผลบนสมาร์ทโฟนได้

Credit: Google

การเปิดตัวครั้งนี้ทำให้ตระกูล EmbeddingGemma ก้าวข้ามขีดจำกัดจากเดิมที่รองรับเฉพาะข้อความเพียงอย่างเดียวตามที่ Google เคยนำเสนอไว้เมื่อเดือนกันยายน 2025 โดยในปัจจุบัน รูปภาพ เสียง และวิดีโอ สามารถใช้พื้นที่การฝังร่วมกับข้อความได้แล้ว ตัวอย่างเช่น แอปพลิเคชันที่สร้างขึ้นจากโมเดลใหม่นี้สามารถรับบันทึกเสียงและค้นหาช่วงเวลาที่ตรงกันภายในวิดีโอได้โดยที่ไม่จำเป็นต้องส่งข้อมูลออกจากโทรศัพท์เลย

Sahil Dua และ Henrique Schechter Vera วิศวกรวิจัยจาก Google DeepMind ได้ระบุในประกาศว่า ผลตอบรับที่มีต่อโมเดลรุ่นแรกนั้น “เหนือความคาดหมายของเราอย่างมาก” โดยพวกเขานับจำนวนการดาวน์โหลดจากนักพัฒนาได้มากกว่า 20 ล้านครั้ง

โมเดลรุ่นใหม่นี้สร้างขึ้นบนสถาปัตยกรรม Gemma 4 ที่ Google เปิดตัวไปเมื่อเดือนเมษายน และมีขนาดใหญ่กว่ารุ่นเดิมถึงสองเท่าด้วยพารามิเตอร์จำนวน 740 ล้านพารามิเตอร์ โดยการขยายตัวส่วนใหญ่เกิดขึ้นในส่วนของเอนโค้ดเดอร์สำหรับภาพและเสียง ซึ่งแอปพลิเคชันที่ทำงานเฉพาะกับข้อความสามารถเลือกตัดออกได้ ทั้งนี้ ในส่วนของแกนประมวลผลข้อความจำนวน 270 ล้านพารามิเตอร์นั้น ใช้หน่วยความจำประมาณ 191 เมกะไบต์เมื่อ Google ทดสอบเวอร์ชันที่ผ่านการลดทอนขนาดข้อมูลบน Google Pixel 11 Pro

แอปพลิเคชันยังจำเป็นต้องจัดเก็บสิ่งที่โมเดลสร้างขึ้นด้วย โดยแต่ละการฝังคือรายการตัวเลข 768 ค่า และทุกรูปภาพ คลิป หรือเอกสารที่ถูกจัดดัชนีจะเพิ่มเข้าไปในฐานข้อมูลเวกเตอร์ภายในเครื่องอีกหนึ่งรายการ ทั้งนี้ เทคนิคการฝึกฝนที่เรียกว่า Matryoshka Representation Learning ช่วยให้นักพัฒนาสามารถตัดรายการเหล่านั้นให้เหลือตัวเลขเพียง 128 ค่า ซึ่งช่วยลดพื้นที่จัดเก็บได้มากถึง 6 เท่า โดยคู่มือนักพัฒนาของ Google ระบุว่าด้วยขนาด 256 นั้น การเรียกค้นข้อมูลรูปภาพ วิดีโอ และเสียง ยังคงรักษาคุณภาพไว้ได้ถึงประมาณ 95% ของคุณภาพเต็ม

คะแนนทดสอบเกณฑ์มาตรฐานด้านโค้ดมีการพัฒนาสูงที่สุด โดย EmbeddingGemma 2 ทำคะแนนได้ 78.68 ในหมวดโค้ดของ Massive Text Embedding Benchmark ซึ่งสูงกว่ารุ่นแรกเกือบ 10 คะแนน โดย Google กำลังมุ่งเป้าผลลัพธ์นี้ไปที่นักพัฒนาที่สร้างระบบเรียกค้นข้อมูลสำหรับเอเจนต์ที่เกี่ยวข้องกับการเขียนโปรแกรม ขณะที่คะแนนสำหรับข้อความหลายภาษานั้นมีการเปลี่ยนแปลงเพียงเล็กน้อย

บริษัทอ้างว่าโมเดลนี้ให้ผลลัพธ์ระดับชั้นนำในกลุ่มโมเดลฝังตัวแบบมัลติโมดัลที่มีขนาดต่ำกว่า 1 พันล้านพารามิเตอร์ และยังระบุว่าโมเดลนี้มีประสิทธิภาพเหนือกว่าโมเดลเฉพาะทางบางรุ่นที่มีขนาดใหญ่กว่าถึงสองเท่าในงานที่เกี่ยวข้องกับรูปภาพ วิดีโอ และเสียง

เนื่องจาก EmbeddingGemma 2 ใช้ตัวตัดข้อความและเอนโค้ดเดอร์เสียงร่วมกับ Gemma 4 การตั้งค่าระบบการสร้างคำตอบแบบเรียกค้นข้อมูลบนอุปกรณ์ที่รันทั้งสองส่วนพร้อมกันจึงต้องการหน่วยความจำน้อยกว่าการใช้โมเดลที่ไม่เกี่ยวข้องกันสองโมเดล โดยแอปพลิเคชัน AI Edge Foresight ของ Google สำหรับ Mac ได้ใช้งานทั้งสองส่วนร่วมกันแล้ว และในแอปตัวอย่าง AI Edge Gallery ของ Google ฟีเจอร์ Video Moments Finder สามารถค้นหาฉากภายในวิดีโอจากคำค้นหาที่พิมพ์หรือสั่งการด้วยเสียงได้

ผู้ใช้งานสามารถเข้าถึงน้ำหนักโมเดลได้แล้วผ่านทาง Hugging Face และ Kaggle ของ Google ภายใต้ใบอนุญาต Apache 2.0 ซึ่งอนุญาตให้ใช้งานเชิงพาณิชย์ได้ โดย Google กล่าวว่าโมเดลนี้จะเข้าสู่ Model Garden บน Gemini Enterprise Agent Platform เร็ว ๆ นี้ และน้ำหนักโมเดลสามารถทำงานร่วมกับเครื่องมือให้บริการแบบโอเพนซอร์ส เช่น vLLM, llama.cpp และ Ollama ได้แล้ว

ที่มา: https://siliconangle.com/2026/10/06/google-expands-embeddinggemma-beyond-text-to-images-audio-and-video/

About นักเขียนฝึกหัดหมายเลขเก้า

Check Also

Google ซื้อพลังงานนิวเคลียร์ 890 เมกะวัตต์จาก Constellation เดินหน้า AI Data Center เต็มรูปแบบ

Google จับมือ Constellation Energy เซ็นสัญญาซื้อขายไฟฟ้าพลังงานนิวเคลียร์เป็นเวลา 20 ปี กำลังการผลิต 890 เมกะวัตต์ เพื่อป้อนให้กับระบบนิเวศ Data Center ด้าน AI …

ingfah ผู้ให้บริการ AI Voicebot สัญชาติไทย ได้รับการรับรอง ISO/IEC 27001 และ ISO/IEC 20000-1 จาก BSI พร้อมเปิด Roadmap สู่ SOC 2 และ ISO 42001 [Guest Post]

เมื่อองค์กรเลือกนำ AI มาดูแลลูกค้า คำถามสำคัญคือ ระบบนั้นมีความน่าเชื่อถือได้แค่ไหน และผู้ให้บริการรายนั้นผ่านเกณฑ์ประเมินความปลอดภัยของฝ่ายไอทีและฝ่ายจัดซื้อหรือไม่