Google ได้เปิดตัว EmbeddingGemma 2 ซึ่งเป็นโมเดลมัลติโมดัลโอเพนซอร์สที่มีขนาดเล็กพอที่จะประมวลผลบนสมาร์ทโฟนได้

การเปิดตัวครั้งนี้ทำให้ตระกูล EmbeddingGemma ก้าวข้ามขีดจำกัดจากเดิมที่รองรับเฉพาะข้อความเพียงอย่างเดียวตามที่ Google เคยนำเสนอไว้เมื่อเดือนกันยายน 2025 โดยในปัจจุบัน รูปภาพ เสียง และวิดีโอ สามารถใช้พื้นที่การฝังร่วมกับข้อความได้แล้ว ตัวอย่างเช่น แอปพลิเคชันที่สร้างขึ้นจากโมเดลใหม่นี้สามารถรับบันทึกเสียงและค้นหาช่วงเวลาที่ตรงกันภายในวิดีโอได้โดยที่ไม่จำเป็นต้องส่งข้อมูลออกจากโทรศัพท์เลย
Sahil Dua และ Henrique Schechter Vera วิศวกรวิจัยจาก Google DeepMind ได้ระบุในประกาศว่า ผลตอบรับที่มีต่อโมเดลรุ่นแรกนั้น “เหนือความคาดหมายของเราอย่างมาก” โดยพวกเขานับจำนวนการดาวน์โหลดจากนักพัฒนาได้มากกว่า 20 ล้านครั้ง
โมเดลรุ่นใหม่นี้สร้างขึ้นบนสถาปัตยกรรม Gemma 4 ที่ Google เปิดตัวไปเมื่อเดือนเมษายน และมีขนาดใหญ่กว่ารุ่นเดิมถึงสองเท่าด้วยพารามิเตอร์จำนวน 740 ล้านพารามิเตอร์ โดยการขยายตัวส่วนใหญ่เกิดขึ้นในส่วนของเอนโค้ดเดอร์สำหรับภาพและเสียง ซึ่งแอปพลิเคชันที่ทำงานเฉพาะกับข้อความสามารถเลือกตัดออกได้ ทั้งนี้ ในส่วนของแกนประมวลผลข้อความจำนวน 270 ล้านพารามิเตอร์นั้น ใช้หน่วยความจำประมาณ 191 เมกะไบต์เมื่อ Google ทดสอบเวอร์ชันที่ผ่านการลดทอนขนาดข้อมูลบน Google Pixel 11 Pro
แอปพลิเคชันยังจำเป็นต้องจัดเก็บสิ่งที่โมเดลสร้างขึ้นด้วย โดยแต่ละการฝังคือรายการตัวเลข 768 ค่า และทุกรูปภาพ คลิป หรือเอกสารที่ถูกจัดดัชนีจะเพิ่มเข้าไปในฐานข้อมูลเวกเตอร์ภายในเครื่องอีกหนึ่งรายการ ทั้งนี้ เทคนิคการฝึกฝนที่เรียกว่า Matryoshka Representation Learning ช่วยให้นักพัฒนาสามารถตัดรายการเหล่านั้นให้เหลือตัวเลขเพียง 128 ค่า ซึ่งช่วยลดพื้นที่จัดเก็บได้มากถึง 6 เท่า โดยคู่มือนักพัฒนาของ Google ระบุว่าด้วยขนาด 256 นั้น การเรียกค้นข้อมูลรูปภาพ วิดีโอ และเสียง ยังคงรักษาคุณภาพไว้ได้ถึงประมาณ 95% ของคุณภาพเต็ม
คะแนนทดสอบเกณฑ์มาตรฐานด้านโค้ดมีการพัฒนาสูงที่สุด โดย EmbeddingGemma 2 ทำคะแนนได้ 78.68 ในหมวดโค้ดของ Massive Text Embedding Benchmark ซึ่งสูงกว่ารุ่นแรกเกือบ 10 คะแนน โดย Google กำลังมุ่งเป้าผลลัพธ์นี้ไปที่นักพัฒนาที่สร้างระบบเรียกค้นข้อมูลสำหรับเอเจนต์ที่เกี่ยวข้องกับการเขียนโปรแกรม ขณะที่คะแนนสำหรับข้อความหลายภาษานั้นมีการเปลี่ยนแปลงเพียงเล็กน้อย
บริษัทอ้างว่าโมเดลนี้ให้ผลลัพธ์ระดับชั้นนำในกลุ่มโมเดลฝังตัวแบบมัลติโมดัลที่มีขนาดต่ำกว่า 1 พันล้านพารามิเตอร์ และยังระบุว่าโมเดลนี้มีประสิทธิภาพเหนือกว่าโมเดลเฉพาะทางบางรุ่นที่มีขนาดใหญ่กว่าถึงสองเท่าในงานที่เกี่ยวข้องกับรูปภาพ วิดีโอ และเสียง
เนื่องจาก EmbeddingGemma 2 ใช้ตัวตัดข้อความและเอนโค้ดเดอร์เสียงร่วมกับ Gemma 4 การตั้งค่าระบบการสร้างคำตอบแบบเรียกค้นข้อมูลบนอุปกรณ์ที่รันทั้งสองส่วนพร้อมกันจึงต้องการหน่วยความจำน้อยกว่าการใช้โมเดลที่ไม่เกี่ยวข้องกันสองโมเดล โดยแอปพลิเคชัน AI Edge Foresight ของ Google สำหรับ Mac ได้ใช้งานทั้งสองส่วนร่วมกันแล้ว และในแอปตัวอย่าง AI Edge Gallery ของ Google ฟีเจอร์ Video Moments Finder สามารถค้นหาฉากภายในวิดีโอจากคำค้นหาที่พิมพ์หรือสั่งการด้วยเสียงได้
ผู้ใช้งานสามารถเข้าถึงน้ำหนักโมเดลได้แล้วผ่านทาง Hugging Face และ Kaggle ของ Google ภายใต้ใบอนุญาต Apache 2.0 ซึ่งอนุญาตให้ใช้งานเชิงพาณิชย์ได้ โดย Google กล่าวว่าโมเดลนี้จะเข้าสู่ Model Garden บน Gemini Enterprise Agent Platform เร็ว ๆ นี้ และน้ำหนักโมเดลสามารถทำงานร่วมกับเครื่องมือให้บริการแบบโอเพนซอร์ส เช่น vLLM, llama.cpp และ Ollama ได้แล้ว
TechTalkThai ศูนย์รวมข่าว Enterprise IT ออนไลน์แห่งแรกในประเทศไทย






