Google เปิดตัว Gemini 2.5 Computer Use Model ควบคุมหน้าจอผ่าน AI

Google ประกาศเปิดตัว Gemini 2.5 Computer Use Model ผ่าน API ให้นักพัฒนาสร้าง AI Agent ที่สามารถโต้ตอบกับ User Interface ได้โดยตรง มีประสิทธิภาพเหนือกว่าคู่แข่งในการควบคุม Browser และ Mobile พร้อม Latency ที่ต่ำกว่า

Credit: Google

Google DeepMind ได้เปิดตัว Gemini 2.5 Computer Use Model โมเดล AI เฉพาะทางที่พัฒนาต่อยอดจากความสามารถด้าน Visual Understanding และ Reasoning ของ Gemini 2.5 Pro เพื่อขับเคลื่อน AI Agent ให้สามารถโต้ตอบกับ Graphical User Interface (GUI) ได้เหมือนมนุษย์ ไม่ว่าจะเป็นการคลิก พิมพ์ข้อความ หรือเลื่อนหน้าจอ โมเดลนี้พร้อมให้ใช้งานแบบ Preview ผ่าน Gemini API ทั้งใน Google AI Studio และ Vertex AI

การทำงานของโมเดลอาศัย Computer Use Tool ใน Gemini API ที่ทำงานแบบ Loop โดยรับ Input จากคำขอของผู้ใช้งาน Screenshot ของหน้าจอ และประวัติการดำเนินการล่าสุด จากนั้นโมเดลจะวิเคราะห์และสร้าง Response เป็น Function Call ที่แสดงถึงการกระทำบน UI เช่น การคลิกหรือการพิมพ์ หลังจากดำเนินการเสร็จสิ้น Screenshot ใหม่และ URL ปัจจุบันจะถูกส่งกลับไปยังโมเดลเพื่อเริ่ม Loop ใหม่ กระบวนการนี้จะดำเนินต่อไปจนกว่างานจะเสร็จสมบูรณ์หรือเกิดข้อผิดพลาด โมเดลได้รับการออกแบบมาให้ทำงานกับ Web Browser เป็นหลัก แต่ยังแสดงศักยภาพที่ดีในการควบคุม Mobile UI แม้ว่ายังไม่ได้รับการปรับแต่งสำหรับการควบคุมระดับ Desktop OS

ในด้านประสิทธิภาพ Gemini 2.5 Computer Use Model แสดงผลลัพธ์ที่โดดเด่นบน Benchmark หลายตัว โดยทำคะแนนนำใน Online-Mind2Web, WebVoyager และ AndroidWorld เหนือกว่าโมเดลคู่แข่ง จุดเด่นสำคัญคือความสามารถในการให้ Accuracy สูงพร้อมกับ Latency ต่ำที่สุดเมื่อเทียบกับคู่แข่งในการทดสอบบน Browserbase harness สำหรับ Online-Mind2Web

Google ให้ความสำคัญกับความปลอดภัยโดยฝึก Safety Features เข้าไปในโมเดลโดยตรงเพื่อจัดการกับความเสี่ยงหลัก 3 ประการ ได้แก่ การใช้งานในทางที่ผิดโดยผู้ใช้ พฤติกรรมที่ไม่คาดคิดของโมเดล และ Prompt Injection หรือการหลอกลวงบนเว็บ นอกจากนี้ยังมี Per-step Safety Service ที่ประเมินการกระทำแต่ละขั้นตอนก่อนดำเนินการ และ System Instructions ที่ให้นักพัฒนากำหนดให้ Agent ปฏิเสธหรือขอการยืนยันจากผู้ใช้ก่อนทำการกระทำที่มีความเสี่ยงสูง เช่น การเปลี่ยนแปลง System Integrity การ Bypass CAPTCHA หรือการควบคุมอุปกรณ์ทางการแพทย์ ทีมภายใน Google ได้นำโมเดลนี้ไปใช้ในการทำ UI Testing และขับเคลื่อน Project Mariner, Firebase Testing Agent รวมถึงฟีเจอร์ AI Mode ใน Google Search

ที่มา: https://blog.google/technology/google-deepmind/gemini-computer-use-model/

About เด็กฝึกงาน TechTalkThai หมายเลข 1

นักเขียนผู้มีความสนใจใน Enterprise IT ด้วยประสบการณ์กว่า 10 ปีในไทย ปัจจุบันใช้ชีวิตอยู่ที่สหรัฐอเมริกา แต่ยังคงมุ่งมั่นในการแบ่งปันความรู้และประสบการณ์ด้านเทคโนโลยีให้กับทุกคน

Check Also

IBM จับมือ OpenAI รุกตลาด Enterprise AI ผสานโมเดลล่าสุดเข้ากับบริการให้คำปรึกษา

IBM ร่วมมือกับ OpenAI นำโมเดลและเครื่องมือเกี่ยวกับ AI เพิ่มประสิทธิภาพ IBM Consulting เพื่อให้บริการให้คำปรึกษากับลูกค้าองค์กรได้ดีขึ้น ความร่วมมือครั้งนี้เปิดช่องทางให้ OpenAI สามารถเจาะตลาดบริษัทยักษ์ใหญ่ระดับโลกได้มากขึ้น ภายใต้ดีลนี้ทั้งสองบริษัทจะร่วมกันทำตลาดและพัฒนาโซลูชัน AI เฉพาะทางสำหรับอุตสาหกรรมการเงินการธนาคาร …

Alibaba Cloud ขอเชิญร่วมงานสัมมนา Qwen Conference Thailand 2026 [4 ก.ย. 2026 – 13.00น.]

Alibaba Cloud ขอเรียนเชิญ CAIO, CTO, CIO, CDO, AI Leader, IT Manager, AI Engineer, Data Engineer และทุกท่านที่สนใจเข้าร่วมงานสัมมนา Qwen Conference Thailand 2026 เพื่อร่วมเรียนรู้ถึงแนวโน้มล่าสุดในการประยุกต์ใช้งาน AI สำหรับภาคธุรกิจองค์กร พร้อมแนะนำเครื่องมือ AI ชั้นนำที่ครอบคลุมทั้ง Agentic AI, Video AI, Agentic Coding AI และ AI Production Platform พร้อมกรณีศึกษาการใช้งานจริง ให้ธุรกิจนำไปพร้อมใช้งานต่อยอดได้ทันที งานสัมมนานี้จะจัดขึ้นในวันศุกร์ที่ 4 กันยายน 2026 เวลา 13.00น. - 18.00น. ณ โรงแรม Centara Grand, Central World โดยผู้ที่สนใจสามารถตรวจสอบรายละเอียด กำหนดการ และลงทะเบียนเข้าร่วมงานโดยไม่มีค่าใช้จ่ายได้ดังนี้