OpenAI เปิดตัวโมเดล o3 ทำลายสถิติการทดสอบด้านการใช้เหตุผล

OpenAI ประกาศรายละเอียดโมเดล AI ตัวใหม่ชื่อ o3 ที่มีความสามารถด้านการใช้เหตุผลสูง โดยทำลายสถิติการทดสอบในหลายด้าน รวมถึงการทดสอบ ARC-AGI-1 ที่วัดความสามารถในการปรับตัวทำงานที่ไม่เคยถูกฝึกฝนมาก่อน

โมเดล o3 สร้างความน่าประหลาดใจด้วยผลการทดสอบ ARC-AGI-1 ที่ได้คะแนน 75.7% และเพิ่มขึ้นเป็น 87.5% เมื่อใช้ทรัพยากรการประมวลผลเพิ่มขึ้น ซึ่งสูงกว่า GPT-3 และ GPT-4o ที่ทำได้เพียง 0% และ 5% ตามลำดับ François Chollet ผู้พัฒนาการทดสอบนี้กล่าวว่า แม้ผลการทดสอบจะน่าประทับใจ แต่ยังไม่ถือว่า o3 เป็น AGI (Artificial General Intelligence) เพราะยังมีข้อจำกัดในการทำงานบางด้านที่มนุษย์ทำได้ดีกว่า

นอกจากนี้ o3 ยังทำลายสถิติในการทดสอบ Frontier Math ซึ่งเป็นชุดโจทย์คณิตศาสตร์ขั้นสูงที่สร้างขึ้นโดยนักคณิตศาสตร์กว่า 60 คน โดยสามารถแก้โจทย์ได้ถึง 25.2% เทียบกับสถิติเดิมที่ทำได้เพียง 2% ในด้านการเขียนโปรแกรม o3 ทำคะแนนในการทดสอบ SWE-Bench Verified สูงกว่ารุ่นก่อนหน้า o1 ถึง 22.8% โดยการทดสอบนี้วัดความสามารถในการค้นหาและแก้ไขข้อผิดพลาดในโค้ดจากคำอธิบายภาษาธรรมชาติ

OpenAI เปิดเผยว่า o3 มีให้เลือก 2 เวอร์ชัน ได้แก่ o3 รุ่นเต็มประสิทธิภาพ และ o3-mini ที่เน้นการตอบสนองเร็วและใช้ทรัพยากรน้อยกว่า เช่นเดียวกับรุ่น o1 ที่มีเวอร์ชันย่อยเช่นกัน ในช่วงแรก บริษัทจะจำกัดการเข้าถึงเฉพาะนักวิจัยด้านความปลอดภัย AI และความปลอดภัยไซเบอร์ เพื่อรวบรวมข้อเสนอแนะในการปรับปรุงความปลอดภัยก่อนเปิดให้ใช้งานในวงกว้าง

ในด้านความปลอดภัย OpenAI ได้พัฒนาเทคนิคใหม่ชื่อ deliberative alignment สำหรับป้องกันการสร้างเนื้อหาที่เป็นอันตราย โดยเทคนิคนี้ช่วยให้นักวิจัยสามารถกำหนดแนวทางด้านความปลอดภัยที่เขียนโดยมนุษย์เข้าไปในชุดข้อมูลฝึกฝน ทำให้โมเดลเรียนรู้และปฏิบัติตามแนวทางเหล่านั้นได้อย่างมีประสิทธิภาพ การพัฒนานี้เป็นส่วนหนึ่งของความพยายามในการสร้าง AI ที่ปลอดภัยและมีความรับผิดชอบ

ที่มา: https://siliconangle.com/2024/12/20/openai-details-o3-reasoning-model-record-breaking-benchmark-scores/

About เด็กฝึกงาน TechTalkThai หมายเลข 1

นักเขียนผู้มีความสนใจใน Enterprise IT ด้วยประสบการณ์กว่า 10 ปีในไทย ปัจจุบันใช้ชีวิตอยู่ที่สหรัฐอเมริกา แต่ยังคงมุ่งมั่นในการแบ่งปันความรู้และประสบการณ์ด้านเทคโนโลยีให้กับทุกคน

Check Also

Sonar เข้าซื้อกิจการ Gitar สตาร์ตอัป AI Code Review ยกระดับระบบตรวจสอบโค้ดด้วย Agentic Reasoning

Sonar ผู้ให้บริการแพลตฟอร์มตรวจสอบคุณภาพและความมั่นคงปลอดภัยของโค้ด ประกาศเข้าซื้อกิจการ Gitar สตาร์ตอัปผู้เชี่ยวชาญด้านระบบ AI-native Code Review การเข้าซื้อกิจการครั้งนี้มีเป้าหมายเพื่อผสานความสามารถด้านการคิดวิเคราะห์ของ Gitar เข้ากับเอนจินตรวจสอบโค้ดของ Sonar เพื่อสร้างความมั่นคงปลอดภัยที่รัดกุมยิ่งขึ้นสำหรับทีม DevOps ในยุคที่ …

Huawei เปิดตัวสถาปัตยกรรมชิปใหม่ แก้ปัญหาคว่ำบาตรและข้อจำกัด Moore’s Law

Huawei Technologies ยักษ์ใหญ่ด้านอิเล็กทรอนิกส์จากจีนได้เปิดตัวเฟรมเวิร์กการออกแบบชิปใหม่ ซึ่งบริษัทระบุว่าจะช่วยลดช่องว่างในอุตสาหกรรมเซมิคอนดักเตอร์กับผู้นำระดับโลกอย่าง TSMC และ Nvidia ได้