Reflection AI ได้เปิดตัว Beam ซึ่งเป็นโมเดลภาษาขนาดใหญ่แบบโอเพนซอร์สที่มีพารามิเตอร์จำนวน 501 พันล้านตัว

การเปิดตัวครั้งนี้เกิดขึ้นหลังจากที่บริษัทสตาร์ทอัพดังกล่าวระดมทุนได้ด้วยมูลค่าบริษัทสูงถึง 2.5 หมื่นล้านดอลลาร์เมื่อไม่กี่เดือนก่อน ในช่วงเวลาเดียวกันนั้นมีรายงานว่า Reflection AI ได้บรรลุข้อตกลงมูลค่า 6.3 พันล้านดอลลาร์กับ SpaceX เพื่อเช่าใช้งานระบบ Nvidia GB300 NVL72 ซึ่งแต่ละชุดประกอบด้วยการ์ดจอ 72 ตัว ในการฝึกสอนโมเดล Beam
Reflection AI ได้ทดสอบประสิทธิภาพโมเดลของตนโดยเปรียบเทียบกับ GLM-5.2 ซึ่งเป็นโมเดล LLM แบบโอเพนซอร์สที่มีพารามิเตอร์มากกว่าประมาณ 250 พันล้านตัว บริษัทพบว่า Beam สามารถทำงานบางอย่างได้ดีกว่าในขณะที่ใช้ทรัพยากรฮาร์ดแวร์เพียงหนึ่งในสามถึงหนึ่งในสี่เท่านั้น ยิ่งไปกว่านั้นบริษัทยังระบุว่า LLM ดังกล่าวมีประสิทธิภาพใกล้เคียงกับ Qwen 3.8-Max ซึ่งเป็นโมเดลที่มีพารามิเตอร์มากกว่า 2 ล้านล้านตัว
การเปิดตัวครั้งนี้ถือเป็นเรื่องน่าจับตามองเป็นพิเศษ เนื่องจาก LLM ระดับสูงส่วนใหญ่ในระบบนิเวศโอเพนซอร์สมักถูกสร้างขึ้นโดยบริษัทจากประเทศจีน ซึ่งรวมถึง Qwen 3.8-Max และ GLM-5.2 ด้วย โดย Beam ถือเป็นโมเดลโอเพนซอร์สตัวแรกจากสตาร์ทอัพในประเทศสหรัฐอเมริกาที่แสดงให้เห็นถึงประสิทธิภาพที่เทียบเท่าหรือดีกว่า อย่างไรก็ตาม LLM แบบเปิดให้ใช้งานฟรีต่าง ๆ ยังคงมีประสิทธิภาพตามหลังโมเดลระดับแนวหน้าอย่าง Claude Fable 5.1 จาก Anthropic อยู่
Reflection AI เริ่มต้นการพัฒนา Beam ด้วยการฝึกสอนโมเดลต้นแบบที่มีขนาดค่อนข้างเล็ก จากนั้นจึงสร้างอัลกอริทึมที่ใหญ่ขึ้นและมีความสามารถมากขึ้นตามลำดับ โดยกระบวนการทำงานดังกล่าวได้นำไปสู่การสร้าง Beam Base ซึ่งเป็นรากฐานสำคัญที่ใช้ในการพัฒนา Beam
บริษัทได้พัฒนา Beam Base โดยใช้คลัสเตอร์ของการ์ดจอจำนวน 6,144 ตัว และได้ฝึกสอนโมเดลด้วยโทเค็นจำนวน 23.8 ล้านล้านโทเค็นจากเว็บไซต์สาธารณะและแหล่งข้อมูลเชิงพาณิชย์ ชุดข้อมูลดังกล่าวรวมถึงซอร์สโค้ดซอฟต์แวร์จำนวนมาก โดยบริษัทได้สร้างตัวกรองเฉพาะสำหรับแต่ละภาษาโปรแกรมเพื่อคัดกรองไฟล์คุณภาพต่ำออกไป
Beam Base ได้รับการพัฒนาขึ้นในเวลาไม่ถึงสี่สัปดาห์ หลังจากนั้นจึงได้ผ่านกระบวนการ Midtraining ซึ่งเป็นกระบวนการปรับแต่งเพื่อขยายหน้าต่างบริบทของโมเดลและยกระดับความสามารถในการใช้เหตุผล ซึ่งขั้นตอนดังกล่าวถือเป็นการปูทางไปสู่ขั้นตอนที่สามซึ่งเป็นช่วงที่ใช้ทรัพยากรฮาร์ดแวร์เข้มข้นที่สุดในกระบวนการฝึกสอน
Reflection AI ได้เปิดใช้งานการ์ดจอ GB300 จำนวน 10,000 ตัวและใช้ในการสร้างแซนด์บ็อกซ์สำหรับการเรียนรู้แบบเสริมกำลังจำนวน 1.3 พันล้านระบบ โดยสภาพแวดล้อมเสมือนเหล่านี้เป็นพื้นที่ที่เอเจนต์ AI จะได้เรียนรู้ทักษะใหม่ ๆ ซึ่งแซนด์บ็อกซ์ของ Beam ได้รับการปรับแต่งให้เหมาะสมกับงานต่าง ๆ เช่น การเขียนโค้ด การค้นหาข้อมูลบนเว็บ และการรันเอเจนต์ AI
บริษัทระบุว่าขั้นตอนการเรียนรู้แบบเสริมกำลังของโครงการนี้ใช้เวลาเพียงสี่สัปดาห์เท่านั้น โดยสามารถหลีกเลี่ยงความล่าช้าที่ไม่จำเป็นด้วยการพัฒนาซอฟต์แวร์ที่ช่วยป้องกันไม่ให้การทำงานผิดพลาดมาขัดจังหวะกระบวนการทำงาน ทั้งนี้บริษัทระบุว่าคลัสเตอร์ของตนมีเวลาในการกู้คืนระบบเฉลี่ยอยู่ที่ 8 นาทีจากข้อผิดพลาดทั้งหมด 71 ครั้งที่เกิดขึ้นระหว่างการฝึกสอน
ขณะนี้ Beam เปิดให้ใช้งานได้ผ่านโปรแกรมการเข้าถึงล่วงหน้า โดย Reflection AI มีแผนที่จะเผยแพร่น้ำหนักโมเดล เอกสารประกอบ และเครื่องมือสำหรับปรับจูนละเอียดในช่วงปลายเดือนนี้
TechTalkThai ศูนย์รวมข่าว Enterprise IT ออนไลน์แห่งแรกในประเทศไทย






