Mistral AI ได้เปิดให้เข้าถึง Mistral Large 4 ซึ่งเป็นโมเดลภาษาขนาดใหญ่ที่มีความสามารถสูงที่สุดเท่าที่เคยมีมาของบริษัท

LLM ดังกล่าวพร้อมให้ใช้งานในรูปแบบพรีวิวสาธารณะผ่านแพลตฟอร์มคลาวด์ของบริษัท โดย Mistral มีแผนที่จะปล่อยข้อมูลน้ำหนักของโมเดลในช่วงปลายเดือนนี้
Mistral Large 4 มาพร้อมสถาปัตยกรรมแบบ Mixture of Experts ขนาด 1 ล้านล้านพารามิเตอร์ แต่จะใช้งานจริงเพียง 49 พันล้านพารามิเตอร์ต่อครั้ง ซึ่งประหยัดทรัพยากรฮาร์ดแวร์มากกว่าการเปิดใช้งานทั้งโมเดลในขณะที่ผู้ใช้งานป้อนคำสั่ง ทั้งนี้ Mistral ระบุว่า LLM รุ่นนี้สามารถตอบคำถามได้มากกว่า 160 ภาษา
โมเดลใหม่นี้ทำคะแนนติดอันดับท็อป 5 บน AA Cyber Index ซึ่งเป็นชุดเกณฑ์มาตรฐานที่ใช้วัดความสามารถของ LLM ในการค้นหาและแก้ไขช่องโหว่ในซอฟต์แวร์ โดยโมเดลนี้แสดงให้เห็นว่ามีความเชี่ยวชาญเป็นพิเศษในการแก้ไขแพตช์ให้กับโปรเจกต์แบบโอเพนซอร์ส ซึ่ง Mistral Large 4 ได้คะแนน AA Cyber Index ในส่วนนี้ไปถึง 82% ทำให้มีคะแนนนำหน้าคู่แข่งในกลุ่มโอเพนซอร์สอื่น ๆ
Mistral กล่าวว่าคอมพิวเตอร์วิชันเป็นอีกหนึ่งจุดเด่นของ LLM รุ่นนี้ โดยทำคะแนนได้เหนือกว่า GPT-6 Astra อยู่ 1% บน Dense200 ซึ่งเป็นเกณฑ์มาตรฐานที่วัดความสามารถของโมเดลในการค้นหาวัตถุที่น่าสนใจในภาพ
แม้ Mistral Large 4 จะยังตามหลังโมเดลระดับแนวหน้าอย่าง Astra อยู่พอสมควรในเกณฑ์มาตรฐานด้านการเขียนโค้ดที่เป็นที่นิยมในอุตสาหกรรม AI แต่ก็ยังทำผลงานได้เหนือกว่า LLM แบบโอเพนซอร์สชั้นนำหลายตัว รวมถึง Qwen3.8 Max และ DeepSeek V4 Pro นอกจากนี้ยังทำคะแนนได้สูงกว่าโมเดลหลังบนเกณฑ์มาตรฐานงานความรู้ AutomationBench และ AA-Briefcase โดยการทดสอบแบบแรกประกอบด้วยงานที่ค่อนข้างง่าย ในขณะที่แบบหลังรวมถึงงานที่มนุษย์ต้องใช้เวลาหลายสัปดาห์กว่าจะทำสำเร็จ
Mistral ฝึกสอน Large 4 ด้วยชิป Grace Blackwell จำนวน 3,800 ตัว โดยตัวเร่งประมวลผลแต่ละตัวจะประกอบด้วยการ์ดจอ Blackwell ของ Nvidia สองตัวรวมกับหน่วยประมวลผลกลางหนึ่งตัว อย่างไรก็ตามทางบริษัทไม่ได้ระบุว่าการฝึกสอนใช้เวลานานเท่าใด แต่ได้เปิดเผยรายละเอียดอื่น ๆ เกี่ยวกับโครงการนี้
LLM ขั้นสูงได้รับการฝึกสอนผ่านวิธีการลองผิดลองถูก โดยโมเดลที่กำลังพัฒนาจะได้รับงานและพยายามทำให้สำเร็จโดยปราศจากการแนะนำจากมนุษย์ ซึ่งกระบวนการแต่ละครั้งเรียกว่า rollout และเมื่อสิ้นสุดการ rollout โมเดล AI เฉพาะทางจะวิเคราะห์ผลลัพธ์และนำไปใช้ในการปรับแต่ง LLM ให้ดียิ่งขึ้น
ตามข้อมูลของ Mistral วิศวกรของบริษัทได้พัฒนาซอฟต์แวร์สแต็กที่สามารถรัน rollout ได้หลายหมื่นครั้งพร้อมกัน โดยมีการรวบรวม rollout จากคลังโมดูลที่เป็นองค์ประกอบของ AI ซึ่งโมดูลเหล่านั้นรวมถึงแซนด์บ็อกซ์ที่ LLM สามารถรันโค้ดได้ เอ็นจิ้นสำหรับค้นหาที่ช่วยให้เข้าถึงเว็บได้ และการทดสอบสำหรับตรวจสอบผลลัพธ์ของ rollout โดยซอฟต์แวร์สแต็กดังกล่าวถูกนำมาใช้ในการพัฒนา Mistral Large 4
การ rollout ของโมเดลสร้างโทเคนออกมาได้ 33 พันล้านโทเคนต่อวัน โดย Mistral ใช้โทเคนเหล่านั้นไม่ถึงครึ่งหนึ่งในการขับเคลื่อนเวิร์กโฟลว์การฝึกสอนที่มีหน้าที่ในการปรับแต่ง Large 4 ซึ่งการ rollout และเวิร์กโฟลว์การฝึกสอนนั้นทำงานแบบไม่พร้อมกัน ซึ่งหมายความว่าความล่าช้าในเวิร์กโหลดหนึ่งจะไม่ทำให้อีกเวิร์กโหลดหนึ่งทำงานช้าลง ซึ่งช่วยให้ Mistral เร่งความเร็วในการประมวลผลได้
ที่น่าสนใจคือบริษัทไม่ได้หยุดการทำงานของขั้นตอนการฝึกสอนที่สร้าง Large 4 หลังจากสร้างโมเดลเวอร์ชันปัจจุบันเสร็จสิ้น โดย Mistral คาดการณ์ว่าเวิร์กโฟลว์นี้จะผลิต LLM เวอร์ชันที่มีขนาดใหญ่และมีความสามารถมากขึ้นในอีกไม่กี่เดือนข้างหน้า และในระยะยาว บริษัทจะใช้ Mistral Large 4 เพื่อสร้างโมเดลทั้งซีรีส์ที่ได้รับการปรับแต่งมาสำหรับกรณีการใช้งานแบบเฉพาะเจาะจงต่าง ๆ
ที่มา: https://siliconangle.com/2026/10/06/mistral-launches-open-source-mistral-large-4-details-ai-roadmap/
TechTalkThai ศูนย์รวมข่าว Enterprise IT ออนไลน์แห่งแรกในประเทศไทย






