NVIDIA เริ่มผลิต Groq 3 LPX เต็มรูปแบบ ชิป Inference เร่ง Agentic AI ที่ 3,400 Token ต่อวินาที

NVIDIA ประกาศว่า Groq 3 LPX ตัวเร่งการประมวลผล AI Inference สำหรับงานที่ต้องการการโต้ตอบแบบทันที ได้เข้าสู่สายการผลิตเต็มรูปแบบแล้ว พร้อมทำสถิติสร้าง Output Token ได้ 3,400 Token ต่อวินาทีในการทดสอบของ Artificial Analysis

Credit: NVIDIA

NVIDIA ประกาศเรื่องนี้ในงาน Hot Chips โดย NVIDIA Groq 3 LPX เป็นส่วนขยายของแพลตฟอร์ม NVIDIA Vera Rubin ที่เข้ามาเพิ่มอัตราการสร้าง Token ให้สูงขึ้นอย่างมีนัยสำคัญ เหตุผลอยู่ที่ระบบ Agentic AI ต้องสร้าง Token ปริมาณมหาศาลผ่านขั้นตอน Inference นับร้อยจนถึงนับพันครั้งกว่าจะทำงานหนึ่งชิ้นให้เสร็จ ความเร็วในการสร้าง Token จึงกลายเป็นตัวชี้ขาดว่า AI Agent จะประมวลผล ตัดสินใจ และลงมือทำงานที่ซับซ้อนได้ทันเวลาหรือไม่ ขณะที่ Vera Rubin NVL72 เป็นแพลตฟอร์มที่รองรับได้ทั้งงาน Training และ Inference สำหรับ AI Factory

โจทย์ของ Agentic AI แบ่งออกเป็นสองด้าน คือการประมวลผล Context ปริมาณมหาศาลให้มีประสิทธิภาพ และการสร้าง Token ด้วย Latency ที่ต่ำมาก โดย Groq 3 LPX ออกแบบมาเพื่อขยายความสามารถด้าน Interactivity ของ Vera Rubin ซึ่งหมายถึงอัตราการสร้าง Token ต่อผู้ใช้งานหนึ่งราย อันเป็นตัวกำหนดว่า AI Agent จะทำงานแต่ละขั้นตอนเสร็จเร็วเพียงใด ตัวเร่งการประมวลผลตัวนี้ทำได้ 3,400 Output Token ต่อวินาทีบนโมเดล Gemma 4 31B ซึ่งเป็นโมเดล Open Source สำหรับงาน Agentic ที่ Context ขนาด 100,000 Token ซึ่งถือเป็นตัวเลขที่เร็วที่สุดเท่าที่เคยบันทึกได้กับโมเดลนี้ และให้การตอบสนองเร็วกว่าแพลตฟอร์มทางเลือกที่ใกล้เคียงที่สุด 4 เท่า ทำให้งานอย่างการเขียนโค้ดด้วย AI Agent ที่เคยใช้เวลาหลายชั่วโมงเหลือเพียงไม่กี่นาที และเปิดพื้นที่ให้ AI Agent มีเวลาตรวจสอบไฟล์ เขียนและทดสอบโค้ด เรียกใช้ Tool ตรวจสอบผลลัพธ์ แล้ววนทำซ้ำได้โดยยังคงความลื่นไหลในการใช้งาน

ในระดับโครงสร้างพื้นฐาน NVIDIA Vera Rubin ใช้แนวทาง Extreme Codesign ครอบคลุมชิป 7 ตัวและแร็คที่ออกแบบมาเฉพาะทาง 5 แบบ โดย Vera Rubin NVL72 และ Groq 3 LPX จะทำงานร่วมกันเพื่อรองรับความต้องการของ Workload ที่ต่างกันภายใน AI Factory ตั้งแต่ผู้พัฒนาโมเดลระดับ Frontier ไปจนถึงผู้ให้บริการโมเดล Open Source โดยแพลตฟอร์มระดับแร็คเหล่านี้ใช้ NVIDIA BlueField-4 DPU ทำงานประกอบกับแร็ค NVIDIA Vera CPU ระบบ Storage แบบ NVIDIA Vera BlueField-4 STX และเครือข่าย NVIDIA Spectrum-6 SPX Ethernet เพื่อเพิ่มประสิทธิภาพให้ระบบ Multi-agent ให้ได้ Throughput ต่อวัตต์สูงที่สุดและ Latency ในการทำ Inference ต่ำที่สุด

ฝั่งการนำไปใช้งานจริง Nebius เป็น AI Cloud รายแรกที่เตรียมนำ NVIDIA Groq 3 LPX เข้าไปให้บริการบน Nebius Token Factory ซึ่งเป็นแพลตฟอร์ม Inference ระดับ Production ของตนเอง โดยระบุว่านักพัฒนาจะเรียกใช้งานผ่าน API ชุดเดิมที่ใช้อยู่แล้ว ไม่ต้องย้ายไปยัง Stack ใหม่ ขณะที่ Groq ผู้ให้บริการ AI Inference Cloud จะเป็นหนึ่งในรายแรก ๆ ที่นำแพลตฟอร์มนี้ไปใช้ต่อจาก Nebius ทั้งนี้ ชื่อ Groq และ LPU เป็นชื่อที่ NVIDIA ใช้งานภายใต้การอนุญาตจาก Groq, Inc.

ที่มา: https://nvidianews.nvidia.com/news/nvidia-groq-3-lpx-now-in-full-production-with-world-class-speed-for-agentic-ai

About เด็กฝึกงาน TechTalkThai หมายเลข 1

นักเขียนผู้มีความสนใจใน Enterprise IT ด้วยประสบการณ์กว่า 10 ปีในไทย ปัจจุบันใช้ชีวิตอยู่ที่สหรัฐอเมริกา แต่ยังคงมุ่งมั่นในการแบ่งปันความรู้และประสบการณ์ด้านเทคโนโลยีให้กับทุกคน

Check Also

ฟอร์ติเน็ต ซื้อกิจการ Virtue AI เสริมแกร่งกลยุทธ์ Security for AI ตอบโจทย์องค์กรในยุค Agentic Enterprise [PR]

ฟอร์ติเน็ต® (NASDAQ: FTNT) ผู้นำระดับโลกด้านความมั่นคงปลอดภัยไซเบอร์ที่มุ่งเน้นการรวมระบบเครือข่ายและความมั่นคงปลอดภัยเข้าด้วยกัน ประกาศเข้าซื้อกิจการ Virtue AI ผู้นำด้านนวัตกรรมการปกป้อง AI ขณะทำงาน การตรวจสอบและทดสอบระบบ AI แบบอัตโนมัติ และระบบความมั่นคงปลอดภัยสำหรับระบบ AI …

NTT DATA และ Palo Alto Networks ลงนามความร่วมมือ เชิงกลยุทธ์ระดับโลกเพื่อเร่งการเปลี่ยนผ่านด้าน AI อย่างปลอดภัย [PR]

NTT DATA ผู้นำระดับโลกด้านปัญญาประดิษฐ์ (AI) ธุรกิจดิจิทัล และบริการด้านเทคโนโลยี ร่วมกับ Palo Alto Networks (NASDAQ: PANW) ประกาศความร่วมมือเชิงกลยุทธ์ระยะยาวหลายปี เพื่อสนับสนุนองค์กรในการนำ AI …