Cerebras เปิดตัว CS-4 AI Accelerator ทำความเร็วเหนือกว่า GPU ถึง 30 เท่า

Cerebras เปิดตัว Cerebras CS-4 ตัว AI Accelerator ตัว Rack-scale ที่ใช้ Wafer Scale Engine 3 Turbo (WSE-3T) จำนวน 3 ชุด ให้ประสิทธิภาพการประมวลผลสูงกว่ารุ่นก่อนหน้าอย่าง CS-3 ถึง 2 เท่า และให้จำนวน Tokens-per-second-per-user สูงกว่าโซลูชัน GPU ทั่วไปถึง 30 เท่า การอัปเกรดครั้งนี้ยังตอบโจทย์ความคุ้มค่ระดับดาต้าเซ็นเตอร์ ด้วย Throughput ต่อวัตต์ที่เพิ่มขึ้นถึง 10 เท่าเมื่อเทียบกับ CS-3

หัวใจของ CS-4 คือหน่วยประมวลผล WSE-3 Turbo (WSE-3T) ที่บรรจุทรานซิสเตอร์ 4 ล้านล้านตัว และคอร์ประมวลผลปรับแต่งพิเศษสำหรับ AI จำนวน 900,000 คอร์ บนพื้นที่ซิลิคอน 46,225 ตารางมิลลิเมตร พร้อมรวมหน่วยความจำ SRAM ขนาด 44GB ไว้บนชิปโดยตรง โดยมีรายละเอียดที่น่าสนใจดังนี้

  • WSE-3T 1 ตัวรองรับการประมวลผล AI ที่ 250 PFLOPS พร้อม Memory Bandwidth 43.2 PB/s
  • เมื่อทำงานร่วมกัน 3 ตัว CS-4 จะให้พลังประมวลผลรวม 750 PFLOPS, Memory Bandwidth 129.6 PB/s และ System I/O สูงถึง 7.2 Tbps
  • I/O Latency ระหว่างแต่ละตัวลดลงจาก 5 ไมโครวินาทีเหลือเพียง 2 ไมโครวินาที รองรับการสร้างคลัสเตอร์ขนาดใหญ่เพื่อเทรนโมเดลที่มีพารามิเตอร์สูงกว่า 50 ล้านล้านพารามิเตอร์ได้คล่องตัวขึ้น

CS-4 นำเสนอการออกแบบสถาปัตยกรรม Modular ภายใต้ชื่อ Cerebras Nexus ที่แยกองค์ประกอบด้านการประมวลผล พลังงาน และ I/O ออกจากกัน เพื่อรองรับการอัปเกรดที่รวดเร็วและเป็นอิสระต่อกัน ไม่ว่าจะเป็น Pluggable Backpack Design นวัตกรรมการออกแบบที่รวมระบบระบายความร้อนด้วยของเหลว I/O ความเร็วสูง และวงจรควบคุมไว้ในชุดเดียวที่ติดตั้งด้านหลังเวเฟอร์ ช่วยลดชิ้นส่วนประกอบลง 50% และลดเวลา Deploy ระบบจากหลายวันเหลือเพียงไม่กี่ชั่วโมง

High-Density Power Delivery ลดระยะห่างการแปลงพลังงานจากชิปประมวลผลเหลือเพียง 0.5 มิลลิเมตร (เทียบกับประมาณ 50 มิลลิเมตรบนบอร์ด GPU ทั่วไป) แทบจะขจัดการสูญเสียพลังงานในระดับบอร์ดทั้งหมด รวมถึง Modular I/O Subsystem ที่รองรับมาตรฐาน RoCE v2 RDMA over Ethernet เพื่อผสานรวมกับโครงสร้างพื้นฐานเดิมอย่างไร้รอยต่อ และระบบ Direct Wafer Links ที่ทำให้แต่ละตัวสื่อสารข้ามแร็คได้โดยตรงโดยไม่ต้องผ่านสวิตช์

ในการทดสอบ Head-to-head บนโมเดล GPT-OSS-120B ระบบ CS-4 สามารถสร้าง Token ได้มากกว่า 4,400 Tokens ต่อวินาทีต่อผู้ใช้ (TPS/user) ความเร็วระดับนี้ให้พื้นที่ว่างสำหรับระบบ Agentic AI ในการทำ Reasoning การตรวจสอบข้อมูล หรือการใช้เครื่องมืออื่น ๆ ได้มากกว่าเดิมเป็นสิบเท่าภายในกรอบเวลา Wall-clock เดียวกัน โดย Cerebras มีกำหนดเริ่มจัดส่ง CS-4 ภายในไตรมาสนี้

ที่มา: https://investors.cerebras.ai/news-releases/news-release-details/cerebras-unveils-cs-4-30-times-faster-gpu-based-solutions

About Veerapon Tangsiripathanawong

Check Also

OpenAI รายได้โตน้อย ขาดทุนพุ่ง ตามหลัง Anthropic กว่าเดิม

OpenAI กำลังถูกคู่แข่งอย่าง Anthropic ทิ้งห่างยิ่งขึ้น หากพิจารณาจากผลประกอบการทางการเงินล่าสุด

OpenAI เปิดตัว ChatGPT สำหรับวัยรุ่นพร้อมระบบความปลอดภัย

OpenAI ประกาศเปิดตัว ChatGPT เวอร์ชันที่มีความเข้มงวดมากขึ้นสำหรับผู้ใช้งานที่เป็นเยาวชน