Anthropic เปิดตัว Claude Opus 5.5 ให้ประสิทธิภาพเทียบเท่า Claude Fable 5.1 ในงานส่วนใหญ่ แต่มีต้นทุนการใช้งานถูกลงกว่า Opus 5 ถึง 40%

Anthropic ประกาศเปิดตัว Claude Opus 5.5 นับเป็นโมเดลแรกที่ปล่อยออกมาหลังบริษัทเรียกร้องแนวทาง pacing the frontier หรือการกำหนดจังหวะการพัฒนาให้แนวปฏิบัติด้านความปลอดภัยเดินนำหน้าความสามารถของโมเดล ก่อนเปิดให้ใช้งานจริง โมเดลผ่านการประเมินจากผู้ตรวจสอบภายนอกทั้ง Frontier Design และ METR โดยรายละเอียดการประเมินทั้งหมดถูกเผยแพร่ไว้ใน Opus 5.5 System Card นอกจากเรื่องประสิทธิภาพและต้นทุนแล้ว Anthropic ยังปรับปรุงรูปแบบการสื่อสารของโมเดลให้อ่านเข้าใจง่ายขึ้น โดยวางข้อมูลสำคัญไว้ต้นคำตอบ ลดการใช้ศัพท์เฉพาะ และทำตามกฎการเขียนที่ผู้ใช้งานกำหนด ซึ่งเป็นหนึ่งใน feedback ที่พบบ่อยที่สุดจากผู้ใช้งาน Opus 5
ในด้าน benchmark Opus 5.5 ทำคะแนน Terminal-Bench 4.0 ได้ 66.4% เทียบกับ 52.3% ของ Opus 5 และ 55.8% ของ Fable 5.1 ส่วน FrontierCode v1.1 ทำได้ 54.4% และ CursorBench 4.0 ทำได้ 57.8% ด้านงาน knowledge work บน GDPval-AA v2.1 ซึ่งวัดงานวิชาชีพจริงครอบคลุม 44 สายอาชีพ ทำได้ 1,846 Elo นำหน้า Fable 5.1 ที่ 1,735 และ Opus 5 ที่ 1,708 ขณะที่ computer use บน OSWorld 2.0 อยู่ที่ 81.8% แบบ partial โดยผลทั้งหมดรันด้วย adaptive thinking ที่ระดับ max effort และเปิด production safeguards ไว้ ทั้งนี้ Anthropic ระบุว่าที่ระดับความสามารถขนาดนี้ ส่วนต่างของคะแนน benchmark เริ่มสะท้อนความแตกต่างในการใช้งานจริงได้น้อยลง และช่องว่างระหว่าง Opus 5.5 กับ Fable 5.1 ในการใช้งานจริงแคบกว่าที่ตัวเลขบ่งชี้ โดยจุดที่เห็นผลชัดกว่าคืองาน coding ขนาดใหญ่และกินเวลานาน ผู้ทดสอบรายหนึ่งใช้ Opus 5.5 ตรวจสอบและแก้ไข codebase ขนาด 200,000 บรรทัดเสร็จภายในเวลาไม่ถึง 3 ชั่วโมง ขณะที่ Opus 5 ใช้เวลากว่า 20 ชั่วโมงและใช้ token มากกว่า 2.5 เท่า อีกรายใช้ทำ migration ขนาด 680,000 บรรทัดเสร็จภายในวันเดียว ส่วนการทดสอบภายในที่ให้แปลง HAProxy จากภาษา C ไปเป็น Rust นั้น ทั้ง Opus 5.5 และ Fable 5.1 ผ่าน regression test ของ HAProxy เองเกือบทั้งหมด แต่ Opus 5.5 ใช้เวลา 9.5 ชั่วโมงเทียบกับ 12 ชั่วโมง และมีต้นทุนต่ำกว่า 51% นอกจากนี้เมื่อรันที่ default effort บน FrontierCode ยังทำคะแนนชนะ GPT-6 Astra ด้วยต้นทุนต่องานราว 20% ของคู่แข่ง
ด้านราคา Opus 5.5 คิดค่า input tokens ที่ 4 ดอลลาร์ และ output tokens ที่ 20 ดอลลาร์ต่อ 1 ล้าน tokens ลดลง 20% จาก Opus 5 ส่วน cache reads ซึ่งเป็นต้นทุนส่วนใหญ่ของงาน agentic และ coding อยู่ที่ 0.20 ดอลลาร์ต่อ 1 ล้าน tokens ถูกลงถึง 60% และ cache writes อยู่ที่ 5 ดอลลาร์ต่อ 1 ล้าน tokens เมื่อรวมกับการใช้ token ต่องานที่น้อยลง ทำให้ต้นทุนโดยรวมของ workload ทั่วไปลดลงราว 40% ขณะเดียวกันโมเดลยังสร้าง output ได้เร็วขึ้นกว่า 30% และมี Fast mode บน Claude Code และ Claude Platform ที่เร็วขึ้นสูงสุด 2.5 เท่า ในราคา 8 ดอลลาร์ต่อ 1 ล้าน input tokens และ 40 ดอลลาร์ต่อ 1 ล้าน output tokens พร้อมกันนี้ Anthropic ได้เพิ่ม usage limit รอบ 5 ชั่วโมงให้แผน Pro, Max, Team และ Enterprise แบบ seat-based ด้วย
สำหรับองค์กรที่ปล่อยให้ AI agent ทำงานอัตโนมัติในระบบเป็นเวลานาน Anthropic เพิ่มกลไกความปลอดภัยหลายชั้น ทั้ง classifier ที่ตรวจทุก action ก่อนสั่งรันจริง มี sandbox แบบ open source ที่ทีม security ตรวจสอบได้เอง และมีระบบ code review ที่จับช่องโหว่ก่อน merge ส่วนในการทดสอบ prompt injection โมเดลทำได้เท่าหรือดีกว่า Opus 5 ในทุกสถานการณ์ที่ทดสอบ และบน benchmark ของบริษัทความปลอดภัย AI อย่าง Gray Swan มีอัตราความสำเร็จของ prompt injection ต่ำที่สุดเท่ากับ Fable 5.1 ขณะที่การทดสอบ alignment ผ่าน automated behavioral audit เกือบ 2,000 สถานการณ์พบว่า Opus 5.5 พยายามข้ามขอบเขต containment น้อยลงราว 85% เทียบกับ Opus 5 และ Claude Mythos 5.1 นอกจากนี้ยังมีมาตรการ preserved thinking ที่บล็อกไม่ให้ผู้ใช้งาน API แก้ไข context ก่อนหน้าเพื่อดึงกระบวนการคิดของโมเดลออกไปทำ distillation โดยมีผลกับบัญชี API ที่สร้างตั้งแต่วันที่ 31 สิงหาคม 2026 เป็นต้นไป
อย่างไรก็ตาม เนื่องจากความสามารถด้าน cybersecurity และ biology อยู่ในระดับเดียวกับ Claude Mythos 5.1 บริษัทจึงบังคับใช้ safeguards ชุดเดียวกับ Fable 5.1 โดยงาน cybersecurity ส่วนใหญ่จะถูก re-route ไปยัง Opus 4.8 แทน องค์กรที่ต้องการใช้งานเต็มรูปแบบสามารถสมัคร Life Sciences Verification Program สำหรับงานวิจัยด้านชีววิทยา หรือรอ Cyber Verification Program ที่จะขยายมารองรับ Opus 5.5 ในอีกไม่กี่สัปดาห์ข้างหน้า ด้าน compliance โมเดลรองรับ zero data retention เช่นเดียวกับ Opus รุ่นก่อน และมีการฝัง watermark เพื่อให้สอดคล้องกับ EU AI Act ขณะที่โหมด thinking ไม่สามารถปิดการทำงานได้อีกต่อไป ผู้ที่สนใจสามารถเริ่มใช้งาน Opus 5.5 ได้แล้วบนทุกแพลตฟอร์ม ทั้ง Amazon Web Services, Google Cloud, Microsoft Azure และ Claude Platform ด้วยชื่อโมเดล claude-opus-5-5 ส่วน Claude Sonnet 5.5 และ Claude Haiku 5.5 จะตามมาในอีกไม่กี่สัปดาห์ข้างหน้า
TechTalkThai ศูนย์รวมข่าว Enterprise IT ออนไลน์แห่งแรกในประเทศไทย









