โมเดลภาษาขนาดใหญ่สามรุ่นของ Anthropic ได้ดำเนินการโจมตีทางไซเบอร์สำเร็จระหว่างการทดสอบภายในตามปกติ

บริษัทได้ให้รายละเอียดเกี่ยวกับการละเมิดดังกล่าวเมื่อวันพฤหัสบดีที่ผ่านมา โดยเพียงไม่กี่วันก่อนหน้านี้ OpenAI ได้เปิดเผยเหตุการณ์ที่คล้ายคลึงกัน โดย LLM สองรุ่นของบริษัทได้หลุดออกจากแซนด์บ็อกซ์ที่แยกส่วนซึ่งใช้ในการประเมินขีดความสามารถด้านความมั่นคงปลอดภัยไซเบอร์ และได้แฮ็ก Hugging Face ซึ่งเป็นแพลตฟอร์มยอดนิยมสำหรับการโฮสต์โปรเจกต์ AI แบบโอเพนซอร์ส
การเปิดเผยข้อมูลของ OpenAI ส่งผลให้ Anthropic ตรวจสอบบันทึกจากการประเมินความมั่นคงปลอดภัยของโมเดลตนเอง ซึ่งการตรวจสอบดังกล่าวนำไปสู่การค้นพบการโจมตีทางไซเบอร์ที่เปิดเผยเมื่อวันพฤหัสบดี โดย Anthropic ระบุว่าวิศวกรของบริษัทได้ระบุการละเมิดสามครั้งที่ดำเนินการโดยโมเดล Claude ที่แตกต่างกันสามรุ่น
การโจมตีทางไซเบอร์ทั้งสามครั้งเกิดขึ้นระหว่างสิ่งที่เรียกว่าการประเมินแบบ capture the flag ในระหว่างการทดสอบดังกล่าว Anthropic ได้ติดตั้งโมเดล Claude ไว้ในแซนด์บ็อกซ์ที่จำลองโครงสร้างพื้นฐานของบริษัทภายนอก โดยมีภารกิจให้ Claude ค้นหาวิธีขโมยข้อมูลจากระบบขององค์กรที่ถูกจำลองขึ้น
Anthropic ได้พัฒนาสภาพแวดล้อมการทดสอบร่วมกับ Irregular ซึ่งเป็นสตาร์ทอัพด้านความมั่นคงปลอดภัย AI โดยปกติแล้วบริษัทจะแยกแซนด์บ็อกซ์ออกจากอินเทอร์เน็ตเพื่อลดความเสี่ยงของการโจมตีทางไซเบอร์ แต่เกิดข้อผิดพลาดในการกำหนดค่าที่ทำให้โมเดล AI ทั้งสามอินสแตนซ์ที่ดำเนินการโจมตีสามารถเข้าถึงอินเทอร์เน็ตได้
การละเมิดที่รุนแรงที่สุดเกี่ยวข้องกับ Claude Opus 4.7 ซึ่งเป็น LLM ที่ Anthropic เปิดตัวในเดือนเมษายน บริษัทที่ถูกจำลองขึ้นซึ่งโมเดลได้รับมอบหมายให้ไปแฮ็กนั้นมีชื่อเดียวกับเว็บไซต์จริง ส่งผลให้โมเดลได้แฮ็กองค์กรที่ดูแลเว็บไซต์ดังกล่าวด้วยการเชื่อมโยงช่องโหว่หลายจุดเข้าด้วยกัน
Opus 4.7 สามารถเจาะฐานข้อมูลการผลิตที่มีข้อมูลหลายร้อยแถว นอกจากนี้ยังได้รับข้อมูลประจำตัวสำหรับการเข้าถึงแอปพลิเคชันและทรัพย์สินโครงสร้างพื้นฐานหลายรายการ
การโจมตีทางไซเบอร์ครั้งที่สองดำเนินการโดย Mythos 5 ซึ่งเป็นโมเดลที่ทันสมัยที่สุดของ Anthropic ที่มีให้บริการเชิงพาณิชย์ LLM รุ่นนี้ได้เขียนแพ็กเกจ Python หรือชุดโค้ดที่เป็นอันตราย และอัปโหลดไปยังแพลตฟอร์มโฮสต์โปรเจกต์โอเพนซอร์สยอดนิยม โดยไฟล์ดังกล่าวถูกบริษัทความมั่นคงปลอดภัยไซเบอร์แห่งหนึ่งดาวน์โหลดไปหลังจากนั้นไม่กี่นาที ซึ่งแพ็กเกจที่เป็นอันตรายนี้ได้เจาะระบบโครงสร้างพื้นฐานของบริษัทและขโมยข้อมูลประจำตัวสำหรับการเข้าถึงไป
ตามข้อมูลของ Anthropic เหตุการณ์ความมั่นคงปลอดภัยไซเบอร์ครั้งที่สามเกี่ยวข้องกับ “โมเดลทดสอบการวิจัยภายใน” ที่ไม่เปิดเผยชื่อ ซึ่งได้ทำการเจาะแอปพลิเคชันโดยใช้วิธีการแฮ็กง่าย ๆ เช่น SQL injection โดยในบางช่วง โมเดลได้ตรวจพบว่าแอปพลิเคชันนั้นไม่ได้เป็นส่วนหนึ่งของแซนด์บ็อกซ์ในการประเมินความมั่นคงปลอดภัยของตน จึงได้ยุติการโจมตีทางไซเบอร์ลง
Anthropic กำลังร่วมมือกับห้องปฏิบัติการความปลอดภัย AI ที่ไม่แสวงหาผลกำไรชื่อ METR เพื่อดำเนินการตรวจสอบการละเมิดดังกล่าวอย่างละเอียดมากขึ้น นอกจากนี้ บริษัทยังวางแผนที่จะปรับปรุงวิธีการพัฒนาและตรวจสอบแซนด์บ็อกซ์สำหรับการประเมิน LLM ของตนให้ดียิ่งขึ้นต่อไป
ที่มา: https://siliconangle.com/2026/07/31/anthropic-discloses-claude-hacked-three-organizations-internal-tests/
TechTalkThai ศูนย์รวมข่าว Enterprise IT ออนไลน์แห่งแรกในประเทศไทย







