Amazon Web Services เพิ่มขีดความสามารถในการเรียกค้นข้อมูลจากทะเลสาบข้อมูล Apache Iceberg โดยตรงผ่านระบบจัดการฐานข้อมูล Aurora PostgreSQL ทำให้แอปพลิเคชันต่าง ๆ สามารถรวมข้อมูลการดำเนินการแบบเรียลไทม์เข้ากับบันทึกข้อมูลย้อนหลังได้โดยไม่จำเป็นต้องคัดลอกข้อมูลหรือสร้างไปป์ไลน์สำหรับการดึง แปลง และโหลดข้อมูล (ETL)

ความสามารถดังกล่าวได้ทำการฝังเอนจินการวิเคราะห์ DuckDB ไว้ภายใน Aurora PostgreSQL เพื่อรองรับการทำงานกับข้อมูลที่จัดเก็บในรูปแบบ Iceberg และ Apache Parquet ลูกค้าสามารถใช้แอปพลิเคชัน เครื่องมือ และเอนด์พอยต์ของ PostgreSQL ที่มีอยู่เดิมเพื่อค้นบันทึกข้อมูลการดำเนินงานควบคู่ไปกับข้อมูลที่จัดเก็บใน Amazon S3 รวมถึง S3 Tables ได้ทันที
เมื่อเดือนที่ผ่านมา AWS ได้เข้าซื้อกิจการ DuckLabs ผู้พัฒนาฐานข้อมูลโอเพนซอร์สยอดนิยมดังกล่าว
AWS วางตำแหน่งฟีเจอร์นี้ในฐานะวิธีการลดความซับซ้อนของการพัฒนาแอปพลิเคชันและลดภาระงานทางวิศวกรรมที่จำเป็นในการดูแลรักษาไปป์ไลน์ข้อมูล โดยการใช้งานที่เป็นไปได้รวมถึงแดชบอร์ดแบบเรียลไทม์ ธุรกรรมที่เสริมด้วยข้อมูลย้อนหลัง และเอเจนต์ AI ที่จำเป็นต้องเข้าถึงทั้งบันทึกปัจจุบันและข้อมูลที่จัดเก็บไว้ในคลังข้อมูล
ก่อนหน้านี้ การรวมธุรกรรมล่าสุดใน Aurora เข้ากับบันทึกย้อนหลังใน S3 มักต้องใช้ไปป์ไลน์ ETL แบบย้อนกลับ ซึ่งส่งผลให้เกิดข้อมูลซ้ำซ้อน มีต้นทุนด้านโครงสร้างพื้นฐานเพิ่มเติม และต้องคอยดูแลรักษาให้บันทึกข้อมูลมีความสอดคล้องอยู่เสมอ
Esra Kayabali สถาปนิกโซลูชันระดับสูงของ AWS ได้ระบุไว้ในประกาศว่า ความท้าทายนี้จะยิ่งทวีความรุนแรงมากขึ้นเมื่อมีการฝังเอเจนต์ AI เข้าไปในแอปพลิเคชันต่าง ๆ มากขึ้น ซึ่งการคาดการณ์และคัดลอกชุดข้อมูลทุกชุดที่เอเจนต์อาจจำเป็นต้องใช้ล่วงหน้านั้นเป็นเรื่องที่ไม่สามารถทำได้จริงในทางปฏิบัติ
DuckDB จะทำการประมวลผลการสแกนเชิงวิเคราะห์ภายใน Aurora โดยหลีกเลี่ยงการกระโดดข้ามเครือข่ายเพื่อการประมวลผลการเรียกค้นข้อมูล ทั้งนี้ข้อมูลหนึ่งชุดสามารถเข้าถึงบันทึกจากทะเลสาบข้อมูลควบคู่ไปกับข้อมูลการดำเนินงานจริง รวมถึงรายการแก้ไขที่ยังไม่ได้คอมมิต โดย AWS กล่าวว่าการผสานรวมนี้เป็นตัวอย่างของการนำเอนจิน DuckDB ไปใช้อย่างกว้างขวางในบริการต่าง ๆ ของบริษัท
ฟีเจอร์นี้ยังรองรับแคตตาล็อกภายนอกที่เข้ากันได้กับข้อกำหนด Iceberg Representational State Transfer Catalog ผ่านการเชื่อมโยงกับแคตตาล็อกข้อมูลในบริการประมวลผลข้อมูลแบบไร้เซิร์ฟเวอร์อย่าง AWS Glue โดยลูกค้าสามารถลงทะเบียนแคตตาล็อกภายนอกกับ Glue และสร้างตารางภายนอกที่อ้างอิงถึงข้อมูลนั้น ๆ ได้ จากนั้นแอปพลิเคชันจะสามารถรวมบันทึกจาก Aurora เข้ากับตาราง Iceberg ที่ลงทะเบียนไว้ในหลายแคตตาล็อกได้
เพื่อจำกัดปริมาณข้อมูลที่ต้องอ่าน Aurora จะทำการกรองบันทึกและเลือกเฉพาะคอลัมน์ที่เกี่ยวข้องในระหว่างการดำเนินการเรียกค้น นอกจากนี้ยังมีการแคชข้อมูลที่ถูกเข้าถึงบ่อยครั้ง นักพัฒนาสามารถตรวจสอบเมตริกต่าง ๆ รวมถึงจำนวนแถวที่สแกน ปริมาณไบต์ที่อ่านจาก S3 และจำนวนการเข้าถึงแคชได้
ในตัวอย่างด้านการเงิน Kayabali ได้สาธิตการเรียกค้นที่รวมธุรกรรมของลูกค้าในช่วง 7 วันใน Aurora เข้ากับธุรกรรมย้อนหลัง 5 ปีที่จัดเก็บในไฟล์ Parquet บน S3 โดย Aurora ได้ทำการอนุมานสกีมาของตารางย้อนหลังจากข้อมูลเมตาของไฟล์ ซึ่งช่วยลดขั้นตอนการกำหนดคอลัมน์ด้วยตนเอง
สำหรับภาระงานที่ต้องการความหน่วงในระดับหลักมิลลิวินาที ลูกค้าสามารถคัดลอกบันทึกจากทะเลสาบข้อมูลที่เลือกไปยังตารางดั้งเดิมของ Aurora โดยใช้คำสั่ง SQL มาตรฐาน การเรียกแบบอ่านสามารถรันบนโหนดเขียนหรือโหนดอ่านจำลองของคลัสเตอร์ เพื่อลดภาระการสแกนเชิงวิเคราะห์จากภาระงานปกติ ส่วนคำสั่งที่ทำให้ข้อมูลปรากฏในตารางจะดำเนินการบนโหนดเขียน
ลูกค้าสามารถเปิดใช้งานความสามารถนี้ผ่านส่วนขยาย aurora_analytics และการกำหนดบทบาท AWS Identity and Access Management เพื่อให้สิทธิ์ในการเข้าถึง S3 และ Glue โดยรองรับ Aurora PostgreSQL เวอร์ชัน 17 และ 18 เริ่มต้นที่เวอร์ชัน 17.11 และ 18.6 ตามลำดับ
AWS ระบุว่าฟีเจอร์นี้พร้อมใช้งานแล้วในทุกภูมิภาคเชิงพาณิชย์ของ AWS โดยไม่มีค่าใช้จ่ายเพิ่มเติมสำหรับฟีเจอร์นี้ ลูกค้าจะชำระค่าทรัพยากรการประมวลผลของ Aurora ที่เพิ่มขึ้นตามการเรียกค้นจริง และค่าคำขอ S3 ที่ใช้ในการอ่านไฟล์เท่านั้น
TechTalkThai ศูนย์รวมข่าว Enterprise IT ออนไลน์แห่งแรกในประเทศไทย






