Microsoft AI เปิดตัว MAI-Transcribe-2 โมเดล Speech Recognition รุ่นใหม่ ซึ่งทำคะแนนอันดับ 1 บน FLEURS benchmark ครอบคลุม 60 ภาษา ด้วย Word Error Rate เฉลี่ย 5.2% และคิดราคา 0.10 ดอลลาร์ต่อเสียง 1 ชั่วโมง

MAI-Transcribe-2 เป็นโมเดลถอดเสียงรุ่นล่าสุดจาก Microsoft AI ที่พัฒนาต่อเนื่องจากรุ่นก่อนหน้าอย่าง MAI-Transcribe-1 และ MAI-Transcribe-1.5 โดยผลทดสอบระบุว่าโมเดลนี้ทำได้ดีกว่าโมเดลชั้นนำอย่าง Gemini 3.5 Transcribe, GPT-Transcribe, Whisper V3-Large และ Scribe v2 ทั้งในแง่ความแม่นยำ ความเร็ว และต้นทุน นอกจากอันดับ 1 บน FLEURS แล้ว โมเดลนี้ยังกำหนดเส้น Pareto Frontier ด้านความแม่นยำกับ latency บน Artificial Analysis และอยู่อันดับ 2 บนตารางจัดอันดับ AA-WER Index ด้วยคะแนน 2.0 ตามหลังเพียง Fun-Realtime-ASR-preview จาก Alibaba ที่ทำได้ 1.7 โดย Microsoft AI ออกแบบโมเดลนี้มาสำหรับงานถอดเสียงในสถานการณ์จริง ตั้งแต่การบันทึกข้อมูลทางการแพทย์ เอกสารทางกฎหมาย ไปจนถึงงานด้าน Accessibility และ Closed Captioning
ความสามารถที่เพิ่มเข้ามาในรุ่นนี้มีหลายส่วน เริ่มจาก Speaker Diarization ที่แยกแยะผู้พูดแต่ละคนและระบุว่าคำพูดใดเป็นของใครภายในไฟล์บันทึกเดียวกัน ตามด้วย Word-level Timestamps ที่ให้ข้อมูลเวลาระดับรายคำ ทำให้การค้นหา การจัดตำแหน่ง และการแก้ไขทำได้แม่นยำขึ้น ขณะที่ Keyword Biasing ช่วยให้โมเดลจับศัพท์เฉพาะทาง ตัวย่อ และชื่อเฉพาะที่แยกแยะจากบริบทได้ยาก อีกฟีเจอร์หนึ่งคือ Configurable Transcription Styles ซึ่งให้นักพัฒนาเลือกรูปแบบผลลัพธ์เองได้ โดยโหมด verbatim จะถอดเสียงตามที่พูดจริงรวมถึงคำพูดเสริม (filler) และการพูดค้างหรือเริ่มประโยคใหม่ เหมาะกับงานด้าน Compliance และการวิเคราะห์ ส่วนโหมด clean จะตัด filler ออกเพื่อให้ได้ Caption และบันทึกที่อ่านง่ายกว่า นอกจากนี้ยังรองรับ Code Switching สำหรับบทสนทนาที่สลับไปมาระหว่างสองภาษา เช่น Hinglish และ Spanglish พร้อม Automatic Language Identification ที่ตรวจจับภาษาที่กำลังพูดได้เองโดยผู้ใช้งานไม่ต้องระบุล่วงหน้า และยังคงคุณภาพการถอดเสียงไว้ได้ในสภาพแวดล้อมที่มีเสียงรบกวน
ด้านประสิทธิภาพ ผลทดสอบจาก Artificial Analysis ระบุว่า MAI-Transcribe-2 ทำ Speed Factor ได้ 403.6 หรือถอดเสียงความยาว 1 ชั่วโมงเสร็จภายในเวลาราว 9-10 วินาที เร็วกว่า GPT-Transcribe ของ OpenAI ถึง 10 เท่า เร็วกว่า Scribe v2 ของ ElevenLabs 7 เท่า และเร็วกว่า Gemini 3.5 Transcribe 5 เท่า โดยที่ยังให้ความแม่นยำสูงกว่าทั้งสามโมเดล ประสิทธิภาพระดับนี้ส่งผลโดยตรงต่อราคา โดย Microsoft AI ตั้งราคา MAI-Transcribe-2 ไว้ที่ 0.10 ดอลลาร์ต่อเสียง 1 ชั่วโมง ซึ่งเป็นราคาโปรโมชันช่วงเปิดตัวไปจนถึงสิ้นปีนี้ เพื่อให้นักพัฒนาประมวลผลไฟล์เสียงได้มากขึ้นโดยไม่ต้องลดคุณภาพการถอดเสียงลง
สำหรับการรองรับหลายภาษา Microsoft AI ทดสอบ MAI-Transcribe-2 บนชุดข้อมูล FLEURS ครบทั้ง 60 ภาษาและระบุว่าโมเดลรักษาระดับความแม่นยำได้สม่ำเสมอในทุกภาษาที่ทดสอบ ทำให้นักพัฒนาที่ต้องถอดเสียงหลายภาษาสามารถใช้โมเดลเดียวครอบคลุมได้ทั้งหมด ช่วยลดความซับซ้อนของระบบและอาจช่วยลดปัญหาด้านการใช้ทรัพยากร GPU สำหรับภาษาไทย MAI-Transcribe-2 ทำ Word Error Rate ได้ 3.4% ซึ่งเป็นคะแนนดีที่สุดในบรรดา 7 โมเดลที่นำมาเปรียบเทียบ ตามมาด้วย Gemini 3.5 Transcribe ที่ 3.8%, Gemini 3.1 Pro ที่ 4.7%, Gemini 3.6 Flash ที่ 5.1%, GPT-Transcribe ที่ 5.4%, Scribe v2 ที่ 6.1% และ Whisper V3-Large ที่ 8.7% ผู้ที่สนใจสามารถทดลองใช้งาน MAI-Transcribe-2 ได้แล้วผ่าน Microsoft Foundry, MAI Playground และ OpenRouter
TechTalkThai ศูนย์รวมข่าว Enterprise IT ออนไลน์แห่งแรกในประเทศไทย









