นักวิจัยจาก Institute for Intelligent Computing ของ Alibaba ล่าสุดได้พัฒนาระบบ AI ใหม่ที่มีชื่อว่า “EMO” ที่สามารถสร้างสรรค์วีดีโอบุคคลให้พูดหรือร้องเพลงได้จากภาพถ่าย Portrait เพียงภาพเดียว ได้แบบเนียนมาก ๆ

EMO ย่อมาจาก Emote Portrait Alive หรือบอกถึงลักษณะของโมเดลที่ทำชัดเจนว่าเป็นการทำให้ภาพแสดงอารมณ์ออกมาเหมือนมีชีวิต ซึ่งในงานตีพิมพ์ ได้อธิบายว่าระบบนี้สามารถสร้างการเคลื่อนไหวทางสีหน้าพร้อมกับขยับเคลื่อนไหวไปมาได้อย่างลื่นไหลตามเสียงที่ใส่เข้าไปได้อย่างจังหวะใกล้เคียงสุด ๆ
โดยเบื้องหลังของงานวิจัยนี้คือโมเดล Diffusion อีกเทคนิค AI ที่มีขีดความสามารถมาก ๆ ในการสร้างสรรค์สังเคราะห์ภาพออกมาได้อย่างสมจริง ซึ่งนักวิจัยได้ฝึกฝนโมเดลด้วย Dataset วีดีโอที่เป็นฉากบทพูดที่โฟกัสส่วนศีรษะความยาวกว่า 250 ชั่วโมง ซึ่งเป็นวีดีโอจากสุนทรพจน์ ภาพยนตร์ รายการทีวีโชว์ หรือว่าการแข่งขันร้องเพลง
สำหรับ EMO นั้น ส่วนที่แตกต่างจากวิธีการก่อนหน้านี้คือจะเป็นการใช้คลื่นเสียงแปลงเอาไปใส่ในเฟรมวีดีโอโดยตรง แทนที่จะเป็นวีธีการเดิม ๆ ที่จะต้องพึ่งโมเดลใบหน้าสามมิติ (3D) ซึ่งวิธีนี้จะช่วยทำให้จับการเคลื่อนไหวที่ละเอียดอ่อนจากเสียงพูดที่เป็นธรรมชาติได้

นอกจากเรื่องการพูดตามเสียงที่เนียนตามาก ๆ แล้ว ยังมีตัวอย่างวีดีโอที่สร้างขึ้นมามากมายจากภาพนิ่ง ที่ทำให้กลายเป็นวีดีโอร้องเพลงป็อปตามจังหวะได้อย่างแนบเนียน หรือแม้แต่จังหวะเพลงแร็ปที่ต้องขยับปากเร็ว ๆ ก็ทำได้ลื่นมาก ๆ ดูตัวอย่างวีดีโอเหล่านั้นเพิ่มเติมได้ในลิงก์เว็บ EMO ทางการ

สำหรับผู้ที่สนใจรายละเอียดเพิ่มเติมสามารถดูรายละเอียดได้บนเว็บไซต์นี้ หรืออ่านงานตีพิมพ์เต็ม ๆ ได้ที่ arXiv หรือศึกษารายละเอียดได้บน GitHub
SourceTitle:
PermanentURL:
Hashtag:


