Alibaba เปิดตัว AI ใหม่ “EMO” สร้างวีดีโอคนพูดหรือร้องเพลงจากภาพได้สุดสมจริง 

0

นักวิจัยจาก Institute for Intelligent Computing ของ Alibaba ล่าสุดได้พัฒนาระบบ AI ใหม่ที่มีชื่อว่า “EMO” ที่สามารถสร้างสรรค์วีดีโอบุคคลให้พูดหรือร้องเพลงได้จากภาพถ่าย Portrait เพียงภาพเดียว ได้แบบเนียนมาก ๆ 

Credit : EMO

EMO ย่อมาจาก Emote Portrait Alive หรือบอกถึงลักษณะของโมเดลที่ทำชัดเจนว่าเป็นการทำให้ภาพแสดงอารมณ์ออกมาเหมือนมีชีวิต ซึ่งในงานตีพิมพ์ ได้อธิบายว่าระบบนี้สามารถสร้างการเคลื่อนไหวทางสีหน้าพร้อมกับขยับเคลื่อนไหวไปมาได้อย่างลื่นไหลตามเสียงที่ใส่เข้าไปได้อย่างจังหวะใกล้เคียงสุด ๆ 

โดยเบื้องหลังของงานวิจัยนี้คือโมเดล Diffusion อีกเทคนิค AI ที่มีขีดความสามารถมาก ๆ ในการสร้างสรรค์สังเคราะห์ภาพออกมาได้อย่างสมจริง ซึ่งนักวิจัยได้ฝึกฝนโมเดลด้วย Dataset วีดีโอที่เป็นฉากบทพูดที่โฟกัสส่วนศีรษะความยาวกว่า 250 ชั่วโมง ซึ่งเป็นวีดีโอจากสุนทรพจน์ ภาพยนตร์ รายการทีวีโชว์ หรือว่าการแข่งขันร้องเพลง

สำหรับ EMO นั้น ส่วนที่แตกต่างจากวิธีการก่อนหน้านี้คือจะเป็นการใช้คลื่นเสียงแปลงเอาไปใส่ในเฟรมวีดีโอโดยตรง แทนที่จะเป็นวีธีการเดิม ๆ ที่จะต้องพึ่งโมเดลใบหน้าสามมิติ (3D) ซึ่งวิธีนี้จะช่วยทำให้จับการเคลื่อนไหวที่ละเอียดอ่อนจากเสียงพูดที่เป็นธรรมชาติได้

Credit : EMO

นอกจากเรื่องการพูดตามเสียงที่เนียนตามาก ๆ แล้ว ยังมีตัวอย่างวีดีโอที่สร้างขึ้นมามากมายจากภาพนิ่ง ที่ทำให้กลายเป็นวีดีโอร้องเพลงป็อปตามจังหวะได้อย่างแนบเนียน หรือแม้แต่จังหวะเพลงแร็ปที่ต้องขยับปากเร็ว ๆ ก็ทำได้ลื่นมาก ๆ ดูตัวอย่างวีดีโอเหล่านั้นเพิ่มเติมได้ในลิงก์เว็บ EMO ทางการ 

ตัวอย่าง Leonardo Wilhelm DiCaprio ร้องเพลง EMINEM – GODZILLA (FT. JUICE WRLD) COVER

สำหรับผู้ที่สนใจรายละเอียดเพิ่มเติมสามารถดูรายละเอียดได้บนเว็บไซต์นี้ หรืออ่านงานตีพิมพ์เต็ม ๆ ได้ที่ arXiv หรือศึกษารายละเอียดได้บน GitHub

ที่มา: https://venturebeat.com/ai/alibabas-new-ai-system-emo-creates-realistic-talking-and-singing-videos-from-photos/

SourceTitle:

PermanentURL:

Hashtag: