Analisis Perbandingan Performa Library Rhubarb dan Azure untuk Real-Time Lipsync pada Sistem Avatar Interaktif
Shyra Athaya, Divi Galih Prasetyo Putri, S.Kom., M.Kom, Ph.D.
2026 | Tugas Akhir | D4 Teknologi Perangkat Lunak
Perkembangan teknologi avatar digital 3D meningkatkan kebutuhan akan
sinkronisasi gerakan bibir (lipsync) yang realistis untuk mendukung
interaksi yang lebih natural. Berbagai library lipsync telah
dikembangkan untuk tujuan tersebut, di antaranya Rhubarb dan Azure Neural Text-to-Speech. Meskipun
keduanya banyak digunakan, perbandingan langsung mengenai efektivitasnya dalam
menghasilkan viseme untuk animasi avatar 3D masih terbatas. Oleh karena
itu, penelitian ini mengkaji efektivitas kedua library lipsync tersebut
dalam menghasilkan urutan viseme yang akurat untuk animasi avatar 3D. Evaluasi
dilakukan melalui pengujian kinerja sistem, pengukuran tingkat akurasi viseme
yang dihasilkan, serta penilaian persepsi pengguna terhadap kualitas animasi
yang ditampilkan. Parameter evaluasi yang digunakan meliputi Real-Time
Factor (RTF) untuk mengukur efisiensi pemrosesan, Viseme Accuracy Score
(VAS) untuk mengukur kesesuaian viseme yang dihasilkan, dan Mean
Opinion Score (MOS) untuk menilai persepsi pengguna terhadap naturalitas
animasi. Hasil penelitian menunjukkan bahwa Rhubarb memiliki efisiensi pemrosesan
yang lebih baik dengan rata-rata RTF sebesar 0,2555 dibandingkan Azure Neural Text-to-Speech
sebesar 0,4822, meskipun keduanya tetap berada dalam kategori real-time (RTF < 1>viseme pada
Rhubarb dipersepsikan lebih natural meskipun akurasinya lebih rendah. Dengan demikian, penelitian ini diharapkan
dapat memberikan referensi bagi pengembang avatar 3D interaktif dalam memilih
teknologi lipsync yang sesuai dengan kebutuhan sistem. Selain itu, hasil
penelitian ini diharapkan dapat memberikan rekomendasi penggunaan Rhubarb dan
Azure Neural Text-to-Speech berdasarkan aspek efisiensi, akurasi, dan kualitas
visual yang dihasilkan, baik untuk bahasa Inggris maupun bahasa Indonesia.
The development of 3D digital avatar technology has increased the demand for realistic lip synchronization (lipsync) to support more natural interactions. Various lipsync libraries have been developed for this purpose, including Rhubarb, and Azure Neural Text-to-Speech. Although both are widely used, direct comparisons of their effectiveness in generating visemes for 3D avatar animation remain limited. Therefore, this study examines the effectiveness of these two lipsync libraries in producing accurate viseme sequences for 3D avatar animation. The evaluation was conducted through system performance testing, measurement of viseme accuracy, and user perception assessment of the resulting animation quality. The evaluation parameters included Real-Time Factor (RTF) to measure processing efficiency, Viseme Accuracy Score (VAS) to measure the accuracy of generated visemes, and Mean Opinion Score (MOS) to assess users' perceptions of animation naturalness. The results show that Rhubarb achieved better processing efficiency, with an average RTF of 0.2555 compared to 0.4822 for Azure Neural Text-to-Speech, although both remained within the real-time category (RTF < 1>
Kata Kunci : real-time animation, avatar 3D, azure neural text-to-speech, rhubarb library, viseme