Klasifikasi Emosi Suara Multi Bahasa Berbasis Deep Learning Menggunakan Mel Spectrogram dan MFCC pada Indian Speech Emotion
Kata Kunci:
CNN-LSTM; Indian Speech Emotion Dataset; Mel Spectrogram; MFCC; multibahasa; Speech Emotion RecognitionAbstrak
Pengenalan emosi berbasis suara (Speech Emotion Recognition/SER) pada lingkungan multibahasa masih menjadi tantangan karena keterbatasan dataset dan variasi karakteristik akustik antar bahasa. Penelitian ini bertujuan membangun sistem klasifikasi emosi suara menggunakan arsitektur deep learning CNN-LSTM hibrida dengan fitur gabungan Mel Spectrogram dan MFCC pada Indian Speech Emotion Dataset yang mencakup tiga bahasa (Inggris, Hindi, dan Marathi) dengan 1.000 sampel audio pada lima kelas emosi (angry, happy, neutral, sad, surprise). Metode penelitian meliputi pra-pemrosesan audio, augmentasi data (time stretching, pitch shifting, penambahan noise, dan volume scaling), ekstraksi fitur Mel Spectrogram, MFCC, Delta MFCC, dan Delta-Delta MFCC, serta pelatihan model CNN-BiLSTM dengan rasio data latih dan uji 80:20. Hasil pengujian pada data uji menunjukkan akurasi sebesar 70,00% dengan F1-score rata-rata sebesar 0,70. Kelas neutral memperoleh performa terbaik (F1-score 0,78), sedangkan kelas happy paling sering tertukar dengan kelas lain (F1-score 0,58). Hasil ini menunjukkan kombinasi fitur Mel Spectrogram dan MFCC mampu mengenali emosi suara multibahasa, meskipun terdapat indikasi overfitting yang membuka peluang perbaikan melalui regularisasi dan penambahan data pada penelitian selanjutnya.
