بهبود بازشناسي احساس از روي گفتار مستقل از گوينده، به كمك ويژگي هاي MFCC مختلط و بهره گيري از شبكه هاي عصبي مبتني بر مكانيسم توجه
دانشکده فنی و مهندسی رسانه
کارشناسی ارشد- مهندسی صدا
راهیل مهدیان
محمدابراهیم صادقی علویچه
هادی ویسی
--------
----------
1402-07-03
چکیده پایان نامه گفتار، يكي از راههاي مهم ارتباطي بوده و روشي موثر براي بيان احساس است. در چند دههي گذشته بازشناسي احساس از گفتار توسط ماشينها، مورد توجه محققان قرار گرفته است كه منجر به بروز مدلهاي بازشناسي احساس از گفتار شده است. يكي از چالشهاي موجود در طراحي اين مدلها، وابستگي آنها به خصوصيات گفتاري گوينده، مانند: زبان، لهجه، فرهنگ، سن و جنسيت گوينده است. بنابراين، اين مدلها بهتر است كه به صورت مستقل از گوينده طراحي شوند. در اين پاياننامه، طراحي يك مدل بازشناسي احساس از گفتار انتها به انتها و مستقل از گوينده با استفاده از ويژگيهاي صوتي چند سطحي جديد و بهرهگيري از ماژول همتوجه پيشنهاد شده است. در روش پيشنهادي، ابتدا ويژگيهاي صوتي چند سطحي، از جمله ضرايب مختلط كپسترال مبتني بر معيار مل ( MFCCمختلط)، اسپكتروگرام و سيگنال اصلي گفتار بهعنوان ورودي به ترتيب به سه شبكهي Bi-LSTM، ترنسفورمر Swin و شبكهي Wav۲vec۲/۰ داده ميشود. سپس بازنماييهاي حاصل از اين شبكهها توسط مكانيسم همتوجه پيشنهادي براي بهينهسازي ويژگيهاي جاسازي شده Wav۲vec۲/۰ تركيب ميشوند. در انتها هر سه ويژگي استخراجشده را به هم متصل و با اين ويژگيهاي تركيبشده نهايي، پيشبيني احساسات انجام ميگردد. همچنين در قسمت دستهبندي احساسات از دستهبند غيرخطي(SVM كرنل) براي دستهبندي هرچه بهتر احساسات استفاده نموديم. دادگان مورد استفاده براي انجام آزمايش، دادگانIEMOCAP ميباشد و بر حسب معيار (Weighted Average) WA دقت ۷۱/۸۵% ، و بر اساس معيار ((Unweighted Average UA دقت ۷۳/۴۲% در حالت ترك يك جلسه از دادگان حاصل شد و در حالت ترك يك گوينده بر اساس معيار WA دقت ۷۳/۹۲%، و بر اساس معيار UA دقت ۷۵/۵% حاصل شد، كه نسبت به كارهاي پيشين بر اساس معيار WA به ترتيب افزايش ۲/۰۵% و ۲/۲۸% و بر اساس معيار UA به ترتيب افزايش %۲/۳۷ و ۲/۸% را نشان ميدهد.