محمدحسین بیگرضایی


عنوان پایان نامه

بهسازي گفتار تك كاناله به كمك تقويت يك شبكه ي مولد تخاصمي داراي متمايزگرهاي دوگانه

نام دانشکده

دانشکده فنی و مهندسی رسانه

رشته تحصیلی

کارشناسی ارشد- مهندسی صدا

استاد راهنما

معصومه شفیعیان بجستانی

استادان داور

راهیل مهدیان

فرید رزازی

استادان مشاور

-----

--------

تاریخ دفاع

1402-07-29

مکان دفاع

چکیده پایان نامه

چکیده پایان نامه بهسازي گفتاركه همواره يكي از چالش هاي اصلي محققين حوزه پردازش سيگنال هاي صوتي بوده است، مي تواند كيفيت و قابليت فهم يك گفتار همراه با نويز را بهبود ببخشد وهمچنين نويز آن را تا حد امكان كاهش دهد. عمده ترين كاربردهاي آن در بهبود كيفيت ارتياطات موبايلي درمحيط هاي نويزي ودر افزايش كيفيت سمعك هاست. اخيرا شبكه هاي مولد تخاصميGANs) ) ، در پژوهش هاي زيادي در زمينه ي بهسازي گفتار به كار رفته اند. در اين پژوهش ها يكي از چالش هاي مهمي كه همواره مورد توجه محققين بوده است، طراحي يك مدل متمايزگر) D) در اين شبكه ها بوده است، به طوري كه اين مدل بتواند با دقت و سخت گيري تا حد امكان بيشتري نمونه هاي صوتي واقعي را از جعلي تشخيص دهد و از اين طريق خروجي مدل مولد به كيفيت بيشتري دست پيدا كند. در رويكرد جديد پيشنهادشده در اين پژوهش، از متمايزگرهاي دوگانه براي حل اين چالش استفاده شده است. دو متمايزگر D۱ و D۲ با دقت و سخت گيري بيشتري مي توانند داده ي واقعي را از داده ي جعلي تشخيص دهند . همچنين در ساختار شبكه ي مولد تخاصمي، يك ماژول U-Net استفاده شده است. در ساختار اين ماژول، از تكنيك هايي مانند اتصالات پرش ونوعي بلوك كانولوشني بازشونده ي متراكم به منظور بهبود كيفيت سيگنال خروجي بهره گرفته شده است. به منظور پياده سازي روش پيشنهادي از دادگان CHIME-۴استفاده شده است. همچنين ۶ شاخص ارزيابي PESQ، R، STOI، CSIG، CBAKو COVL? براي ارزيابي نهايي اين رويكرد در نظر گرفته شدند. براي بررسي عملكرد روش پيشنهادي، با ۳ تا از رويكردهاي پيشين مقايسه اي انجام شد و اين نتيجه گرفته شد كه شاخصPESQ ، نسبت به رويكرد SEGAN حدود ۲/۲۲ درصد و نسبت به رويكرد SERGA حدود ۹ / ۶ درصد بهبود يافته است. اما در عين حال نسبت به مقاله ي E-AMTL كه جز مقالات state-of-the-art محسوب مي شود، شاهد افت حدود ۴۵ / ۶ درصدي در كيفيت بهسازي گفتار بوديم. براي بررسي قابليت فهم روش پيشنهادي، بهترين شاخصي كه مي توانستيم از آن بهره ببريم، شاخص STOI بود. در شاخصSTOI ، روش پيشنهادي نسبت به رويكردSEGAN حدود ۲۸/۱ درصد و نسبت به رويكرد SERGA حدود ۳۲/۰ درصد بهبود يافته است. اما در عين حال نسبت به مقاله ي SE-AMTL شاهد افت حدود ۵۳ / ۰ درصدي در قابليت فهم گفتار بوديم. در مجموع مي توان گفت كه عملكرد روش پيشنهادي اين پايان نامه هم از نظركيفيت گفتار و هم از نظر قابليت فهم گفتار نسبت به روش هاي سنتي و قديمي تر بهسازي گفتار با استفاده از شبكه هاي GAN (قبل از ۲۰۲۰)، مانند SEGAN قابل قبول بوده است. اما در برابر روش هاي جديد و state-of-the-art ۲۰۲۲ و ۲۰۲۳ عملكرد خيلي رضايت بخشي نداشته است.

ابتدای صفحه