مهدی مظلومی


عنوان پایان نامه

بهسازي گفتار تك كاناله با استفاده از روش هاي عصبي مولد عميق

نام دانشکده

دانشکده فنی و مهندسی رسانه

رشته تحصیلی

کارشناسی ارشد- مهندسی صدا

استاد راهنما

راهیل مهدیان

استادان داور

محمدرضاجعفریانی

فربد رزازی

استادان مشاور

-----

------

تاریخ دفاع

1404-08-21

مکان دفاع

-------

چکیده پایان نامه

بهسازي گفتار، به مجموعه‌اي از تكنيك‌ها و روش‌ها اطلاق مي‌شود كه به منظور بهبود كيفيت و قابليت فهم گفتار، در شرايطي كه سيگنال گفتار با نويز يا اختلالات ديگر مخلوط شده باشد، طراحي شده‌اند. اين فرآيند، به‌ويژه در كاربردهايي مانند سيستم‌هاي ارتباط گفتاري، دستگاه‌هاي شنوايي و سيستم‌هاي پردازش گفتار، اهميت فراواني دارد. در اين تحقيق، به بهسازي گفتار تك كاناله در محيط‌هاي با نسبت سيگنال به نويز(SNR) پايين مي‌پردازيم. براي اين منظور، MambaSCA-GAN را معرفي مي‌كنيم؛ چارچوبي مبتني بر شبكه مولد تخاصمي كه از يك ماژول نوين به نام Mamba-based Fusion with symmetric Co-attention (MambaSCA) بهره مي‌برد. اين ماژول با جايگزيني بلوك‌هاي توجه مرسوم با بلوك‌هاي mamba با پيچيدگي خطي، وابستگي‌هاي بلندمدت زماني و طيفي را به صورت موازي مدل‌سازي كرده و از طريق هم‌جوشي متقارن، تبادل دوطرفه اطلاعات را ميان اين دو حوزه تسهيل مي‌كند. معماري پيشنهادي در حوزه مختلط عمل كرده و با تركيب يك رمزگذار متراكم سبك و دو رمزگشاي مكمل براي دامنه و فاز، بازسازي سيگنال گفتار را بهبود مي‌بخشد. ارزيابي‌ها بر روي ديتاست VoiceBank+DEMAND و همچنين مجموعه‌داده Deep Xi با سطح SNR پايين، مورد بررسي قرار گرفته است. هدف اصلي اين تحقيق، بهبود كيفيت گفتار در شرايط SNR پايين است. MambaSCA-GAN پيشنهادي، نتيجه‌ي مطلوبي در بين مدل‌هاي موجود به دست آورد. نتايج مدل پيشنهادي در مجموعه‌داده Deep Xi با سطح SNR پايين، به صورت ميانگين در SNRها و نويزهاي بررسي شده، در معيارهاي PESQ، ESTOI، CSIG، CBAK و COVL به ترتيب ۱۸/۵%، ۱۲/۷%، ۱۳/۶%، ۱۲/۴% و۲۱/۹% بهبود نسبت به بهترين مدل SOTA قبل از خود را نشان مي‌دهد.

ابتدای صفحه