بهسازي گفتار تك كاناله با استفاده از روش هاي عصبي مولد عميق
دانشکده فنی و مهندسی رسانه
کارشناسی ارشد- مهندسی صدا
راهیل مهدیان
محمدرضاجعفریانی
فربد رزازی
-----
------
1404-08-21
-------
بهسازي گفتار، به مجموعهاي از تكنيكها و روشها اطلاق ميشود كه به منظور بهبود كيفيت و قابليت فهم گفتار، در شرايطي كه سيگنال گفتار با نويز يا اختلالات ديگر مخلوط شده باشد، طراحي شدهاند. اين فرآيند، بهويژه در كاربردهايي مانند سيستمهاي ارتباط گفتاري، دستگاههاي شنوايي و سيستمهاي پردازش گفتار، اهميت فراواني دارد. در اين تحقيق، به بهسازي گفتار تك كاناله در محيطهاي با نسبت سيگنال به نويز(SNR) پايين ميپردازيم. براي اين منظور، MambaSCA-GAN را معرفي ميكنيم؛ چارچوبي مبتني بر شبكه مولد تخاصمي كه از يك ماژول نوين به نام Mamba-based Fusion with symmetric Co-attention (MambaSCA) بهره ميبرد. اين ماژول با جايگزيني بلوكهاي توجه مرسوم با بلوكهاي mamba با پيچيدگي خطي، وابستگيهاي بلندمدت زماني و طيفي را به صورت موازي مدلسازي كرده و از طريق همجوشي متقارن، تبادل دوطرفه اطلاعات را ميان اين دو حوزه تسهيل ميكند. معماري پيشنهادي در حوزه مختلط عمل كرده و با تركيب يك رمزگذار متراكم سبك و دو رمزگشاي مكمل براي دامنه و فاز، بازسازي سيگنال گفتار را بهبود ميبخشد. ارزيابيها بر روي ديتاست VoiceBank+DEMAND و همچنين مجموعهداده Deep Xi با سطح SNR پايين، مورد بررسي قرار گرفته است. هدف اصلي اين تحقيق، بهبود كيفيت گفتار در شرايط SNR پايين است. MambaSCA-GAN پيشنهادي، نتيجهي مطلوبي در بين مدلهاي موجود به دست آورد. نتايج مدل پيشنهادي در مجموعهداده Deep Xi با سطح SNR پايين، به صورت ميانگين در SNRها و نويزهاي بررسي شده، در معيارهاي PESQ، ESTOI، CSIG، CBAK و COVL به ترتيب ۱۸/۵%، ۱۲/۷%، ۱۳/۶%، ۱۲/۴% و۲۱/۹% بهبود نسبت به بهترين مدل SOTA قبل از خود را نشان ميدهد.