بهسازي گفتار تك كاناله در SNR پايين با استفاده از ترنسفورمر متقاطع موازي دو شاخه
دانشکده فنی و مهندسی رسانه
کارشناسی ارشد- مهندسی صدا
راهیل مهدیان
محمدابراهیم صادقی علویچه
فربد رزازی
-----
------
1403-08-13
چکیده پایان نامه بهسازي گفتار، به مجموعهاي از تكنيكها و روشها اطلاق ميشود كه به منظور بهبود كيفيت و قابليت فهم گفتار، در شرايطي كه سيگنال گفتار با نويز يا اختلالات ديگر مخلوط شده باشد، طراحي شدهاند. اين فرآيند، بهويژه در كاربردهايي مانند سيستمهاي ارتباط گفتاري، دستگاههاي شنوايي و سيستمهاي پردازش گفتار، اهميت فراواني دارد. در اين تحقيق، به بهسازي گفتار تك كاناله در محيطهاي با نسبت سيگنال به نويز(SNR) پايين ميپردازيم. براي اين منظور، از دو شاخهي موازي كه وظيفه "ماسك كردن قسمتهاي نويزي دامنه طيف" و "بازيابي جزئيات طيفي از دست رفته و استخراج اطلاعات فاز بهطورضمني" را به عهده دارند، استفاده ميكنيم و اطلاعات فاز را كه در شرايط SNR پايين به بهسازي كمك ميكند، وارد ميكنيم. در هر شاخه، يك ماژول ترنسفورمر متقاطع موازي(CPTM) در حوزه زمان-فركانس، پيشنهاد شده است كه وابستگيهاي طولاني مدت را در امتداد محورهاي زماني و فركانسي ثبت كرده و با تركيب اطلاعات آنها، ويژگيهاي مرتبط زماني-فركانسي را استخراج ميكند. اين تحقيق در مجموعهداده VoiceBank+DEMAND و همچنين مجموعهداده Deep Xi با سطح SNR پايين، مورد بررسي قرار گرفته است. هدف اصلي اين تحقيق، بهبود كيفيت گفتار در شرايط SNR پايين است. شبكه عصبي ترنسفورمر متقاطع موازي دو شاخه(DB-CPTNN) پيشنهادي، نتيجهي مطلوبي در بين مدلهاي موجود به دست آورد. نتايج مدل پيشنهادي در مجموعهداده Deep Xi با سطح SNR پايين، به صورت ميانگين در SNRها و نويزهاي بررسي شده، در معيارهاي PESQ، ESTOI، CSIG، CBAK و COVL به ترتيب ۲۹/۸%، ۱۷/۶%، ۱۹/۲%، ۱۹/۹% و %۲۴/۶ بهبود نسبت به بهترين مدل SOTA قبل از خود را نشان ميدهد.