محمدحکیم خواه


عنوان پایان نامه

بهسازي گفتار تك كاناله در SNR پايين با استفاده از ترنسفورمر متقاطع موازي دو شاخه

نام دانشکده

دانشکده فنی و مهندسی رسانه

رشته تحصیلی

کارشناسی ارشد- مهندسی صدا

استاد راهنما

راهیل مهدیان

استادان داور

محمدابراهیم صادقی علویچه

فربد رزازی

استادان مشاور

-----

------

تاریخ دفاع

1403-08-13

مکان دفاع

چکیده پایان نامه

چکیده پایان نامه بهسازي گفتار، به مجموعه‌اي از تكنيك‌ها و روش‌ها اطلاق مي‌شود كه به منظور بهبود كيفيت و قابليت فهم گفتار، در شرايطي كه سيگنال گفتار با نويز يا اختلالات ديگر مخلوط شده باشد، طراحي شده‌اند. اين فرآيند، به‌ويژه در كاربردهايي مانند سيستم‌هاي ارتباط گفتاري، دستگاه‌هاي شنوايي و سيستم‌هاي پردازش گفتار، اهميت فراواني دارد. در اين تحقيق، به بهسازي گفتار تك كاناله در محيط‌هاي با نسبت سيگنال به نويز(SNR) پايين مي‌پردازيم. براي اين منظور، از دو شاخه‌ي موازي كه وظيفه "ماسك كردن قسمت‌هاي نويزي دامنه طيف" و "بازيابي جزئيات طيفي از دست رفته و استخراج اطلاعات فاز به‌طورضمني" را به عهده دارند، استفاده مي‌كنيم و اطلاعات فاز را كه در شرايط SNR پايين به بهسازي كمك مي‌كند، وارد مي‌كنيم. در هر شاخه، يك ماژول ترنسفورمر متقاطع موازي(CPTM) در حوزه زمان-فركانس، پيشنهاد شده است كه وابستگي‌هاي طولاني مدت را در امتداد محورهاي زماني و فركانسي ثبت كرده و با تركيب اطلاعات آن‌ها، ويژگي‌هاي مرتبط زماني-فركانسي را استخراج مي‌كند. اين تحقيق در مجموعه‌داده VoiceBank+DEMAND و همچنين مجموعه‌داده Deep Xi با سطح SNR پايين، مورد بررسي قرار گرفته است. هدف اصلي اين تحقيق، بهبود كيفيت گفتار در شرايط SNR پايين است. شبكه عصبي ترنسفورمر متقاطع موازي دو شاخه(DB-CPTNN) پيشنهادي، نتيجه‌ي مطلوبي در بين مدل‌هاي موجود به دست آورد. نتايج مدل پيشنهادي در مجموعه‌داده Deep Xi با سطح SNR پايين، به صورت ميانگين در SNRها و نويزهاي بررسي شده، در معيارهاي PESQ، ESTOI، CSIG، CBAK و COVL به ترتيب ۲۹/۸%، ۱۷/۶%، ۱۹/۲%، ۱۹/۹% و %۲۴/۶ بهبود نسبت به بهترين مدل SOTA قبل از خود را نشان مي‌دهد.

ابتدای صفحه