جداسازي تك كاناله و استخراج تعداد گويندگان، بر اساس مكانيزم توجه و ساختار سلسله مراتبي و بازگشتي
دانشکده فنی و مهندسی رسانه
کارشناسی ارشد- مهندسی صدا
راهیل مهدیان
معصومه شفیعیان بجستانی
یاسر شکفته
-----
----
1403-08-05
چکیده پایان نامه انسانها از ديرباز از دو قدرت خدادادي يعني قدرت تكلم و شنوايي به عنوان دو ابزار كليدي در برقراري ارتباط بهره بردهاند. اين دو حس، تعامل و تبادل اطلاعات را ميان افراد امكانپذير ميسازند و در شكلگيري جوامع بشري نقشي اساسي ايفا ميكنند. با اين حال، در برخي از موقعيتها، اين ارتباط دچار اختلال ميشود. نمونه بارز اين اختلال، صحبت همزمان چند نفر در يك محيط است كه ميتواند درك صحيح گفتار را دشوار يا غيرممكن سازد. اين مشكل در محيطهاي شلوغ و پر سر و صدا، مانند خيابانها، رستورانها و يا حتي جلسات كاري، تشديد ميشود. علاوه بر اين، با پيشرفت روزافزون فناوري و نياز فزاينده به استفاده از آن در زمينههاي مختلف، يافتن راهحلهايي براي غلبه بر اين چالشها بيش از پيش ضرورت پيدا ميكند. به عنوان مثال، در سامانههاي تشخيص گفتار، حضور نويز و صحبتهاي همزمان ميتواند به طور قابل توجهي بر دقت عملكرد اين سامانهها تأثير منفي بگذارد. به همين دليل، توسعه رويكردهاي نوين براي جداسازي صدا و حذف نويز از اهميت بالايي برخوردار است. اين رويكردها ميتوانند به ارتقاي كيفيت ارتباطات در محيطهاي شلوغ، افزايش دقت سامانههاي تشخيص گفتار و در نهايت، بهبود تجربه كاربري در تعامل با فناوري كمك كنند. فرآيند جداسازي گفتار شامل چالشهاي مختلفي است كه از جمله آنها: ۱. نويز زمينهاي: حضور هميشگي نويز زمينهاي، مانند صداي موتور خودروها، زمزمه افراد و يا صداي موسيقي، يكي از چالشهاي اساسي در جداسازي گفتار است. اين نويزها ميتوانند اطلاعات موجود در صداي مورد نظر را تحت شعاع قرار داده و فرآيند جداسازي را دشوارتر كنند. ۲. تغيير شكل صدا: بازتاب صدا از سطوح مختلف، افت كيفيت صدا به دليل دور بودن منبع و يا وجود موانع، ميتوانند شكل صداي مورد نظر را تغيير داده و جداسازي آن را دشوارتر كنند. ۳. تعداد منابع صوتي موجود در مخلوط صوتي: بسياري از رويكردهاي مطرح شده در اين حوزه قادر هستند براي تعداد مشخصي گوينده موجود در مخلوط ورودي، فرآيند جداسازي را انجام دهند. بنابراين ارائه رويكردي كه بتواند بدون هيچ محدوديتي از لحاظ تعداد گوينده، جداسازي منابع را انجام دهد؛ از جمله چالشهاي اين حوزه محسوب ميشود. در اين پژوهش، به منظور رفع چالش محدوديت تعداد منابع در روشهاي جداسازي گفتار، ساختار بازگشتي ارائه شدهاست. طي اين ساختار رويكرد پيشنهادي، توانايي جداسازي مخلوط صوت ورودي، بدون نياز به دانستن تعداد گويندگان موجود در مخلوط را دارد. از طرفي براي افزايش كيفيت صوتهاي خروجي، از ساختار دو مسيره و بلوك MLT استفاده شدهاست كه قابليت پردازش محلي و كلي ورودي را فراهم ميكند. از اينرو اين مدل براي جداسازي تعداد گويندگاني كه در آموزش مدل از آن استفاده نشدهاست نيز كاربرد دارد. نتايج ارزيابي نشان ميدهد، كيفيت صوتهاي جداسازي شده براي مخلوط دو گوينده و سه گوينده به ترتيب ۲۱/۰۵dB و ۱۹/۰۰dB در معيار SI-SNRi روي مجموعه دادگان آزمون WSJ۰-۲mix و WSJ۰-۳mix است.