هادی علی زاده


عنوان پایان نامه

جداسازي تك كاناله و استخراج تعداد گويندگان، بر اساس مكانيزم توجه و ساختار سلسله مراتبي و بازگشتي

نام دانشکده

دانشکده فنی و مهندسی رسانه

رشته تحصیلی

کارشناسی ارشد- مهندسی صدا

استاد راهنما

راهیل مهدیان

استادان داور

معصومه شفیعیان بجستانی

یاسر شکفته

استادان مشاور

-----

----

تاریخ دفاع

1403-08-05

مکان دفاع

چکیده پایان نامه

چکیده پایان نامه انسان‌ها از ديرباز از دو قدرت خدادادي يعني قدرت تكلم و شنوايي به عنوان دو ابزار كليدي در برقراري ارتباط بهره برده‌اند. اين دو حس، تعامل و تبادل اطلاعات را ميان افراد امكان‌پذير مي‌سازند و در شكل‌گيري جوامع بشري نقشي اساسي ايفا مي‌كنند. با اين حال، در برخي از موقعيت‌ها، اين ارتباط دچار اختلال مي‌شود. نمونه بارز اين اختلال، صحبت همزمان چند نفر در يك محيط است كه مي‌تواند درك صحيح گفتار را دشوار يا غيرممكن سازد. اين مشكل در محيط‌هاي شلوغ و پر سر و صدا، مانند خيابان‌ها، رستوران‌ها و يا حتي جلسات كاري، تشديد مي‌شود. علاوه بر اين، با پيشرفت روزافزون فناوري و نياز فزاينده به استفاده از آن در زمينه‌هاي مختلف، يافتن راه‌حل‌هايي براي غلبه بر اين چالش‌ها بيش از پيش ضرورت پيدا مي‌كند. به عنوان مثال، در سامانه‌هاي تشخيص گفتار، حضور نويز و صحبت‌هاي همزمان مي‌تواند به طور قابل توجهي بر دقت عملكرد اين سامانه‌ها تأثير منفي بگذارد. به همين دليل، توسعه رويكردهاي نوين براي جداسازي صدا و حذف نويز از اهميت بالايي برخوردار است. اين رويكردها مي‌توانند به ارتقاي كيفيت ارتباطات در محيط‌هاي شلوغ، افزايش دقت سامانه‌هاي تشخيص گفتار و در نهايت، بهبود تجربه كاربري در تعامل با فناوري كمك كنند. فرآيند جداسازي گفتار شامل چالش‌هاي مختلفي است كه از جمله آن‌ها: ۱. نويز زمينه‌اي: حضور هميشگي نويز زمينه‌اي، مانند صداي موتور خودروها، زمزمه افراد و يا صداي موسيقي، يكي از چالش‌هاي اساسي در جداسازي گفتار است. اين نويزها مي‌توانند اطلاعات موجود در صداي مورد نظر را تحت شعاع قرار داده و فرآيند جداسازي را دشوارتر كنند. ۲. تغيير شكل صدا: بازتاب صدا از سطوح مختلف، افت كيفيت صدا به دليل دور بودن منبع و يا وجود موانع، مي‌توانند شكل صداي مورد نظر را تغيير داده و جداسازي آن را دشوارتر كنند. ۳. تعداد منابع صوتي موجود در مخلوط صوتي: بسياري از رويكردهاي مطرح شده در اين حوزه قادر هستند براي تعداد مشخصي گوينده موجود در مخلوط ورودي، فرآيند جداسازي را انجام دهند. بنابراين ارائه رويكردي كه بتواند بدون هيچ محدوديتي از لحاظ تعداد گوينده، جداسازي منابع را انجام دهد؛ از جمله چالش‌هاي اين حوزه محسوب مي‌شود. در اين پژوهش، به منظور رفع چالش محدوديت تعداد منابع در روش‌هاي جداسازي گفتار، ساختار بازگشتي ارائه شده‌است. طي اين ساختار رويكرد پيشنهادي، توانايي جداسازي مخلوط صوت‌ ورودي، بدون نياز به دانستن تعداد گويندگان موجود در مخلوط را دارد. از طرفي براي افزايش كيفيت صوت‌هاي خروجي، از ساختار دو مسيره و بلوك MLT استفاده شده‌است كه قابليت پردازش محلي و كلي ورودي را فراهم مي‌كند. از اين‌رو اين مدل براي جداسازي تعداد گويندگاني كه در آموزش مدل از آن استفاده نشده‌است نيز كاربرد دارد. نتايج ارزيابي نشان مي‌دهد، كيفيت صوت‌هاي جداسازي شده براي مخلوط دو گوينده و سه گوينده به ترتيب ۲۱/۰۵dB و ۱۹/۰۰dB در معيار SI-SNRi روي مجموعه دادگان آزمون WSJ۰-۲mix و WSJ۰-۳mix ‌است.

ابتدای صفحه