محمدامین پیش خورد


عنوان پایان نامه

تبديل تصوير به گفتار با استفاده از شبكه ي عصبي مبتني بر مبدل(ترنسفرمر)

نام دانشکده

دانشکده فنی و مهندسی رسانه

رشته تحصیلی

کارشناسی ارشد- مهندسی صدا

استاد راهنما

راهیل مهدیان

استادان داور

محمدعسگری

یاسر شکفته

استادان مشاور

------

------

تاریخ دفاع

1404-09-18

مکان دفاع

-------

چکیده پایان نامه

تصاوير به‌عنوان منابعي غني از اطلاعات، نقشي اساسي در درك انسان از جهان پيرامون ايفا مي‌كنند و از طريق حواس بينايي و گفتار، توصيف و انتقال مي‌يابند. با اين حال، افراد نابينا و كم‌بينا به‌دليل محدوديت‌هاي بصري، از دسترسي مستقيم به اين اطلاعات محروم هستند؛ امري كه چالش‌هاي قابل‌توجهي را در تعامل آن‌ها با محيط ايجاد مي‌كند. در اين راستا، توسعه‌ي سامانه‌هاي تبديل تصوير به گفتار به‌عنوان راهكاري مؤثر براي ارائه‌ي توصيف‌هاي شنيداري از محتواي بصري، امكان درك بهتر محيط را براي اين افراد فراهم مي‌سازد. اين فناوري نه‌تنها موجب افزايش دسترسي‌پذيري مي‌شود، بلكه كاربردهاي گسترده‌اي در حوزه‌هايي همچون آموزش، ناوبري و تعاملات اجتماعي دارد. براي تحقق چنين سامانه‌هايي، از تلفيق سه حوزه‌ي كليديِ بينايي ماشين، پردازش زبان طبيعي(NLP) و مدل‌هاي گفتاري استفاده مي‌شود. در اين فرآيند، مدل‌هاي بينايي ماشين ابتدا ويژگي‌هاي معنايي و ساختاري تصاوير را استخراج مي‌كنند و سپس اين ويژگي‌ها از طريق سامانه‌هاي زباني و گفتاري – كه در چارچوب NLP تعريف مي‌شوند – به گفتار تبديل مي‌شوند. روش‌هاي موجود در اين حوزه به دو دسته‌ي اصلي تقسيم مي‌شوند: روش‌هاي End-to-End كه تصوير را مستقيماً به گفتار نگاشت مي‌كنند و روش‌هاي مبتني بر بازنمايي‌هاي مياني كه از متن يا واحدهاي گفتاري به‌عنوان واسطه بهره مي‌برند. با وجود مزاياي استفاده از بازنمايي‌هاي مياني در بهبود دقت، اين روش‌ها در زبان‌هايي با تنوع بالا يا فاقد خط نوشتاري با محدوديت‌هايي روبه‌رو هستند. افزون بر اين، چالش‌هايي نظير كيفيت و طبيعي‌بودن گفتار توليدي همچنان نيازمند بررسي و بهبود است. در اين پژوهش، مدلي نوين براي تبديل تصوير به گفتار ارائه شده است كه در بخش استخراج ويژگي‌هاي تصويري از رمزگذار ترنسفورمري الهام‌گرفته از معماري Diffusion Transformer بهره مي‌برد. اين رمزگذار با بهبود توانايي مدل در درك روابط معنايي و ساختاري تصوير، بازنمايي دقيق‌تري از محتواي بصري فراهم مي‌كند. افزون بر اين، با به‌كارگيري تابع هزينه‌ي SSIM Loss، كيفيت بازسازي گفتار ارتقا يافته و گفتاري طبيعي‌تر و قابل‌فهم‌تر توليد مي‌شود. نتايج ارزيابي‌ها نشان مي‌دهد كه مدل پيشنهادي در مقايسه با مدل‌هاي پايه، از نظر دقت و كيفيت خروجي عملكرد بهتري دارد و گامي مؤثر در راستاي رفع محدوديت‌هاي موجود در حوزه‌ي تبديل تصوير به گفتار به‌شمار مي‌آيد.

ابتدای صفحه