تبديل تصوير به گفتار با استفاده از شبكه ي عصبي مبتني بر مبدل(ترنسفرمر)
دانشکده فنی و مهندسی رسانه
کارشناسی ارشد- مهندسی صدا
راهیل مهدیان
محمدعسگری
یاسر شکفته
------
------
1404-09-18
-------
تصاوير بهعنوان منابعي غني از اطلاعات، نقشي اساسي در درك انسان از جهان پيرامون ايفا ميكنند و از طريق حواس بينايي و گفتار، توصيف و انتقال مييابند. با اين حال، افراد نابينا و كمبينا بهدليل محدوديتهاي بصري، از دسترسي مستقيم به اين اطلاعات محروم هستند؛ امري كه چالشهاي قابلتوجهي را در تعامل آنها با محيط ايجاد ميكند. در اين راستا، توسعهي سامانههاي تبديل تصوير به گفتار بهعنوان راهكاري مؤثر براي ارائهي توصيفهاي شنيداري از محتواي بصري، امكان درك بهتر محيط را براي اين افراد فراهم ميسازد. اين فناوري نهتنها موجب افزايش دسترسيپذيري ميشود، بلكه كاربردهاي گستردهاي در حوزههايي همچون آموزش، ناوبري و تعاملات اجتماعي دارد. براي تحقق چنين سامانههايي، از تلفيق سه حوزهي كليديِ بينايي ماشين، پردازش زبان طبيعي(NLP) و مدلهاي گفتاري استفاده ميشود. در اين فرآيند، مدلهاي بينايي ماشين ابتدا ويژگيهاي معنايي و ساختاري تصاوير را استخراج ميكنند و سپس اين ويژگيها از طريق سامانههاي زباني و گفتاري – كه در چارچوب NLP تعريف ميشوند – به گفتار تبديل ميشوند. روشهاي موجود در اين حوزه به دو دستهي اصلي تقسيم ميشوند: روشهاي End-to-End كه تصوير را مستقيماً به گفتار نگاشت ميكنند و روشهاي مبتني بر بازنماييهاي مياني كه از متن يا واحدهاي گفتاري بهعنوان واسطه بهره ميبرند. با وجود مزاياي استفاده از بازنماييهاي مياني در بهبود دقت، اين روشها در زبانهايي با تنوع بالا يا فاقد خط نوشتاري با محدوديتهايي روبهرو هستند. افزون بر اين، چالشهايي نظير كيفيت و طبيعيبودن گفتار توليدي همچنان نيازمند بررسي و بهبود است. در اين پژوهش، مدلي نوين براي تبديل تصوير به گفتار ارائه شده است كه در بخش استخراج ويژگيهاي تصويري از رمزگذار ترنسفورمري الهامگرفته از معماري Diffusion Transformer بهره ميبرد. اين رمزگذار با بهبود توانايي مدل در درك روابط معنايي و ساختاري تصوير، بازنمايي دقيقتري از محتواي بصري فراهم ميكند. افزون بر اين، با بهكارگيري تابع هزينهي SSIM Loss، كيفيت بازسازي گفتار ارتقا يافته و گفتاري طبيعيتر و قابلفهمتر توليد ميشود. نتايج ارزيابيها نشان ميدهد كه مدل پيشنهادي در مقايسه با مدلهاي پايه، از نظر دقت و كيفيت خروجي عملكرد بهتري دارد و گامي مؤثر در راستاي رفع محدوديتهاي موجود در حوزهي تبديل تصوير به گفتار بهشمار ميآيد.