Detailed Information

Cited 0 time in webofscience Cited 0 time in scopus
Metadata Downloads

Improving Noise Robust Audio-Visual Speech Recognition via Router-Gated Cross-Modal Feature Fusion

Full metadata record
DC Field Value Language
dc.contributor.authorLim, DongHoon-
dc.contributor.authorKim, YoungChae-
dc.contributor.authorKim, Dong-Hyun-
dc.contributor.authorYang, Da-Hee-
dc.contributor.authorChang, Joon-Hyuk-
dc.date.accessioned2026-07-24T07:00:16Z-
dc.date.available2026-07-24T07:00:16Z-
dc.date.issued2026-04-
dc.identifier.issn2997-6928-
dc.identifier.issn2997-6995-
dc.identifier.urihttps://scholarworks.bwise.kr/hanyang/handle/2021.sw.hanyang/219640-
dc.description.abstractRobust audio-visual speech recognition (AVSR) in noisy environments remains challenging, as existing systems struggle to estimate audio reliability and dynamically adjust modality reliance. We propose router-gated cross-modal feature fusion, a novel AVSR framework that adaptively reweights audio and visual features based on token-level acoustic corruption scores. Using an audio-visual feature fusion-based router, our method down-weights unreliable audio tokens and reinforces visual cues through gated cross-attention in each decoder layer. This enables the model to pivot toward the visual modality when audio quality deteriorates. Experiments on LRS3 demonstrate that our approach achieves an 16.51-42.67% relative reduction in word error rate compared to AV-HuBERT. Ablation studies confirm that both the router and gating mechanism contribute to improved robustness under real-world acoustic noise.-
dc.format.extent7-
dc.language영어-
dc.language.isoENG-
dc.publisherInstitute of Electrical and Electronics Engineers Inc.-
dc.titleImproving Noise Robust Audio-Visual Speech Recognition via Router-Gated Cross-Modal Feature Fusion-
dc.typeArticle-
dc.identifier.doi10.1109/ASRU65441.2025.11434748-
dc.identifier.scopusid2-s2.0-105036549498-
dc.identifier.bibliographicCitationASRU 2025 - 2025 IEEE Automatic Speech Recognition and Understanding Workshop, pp 1 - 7-
dc.citation.titleASRU 2025 - 2025 IEEE Automatic Speech Recognition and Understanding Workshop-
dc.citation.startPage1-
dc.citation.endPage7-
dc.type.docTypeConference paper-
dc.description.isOpenAccessN-
dc.description.journalRegisteredClassscopus-
dc.subject.keywordPlusAudio acoustics-
dc.subject.keywordPlusAudio signal processing-
dc.subject.keywordPlusAudio systems-
dc.subject.keywordPlusRouters-
dc.subject.keywordPlusSound reproduction-
dc.subject.keywordPlusSpeech communication-
dc.subject.keywordPlusSpeech recognition-
dc.subject.keywordAuthorAudio-Visual Speech Recognition-
dc.subject.keywordAuthorCross-Modal Fusion-
dc.subject.keywordAuthorNoise-Robust ASR-
dc.subject.keywordAuthorRouter-Gated Cross Attention-
dc.identifier.urlhttps://ieeexplore.ieee.org/document/11434748-
Files in This Item
Go to Link
Appears in
Collections
서울 공과대학 > 서울 융합전자공학부 > 1. Journal Articles

qrcode

Items in ScholarWorks are protected by copyright, with all rights reserved, unless otherwise indicated.

Related Researcher

Researcher Chang, Joon-Hyuk photo

Chang, Joon-Hyuk
COLLEGE OF ENGINEERING (SCHOOL OF ELECTRONIC ENGINEERING)
Read more

Altmetrics

Total Views & Downloads

BROWSE