Neural Speech Tracking in a Virtual Acoustic Environment: Audio-Visual Benefit for Unscripted Continuous Speech
Fuente:
arXiv
Salvato in:
| Autori principali: | Daeglau, Mareike, Otten, Juergen, Grimm, Giso, Mirkovic, Bojana, Hohmann, Volker, Debener, Stefan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A toolbox for rendering virtual acoustic environments in the context of audiology
di: Grimm, Giso, et al.
Pubblicazione: (2018)
di: Grimm, Giso, et al.
Pubblicazione: (2018)
Uncovering the Visual Contribution in Audio-Visual Speech Recognition
di: Lin, Zhaofeng, et al.
Pubblicazione: (2024)
di: Lin, Zhaofeng, et al.
Pubblicazione: (2024)
Audio-Visual Speech Enhancement in Noisy Environments via Emotion-Based Contextual Cues
di: Hussain, Tassadaq, et al.
Pubblicazione: (2024)
di: Hussain, Tassadaq, et al.
Pubblicazione: (2024)
Evaluation of Virtual Acoustic Environments with Different Acoustic Level of Detail
di: Fichna, Stefan, et al.
Pubblicazione: (2023)
di: Fichna, Stefan, et al.
Pubblicazione: (2023)
Robust Audio-Visual Speech Enhancement: Correcting Misassignments in Complex Environments with Advanced Post-Processing
di: Ren, Wenze, et al.
Pubblicazione: (2024)
di: Ren, Wenze, et al.
Pubblicazione: (2024)
Contrastive Learning With Audio Discrimination For Customizable Keyword Spotting In Continuous Speech
di: Xi, Yu, et al.
Pubblicazione: (2024)
di: Xi, Yu, et al.
Pubblicazione: (2024)
A Fast and Lightweight Model for Causal Audio-Visual Speech Separation
di: Sang, Wendi, et al.
Pubblicazione: (2025)
di: Sang, Wendi, et al.
Pubblicazione: (2025)
Leveraging Mamba with Full-Face Vision for Audio-Visual Speech Enhancement
di: Chao, Rong, et al.
Pubblicazione: (2025)
di: Chao, Rong, et al.
Pubblicazione: (2025)
DAIEN-TTS: Disentangled Audio Infilling for Environment-Aware Text-to-Speech Synthesis
di: Lu, Ye-Xin, et al.
Pubblicazione: (2025)
di: Lu, Ye-Xin, et al.
Pubblicazione: (2025)
FlowAVSE: Efficient Audio-Visual Speech Enhancement with Conditional Flow Matching
di: Jung, Chaeyoung, et al.
Pubblicazione: (2024)
di: Jung, Chaeyoung, et al.
Pubblicazione: (2024)
Acoustic BPE for Speech Generation with Discrete Tokens
di: Shen, Feiyu, et al.
Pubblicazione: (2023)
di: Shen, Feiyu, et al.
Pubblicazione: (2023)
Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation
di: Li, Jiaqi, et al.
Pubblicazione: (2024)
di: Li, Jiaqi, et al.
Pubblicazione: (2024)
Rethinking Continual Learning for Speech and Audio: A Representation-Centric Taxonomy and Open Problems
di: Xiao, Yang, et al.
Pubblicazione: (2026)
di: Xiao, Yang, et al.
Pubblicazione: (2026)
Multimodal Assessment of Speech Impairment in ALS Using Audio-Visual and Machine Learning Approaches
di: Pierotti, Francesco, et al.
Pubblicazione: (2025)
di: Pierotti, Francesco, et al.
Pubblicazione: (2025)
Audio-Visual Representation Learning via Knowledge Distillation from Speech Foundation Models
di: Zhang, Jing-Xuan, et al.
Pubblicazione: (2025)
di: Zhang, Jing-Xuan, et al.
Pubblicazione: (2025)
Audio-Visual Speech Separation via Bottleneck Iterative Network
di: Zhang, Sidong, et al.
Pubblicazione: (2025)
di: Zhang, Sidong, et al.
Pubblicazione: (2025)
Enhancing Crowdsourced Audio for Text-to-Speech Models
di: Giraldo, José, et al.
Pubblicazione: (2024)
di: Giraldo, José, et al.
Pubblicazione: (2024)
From Human Speech to Ocean Signals: Transferring Speech Large Models for Underwater Acoustic Target Recognition
di: Huang, Mengcheng, et al.
Pubblicazione: (2026)
di: Huang, Mengcheng, et al.
Pubblicazione: (2026)
Towards General Discrete Speech Codec for Complex Acoustic Environments: A Study of Reconstruction and Downstream Task Consistency
di: Wang, Haoran, et al.
Pubblicazione: (2025)
di: Wang, Haoran, et al.
Pubblicazione: (2025)
DCIM-AVSR : Efficient Audio-Visual Speech Recognition via Dual Conformer Interaction Module
di: Wang, Xinyu, et al.
Pubblicazione: (2024)
di: Wang, Xinyu, et al.
Pubblicazione: (2024)
LCB-net: Long-Context Biasing for Audio-Visual Speech Recognition
di: Yu, Fan, et al.
Pubblicazione: (2024)
di: Yu, Fan, et al.
Pubblicazione: (2024)
Human-Inspired Computing for Robust and Efficient Audio-Visual Speech Recognition
di: Liu, Qianhui, et al.
Pubblicazione: (2024)
di: Liu, Qianhui, et al.
Pubblicazione: (2024)
Abusive Speech Detection in Indic Languages Using Acoustic Features
di: Spiesberger, Anika A., et al.
Pubblicazione: (2024)
di: Spiesberger, Anika A., et al.
Pubblicazione: (2024)
Exploiting Audio-Visual Features with Pretrained AV-HuBERT for Multi-Modal Dysarthric Speech Reconstruction
di: Chen, Xueyuan, et al.
Pubblicazione: (2024)
di: Chen, Xueyuan, et al.
Pubblicazione: (2024)
AVFSNet: Audio-Visual Speech Separation for Flexible Number of Speakers with Multi-Scale and Multi-Task Learning
di: Zhang, Daning, et al.
Pubblicazione: (2025)
di: Zhang, Daning, et al.
Pubblicazione: (2025)
Leveraging Self-Supervised Models for Automatic Whispered Speech Recognition
di: Farhadipour, Aref, et al.
Pubblicazione: (2024)
di: Farhadipour, Aref, et al.
Pubblicazione: (2024)
Continual Test-time Adaptation for End-to-end Speech Recognition on Noisy Speech
di: Lin, Guan-Ting, et al.
Pubblicazione: (2024)
di: Lin, Guan-Ting, et al.
Pubblicazione: (2024)
LiveSpeech: Low-Latency Zero-shot Text-to-Speech via Autoregressive Modeling of Audio Discrete Codes
di: Dang, Trung, et al.
Pubblicazione: (2024)
di: Dang, Trung, et al.
Pubblicazione: (2024)
RAVSS: Robust Audio-Visual Speech Separation in Multi-Speaker Scenarios with Missing Visual Cues
di: Pan, Tianrui, et al.
Pubblicazione: (2024)
di: Pan, Tianrui, et al.
Pubblicazione: (2024)
SAC: Neural Speech Codec with Semantic-Acoustic Dual-Stream Quantization
di: Chen, Wenxi, et al.
Pubblicazione: (2025)
di: Chen, Wenxi, et al.
Pubblicazione: (2025)
Comparative Evaluation of Acoustic Feature Extraction Tools for Clinical Speech Analysis
di: Choi, Anna Seo Gyeong, et al.
Pubblicazione: (2025)
di: Choi, Anna Seo Gyeong, et al.
Pubblicazione: (2025)
SynHate: Detecting Hate Speech in Synthetic Deepfake Audio
di: Ranjan, Rishabh, et al.
Pubblicazione: (2025)
di: Ranjan, Rishabh, et al.
Pubblicazione: (2025)
Amphion: An Open-Source Audio, Music and Speech Generation Toolkit
di: Zhang, Xueyao, et al.
Pubblicazione: (2023)
di: Zhang, Xueyao, et al.
Pubblicazione: (2023)
Discrete Tokens Exhibit Interlanguage Speech Intelligibility Benefit: an Analytical Study Towards Accent-robust ASR Only with Native Speech Data
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
di: Onda, Kentaro, et al.
Pubblicazione: (2025)
LLM-Guided Reinforcement Learning for Audio-Visual Speech Enhancement
di: Chen, Chih-Ning, et al.
Pubblicazione: (2026)
di: Chen, Chih-Ning, et al.
Pubblicazione: (2026)
XLAVS-R: Cross-Lingual Audio-Visual Speech Representation Learning for Noise-Robust Speech Perception
di: Han, HyoJung, et al.
Pubblicazione: (2024)
di: Han, HyoJung, et al.
Pubblicazione: (2024)
Using Speech Foundational Models in Loss Functions for Hearing Aid Speech Enhancement
di: Sutherland, Robert, et al.
Pubblicazione: (2024)
di: Sutherland, Robert, et al.
Pubblicazione: (2024)
Listen through the Sound: Generative Speech Restoration Leveraging Acoustic Context Representation
di: Chung, Soo-Whan, et al.
Pubblicazione: (2025)
di: Chung, Soo-Whan, et al.
Pubblicazione: (2025)
Evaluating Parkinson's Disease Detection in Anonymized Speech: A Performance and Acoustic Analysis
di: Franzreb, Carlos, et al.
Pubblicazione: (2026)
di: Franzreb, Carlos, et al.
Pubblicazione: (2026)
BANC: Towards Efficient Binaural Audio Neural Codec for Overlapping Speech
di: Ratnarajah, Anton, et al.
Pubblicazione: (2023)
di: Ratnarajah, Anton, et al.
Pubblicazione: (2023)
Documenti analoghi
-
A toolbox for rendering virtual acoustic environments in the context of audiology
di: Grimm, Giso, et al.
Pubblicazione: (2018) -
Uncovering the Visual Contribution in Audio-Visual Speech Recognition
di: Lin, Zhaofeng, et al.
Pubblicazione: (2024) -
Audio-Visual Speech Enhancement in Noisy Environments via Emotion-Based Contextual Cues
di: Hussain, Tassadaq, et al.
Pubblicazione: (2024) -
Evaluation of Virtual Acoustic Environments with Different Acoustic Level of Detail
di: Fichna, Stefan, et al.
Pubblicazione: (2023) -
Robust Audio-Visual Speech Enhancement: Correcting Misassignments in Complex Environments with Advanced Post-Processing
di: Ren, Wenze, et al.
Pubblicazione: (2024)