Interventional Speech Noise Injection for ASR Generalizable Spoken Language Understanding
Fuente:
arXiv
Guardado en:
| Autores principales: | Jung, Yeonjoon, Lee, Jaeseong, Choi, Seungtaek, Lee, Dohyeon, Kim, Minsoo, Hwang, Seung-won |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Analyzing Error Propagation in Korean Spoken QA with ASR-LLM Cascades
por: Jung, Donghyuk, et al.
Publicado: (2026)
por: Jung, Donghyuk, et al.
Publicado: (2026)
On the Evaluation of Speech Foundation Models for Spoken Language Understanding
por: Arora, Siddhant, et al.
Publicado: (2024)
por: Arora, Siddhant, et al.
Publicado: (2024)
RAF: Relativistic Adversarial Feedback For Universal Speech Synthesis
por: Lee, Yongjoon, et al.
Publicado: (2026)
por: Lee, Yongjoon, et al.
Publicado: (2026)
WHISMA: A Speech-LLM to Perform Zero-shot Spoken Language Understanding
por: Li, Mohan, et al.
Publicado: (2024)
por: Li, Mohan, et al.
Publicado: (2024)
SEMamba++: A General Speech Restoration Framework Leveraging Global, Local, and Periodic Spectral Patterns
por: Lee, Yongjoon, et al.
Publicado: (2026)
por: Lee, Yongjoon, et al.
Publicado: (2026)
Exploring Fine-Tuning of Large Audio Language Models for Spoken Language Understanding under Limited Speech Data
por: Choi, Youngwon, et al.
Publicado: (2025)
por: Choi, Youngwon, et al.
Publicado: (2025)
Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition
por: Bai, Ye, et al.
Publicado: (2024)
por: Bai, Ye, et al.
Publicado: (2024)
Towards Unified Neural Decoding of Perceived, Spoken and Imagined Speech from EEG Signals
por: Lee, Jung-Sun, et al.
Publicado: (2024)
por: Lee, Jung-Sun, et al.
Publicado: (2024)
DISPATCH: Distilling Selective Patches for Speech Enhancement
por: Kim, Dohwan, et al.
Publicado: (2025)
por: Kim, Dohwan, et al.
Publicado: (2025)
TranSentence: Speech-to-speech Translation via Language-agnostic Sentence-level Speech Encoding without Language-parallel Data
por: Kim, Seung-Bin, et al.
Publicado: (2024)
por: Kim, Seung-Bin, et al.
Publicado: (2024)
TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
por: Tseng, Liang-Hsuan, et al.
Publicado: (2025)
por: Tseng, Liang-Hsuan, et al.
Publicado: (2025)
Towards Bitrate-Efficient and Noise-Robust Speech Coding with Variable Bitrate RVQ
por: Chae, Yunkee, et al.
Publicado: (2025)
por: Chae, Yunkee, et al.
Publicado: (2025)
Inter-channel Conv-TasNet for multichannel speech enhancement
por: Lee, Dongheon, et al.
Publicado: (2021)
por: Lee, Dongheon, et al.
Publicado: (2021)
persoDA: Personalized Data Augmentation for Personalized ASR
por: Parada, Pablo Peso, et al.
Publicado: (2025)
por: Parada, Pablo Peso, et al.
Publicado: (2025)
Speech Emotion Recognition with ASR Integration
por: Li, Yuanchao
Publicado: (2026)
por: Li, Yuanchao
Publicado: (2026)
Consistency Based Unsupervised Self-training For ASR Personalisation
por: Zhang, Jisi, et al.
Publicado: (2024)
por: Zhang, Jisi, et al.
Publicado: (2024)
ValSub: Subsampling Validation Data to Mitigate Forgetting during ASR Personalization
por: Mehmood, Haaris, et al.
Publicado: (2025)
por: Mehmood, Haaris, et al.
Publicado: (2025)
DiscreteSLU: A Large Language Model with Self-Supervised Discrete Speech Units for Spoken Language Understanding
por: Shon, Suwon, et al.
Publicado: (2024)
por: Shon, Suwon, et al.
Publicado: (2024)
NAST: Noise Aware Speech Tokenization for Speech Language Models
por: Messica, Shoval, et al.
Publicado: (2024)
por: Messica, Shoval, et al.
Publicado: (2024)
DeFT-Mamba: Universal Multichannel Sound Separation and Polyphonic Audio Classification
por: Lee, Dongheon, et al.
Publicado: (2024)
por: Lee, Dongheon, et al.
Publicado: (2024)
DualSpeech: Enhancing Speaker-Fidelity and Text-Intelligibility Through Dual Classifier-Free Guidance
por: Yang, Jinhyeok, et al.
Publicado: (2024)
por: Yang, Jinhyeok, et al.
Publicado: (2024)
FlowAVSE: Efficient Audio-Visual Speech Enhancement with Conditional Flow Matching
por: Jung, Chaeyoung, et al.
Publicado: (2024)
por: Jung, Chaeyoung, et al.
Publicado: (2024)
Zero Resource Code-switched Speech Benchmark Using Speech Utterance Pairs For Multiple Spoken Languages
por: Huang, Kuan-Po, et al.
Publicado: (2023)
por: Huang, Kuan-Po, et al.
Publicado: (2023)
Language-Universal Speech Attributes Modeling for Zero-Shot Multilingual Spoken Keyword Recognition
por: Yen, Hao, et al.
Publicado: (2024)
por: Yen, Hao, et al.
Publicado: (2024)
Comparative Analysis of ASR Methods for Speech Deepfake Detection
por: Salvi, Davide, et al.
Publicado: (2024)
por: Salvi, Davide, et al.
Publicado: (2024)
ALAS: Measuring Latent Speech-Text Alignment For Spoken Language Understanding In Multimodal LLMs
por: Mousavi, Pooneh, et al.
Publicado: (2025)
por: Mousavi, Pooneh, et al.
Publicado: (2025)
SAM: A Mamba-2 State-Space Audio-Language Model
por: Lee, Taehan, et al.
Publicado: (2025)
por: Lee, Taehan, et al.
Publicado: (2025)
Enhancing Dialogue Speech Recognition with Robust Contextual Awareness via Noise Representation Learning
por: Lee, Wonjun, et al.
Publicado: (2024)
por: Lee, Wonjun, et al.
Publicado: (2024)
CLaM-TTS: Improving Neural Codec Language Model for Zero-Shot Text-to-Speech
por: Kim, Jaehyeon, et al.
Publicado: (2024)
por: Kim, Jaehyeon, et al.
Publicado: (2024)
NanoVoice: Efficient Speaker-Adaptive Text-to-Speech for Multiple Speakers
por: Park, Nohil, et al.
Publicado: (2024)
por: Park, Nohil, et al.
Publicado: (2024)
Rethinking Speech Representation Aggregation in Speech Enhancement: A Phonetic Mutual Information Perspective
por: Han, Seungu, et al.
Publicado: (2026)
por: Han, Seungu, et al.
Publicado: (2026)
Textless Acoustic Model with Self-Supervised Distillation for Noise-Robust Expressive Speech-to-Speech Translation
por: Hwang, Min-Jae, et al.
Publicado: (2024)
por: Hwang, Min-Jae, et al.
Publicado: (2024)
LUPET: Incorporating Hierarchical Information Path into Multilingual ASR
por: Liu, Wei, et al.
Publicado: (2024)
por: Liu, Wei, et al.
Publicado: (2024)
DeepASA: An Object-Oriented Multi-Purpose Network for Auditory Scene Analysis
por: Lee, Dongheon, et al.
Publicado: (2025)
por: Lee, Dongheon, et al.
Publicado: (2025)
Fine-Tuning ASR for Stuttered Speech: Personalized vs. Generalized Approaches
por: Mujtaba, Dena, et al.
Publicado: (2025)
por: Mujtaba, Dena, et al.
Publicado: (2025)
Resource-Efficient Adaptation of Speech Foundation Models for Multi-Speaker ASR
por: Wang, Weiqing, et al.
Publicado: (2024)
por: Wang, Weiqing, et al.
Publicado: (2024)
Long-Form Speech Generation with Spoken Language Models
por: Park, Se Jin, et al.
Publicado: (2024)
por: Park, Se Jin, et al.
Publicado: (2024)
UniverSLU: Universal Spoken Language Understanding for Diverse Tasks with Natural Language Instructions
por: Arora, Siddhant, et al.
Publicado: (2023)
por: Arora, Siddhant, et al.
Publicado: (2023)
VoiceTailor: Lightweight Plug-In Adapter for Diffusion-Based Personalized Text-to-Speech
por: Kim, Heeseung, et al.
Publicado: (2024)
por: Kim, Heeseung, et al.
Publicado: (2024)
ToneUnit: A Speech Discretization Approach for Tonal Language Speech Synthesis
por: Tao, Dehua, et al.
Publicado: (2024)
por: Tao, Dehua, et al.
Publicado: (2024)
Ejemplares similares
-
Analyzing Error Propagation in Korean Spoken QA with ASR-LLM Cascades
por: Jung, Donghyuk, et al.
Publicado: (2026) -
On the Evaluation of Speech Foundation Models for Spoken Language Understanding
por: Arora, Siddhant, et al.
Publicado: (2024) -
RAF: Relativistic Adversarial Feedback For Universal Speech Synthesis
por: Lee, Yongjoon, et al.
Publicado: (2026) -
WHISMA: A Speech-LLM to Perform Zero-shot Spoken Language Understanding
por: Li, Mohan, et al.
Publicado: (2024) -
SEMamba++: A General Speech Restoration Framework Leveraging Global, Local, and Periodic Spectral Patterns
por: Lee, Yongjoon, et al.
Publicado: (2026)