Time-Varying Audio Effect Modeling by End-to-End Adversarial Training
Fuente:
arXiv
Guardado en:
| Autores principales: | Bourdin, Yann, Legrand, Pierrick, Roche, Fanny |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Empirical Results for Adjusting Truncated Backpropagation Through Time while Training Neural Audio Effects
por: Bourdin, Yann, et al.
Publicado: (2025)
por: Bourdin, Yann, et al.
Publicado: (2025)
Meta-Learning in Audio and Speech Processing: An End to End Comprehensive Review
por: Raimon, Athul, et al.
Publicado: (2024)
por: Raimon, Athul, et al.
Publicado: (2024)
AudioJailbreak: Jailbreak Attacks against End-to-End Large Audio-Language Models
por: Chen, Guangke, et al.
Publicado: (2025)
por: Chen, Guangke, et al.
Publicado: (2025)
A$^2$-LLM: An End-to-end Conversational Audio Avatar Large Language Model
por: Hu, Xiaolin, et al.
Publicado: (2026)
por: Hu, Xiaolin, et al.
Publicado: (2026)
End-to-End Efficiency in Keyword Spotting: A System-Level Approach for Embedded Microcontrollers
por: Bartoli, Pietro, et al.
Publicado: (2025)
por: Bartoli, Pietro, et al.
Publicado: (2025)
A Hierarchical End-of-Turn Model with Primary Speaker Segmentation for Real-Time Conversational AI
por: Helwani, Karim, et al.
Publicado: (2026)
por: Helwani, Karim, et al.
Publicado: (2026)
GE2E-AC: Generalized End-to-End Loss Training for Accent Classification
por: Watanabe, Chihiro, et al.
Publicado: (2024)
por: Watanabe, Chihiro, et al.
Publicado: (2024)
E2E-VGuard: Adversarial Prevention for Production LLM-based End-To-End Speech Synthesis
por: Zhang, Zhisheng, et al.
Publicado: (2025)
por: Zhang, Zhisheng, et al.
Publicado: (2025)
Content Adaptive Front End For Audio Classification
por: Verma, Prateek, et al.
Publicado: (2023)
por: Verma, Prateek, et al.
Publicado: (2023)
Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models
por: Hsiao, Chi-Yuan, et al.
Publicado: (2025)
por: Hsiao, Chi-Yuan, et al.
Publicado: (2025)
O-EENC-SD: Efficient Online End-to-End Neural Clustering for Speaker Diarization
por: Gruttadauria, Elio, et al.
Publicado: (2025)
por: Gruttadauria, Elio, et al.
Publicado: (2025)
Towards End-to-End Training of Automatic Speech Recognition for Nigerian Pidgin
por: Rufai, Amina Mardiyyah, et al.
Publicado: (2020)
por: Rufai, Amina Mardiyyah, et al.
Publicado: (2020)
Heterogeneity-Aware Dataset Scheduling for Efficient Audio Large Language Model Training
por: Wu, Yanru, et al.
Publicado: (2026)
por: Wu, Yanru, et al.
Publicado: (2026)
SiFiSinger: A High-Fidelity End-to-End Singing Voice Synthesizer based on Source-filter Model
por: Cui, Jianwei, et al.
Publicado: (2024)
por: Cui, Jianwei, et al.
Publicado: (2024)
TeLeS: Temporal Lexeme Similarity Score to Estimate Confidence in End-to-End ASR
por: Ravi, Nagarathna, et al.
Publicado: (2024)
por: Ravi, Nagarathna, et al.
Publicado: (2024)
End-to-End Spoken Grammatical Error Correction
por: Qian, Mengjie, et al.
Publicado: (2025)
por: Qian, Mengjie, et al.
Publicado: (2025)
Training-Free Multimodal Guidance for Video to Audio Generation
por: Grassucci, Eleonora, et al.
Publicado: (2025)
por: Grassucci, Eleonora, et al.
Publicado: (2025)
FunnelNet: An End-to-End Deep Learning Framework to Monitor Digital Heart Murmur in Real-Time
por: Jobayer, Md, et al.
Publicado: (2024)
por: Jobayer, Md, et al.
Publicado: (2024)
End-to-End Integration of Speech Separation and Voice Activity Detection for Low-Latency Diarization of Telephone Conversations
por: Morrone, Giovanni, et al.
Publicado: (2023)
por: Morrone, Giovanni, et al.
Publicado: (2023)
EVA-Bench: A New End-to-end Framework for Evaluating Voice Agents
por: Bogavelli, Tara, et al.
Publicado: (2026)
por: Bogavelli, Tara, et al.
Publicado: (2026)
Fast Text-to-Audio Generation with Adversarial Post-Training
por: Novack, Zachary, et al.
Publicado: (2025)
por: Novack, Zachary, et al.
Publicado: (2025)
Zero-Shot End-To-End Spoken Question Answering In Medical Domain
por: Labrak, Yanis, et al.
Publicado: (2024)
por: Labrak, Yanis, et al.
Publicado: (2024)
Audio-Visual Continual Test-Time Adaptation without Forgetting
por: Maharana, Sarthak Kumar, et al.
Publicado: (2026)
por: Maharana, Sarthak Kumar, et al.
Publicado: (2026)
AaSP: Aliasing-aware Self-Supervised Pre-Training for Audio Spectrogram Transformers
por: Yamamoto, Kohei, et al.
Publicado: (2025)
por: Yamamoto, Kohei, et al.
Publicado: (2025)
AMAuT: A Flexible and Efficient Multiview Audio Transformer Framework Trained from Scratch
por: Shao, Weichuang, et al.
Publicado: (2025)
por: Shao, Weichuang, et al.
Publicado: (2025)
Segmentwise Pruning in Audio-Language Models
por: Gibier, Marcel, et al.
Publicado: (2025)
por: Gibier, Marcel, et al.
Publicado: (2025)
Audio Super-Resolution with Latent Bridge Models
por: Li, Chang, et al.
Publicado: (2025)
por: Li, Chang, et al.
Publicado: (2025)
DHAuDS: A Dynamic and Heterogeneous Audio Benchmark for Test-Time Adaptation
por: Shao, Weichuang, et al.
Publicado: (2025)
por: Shao, Weichuang, et al.
Publicado: (2025)
Enhancing Audio-Language Models through Self-Supervised Post-Training with Text-Audio Pairs
por: Sinha, Anshuman, et al.
Publicado: (2024)
por: Sinha, Anshuman, et al.
Publicado: (2024)
How to Label Resynthesized Audio: The Dual Role of Neural Audio Codecs in Audio Deepfake Detection
por: Xiao, Yixuan, et al.
Publicado: (2026)
por: Xiao, Yixuan, et al.
Publicado: (2026)
Generative Adversarial Post-Training Mitigates Reward Hacking in Live Human-AI Music Interaction
por: Wu, Yusong, et al.
Publicado: (2025)
por: Wu, Yusong, et al.
Publicado: (2025)
ADNAC: Audio Denoiser using Neural Audio Codec
por: Jimon, Daniel, et al.
Publicado: (2025)
por: Jimon, Daniel, et al.
Publicado: (2025)
Differentiable Time-Varying Linear Prediction in the Context of End-to-End Analysis-by-Synthesis
por: Yu, Chin-Yun, et al.
Publicado: (2024)
por: Yu, Chin-Yun, et al.
Publicado: (2024)
End-to-end Piano Performance-MIDI to Score Conversion with Transformers
por: Beyer, Tim, et al.
Publicado: (2024)
por: Beyer, Tim, et al.
Publicado: (2024)
FastWave: Optimized Diffusion Model for Audio Super-Resolution
por: Kuznetsov, Nikita, et al.
Publicado: (2026)
por: Kuznetsov, Nikita, et al.
Publicado: (2026)
TADA! Tuning Audio Diffusion Models through Activation Steering
por: Staniszewski, Łukasz, et al.
Publicado: (2026)
por: Staniszewski, Łukasz, et al.
Publicado: (2026)
Echo: Towards Advanced Audio Comprehension via Audio-Interleaved Reasoning
por: Wu, Daiqing, et al.
Publicado: (2026)
por: Wu, Daiqing, et al.
Publicado: (2026)
AWARE: Audio Watermarking with Adversarial Resistance to Edits
por: Pavlović, Kosta, et al.
Publicado: (2025)
por: Pavlović, Kosta, et al.
Publicado: (2025)
BanglaDialecto: An End-to-End AI-Powered Regional Speech Standardization
por: Samin, Md. Nazmus Sadat, et al.
Publicado: (2024)
por: Samin, Md. Nazmus Sadat, et al.
Publicado: (2024)
Comparative Study on Noise-Augmented Training and its Effect on Adversarial Robustness in ASR Systems
por: Pizzi, Karla, et al.
Publicado: (2024)
por: Pizzi, Karla, et al.
Publicado: (2024)
Ejemplares similares
-
Empirical Results for Adjusting Truncated Backpropagation Through Time while Training Neural Audio Effects
por: Bourdin, Yann, et al.
Publicado: (2025) -
Meta-Learning in Audio and Speech Processing: An End to End Comprehensive Review
por: Raimon, Athul, et al.
Publicado: (2024) -
AudioJailbreak: Jailbreak Attacks against End-to-End Large Audio-Language Models
por: Chen, Guangke, et al.
Publicado: (2025) -
A$^2$-LLM: An End-to-end Conversational Audio Avatar Large Language Model
por: Hu, Xiaolin, et al.
Publicado: (2026) -
End-to-End Efficiency in Keyword Spotting: A System-Level Approach for Embedded Microcontrollers
por: Bartoli, Pietro, et al.
Publicado: (2025)