Should Audio Front-ends be Adaptive? Comparing Learnable and Adaptive Front-ends
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Qiquan, Wickramasinghe, Buddhi, Ambikairajah, Eliathamby, Sethu, Vidhyasaharan, Li, Haizhou |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Adaptive Per-Channel Energy Normalization Front-end for Robust Audio Signal Processing
por: Meng, Hanyu, et al.
Publicado: (2025)
por: Meng, Hanyu, et al.
Publicado: (2025)
What is Learnt by the LEArnable Front-end (LEAF)? Adapting Per-Channel Energy Normalisation (PCEN) to Noisy Conditions
por: Meng, Hanyu, et al.
Publicado: (2024)
por: Meng, Hanyu, et al.
Publicado: (2024)
Binaural Selective Attention Model for Target Speaker Extraction
por: Meng, Hanyu, et al.
Publicado: (2024)
por: Meng, Hanyu, et al.
Publicado: (2024)
Blind Estimation of Sub-band Acoustic Parameters from Ambisonics Recordings using Spectro-Spatial Covariance Features
por: Meng, Hanyu, et al.
Publicado: (2024)
por: Meng, Hanyu, et al.
Publicado: (2024)
An Empirical Study on the Impact of Positional Encoding in Transformer-based Monaural Speech Enhancement
por: Zhang, Qiquan, et al.
Publicado: (2024)
por: Zhang, Qiquan, et al.
Publicado: (2024)
Mamba in Speech: Towards an Alternative to Self-Attention
por: Zhang, Xiangyu, et al.
Publicado: (2024)
por: Zhang, Xiangyu, et al.
Publicado: (2024)
Characterization of Speech Similarity Between Australian Aboriginal and High-Resource Languages: A Case Study on Dharawal
por: Dang, Ting, et al.
Publicado: (2025)
por: Dang, Ting, et al.
Publicado: (2025)
A Novel Markovian Framework for Integrating Absolute and Relative Ordinal Emotion Information
por: Wu, Jingyao, et al.
Publicado: (2021)
por: Wu, Jingyao, et al.
Publicado: (2021)
Exploring Length Generalization For Transformer-based Speech Enhancement
por: Zhang, Qiquan, et al.
Publicado: (2025)
por: Zhang, Qiquan, et al.
Publicado: (2025)
An Exploration of Length Generalization in Transformer-Based Speech Enhancement
por: Zhang, Qiquan, et al.
Publicado: (2024)
por: Zhang, Qiquan, et al.
Publicado: (2024)
UAF: A Unified Audio Front-end LLM for Full-Duplex Speech Interaction
por: Li, Yadong, et al.
Publicado: (2026)
por: Li, Yadong, et al.
Publicado: (2026)
Spiking-LEAF: A Learnable Auditory front-end for Spiking Neural Networks
por: Song, Zeyang, et al.
Publicado: (2023)
por: Song, Zeyang, et al.
Publicado: (2023)
SpeechRefiner: Towards Perceptual Quality Refinement for Front-End Algorithms
por: Li, Sirui, et al.
Publicado: (2025)
por: Li, Sirui, et al.
Publicado: (2025)
UniCodec: Unified Audio Codec with Single Domain-Adaptive Codebook
por: Jiang, Yidi, et al.
Publicado: (2025)
por: Jiang, Yidi, et al.
Publicado: (2025)
LearnAFE: Circuit-Algorithm Co-design Framework for Learnable Audio Analog Front-End
por: Hu, Jinhai, et al.
Publicado: (2025)
por: Hu, Jinhai, et al.
Publicado: (2025)
Accent-VITS:accent transfer for end-to-end TTS
por: Ma, Linhan, et al.
Publicado: (2023)
por: Ma, Linhan, et al.
Publicado: (2023)
Why Can't They Remember? Uncovering Representation and Retrieval Bottlenecks in Multi-Turn Acoustic Memory
por: Xiao, Yang, et al.
Publicado: (2026)
por: Xiao, Yang, et al.
Publicado: (2026)
AudioRAG: A Challenging Benchmark for Audio Reasoning and Information Retrieval
por: Lin, Jingru, et al.
Publicado: (2026)
por: Lin, Jingru, et al.
Publicado: (2026)
Content Adaptive Front End For Audio Classification
por: Verma, Prateek, et al.
Publicado: (2023)
por: Verma, Prateek, et al.
Publicado: (2023)
Continual Adaptation for Pacific Indigenous Speech Recognition
por: Xiao, Yang, et al.
Publicado: (2026)
por: Xiao, Yang, et al.
Publicado: (2026)
A Joint Spectro-Temporal Relational Thinking Based Acoustic Modeling Framework
por: Nan, Zheng, et al.
Publicado: (2024)
por: Nan, Zheng, et al.
Publicado: (2024)
E2E-AEC: Implementing an end-to-end neural network learning approach for acoustic echo cancellation
por: Jiang, Yiheng, et al.
Publicado: (2026)
por: Jiang, Yiheng, et al.
Publicado: (2026)
Audio-Visual Target Speaker Extraction with Reverse Selective Auditory Attention
por: Tao, Ruijie, et al.
Publicado: (2024)
por: Tao, Ruijie, et al.
Publicado: (2024)
SONAR: Self-Distilled Continual Pre-training for Domain Adaptive Audio Representation
por: Zhang, Yizhou, et al.
Publicado: (2025)
por: Zhang, Yizhou, et al.
Publicado: (2025)
Listening to Multi-talker Conversations: Modular and End-to-end Perspectives
por: Raj, Desh
Publicado: (2024)
por: Raj, Desh
Publicado: (2024)
Joint Minimum Processing Beamforming and Near-end Listening Enhancement
por: Fuglsig, Andreas J., et al.
Publicado: (2023)
por: Fuglsig, Andreas J., et al.
Publicado: (2023)
End-to-end Acoustic-linguistic Emotion and Intent Recognition Enhanced by Semi-supervised Learning
por: Ren, Zhao, et al.
Publicado: (2025)
por: Ren, Zhao, et al.
Publicado: (2025)
UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information
por: Wang, Rui, et al.
Publicado: (2025)
por: Wang, Rui, et al.
Publicado: (2025)
Continual Test-time Adaptation for End-to-end Speech Recognition on Noisy Speech
por: Lin, Guan-Ting, et al.
Publicado: (2024)
por: Lin, Guan-Ting, et al.
Publicado: (2024)
StreamVoice+: Evolving into End-to-end Streaming Zero-shot Voice Conversion
por: Wang, Zhichao, et al.
Publicado: (2024)
por: Wang, Zhichao, et al.
Publicado: (2024)
Toward end-to-end interpretable convolutional neural networks for waveform signals
por: Vu, Linh, et al.
Publicado: (2024)
por: Vu, Linh, et al.
Publicado: (2024)
An Adaptive CMSA for Solving the Longest Filled Common Subsequence Problem with an Application in Audio Querying
por: Djukanovic, Marko, et al.
Publicado: (2025)
por: Djukanovic, Marko, et al.
Publicado: (2025)
FADI-AEC: Fast Score Based Diffusion Model Guided by Far-end Signal for Acoustic Echo Cancellation
por: Liu, Yang, et al.
Publicado: (2024)
por: Liu, Yang, et al.
Publicado: (2024)
WaveTransfer: A Flexible End-to-end Multi-instrument Timbre Transfer with Diffusion
por: Baoueb, Teysir, et al.
Publicado: (2024)
por: Baoueb, Teysir, et al.
Publicado: (2024)
SNC: A Stem-Native Codec for Efficient Lossless Audio Storage with Adaptive Playback Capabilities
por: Sufi, Shaad
Publicado: (2026)
por: Sufi, Shaad
Publicado: (2026)
Beyond Deep Learning: Speech Segmentation and Phone Classification with Neural Assemblies
por: Adelson, Trevor, et al.
Publicado: (2026)
por: Adelson, Trevor, et al.
Publicado: (2026)
Stereo Audio Rendering for Personal Sound Zones Using a Binaural Spatially Adaptive Neural Network (BSANN)
por: Jiang, Hao, et al.
Publicado: (2026)
por: Jiang, Hao, et al.
Publicado: (2026)
Human-Inspired Computing for Robust and Efficient Audio-Visual Speech Recognition
por: Liu, Qianhui, et al.
Publicado: (2024)
por: Liu, Qianhui, et al.
Publicado: (2024)
M-Vec: Matryoshka Speaker Embeddings with Flexible Dimensions
por: Wang, Shuai, et al.
Publicado: (2024)
por: Wang, Shuai, et al.
Publicado: (2024)
Bridging the gap: A comparative exploration of Speech-LLM and end-to-end architecture for multilingual conversational ASR
por: Mei, Yuxiang, et al.
Publicado: (2026)
por: Mei, Yuxiang, et al.
Publicado: (2026)
Ejemplares similares
-
Adaptive Per-Channel Energy Normalization Front-end for Robust Audio Signal Processing
por: Meng, Hanyu, et al.
Publicado: (2025) -
What is Learnt by the LEArnable Front-end (LEAF)? Adapting Per-Channel Energy Normalisation (PCEN) to Noisy Conditions
por: Meng, Hanyu, et al.
Publicado: (2024) -
Binaural Selective Attention Model for Target Speaker Extraction
por: Meng, Hanyu, et al.
Publicado: (2024) -
Blind Estimation of Sub-band Acoustic Parameters from Ambisonics Recordings using Spectro-Spatial Covariance Features
por: Meng, Hanyu, et al.
Publicado: (2024) -
An Empirical Study on the Impact of Positional Encoding in Transformer-based Monaural Speech Enhancement
por: Zhang, Qiquan, et al.
Publicado: (2024)