Enregistré dans:
| Auteurs principaux: | Stylianou, Ioannis, Francombe, Jon, Martinez-Nuevo, Pablo, Shepstone, Sven Ewan, Tan, Zheng-Hua |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2601.09448 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LibriVAD: A Scalable Open Dataset with Deep Learning Benchmarks for Voice Activity Detection
par: Stylianou, Ioannis, et autres
Publié: (2025)
par: Stylianou, Ioannis, et autres
Publié: (2025)
Data Aware Differentiable Neural Architecture Search for Tiny Keyword Spotting Applications
par: Shi, Yujia, et autres
Publié: (2025)
par: Shi, Yujia, et autres
Publié: (2025)
Sat2Sound: A Unified Framework for Zero-Shot Soundscape Mapping
par: Khanal, Subash, et autres
Publié: (2025)
par: Khanal, Subash, et autres
Publié: (2025)
BNMusic: Blending Environmental Noises into Personalized Music
par: Zuo, Chi, et autres
Publié: (2025)
par: Zuo, Chi, et autres
Publié: (2025)
The Equalizer: Introducing Shape-Gain Decomposition in Neural Audio Codecs
par: Sadok, Samir, et autres
Publié: (2026)
par: Sadok, Samir, et autres
Publié: (2026)
DSpAST: Disentangled Representations for Spatial Audio Reasoning with Large Language Models
par: Wilkinghoff, Kevin, et autres
Publié: (2025)
par: Wilkinghoff, Kevin, et autres
Publié: (2025)
Are Audio-Language Models Listening? Audio-Specialist Heads for Adaptive Audio Steering
par: Glazer, Neta, et autres
Publié: (2026)
par: Glazer, Neta, et autres
Publié: (2026)
Do LLM Decoders Listen Fairly? Benchmarking How Language Model Priors Shape Bias in Speech Recognition
par: Ginjala, Srishti, et autres
Publié: (2026)
par: Ginjala, Srishti, et autres
Publié: (2026)
Audio Mamba: Selective State Spaces for Self-Supervised Audio Representations
par: Yadav, Sarthak, et autres
Publié: (2024)
par: Yadav, Sarthak, et autres
Publié: (2024)
Text Prompt is Not Enough: Sound Event Enhanced Prompt Adapter for Target Style Audio Generation
par: Xiong, Chenxu, et autres
Publié: (2024)
par: Xiong, Chenxu, et autres
Publié: (2024)
Mind the Prompt: Prompting Strategies in Audio Generations for Improving Sound Classification
par: Ronchini, Francesca, et autres
Publié: (2025)
par: Ronchini, Francesca, et autres
Publié: (2025)
AudioMAE++: learning better masked audio representations with SwiGLU FFNs
par: Yadav, Sarthak, et autres
Publié: (2025)
par: Yadav, Sarthak, et autres
Publié: (2025)
An overview of neural architectures for self-supervised audio representation learning from masked spectrograms
par: Yadav, Sarthak, et autres
Publié: (2025)
par: Yadav, Sarthak, et autres
Publié: (2025)
Beyond Monologue: Interactive Talking-Listening Avatar Generation with Conversational Audio Context-Aware Kernels
par: Weng, Yuzhe, et autres
Publié: (2026)
par: Weng, Yuzhe, et autres
Publié: (2026)
Joint Minimum Processing Beamforming and Near-end Listening Enhancement
par: Fuglsig, Andreas J., et autres
Publié: (2023)
par: Fuglsig, Andreas J., et autres
Publié: (2023)
Listen Like a Teacher: Mitigating Whisper Hallucinations using Adaptive Layer Attention and Knowledge Distillation
par: Tripathi, Kumud, et autres
Publié: (2025)
par: Tripathi, Kumud, et autres
Publié: (2025)
TopSeg: A Multi-Scale Topological Framework for Data-Efficient Heart Sound Segmentation
par: Zhang, Peihong, et autres
Publié: (2025)
par: Zhang, Peihong, et autres
Publié: (2025)
Learning When to Think While Listening in Large Audio-Language Models
par: Song, Zhiyuan, et autres
Publié: (2026)
par: Song, Zhiyuan, et autres
Publié: (2026)
From Sound to Setting: AI-Based Equalizer Parameter Prediction for Piano Tone Replication
par: Yu, Song-Ze
Publié: (2025)
par: Yu, Song-Ze
Publié: (2025)
'Studies for': A Human-AI Co-Creative Sound Artwork Using a Real-time Multi-channel Sound Generation Model
par: Nagashima, Chihiro, et autres
Publié: (2025)
par: Nagashima, Chihiro, et autres
Publié: (2025)
SpeechQualityLLM: LLM-Based Multimodal Assessment of Speech Quality
par: Monjur, Mahathir, et autres
Publié: (2025)
par: Monjur, Mahathir, et autres
Publié: (2025)
How Much Does Machine Identity Matter in Anomalous Sound Detection at Test Time?
par: Wilkinghoff, Kevin, et autres
Publié: (2026)
par: Wilkinghoff, Kevin, et autres
Publié: (2026)
AudioCapBench: Quick Evaluation on Audio Captioning across Sound, Music, and Speech
par: Qiu, Jielin, et autres
Publié: (2026)
par: Qiu, Jielin, et autres
Publié: (2026)
Mind the Gap: Detecting Cluster Exits for Robust Local Density-Based Score Normalization in Anomalous Sound Detection
par: Wilkinghoff, Kevin, et autres
Publié: (2026)
par: Wilkinghoff, Kevin, et autres
Publié: (2026)
MambAttention: Mamba with Multi-Head Attention for Generalizable Single-Channel Speech Enhancement
par: Kühne, Nikolai Lund, et autres
Publié: (2025)
par: Kühne, Nikolai Lund, et autres
Publié: (2025)
Exploring Resolution-Wise Shared Attention in Hybrid Mamba-U-Nets for Improved Cross-Corpus Speech Enhancement
par: Kühne, Nikolai Lund, et autres
Publié: (2025)
par: Kühne, Nikolai Lund, et autres
Publié: (2025)
xLSTM-SENet: xLSTM for Single-Channel Speech Enhancement
par: Kühne, Nikolai Lund, et autres
Publié: (2025)
par: Kühne, Nikolai Lund, et autres
Publié: (2025)
Voice Attribute Editing with Text Prompt
par: Sheng, Zhengyan, et autres
Publié: (2024)
par: Sheng, Zhengyan, et autres
Publié: (2024)
Temporal Pooling Strategies for Training-Free Anomalous Sound Detection with Self-Supervised Audio Embeddings
par: Wilkinghoff, Kevin, et autres
Publié: (2026)
par: Wilkinghoff, Kevin, et autres
Publié: (2026)
Woosh: A Sound Effects Foundation Model
par: Hadjeres, Gaëtan, et autres
Publié: (2026)
par: Hadjeres, Gaëtan, et autres
Publié: (2026)
Language Model Can Listen While Speaking
par: Ma, Ziyang, et autres
Publié: (2024)
par: Ma, Ziyang, et autres
Publié: (2024)
Pediatric Asthma Detection with Googles HeAR Model: An AI-Driven Respiratory Sound Classifier
par: Ehtesham, Abul, et autres
Publié: (2025)
par: Ehtesham, Abul, et autres
Publié: (2025)
Listen to Extract: Onset-Prompted Target Speaker Extraction
par: Shen, Pengjie, et autres
Publié: (2025)
par: Shen, Pengjie, et autres
Publié: (2025)
Towards Open World Sound Event Detection
par: Hai, P. H., et autres
Publié: (2026)
par: Hai, P. H., et autres
Publié: (2026)
Bird detection in audio: a survey and a challenge
par: Stowell, Dan, et autres
Publié: (2016)
par: Stowell, Dan, et autres
Publié: (2016)
SoundSignature: What Type of Music Do You Like?
par: Carone, Brandon James, et autres
Publié: (2024)
par: Carone, Brandon James, et autres
Publié: (2024)
CycleGuardian: A Framework for Automatic RespiratorySound classification Based on Improved Deep clustering and Contrastive Learning
par: Chu, Yun, et autres
Publié: (2025)
par: Chu, Yun, et autres
Publié: (2025)
Vocal Tract Length Warped Features for Spoken Keyword Spotting
par: Sarkar, Achintya kr., et autres
Publié: (2025)
par: Sarkar, Achintya kr., et autres
Publié: (2025)
Learning How to Listen: A Temporal-Frequential Attention Model for Sound Event Detection
par: Shen, Yu-Han, et autres
Publié: (2018)
par: Shen, Yu-Han, et autres
Publié: (2018)
LauraGPT: Listen, Attend, Understand, and Regenerate Audio with GPT
par: Du, Zhihao, et autres
Publié: (2023)
par: Du, Zhihao, et autres
Publié: (2023)
Documents similaires
-
LibriVAD: A Scalable Open Dataset with Deep Learning Benchmarks for Voice Activity Detection
par: Stylianou, Ioannis, et autres
Publié: (2025) -
Data Aware Differentiable Neural Architecture Search for Tiny Keyword Spotting Applications
par: Shi, Yujia, et autres
Publié: (2025) -
Sat2Sound: A Unified Framework for Zero-Shot Soundscape Mapping
par: Khanal, Subash, et autres
Publié: (2025) -
BNMusic: Blending Environmental Noises into Personalized Music
par: Zuo, Chi, et autres
Publié: (2025) -
The Equalizer: Introducing Shape-Gain Decomposition in Neural Audio Codecs
par: Sadok, Samir, et autres
Publié: (2026)