Guardado en:
| Autores principales: | Kelly, David A., Chockler, Hana |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2601.16675 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
On the Utility of Speech and Audio Foundation Models for Marmoset Call Analysis
por: Sarkar, Eklavya, et al.
Publicado: (2024)
por: Sarkar, Eklavya, et al.
Publicado: (2024)
Listenable Maps for Audio Classifiers
por: Paissan, Francesco, et al.
Publicado: (2024)
por: Paissan, Francesco, et al.
Publicado: (2024)
"I am bad": Interpreting Stealthy, Universal and Robust Audio Jailbreaks in Audio-Language Models
por: Gupta, Isha, et al.
Publicado: (2025)
por: Gupta, Isha, et al.
Publicado: (2025)
Listenable Maps for Zero-Shot Audio Classifiers
por: Paissan, Francesco, et al.
Publicado: (2024)
por: Paissan, Francesco, et al.
Publicado: (2024)
Audio2Tool: Speak, Call, Act -- A Dataset for Benchmarking Speech Tool Use
por: Pahwa, Ramit, et al.
Publicado: (2026)
por: Pahwa, Ramit, et al.
Publicado: (2026)
Tuning In: Analysis of Audio Classifier Performance in Clinical Settings with Limited Data
por: Mahdi, Hamza, et al.
Publicado: (2024)
por: Mahdi, Hamza, et al.
Publicado: (2024)
From Birdsong to Rumbles: Classifying Elephant Calls with Out-of-Species Embeddings
por: Geldenhuys, Christiaan M., et al.
Publicado: (2026)
por: Geldenhuys, Christiaan M., et al.
Publicado: (2026)
A2SB: Audio-to-Audio Schrodinger Bridges
por: Kong, Zhifeng, et al.
Publicado: (2025)
por: Kong, Zhifeng, et al.
Publicado: (2025)
Multi-bit Audio Watermarking
por: Lanzendörfer, Luca A., et al.
Publicado: (2025)
por: Lanzendörfer, Luca A., et al.
Publicado: (2025)
Spectrotemporal Modulation: Efficient and Interpretable Feature Representation for Classifying Speech, Music, and Environmental Sounds
por: Chang, Andrew, et al.
Publicado: (2025)
por: Chang, Andrew, et al.
Publicado: (2025)
StethoLM: Audio Language Model for Cardiopulmonary Analysis Across Clinical Tasks
por: Wang, Yishan, et al.
Publicado: (2026)
por: Wang, Yishan, et al.
Publicado: (2026)
TACOS: Temporally-aligned Audio CaptiOnS for Language-Audio Pretraining
por: Primus, Paul, et al.
Publicado: (2025)
por: Primus, Paul, et al.
Publicado: (2025)
Zero Shot Audio to Audio Emotion Transfer With Speaker Disentanglement
por: Dutta, Soumya, et al.
Publicado: (2024)
por: Dutta, Soumya, et al.
Publicado: (2024)
The Rarity of Musical Audio Signals Within the Space of Possible Audio Generation
por: Collins, Nick
Publicado: (2024)
por: Collins, Nick
Publicado: (2024)
Estimated Audio-Caption Correspondences Improve Language-Based Audio Retrieval
por: Primus, Paul, et al.
Publicado: (2024)
por: Primus, Paul, et al.
Publicado: (2024)
Fusing Audio and Metadata Embeddings Improves Language-based Audio Retrieval
por: Primus, Paul, et al.
Publicado: (2024)
por: Primus, Paul, et al.
Publicado: (2024)
SNAC: Multi-Scale Neural Audio Codec
por: Siuzdak, Hubert, et al.
Publicado: (2024)
por: Siuzdak, Hubert, et al.
Publicado: (2024)
Cross-Referencing Self-Training Network for Sound Event Detection in Audio Mixtures
por: Park, Sangwook, et al.
Publicado: (2021)
por: Park, Sangwook, et al.
Publicado: (2021)
Audio Match Cutting: Finding and Creating Matching Audio Transitions in Movies and Videos
por: Fedorishin, Dennis, et al.
Publicado: (2024)
por: Fedorishin, Dennis, et al.
Publicado: (2024)
CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer
por: Takeuchi, Daiki, et al.
Publicado: (2025)
por: Takeuchi, Daiki, et al.
Publicado: (2025)
Language Model Based Text-to-Audio Generation: Anti-Causally Aligned Collaborative Residual Transformers
por: Wang, Juncheng, et al.
Publicado: (2025)
por: Wang, Juncheng, et al.
Publicado: (2025)
uaMix-MAE: Efficient Tuning of Pretrained Audio Transformers with Unsupervised Audio Mixtures
por: Tabassum, Afrina, et al.
Publicado: (2024)
por: Tabassum, Afrina, et al.
Publicado: (2024)
Automatic Contextual Audio Denoising
por: Luong, Diep, et al.
Publicado: (2026)
por: Luong, Diep, et al.
Publicado: (2026)
Unsupervised Composable Representations for Audio
por: Bindi, Giovanni, et al.
Publicado: (2024)
por: Bindi, Giovanni, et al.
Publicado: (2024)
Diffusion Models for Audio Restoration
por: Lemercier, Jean-Marie, et al.
Publicado: (2024)
por: Lemercier, Jean-Marie, et al.
Publicado: (2024)
Instabilities in Convnets for Raw Audio
por: Haider, Daniel, et al.
Publicado: (2023)
por: Haider, Daniel, et al.
Publicado: (2023)
Enhancing Audio-Language Models through Self-Supervised Post-Training with Text-Audio Pairs
por: Sinha, Anshuman, et al.
Publicado: (2024)
por: Sinha, Anshuman, et al.
Publicado: (2024)
Can Synthetic Audio From Generative Foundation Models Assist Audio Recognition and Speech Modeling?
por: Feng, Tiantian, et al.
Publicado: (2024)
por: Feng, Tiantian, et al.
Publicado: (2024)
Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities
por: Kong, Zhifeng, et al.
Publicado: (2024)
por: Kong, Zhifeng, et al.
Publicado: (2024)
Multimodal Attention Merging for Improved Speech Recognition and Audio Event Classification
por: Sundar, Anirudh S., et al.
Publicado: (2023)
por: Sundar, Anirudh S., et al.
Publicado: (2023)
LMAC-TD: Producing Time Domain Explanations for Audio Classifiers
por: Mancini, Eleonora, et al.
Publicado: (2024)
por: Mancini, Eleonora, et al.
Publicado: (2024)
High-Fidelity Speech Enhancement via Discrete Audio Tokens
por: Lanzendörfer, Luca A., et al.
Publicado: (2025)
por: Lanzendörfer, Luca A., et al.
Publicado: (2025)
Audio Decoding by Inverse Problem Solving
por: T., Pedro J. Villasana, et al.
Publicado: (2024)
por: T., Pedro J. Villasana, et al.
Publicado: (2024)
Does Audio Deepfake Detection Generalize?
por: Müller, Nicolas M., et al.
Publicado: (2022)
por: Müller, Nicolas M., et al.
Publicado: (2022)
Aligning Audio Captions with Human Preferences
por: Hegde, Kartik, et al.
Publicado: (2025)
por: Hegde, Kartik, et al.
Publicado: (2025)
Variable Bitrate Residual Vector Quantization for Audio Coding
por: Chae, Yunkee, et al.
Publicado: (2024)
por: Chae, Yunkee, et al.
Publicado: (2024)
Frame-Level Internal Tool Use for Temporal Grounding in Audio LMs
por: An, Joesph, et al.
Publicado: (2026)
por: An, Joesph, et al.
Publicado: (2026)
COVID-19 Detection System: A Comparative Analysis of System Performance Based on Acoustic Features of Cough Audio Signals
por: Shati, Asmaa, et al.
Publicado: (2023)
por: Shati, Asmaa, et al.
Publicado: (2023)
Edge Intelligence for Wildlife Conservation: Real-Time Hornbill Call Classification Using TinyML
por: Hing, Kong Ka, et al.
Publicado: (2025)
por: Hing, Kong Ka, et al.
Publicado: (2025)
Targeted Augmented Data for Audio Deepfake Detection
por: Astrid, Marcella, et al.
Publicado: (2024)
por: Astrid, Marcella, et al.
Publicado: (2024)
Ejemplares similares
-
On the Utility of Speech and Audio Foundation Models for Marmoset Call Analysis
por: Sarkar, Eklavya, et al.
Publicado: (2024) -
Listenable Maps for Audio Classifiers
por: Paissan, Francesco, et al.
Publicado: (2024) -
"I am bad": Interpreting Stealthy, Universal and Robust Audio Jailbreaks in Audio-Language Models
por: Gupta, Isha, et al.
Publicado: (2025) -
Listenable Maps for Zero-Shot Audio Classifiers
por: Paissan, Francesco, et al.
Publicado: (2024) -
Audio2Tool: Speak, Call, Act -- A Dataset for Benchmarking Speech Tool Use
por: Pahwa, Ramit, et al.
Publicado: (2026)