Salvato in:
| Autori principali: | Kelly, David A., Chockler, Hana |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2601.16675 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
On the Utility of Speech and Audio Foundation Models for Marmoset Call Analysis
di: Sarkar, Eklavya, et al.
Pubblicazione: (2024)
di: Sarkar, Eklavya, et al.
Pubblicazione: (2024)
Listenable Maps for Audio Classifiers
di: Paissan, Francesco, et al.
Pubblicazione: (2024)
di: Paissan, Francesco, et al.
Pubblicazione: (2024)
"I am bad": Interpreting Stealthy, Universal and Robust Audio Jailbreaks in Audio-Language Models
di: Gupta, Isha, et al.
Pubblicazione: (2025)
di: Gupta, Isha, et al.
Pubblicazione: (2025)
Listenable Maps for Zero-Shot Audio Classifiers
di: Paissan, Francesco, et al.
Pubblicazione: (2024)
di: Paissan, Francesco, et al.
Pubblicazione: (2024)
Audio2Tool: Speak, Call, Act -- A Dataset for Benchmarking Speech Tool Use
di: Pahwa, Ramit, et al.
Pubblicazione: (2026)
di: Pahwa, Ramit, et al.
Pubblicazione: (2026)
Tuning In: Analysis of Audio Classifier Performance in Clinical Settings with Limited Data
di: Mahdi, Hamza, et al.
Pubblicazione: (2024)
di: Mahdi, Hamza, et al.
Pubblicazione: (2024)
From Birdsong to Rumbles: Classifying Elephant Calls with Out-of-Species Embeddings
di: Geldenhuys, Christiaan M., et al.
Pubblicazione: (2026)
di: Geldenhuys, Christiaan M., et al.
Pubblicazione: (2026)
A2SB: Audio-to-Audio Schrodinger Bridges
di: Kong, Zhifeng, et al.
Pubblicazione: (2025)
di: Kong, Zhifeng, et al.
Pubblicazione: (2025)
Multi-bit Audio Watermarking
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025)
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025)
Spectrotemporal Modulation: Efficient and Interpretable Feature Representation for Classifying Speech, Music, and Environmental Sounds
di: Chang, Andrew, et al.
Pubblicazione: (2025)
di: Chang, Andrew, et al.
Pubblicazione: (2025)
StethoLM: Audio Language Model for Cardiopulmonary Analysis Across Clinical Tasks
di: Wang, Yishan, et al.
Pubblicazione: (2026)
di: Wang, Yishan, et al.
Pubblicazione: (2026)
TACOS: Temporally-aligned Audio CaptiOnS for Language-Audio Pretraining
di: Primus, Paul, et al.
Pubblicazione: (2025)
di: Primus, Paul, et al.
Pubblicazione: (2025)
Zero Shot Audio to Audio Emotion Transfer With Speaker Disentanglement
di: Dutta, Soumya, et al.
Pubblicazione: (2024)
di: Dutta, Soumya, et al.
Pubblicazione: (2024)
The Rarity of Musical Audio Signals Within the Space of Possible Audio Generation
di: Collins, Nick
Pubblicazione: (2024)
di: Collins, Nick
Pubblicazione: (2024)
Estimated Audio-Caption Correspondences Improve Language-Based Audio Retrieval
di: Primus, Paul, et al.
Pubblicazione: (2024)
di: Primus, Paul, et al.
Pubblicazione: (2024)
Fusing Audio and Metadata Embeddings Improves Language-based Audio Retrieval
di: Primus, Paul, et al.
Pubblicazione: (2024)
di: Primus, Paul, et al.
Pubblicazione: (2024)
SNAC: Multi-Scale Neural Audio Codec
di: Siuzdak, Hubert, et al.
Pubblicazione: (2024)
di: Siuzdak, Hubert, et al.
Pubblicazione: (2024)
Cross-Referencing Self-Training Network for Sound Event Detection in Audio Mixtures
di: Park, Sangwook, et al.
Pubblicazione: (2021)
di: Park, Sangwook, et al.
Pubblicazione: (2021)
Audio Match Cutting: Finding and Creating Matching Audio Transitions in Movies and Videos
di: Fedorishin, Dennis, et al.
Pubblicazione: (2024)
di: Fedorishin, Dennis, et al.
Pubblicazione: (2024)
CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer
di: Takeuchi, Daiki, et al.
Pubblicazione: (2025)
di: Takeuchi, Daiki, et al.
Pubblicazione: (2025)
Language Model Based Text-to-Audio Generation: Anti-Causally Aligned Collaborative Residual Transformers
di: Wang, Juncheng, et al.
Pubblicazione: (2025)
di: Wang, Juncheng, et al.
Pubblicazione: (2025)
uaMix-MAE: Efficient Tuning of Pretrained Audio Transformers with Unsupervised Audio Mixtures
di: Tabassum, Afrina, et al.
Pubblicazione: (2024)
di: Tabassum, Afrina, et al.
Pubblicazione: (2024)
Automatic Contextual Audio Denoising
di: Luong, Diep, et al.
Pubblicazione: (2026)
di: Luong, Diep, et al.
Pubblicazione: (2026)
Unsupervised Composable Representations for Audio
di: Bindi, Giovanni, et al.
Pubblicazione: (2024)
di: Bindi, Giovanni, et al.
Pubblicazione: (2024)
Diffusion Models for Audio Restoration
di: Lemercier, Jean-Marie, et al.
Pubblicazione: (2024)
di: Lemercier, Jean-Marie, et al.
Pubblicazione: (2024)
Instabilities in Convnets for Raw Audio
di: Haider, Daniel, et al.
Pubblicazione: (2023)
di: Haider, Daniel, et al.
Pubblicazione: (2023)
Enhancing Audio-Language Models through Self-Supervised Post-Training with Text-Audio Pairs
di: Sinha, Anshuman, et al.
Pubblicazione: (2024)
di: Sinha, Anshuman, et al.
Pubblicazione: (2024)
Can Synthetic Audio From Generative Foundation Models Assist Audio Recognition and Speech Modeling?
di: Feng, Tiantian, et al.
Pubblicazione: (2024)
di: Feng, Tiantian, et al.
Pubblicazione: (2024)
Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities
di: Kong, Zhifeng, et al.
Pubblicazione: (2024)
di: Kong, Zhifeng, et al.
Pubblicazione: (2024)
Multimodal Attention Merging for Improved Speech Recognition and Audio Event Classification
di: Sundar, Anirudh S., et al.
Pubblicazione: (2023)
di: Sundar, Anirudh S., et al.
Pubblicazione: (2023)
LMAC-TD: Producing Time Domain Explanations for Audio Classifiers
di: Mancini, Eleonora, et al.
Pubblicazione: (2024)
di: Mancini, Eleonora, et al.
Pubblicazione: (2024)
High-Fidelity Speech Enhancement via Discrete Audio Tokens
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025)
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025)
Audio Decoding by Inverse Problem Solving
di: T., Pedro J. Villasana, et al.
Pubblicazione: (2024)
di: T., Pedro J. Villasana, et al.
Pubblicazione: (2024)
Does Audio Deepfake Detection Generalize?
di: Müller, Nicolas M., et al.
Pubblicazione: (2022)
di: Müller, Nicolas M., et al.
Pubblicazione: (2022)
Aligning Audio Captions with Human Preferences
di: Hegde, Kartik, et al.
Pubblicazione: (2025)
di: Hegde, Kartik, et al.
Pubblicazione: (2025)
Variable Bitrate Residual Vector Quantization for Audio Coding
di: Chae, Yunkee, et al.
Pubblicazione: (2024)
di: Chae, Yunkee, et al.
Pubblicazione: (2024)
Frame-Level Internal Tool Use for Temporal Grounding in Audio LMs
di: An, Joesph, et al.
Pubblicazione: (2026)
di: An, Joesph, et al.
Pubblicazione: (2026)
COVID-19 Detection System: A Comparative Analysis of System Performance Based on Acoustic Features of Cough Audio Signals
di: Shati, Asmaa, et al.
Pubblicazione: (2023)
di: Shati, Asmaa, et al.
Pubblicazione: (2023)
Edge Intelligence for Wildlife Conservation: Real-Time Hornbill Call Classification Using TinyML
di: Hing, Kong Ka, et al.
Pubblicazione: (2025)
di: Hing, Kong Ka, et al.
Pubblicazione: (2025)
Targeted Augmented Data for Audio Deepfake Detection
di: Astrid, Marcella, et al.
Pubblicazione: (2024)
di: Astrid, Marcella, et al.
Pubblicazione: (2024)
Documenti analoghi
-
On the Utility of Speech and Audio Foundation Models for Marmoset Call Analysis
di: Sarkar, Eklavya, et al.
Pubblicazione: (2024) -
Listenable Maps for Audio Classifiers
di: Paissan, Francesco, et al.
Pubblicazione: (2024) -
"I am bad": Interpreting Stealthy, Universal and Robust Audio Jailbreaks in Audio-Language Models
di: Gupta, Isha, et al.
Pubblicazione: (2025) -
Listenable Maps for Zero-Shot Audio Classifiers
di: Paissan, Francesco, et al.
Pubblicazione: (2024) -
Audio2Tool: Speak, Call, Act -- A Dataset for Benchmarking Speech Tool Use
di: Pahwa, Ramit, et al.
Pubblicazione: (2026)