Enregistré dans:
| Auteurs principaux: | Gupta, Isha, Khachaturov, David, Mullins, Robert |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2502.00718 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Jailbreak-AudioBench: In-Depth Evaluation and Analysis of Jailbreak Threats for Large Audio Language Models
par: Cheng, Hao, et autres
Publié: (2025)
par: Cheng, Hao, et autres
Publié: (2025)
AudioJailbreak: Jailbreak Attacks against End-to-End Large Audio-Language Models
par: Chen, Guangke, et autres
Publié: (2025)
par: Chen, Guangke, et autres
Publié: (2025)
TACOS: Temporally-aligned Audio CaptiOnS for Language-Audio Pretraining
par: Primus, Paul, et autres
Publié: (2025)
par: Primus, Paul, et autres
Publié: (2025)
Enhancing Audio-Language Models through Self-Supervised Post-Training with Text-Audio Pairs
par: Sinha, Anshuman, et autres
Publié: (2024)
par: Sinha, Anshuman, et autres
Publié: (2024)
Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities
par: Kong, Zhifeng, et autres
Publié: (2024)
par: Kong, Zhifeng, et autres
Publié: (2024)
Estimated Audio-Caption Correspondences Improve Language-Based Audio Retrieval
par: Primus, Paul, et autres
Publié: (2024)
par: Primus, Paul, et autres
Publié: (2024)
Fusing Audio and Metadata Embeddings Improves Language-based Audio Retrieval
par: Primus, Paul, et autres
Publié: (2024)
par: Primus, Paul, et autres
Publié: (2024)
I Guess That's Why They Call it the Blues: Causal Analysis for Audio Classifiers
par: Kelly, David A., et autres
Publié: (2026)
par: Kelly, David A., et autres
Publié: (2026)
Guiding Audio Editing with Audio Language Model
par: Lan, Zitong, et autres
Publié: (2025)
par: Lan, Zitong, et autres
Publié: (2025)
Do Audio-Language Models Understand Linguistic Variations?
par: Selvakumar, Ramaneswaran, et autres
Publié: (2024)
par: Selvakumar, Ramaneswaran, et autres
Publié: (2024)
Diffusion Models for Audio Restoration
par: Lemercier, Jean-Marie, et autres
Publié: (2024)
par: Lemercier, Jean-Marie, et autres
Publié: (2024)
A Language Model With Million Context Length For Raw Audio
par: Verma, Prateek
Publié: (2022)
par: Verma, Prateek
Publié: (2022)
Can Synthetic Audio From Generative Foundation Models Assist Audio Recognition and Speech Modeling?
par: Feng, Tiantian, et autres
Publié: (2024)
par: Feng, Tiantian, et autres
Publié: (2024)
A2SB: Audio-to-Audio Schrodinger Bridges
par: Kong, Zhifeng, et autres
Publié: (2025)
par: Kong, Zhifeng, et autres
Publié: (2025)
Learning Spatially-Aware Language and Audio Embeddings
par: Devnani, Bhavika, et autres
Publié: (2024)
par: Devnani, Bhavika, et autres
Publié: (2024)
Zero Shot Audio to Audio Emotion Transfer With Speaker Disentanglement
par: Dutta, Soumya, et autres
Publié: (2024)
par: Dutta, Soumya, et autres
Publié: (2024)
AudioMarkBench: Benchmarking Robustness of Audio Watermarking
par: Liu, Hongbin, et autres
Publié: (2024)
par: Liu, Hongbin, et autres
Publié: (2024)
Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities
par: Ghosh, Sreyan, et autres
Publié: (2025)
par: Ghosh, Sreyan, et autres
Publié: (2025)
Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models
par: Song, Zirui, et autres
Publié: (2025)
par: Song, Zirui, et autres
Publié: (2025)
The Rarity of Musical Audio Signals Within the Space of Possible Audio Generation
par: Collins, Nick
Publié: (2024)
par: Collins, Nick
Publié: (2024)
StethoLM: Audio Language Model for Cardiopulmonary Analysis Across Clinical Tasks
par: Wang, Yishan, et autres
Publié: (2026)
par: Wang, Yishan, et autres
Publié: (2026)
CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer
par: Takeuchi, Daiki, et autres
Publié: (2025)
par: Takeuchi, Daiki, et autres
Publié: (2025)
Audio Match Cutting: Finding and Creating Matching Audio Transitions in Movies and Videos
par: Fedorishin, Dennis, et autres
Publié: (2024)
par: Fedorishin, Dennis, et autres
Publié: (2024)
uaMix-MAE: Efficient Tuning of Pretrained Audio Transformers with Unsupervised Audio Mixtures
par: Tabassum, Afrina, et autres
Publié: (2024)
par: Tabassum, Afrina, et autres
Publié: (2024)
Toward Robust Real-World Audio Deepfake Detection: Closing the Explainability Gap
par: Channing, Georgia, et autres
Publié: (2024)
par: Channing, Georgia, et autres
Publié: (2024)
Generating Sample-Based Musical Instruments Using Neural Audio Codec Language Models
par: Nercessian, Shahan, et autres
Publié: (2024)
par: Nercessian, Shahan, et autres
Publié: (2024)
Multi-bit Audio Watermarking
par: Lanzendörfer, Luca A., et autres
Publié: (2025)
par: Lanzendörfer, Luca A., et autres
Publié: (2025)
Unsupervised Composable Representations for Audio
par: Bindi, Giovanni, et autres
Publié: (2024)
par: Bindi, Giovanni, et autres
Publié: (2024)
Instabilities in Convnets for Raw Audio
par: Haider, Daniel, et autres
Publié: (2023)
par: Haider, Daniel, et autres
Publié: (2023)
Automatic Contextual Audio Denoising
par: Luong, Diep, et autres
Publié: (2026)
par: Luong, Diep, et autres
Publié: (2026)
AdvWave: Stealthy Adversarial Jailbreak Attack against Large Audio-Language Models
par: Kang, Mintong, et autres
Publié: (2024)
par: Kang, Mintong, et autres
Publié: (2024)
EuleroDec: A Complex-Valued RVQ-VAE for Efficient and Robust Audio Coding
par: Cerovaz, Luca, et autres
Publié: (2026)
par: Cerovaz, Luca, et autres
Publié: (2026)
Network Bending of Diffusion Models for Audio-Visual Generation
par: Dzwonczyk, Luke, et autres
Publié: (2024)
par: Dzwonczyk, Luke, et autres
Publié: (2024)
Aligning Audio Captions with Human Preferences
par: Hegde, Kartik, et autres
Publié: (2025)
par: Hegde, Kartik, et autres
Publié: (2025)
Audio Decoding by Inverse Problem Solving
par: T., Pedro J. Villasana, et autres
Publié: (2024)
par: T., Pedro J. Villasana, et autres
Publié: (2024)
Does Audio Deepfake Detection Generalize?
par: Müller, Nicolas M., et autres
Publié: (2022)
par: Müller, Nicolas M., et autres
Publié: (2022)
RiTTA: Modeling Event Relations in Text-to-Audio Generation
par: He, Yuhang, et autres
Publié: (2024)
par: He, Yuhang, et autres
Publié: (2024)
On the Utility of Speech and Audio Foundation Models for Marmoset Call Analysis
par: Sarkar, Eklavya, et autres
Publié: (2024)
par: Sarkar, Eklavya, et autres
Publié: (2024)
Towards Robust Few-shot Class Incremental Learning in Audio Classification using Contrastive Representation
par: Singh, Riyansha, et autres
Publié: (2024)
par: Singh, Riyansha, et autres
Publié: (2024)
Music Boomerang: Reusing Diffusion Models for Data Augmentation and Audio Manipulation
par: Fichtinger, Alexander, et autres
Publié: (2025)
par: Fichtinger, Alexander, et autres
Publié: (2025)
Documents similaires
-
Jailbreak-AudioBench: In-Depth Evaluation and Analysis of Jailbreak Threats for Large Audio Language Models
par: Cheng, Hao, et autres
Publié: (2025) -
AudioJailbreak: Jailbreak Attacks against End-to-End Large Audio-Language Models
par: Chen, Guangke, et autres
Publié: (2025) -
TACOS: Temporally-aligned Audio CaptiOnS for Language-Audio Pretraining
par: Primus, Paul, et autres
Publié: (2025) -
Enhancing Audio-Language Models through Self-Supervised Post-Training with Text-Audio Pairs
par: Sinha, Anshuman, et autres
Publié: (2024) -
Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities
par: Kong, Zhifeng, et autres
Publié: (2024)