Enhancing Audio-Language Models through Self-Supervised Post-Training with Text-Audio Pairs
Fuente:
arXiv
Guardado en:
| Autores principales: | Sinha, Anshuman, Migozzi, Camille, Rey, Aubin, Zhang, Chao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
PTQ4ADM: Post-Training Quantization for Efficient Text Conditional Audio Diffusion Models
por: Vora, Jayneel, et al.
Publicado: (2024)
por: Vora, Jayneel, et al.
Publicado: (2024)
On the Transferability of Large-Scale Self-Supervision to Few-Shot Audio Classification
por: Heggan, Calum, et al.
Publicado: (2024)
por: Heggan, Calum, et al.
Publicado: (2024)
SSLAM: Enhancing Self-Supervised Models with Audio Mixtures for Polyphonic Soundscapes
por: Alex, Tony, et al.
Publicado: (2025)
por: Alex, Tony, et al.
Publicado: (2025)
Fast Text-to-Audio Generation with Adversarial Post-Training
por: Novack, Zachary, et al.
Publicado: (2025)
por: Novack, Zachary, et al.
Publicado: (2025)
Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings
por: Wisnu, Dyah A. M. G., et al.
Publicado: (2025)
por: Wisnu, Dyah A. M. G., et al.
Publicado: (2025)
TACOS: Temporally-aligned Audio CaptiOnS for Language-Audio Pretraining
por: Primus, Paul, et al.
Publicado: (2025)
por: Primus, Paul, et al.
Publicado: (2025)
Cross-Referencing Self-Training Network for Sound Event Detection in Audio Mixtures
por: Park, Sangwook, et al.
Publicado: (2021)
por: Park, Sangwook, et al.
Publicado: (2021)
RiTTA: Modeling Event Relations in Text-to-Audio Generation
por: He, Yuhang, et al.
Publicado: (2024)
por: He, Yuhang, et al.
Publicado: (2024)
Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities
por: Kong, Zhifeng, et al.
Publicado: (2024)
por: Kong, Zhifeng, et al.
Publicado: (2024)
"I am bad": Interpreting Stealthy, Universal and Robust Audio Jailbreaks in Audio-Language Models
por: Gupta, Isha, et al.
Publicado: (2025)
por: Gupta, Isha, et al.
Publicado: (2025)
Estimated Audio-Caption Correspondences Improve Language-Based Audio Retrieval
por: Primus, Paul, et al.
Publicado: (2024)
por: Primus, Paul, et al.
Publicado: (2024)
Fusing Audio and Metadata Embeddings Improves Language-based Audio Retrieval
por: Primus, Paul, et al.
Publicado: (2024)
por: Primus, Paul, et al.
Publicado: (2024)
Audio Editing with Non-Rigid Text Prompts
por: Paissan, Francesco, et al.
Publicado: (2023)
por: Paissan, Francesco, et al.
Publicado: (2023)
Language Model Based Text-to-Audio Generation: Anti-Causally Aligned Collaborative Residual Transformers
por: Wang, Juncheng, et al.
Publicado: (2025)
por: Wang, Juncheng, et al.
Publicado: (2025)
Do Audio-Language Models Understand Linguistic Variations?
por: Selvakumar, Ramaneswaran, et al.
Publicado: (2024)
por: Selvakumar, Ramaneswaran, et al.
Publicado: (2024)
MATS: An Audio Language Model under Text-only Supervision
por: Wang, Wen, et al.
Publicado: (2025)
por: Wang, Wen, et al.
Publicado: (2025)
Creative Text-to-Audio Generation via Synthesizer Programming
por: Cherep, Manuel, et al.
Publicado: (2024)
por: Cherep, Manuel, et al.
Publicado: (2024)
AudioGenX: Explainability on Text-to-Audio Generative Models
por: Kang, Hyunju, et al.
Publicado: (2025)
por: Kang, Hyunju, et al.
Publicado: (2025)
Diffusion Models for Audio Restoration
por: Lemercier, Jean-Marie, et al.
Publicado: (2024)
por: Lemercier, Jean-Marie, et al.
Publicado: (2024)
A Language Model With Million Context Length For Raw Audio
por: Verma, Prateek
Publicado: (2022)
por: Verma, Prateek
Publicado: (2022)
Can Synthetic Audio From Generative Foundation Models Assist Audio Recognition and Speech Modeling?
por: Feng, Tiantian, et al.
Publicado: (2024)
por: Feng, Tiantian, et al.
Publicado: (2024)
A2SB: Audio-to-Audio Schrodinger Bridges
por: Kong, Zhifeng, et al.
Publicado: (2025)
por: Kong, Zhifeng, et al.
Publicado: (2025)
Guiding Audio Editing with Audio Language Model
por: Lan, Zitong, et al.
Publicado: (2025)
por: Lan, Zitong, et al.
Publicado: (2025)
Learning Disentangled Audio Representations through Controlled Synthesis
por: Brima, Yusuf, et al.
Publicado: (2024)
por: Brima, Yusuf, et al.
Publicado: (2024)
From Coarse to Fine: Efficient Training for Audio Spectrogram Transformers
por: Feng, Jiu, et al.
Publicado: (2024)
por: Feng, Jiu, et al.
Publicado: (2024)
Learning Spatially-Aware Language and Audio Embeddings
por: Devnani, Bhavika, et al.
Publicado: (2024)
por: Devnani, Bhavika, et al.
Publicado: (2024)
Zero Shot Audio to Audio Emotion Transfer With Speaker Disentanglement
por: Dutta, Soumya, et al.
Publicado: (2024)
por: Dutta, Soumya, et al.
Publicado: (2024)
On Class Separability Pitfalls In Audio-Text Contrastive Zero-Shot Learning
por: Tavares, Tiago, et al.
Publicado: (2024)
por: Tavares, Tiago, et al.
Publicado: (2024)
The Rarity of Musical Audio Signals Within the Space of Possible Audio Generation
por: Collins, Nick
Publicado: (2024)
por: Collins, Nick
Publicado: (2024)
StethoLM: Audio Language Model for Cardiopulmonary Analysis Across Clinical Tasks
por: Wang, Yishan, et al.
Publicado: (2026)
por: Wang, Yishan, et al.
Publicado: (2026)
Zero-Shot Unsupervised and Text-Based Audio Editing Using DDPM Inversion
por: Manor, Hila, et al.
Publicado: (2024)
por: Manor, Hila, et al.
Publicado: (2024)
An Enhanced Audio Feature Tailored for Anomalous Sound Detection Based on Pre-trained Models
por: Zhong, Guirui, et al.
Publicado: (2025)
por: Zhong, Guirui, et al.
Publicado: (2025)
Audio Match Cutting: Finding and Creating Matching Audio Transitions in Movies and Videos
por: Fedorishin, Dennis, et al.
Publicado: (2024)
por: Fedorishin, Dennis, et al.
Publicado: (2024)
CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer
por: Takeuchi, Daiki, et al.
Publicado: (2025)
por: Takeuchi, Daiki, et al.
Publicado: (2025)
Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities
por: Ghosh, Sreyan, et al.
Publicado: (2025)
por: Ghosh, Sreyan, et al.
Publicado: (2025)
EAT: Self-Supervised Pre-Training with Efficient Audio Transformer
por: Chen, Wenxi, et al.
Publicado: (2024)
por: Chen, Wenxi, et al.
Publicado: (2024)
Generating Sample-Based Musical Instruments Using Neural Audio Codec Language Models
por: Nercessian, Shahan, et al.
Publicado: (2024)
por: Nercessian, Shahan, et al.
Publicado: (2024)
uaMix-MAE: Efficient Tuning of Pretrained Audio Transformers with Unsupervised Audio Mixtures
por: Tabassum, Afrina, et al.
Publicado: (2024)
por: Tabassum, Afrina, et al.
Publicado: (2024)
EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer
por: Hai, Jiarui, et al.
Publicado: (2024)
por: Hai, Jiarui, et al.
Publicado: (2024)
Text-Independent Speaker Identification Using Audio Looping With Margin Based Loss Functions
por: Garcia, Elliot Q C, et al.
Publicado: (2025)
por: Garcia, Elliot Q C, et al.
Publicado: (2025)
Ejemplares similares
-
PTQ4ADM: Post-Training Quantization for Efficient Text Conditional Audio Diffusion Models
por: Vora, Jayneel, et al.
Publicado: (2024) -
On the Transferability of Large-Scale Self-Supervision to Few-Shot Audio Classification
por: Heggan, Calum, et al.
Publicado: (2024) -
SSLAM: Enhancing Self-Supervised Models with Audio Mixtures for Polyphonic Soundscapes
por: Alex, Tony, et al.
Publicado: (2025) -
Fast Text-to-Audio Generation with Adversarial Post-Training
por: Novack, Zachary, et al.
Publicado: (2025) -
Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings
por: Wisnu, Dyah A. M. G., et al.
Publicado: (2025)