Estimated Audio-Caption Correspondences Improve Language-Based Audio Retrieval
Fuente:
arXiv
Salvato in:
| Autori principali: | Primus, Paul, Schmid, Florian, Widmer, Gerhard |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Fusing Audio and Metadata Embeddings Improves Language-based Audio Retrieval
di: Primus, Paul, et al.
Pubblicazione: (2024)
di: Primus, Paul, et al.
Pubblicazione: (2024)
TACOS: Temporally-aligned Audio CaptiOnS for Language-Audio Pretraining
di: Primus, Paul, et al.
Pubblicazione: (2025)
di: Primus, Paul, et al.
Pubblicazione: (2025)
On Temporal Guidance and Iterative Refinement in Audio Source Separation
di: Morocutti, Tobias, et al.
Pubblicazione: (2025)
di: Morocutti, Tobias, et al.
Pubblicazione: (2025)
Improving Audio Spectrogram Transformers for Sound Event Detection Through Multi-Stage Training
di: Schmid, Florian, et al.
Pubblicazione: (2024)
di: Schmid, Florian, et al.
Pubblicazione: (2024)
Effective Pre-Training of Audio Transformers for Sound Event Detection
di: Schmid, Florian, et al.
Pubblicazione: (2024)
di: Schmid, Florian, et al.
Pubblicazione: (2024)
Improving Query-by-Vocal Imitation with Contrastive Learning and Audio Pretraining
di: Greif, Jonathan, et al.
Pubblicazione: (2024)
di: Greif, Jonathan, et al.
Pubblicazione: (2024)
Music Boomerang: Reusing Diffusion Models for Data Augmentation and Audio Manipulation
di: Fichtinger, Alexander, et al.
Pubblicazione: (2025)
di: Fichtinger, Alexander, et al.
Pubblicazione: (2025)
Aligning Audio Captions with Human Preferences
di: Hegde, Kartik, et al.
Pubblicazione: (2025)
di: Hegde, Kartik, et al.
Pubblicazione: (2025)
CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer
di: Takeuchi, Daiki, et al.
Pubblicazione: (2025)
di: Takeuchi, Daiki, et al.
Pubblicazione: (2025)
Creating a Good Teacher for Knowledge Distillation in Acoustic Scene Classification
di: Morocutti, Tobias, et al.
Pubblicazione: (2025)
di: Morocutti, Tobias, et al.
Pubblicazione: (2025)
Low-Complexity Acoustic Scene Classification with Device Information in the DCASE 2025 Challenge
di: Schmid, Florian, et al.
Pubblicazione: (2025)
di: Schmid, Florian, et al.
Pubblicazione: (2025)
Improving Text-To-Audio Models with Synthetic Captions
di: Kong, Zhifeng, et al.
Pubblicazione: (2024)
di: Kong, Zhifeng, et al.
Pubblicazione: (2024)
Exploring Performance-Complexity Trade-Offs in Sound Event Detection Models
di: Morocutti, Tobias, et al.
Pubblicazione: (2025)
di: Morocutti, Tobias, et al.
Pubblicazione: (2025)
Data-Efficient Low-Complexity Acoustic Scene Classification in the DCASE 2024 Challenge
di: Schmid, Florian, et al.
Pubblicazione: (2024)
di: Schmid, Florian, et al.
Pubblicazione: (2024)
Multi-bit Audio Watermarking
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025)
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025)
CosyAudio: Improving Audio Generation with Confidence Scores and Synthetic Captions
di: Zhu, Xinfa, et al.
Pubblicazione: (2025)
di: Zhu, Xinfa, et al.
Pubblicazione: (2025)
SNAC: Multi-Scale Neural Audio Codec
di: Siuzdak, Hubert, et al.
Pubblicazione: (2024)
di: Siuzdak, Hubert, et al.
Pubblicazione: (2024)
Discrete Audio Representations for Automated Audio Captioning
di: Tian, Jingguang, et al.
Pubblicazione: (2025)
di: Tian, Jingguang, et al.
Pubblicazione: (2025)
Improving Audio-Text Retrieval via Hierarchical Cross-Modal Interaction and Auxiliary Captions
di: Xin, Yifei, et al.
Pubblicazione: (2023)
di: Xin, Yifei, et al.
Pubblicazione: (2023)
Device-Robust Acoustic Scene Classification via Impulse Response Augmentation
di: Morocutti, Tobias, et al.
Pubblicazione: (2023)
di: Morocutti, Tobias, et al.
Pubblicazione: (2023)
Enhancing Audio-Language Models through Self-Supervised Post-Training with Text-Audio Pairs
di: Sinha, Anshuman, et al.
Pubblicazione: (2024)
di: Sinha, Anshuman, et al.
Pubblicazione: (2024)
Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities
di: Kong, Zhifeng, et al.
Pubblicazione: (2024)
di: Kong, Zhifeng, et al.
Pubblicazione: (2024)
"I am bad": Interpreting Stealthy, Universal and Robust Audio Jailbreaks in Audio-Language Models
di: Gupta, Isha, et al.
Pubblicazione: (2025)
di: Gupta, Isha, et al.
Pubblicazione: (2025)
A2SB: Audio-to-Audio Schrodinger Bridges
di: Kong, Zhifeng, et al.
Pubblicazione: (2025)
di: Kong, Zhifeng, et al.
Pubblicazione: (2025)
EmotionCaps: Enhancing Audio Captioning Through Emotion-Augmented Data Generation
di: Manivannan, Mithun, et al.
Pubblicazione: (2024)
di: Manivannan, Mithun, et al.
Pubblicazione: (2024)
MACE: Leveraging Audio for Evaluating Audio Captioning Systems
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
Learning Spatially-Aware Language and Audio Embeddings
di: Devnani, Bhavika, et al.
Pubblicazione: (2024)
di: Devnani, Bhavika, et al.
Pubblicazione: (2024)
Zero Shot Audio to Audio Emotion Transfer With Speaker Disentanglement
di: Dutta, Soumya, et al.
Pubblicazione: (2024)
di: Dutta, Soumya, et al.
Pubblicazione: (2024)
Estimating Musical Surprisal in Audio
di: Bjare, Mathias Rose, et al.
Pubblicazione: (2025)
di: Bjare, Mathias Rose, et al.
Pubblicazione: (2025)
Audio Texture Manipulation by Exemplar-Based Analogy
di: Cheng, Kan Jen, et al.
Pubblicazione: (2025)
di: Cheng, Kan Jen, et al.
Pubblicazione: (2025)
The Rarity of Musical Audio Signals Within the Space of Possible Audio Generation
di: Collins, Nick
Pubblicazione: (2024)
di: Collins, Nick
Pubblicazione: (2024)
Do Audio-Language Models Understand Linguistic Variations?
di: Selvakumar, Ramaneswaran, et al.
Pubblicazione: (2024)
di: Selvakumar, Ramaneswaran, et al.
Pubblicazione: (2024)
Multimodal Attention Merging for Improved Speech Recognition and Audio Event Classification
di: Sundar, Anirudh S., et al.
Pubblicazione: (2023)
di: Sundar, Anirudh S., et al.
Pubblicazione: (2023)
Generating Sample-Based Musical Instruments Using Neural Audio Codec Language Models
di: Nercessian, Shahan, et al.
Pubblicazione: (2024)
di: Nercessian, Shahan, et al.
Pubblicazione: (2024)
AVCap: Leveraging Audio-Visual Features as Text Tokens for Captioning
di: Kim, Jongsuk, et al.
Pubblicazione: (2024)
di: Kim, Jongsuk, et al.
Pubblicazione: (2024)
Audio Match Cutting: Finding and Creating Matching Audio Transitions in Movies and Videos
di: Fedorishin, Dennis, et al.
Pubblicazione: (2024)
di: Fedorishin, Dennis, et al.
Pubblicazione: (2024)
A Language Model With Million Context Length For Raw Audio
di: Verma, Prateek
Pubblicazione: (2022)
di: Verma, Prateek
Pubblicazione: (2022)
uaMix-MAE: Efficient Tuning of Pretrained Audio Transformers with Unsupervised Audio Mixtures
di: Tabassum, Afrina, et al.
Pubblicazione: (2024)
di: Tabassum, Afrina, et al.
Pubblicazione: (2024)
MiDashengLM: Efficient Audio Understanding with General Audio Captions
di: Dinkel, Heinrich, et al.
Pubblicazione: (2025)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2025)
Unsupervised Composable Representations for Audio
di: Bindi, Giovanni, et al.
Pubblicazione: (2024)
di: Bindi, Giovanni, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Fusing Audio and Metadata Embeddings Improves Language-based Audio Retrieval
di: Primus, Paul, et al.
Pubblicazione: (2024) -
TACOS: Temporally-aligned Audio CaptiOnS for Language-Audio Pretraining
di: Primus, Paul, et al.
Pubblicazione: (2025) -
On Temporal Guidance and Iterative Refinement in Audio Source Separation
di: Morocutti, Tobias, et al.
Pubblicazione: (2025) -
Improving Audio Spectrogram Transformers for Sound Event Detection Through Multi-Stage Training
di: Schmid, Florian, et al.
Pubblicazione: (2024) -
Effective Pre-Training of Audio Transformers for Sound Event Detection
di: Schmid, Florian, et al.
Pubblicazione: (2024)