TACOS: Temporally-aligned Audio CaptiOnS for Language-Audio Pretraining
Fuente:
arXiv
Salvato in:
| Autori principali: | Primus, Paul, Schmid, Florian, Widmer, Gerhard |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Estimated Audio-Caption Correspondences Improve Language-Based Audio Retrieval
di: Primus, Paul, et al.
Pubblicazione: (2024)
di: Primus, Paul, et al.
Pubblicazione: (2024)
Fusing Audio and Metadata Embeddings Improves Language-based Audio Retrieval
di: Primus, Paul, et al.
Pubblicazione: (2024)
di: Primus, Paul, et al.
Pubblicazione: (2024)
On Temporal Guidance and Iterative Refinement in Audio Source Separation
di: Morocutti, Tobias, et al.
Pubblicazione: (2025)
di: Morocutti, Tobias, et al.
Pubblicazione: (2025)
Improving Audio Spectrogram Transformers for Sound Event Detection Through Multi-Stage Training
di: Schmid, Florian, et al.
Pubblicazione: (2024)
di: Schmid, Florian, et al.
Pubblicazione: (2024)
Effective Pre-Training of Audio Transformers for Sound Event Detection
di: Schmid, Florian, et al.
Pubblicazione: (2024)
di: Schmid, Florian, et al.
Pubblicazione: (2024)
Improving Query-by-Vocal Imitation with Contrastive Learning and Audio Pretraining
di: Greif, Jonathan, et al.
Pubblicazione: (2024)
di: Greif, Jonathan, et al.
Pubblicazione: (2024)
Music Boomerang: Reusing Diffusion Models for Data Augmentation and Audio Manipulation
di: Fichtinger, Alexander, et al.
Pubblicazione: (2025)
di: Fichtinger, Alexander, et al.
Pubblicazione: (2025)
T-CLAP: Temporal-Enhanced Contrastive Language-Audio Pretraining
di: Yuan, Yi, et al.
Pubblicazione: (2024)
di: Yuan, Yi, et al.
Pubblicazione: (2024)
Creating a Good Teacher for Knowledge Distillation in Acoustic Scene Classification
di: Morocutti, Tobias, et al.
Pubblicazione: (2025)
di: Morocutti, Tobias, et al.
Pubblicazione: (2025)
Low-Complexity Acoustic Scene Classification with Device Information in the DCASE 2025 Challenge
di: Schmid, Florian, et al.
Pubblicazione: (2025)
di: Schmid, Florian, et al.
Pubblicazione: (2025)
uaMix-MAE: Efficient Tuning of Pretrained Audio Transformers with Unsupervised Audio Mixtures
di: Tabassum, Afrina, et al.
Pubblicazione: (2024)
di: Tabassum, Afrina, et al.
Pubblicazione: (2024)
Exploring Performance-Complexity Trade-Offs in Sound Event Detection Models
di: Morocutti, Tobias, et al.
Pubblicazione: (2025)
di: Morocutti, Tobias, et al.
Pubblicazione: (2025)
Data-Efficient Low-Complexity Acoustic Scene Classification in the DCASE 2024 Challenge
di: Schmid, Florian, et al.
Pubblicazione: (2024)
di: Schmid, Florian, et al.
Pubblicazione: (2024)
Multi-bit Audio Watermarking
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025)
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025)
SNAC: Multi-Scale Neural Audio Codec
di: Siuzdak, Hubert, et al.
Pubblicazione: (2024)
di: Siuzdak, Hubert, et al.
Pubblicazione: (2024)
Device-Robust Acoustic Scene Classification via Impulse Response Augmentation
di: Morocutti, Tobias, et al.
Pubblicazione: (2023)
di: Morocutti, Tobias, et al.
Pubblicazione: (2023)
Multi-label Zero-Shot Audio Classification with Temporal Attention
di: Dogan, Duygu, et al.
Pubblicazione: (2024)
di: Dogan, Duygu, et al.
Pubblicazione: (2024)
"I am bad": Interpreting Stealthy, Universal and Robust Audio Jailbreaks in Audio-Language Models
di: Gupta, Isha, et al.
Pubblicazione: (2025)
di: Gupta, Isha, et al.
Pubblicazione: (2025)
Enhancing Audio-Language Models through Self-Supervised Post-Training with Text-Audio Pairs
di: Sinha, Anshuman, et al.
Pubblicazione: (2024)
di: Sinha, Anshuman, et al.
Pubblicazione: (2024)
Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities
di: Kong, Zhifeng, et al.
Pubblicazione: (2024)
di: Kong, Zhifeng, et al.
Pubblicazione: (2024)
tinyCLAP: Distilling Constrastive Language-Audio Pretrained Models
di: Paissan, Francesco, et al.
Pubblicazione: (2023)
di: Paissan, Francesco, et al.
Pubblicazione: (2023)
A2SB: Audio-to-Audio Schrodinger Bridges
di: Kong, Zhifeng, et al.
Pubblicazione: (2025)
di: Kong, Zhifeng, et al.
Pubblicazione: (2025)
Frame-Level Internal Tool Use for Temporal Grounding in Audio LMs
di: An, Joesph, et al.
Pubblicazione: (2026)
di: An, Joesph, et al.
Pubblicazione: (2026)
Learning Spatially-Aware Language and Audio Embeddings
di: Devnani, Bhavika, et al.
Pubblicazione: (2024)
di: Devnani, Bhavika, et al.
Pubblicazione: (2024)
Zero Shot Audio to Audio Emotion Transfer With Speaker Disentanglement
di: Dutta, Soumya, et al.
Pubblicazione: (2024)
di: Dutta, Soumya, et al.
Pubblicazione: (2024)
The Rarity of Musical Audio Signals Within the Space of Possible Audio Generation
di: Collins, Nick
Pubblicazione: (2024)
di: Collins, Nick
Pubblicazione: (2024)
Do Audio-Language Models Understand Linguistic Variations?
di: Selvakumar, Ramaneswaran, et al.
Pubblicazione: (2024)
di: Selvakumar, Ramaneswaran, et al.
Pubblicazione: (2024)
CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer
di: Takeuchi, Daiki, et al.
Pubblicazione: (2025)
di: Takeuchi, Daiki, et al.
Pubblicazione: (2025)
Audio Match Cutting: Finding and Creating Matching Audio Transitions in Movies and Videos
di: Fedorishin, Dennis, et al.
Pubblicazione: (2024)
di: Fedorishin, Dennis, et al.
Pubblicazione: (2024)
A Language Model With Million Context Length For Raw Audio
di: Verma, Prateek
Pubblicazione: (2022)
di: Verma, Prateek
Pubblicazione: (2022)
Unsupervised Composable Representations for Audio
di: Bindi, Giovanni, et al.
Pubblicazione: (2024)
di: Bindi, Giovanni, et al.
Pubblicazione: (2024)
Diffusion Models for Audio Restoration
di: Lemercier, Jean-Marie, et al.
Pubblicazione: (2024)
di: Lemercier, Jean-Marie, et al.
Pubblicazione: (2024)
Instabilities in Convnets for Raw Audio
di: Haider, Daniel, et al.
Pubblicazione: (2023)
di: Haider, Daniel, et al.
Pubblicazione: (2023)
Automatic Contextual Audio Denoising
di: Luong, Diep, et al.
Pubblicazione: (2026)
di: Luong, Diep, et al.
Pubblicazione: (2026)
Guiding Audio Editing with Audio Language Model
di: Lan, Zitong, et al.
Pubblicazione: (2025)
di: Lan, Zitong, et al.
Pubblicazione: (2025)
Can Synthetic Audio From Generative Foundation Models Assist Audio Recognition and Speech Modeling?
di: Feng, Tiantian, et al.
Pubblicazione: (2024)
di: Feng, Tiantian, et al.
Pubblicazione: (2024)
Aligning Audio Captions with Human Preferences
di: Hegde, Kartik, et al.
Pubblicazione: (2025)
di: Hegde, Kartik, et al.
Pubblicazione: (2025)
Audio Decoding by Inverse Problem Solving
di: T., Pedro J. Villasana, et al.
Pubblicazione: (2024)
di: T., Pedro J. Villasana, et al.
Pubblicazione: (2024)
Does Audio Deepfake Detection Generalize?
di: Müller, Nicolas M., et al.
Pubblicazione: (2022)
di: Müller, Nicolas M., et al.
Pubblicazione: (2022)
StethoLM: Audio Language Model for Cardiopulmonary Analysis Across Clinical Tasks
di: Wang, Yishan, et al.
Pubblicazione: (2026)
di: Wang, Yishan, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Estimated Audio-Caption Correspondences Improve Language-Based Audio Retrieval
di: Primus, Paul, et al.
Pubblicazione: (2024) -
Fusing Audio and Metadata Embeddings Improves Language-based Audio Retrieval
di: Primus, Paul, et al.
Pubblicazione: (2024) -
On Temporal Guidance and Iterative Refinement in Audio Source Separation
di: Morocutti, Tobias, et al.
Pubblicazione: (2025) -
Improving Audio Spectrogram Transformers for Sound Event Detection Through Multi-Stage Training
di: Schmid, Florian, et al.
Pubblicazione: (2024) -
Effective Pre-Training of Audio Transformers for Sound Event Detection
di: Schmid, Florian, et al.
Pubblicazione: (2024)