Audio-to-Image Bird Species Retrieval without Audio-Image Pairs via Text Distillation
Fuente:
arXiv
Salvato in:
| Autori principali: | Moummad, Ilyass, Miron, Marius, Rauch, Lukas, Robinson, David, Joly, Alexis, Pietquin, Olivier, Chemla, Emmanuel, Geist, Matthieu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Compact Hypercube Embeddings for Fast Text-based Wildlife Observation Retrieval
di: Moummad, Ilyass, et al.
Pubblicazione: (2026)
di: Moummad, Ilyass, et al.
Pubblicazione: (2026)
Can Masked Autoencoders Also Listen to Birds?
di: Rauch, Lukas, et al.
Pubblicazione: (2025)
di: Rauch, Lukas, et al.
Pubblicazione: (2025)
NatureLM-audio: an Audio-Language Foundation Model for Bioacoustics
di: Robinson, David, et al.
Pubblicazione: (2024)
di: Robinson, David, et al.
Pubblicazione: (2024)
Unmute the Patch Tokens: Rethinking Probing in Multi-Label Audio Classification
di: Rauch, Lukas, et al.
Pubblicazione: (2025)
di: Rauch, Lukas, et al.
Pubblicazione: (2025)
MUKA: Multi Kernel Audio Adaptation Of Audio-Language Models
di: Bensaid, Reda, et al.
Pubblicazione: (2026)
di: Bensaid, Reda, et al.
Pubblicazione: (2026)
Self-Supervised Learning for Few-Shot Bird Sound Classification
di: Moummad, Ilyass, et al.
Pubblicazione: (2023)
di: Moummad, Ilyass, et al.
Pubblicazione: (2023)
Domain-Invariant Representation Learning of Bird Sounds
di: Moummad, Ilyass, et al.
Pubblicazione: (2024)
di: Moummad, Ilyass, et al.
Pubblicazione: (2024)
Hashing-Baseline: Rethinking Hashing in the Age of Pretrained Models
di: Moummad, Ilyass, et al.
Pubblicazione: (2025)
di: Moummad, Ilyass, et al.
Pubblicazione: (2025)
Regularized Contrastive Pre-training for Few-shot Bioacoustic Sound Detection
di: Moummad, Ilyass, et al.
Pubblicazione: (2023)
di: Moummad, Ilyass, et al.
Pubblicazione: (2023)
Refining Knowledge Transfer on Audio-Image Temporal Agreement for Audio-Text Cross Retrieval
di: Tsubaki, Shunsuke, et al.
Pubblicazione: (2024)
di: Tsubaki, Shunsuke, et al.
Pubblicazione: (2024)
Biodenoising: Animal Vocalization Denoising without Access to Clean Data
di: Miron, Marius, et al.
Pubblicazione: (2024)
di: Miron, Marius, et al.
Pubblicazione: (2024)
Multi-layer attentive probing improves transfer of audio representations for bioacoustics
di: Miron, Marius, et al.
Pubblicazione: (2026)
di: Miron, Marius, et al.
Pubblicazione: (2026)
AVEX: What Matters for Animal Vocalization Encoding
di: Miron, Marius, et al.
Pubblicazione: (2025)
di: Miron, Marius, et al.
Pubblicazione: (2025)
Acoustic identification of individual animals with hierarchical contrastive learning
di: Nolasco, Ines, et al.
Pubblicazione: (2024)
di: Nolasco, Ines, et al.
Pubblicazione: (2024)
Image Hashing via Cross-View Code Alignment in the Age of Foundation Models
di: Moummad, Ilyass, et al.
Pubblicazione: (2025)
di: Moummad, Ilyass, et al.
Pubblicazione: (2025)
Self-Supervised Learning as Discrete Communication
di: Zaher, Kawtar, et al.
Pubblicazione: (2026)
di: Zaher, Kawtar, et al.
Pubblicazione: (2026)
Omni-Embed-Audio: Leveraging Multimodal LLMs for Robust Audio-Text Retrieval
di: Yoo, HaeJun, et al.
Pubblicazione: (2026)
di: Yoo, HaeJun, et al.
Pubblicazione: (2026)
BirdSet: A Large-Scale Dataset for Audio Classification in Avian Bioacoustics
di: Rauch, Lukas, et al.
Pubblicazione: (2024)
di: Rauch, Lukas, et al.
Pubblicazione: (2024)
Scaling Audio-Text Retrieval with Multimodal Large Language Models
di: Xu, Jilan, et al.
Pubblicazione: (2026)
di: Xu, Jilan, et al.
Pubblicazione: (2026)
Crossing the Species Divide: Transfer Learning from Speech to Animal Sounds
di: Cauzinille, Jules, et al.
Pubblicazione: (2025)
di: Cauzinille, Jules, et al.
Pubblicazione: (2025)
Mixture of Mixups for Multi-label Classification of Rare Anuran Sounds
di: Moummad, Ilyass, et al.
Pubblicazione: (2024)
di: Moummad, Ilyass, et al.
Pubblicazione: (2024)
ASGIR: Audio Spectrogram Transformer Guided Classification And Information Retrieval For Birds
di: Chaudhuri, Yashwardhan, et al.
Pubblicazione: (2024)
di: Chaudhuri, Yashwardhan, et al.
Pubblicazione: (2024)
AudioRAG+: Feedback-driven Retrieval-augmented Audio Generation with Large Audio Language Models
di: Zhao, Junqi, et al.
Pubblicazione: (2025)
di: Zhao, Junqi, et al.
Pubblicazione: (2025)
ATIR: Towards Audio-Text Interleaved Contextual Retrieval
di: Zhao, Tong, et al.
Pubblicazione: (2026)
di: Zhao, Tong, et al.
Pubblicazione: (2026)
Beyond the Baseband: Adaptive Multi-Band Encoding for Full-Spectrum Bioacoustics Classification
di: Sarkar, Eklavya, et al.
Pubblicazione: (2026)
di: Sarkar, Eklavya, et al.
Pubblicazione: (2026)
Enhancing Audio-Language Models through Self-Supervised Post-Training with Text-Audio Pairs
di: Sinha, Anshuman, et al.
Pubblicazione: (2024)
di: Sinha, Anshuman, et al.
Pubblicazione: (2024)
Retrieval-Augmented Text-to-Audio Generation
di: Yuan, Yi, et al.
Pubblicazione: (2023)
di: Yuan, Yi, et al.
Pubblicazione: (2023)
UniAudio 2.0: A Unified Audio Language Model with Text-Aligned Factorized Audio Tokenization
di: Yang, Dongchao, et al.
Pubblicazione: (2026)
di: Yang, Dongchao, et al.
Pubblicazione: (2026)
Bridging Language Gaps in Audio-Text Retrieval
di: Yan, Zhiyong, et al.
Pubblicazione: (2024)
di: Yan, Zhiyong, et al.
Pubblicazione: (2024)
Virtual Consistency for Audio Editing
di: Cervera, Matthieu, et al.
Pubblicazione: (2025)
di: Cervera, Matthieu, et al.
Pubblicazione: (2025)
MoEScore: Mixture-of-Experts-Based Text-Audio Relevance Score Prediction for Text-to-Audio System Evaluation
di: Sun, Bochao, et al.
Pubblicazione: (2026)
di: Sun, Bochao, et al.
Pubblicazione: (2026)
Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text
di: Mei, Jiahao, et al.
Pubblicazione: (2026)
di: Mei, Jiahao, et al.
Pubblicazione: (2026)
MeanAudio: Fast and Faithful Text-to-Audio Generation with Mean Flows
di: Li, Xiquan, et al.
Pubblicazione: (2025)
di: Li, Xiquan, et al.
Pubblicazione: (2025)
Causal Tracing of Audio-Text Fusion in Large Audio Language Models
di: Chen, Wei-Chih, et al.
Pubblicazione: (2026)
di: Chen, Wei-Chih, et al.
Pubblicazione: (2026)
Dissecting Temporal Understanding in Text-to-Audio Retrieval
di: Oncescu, Andreea-Maria, et al.
Pubblicazione: (2024)
di: Oncescu, Andreea-Maria, et al.
Pubblicazione: (2024)
Robust Audio-Text Retrieval via Cross-Modal Attention and Hybrid Loss
di: Liu, Meizhu, et al.
Pubblicazione: (2026)
di: Liu, Meizhu, et al.
Pubblicazione: (2026)
Exploring Meta Information for Audio-based Zero-shot Bird Classification
di: Gebhard, Alexander, et al.
Pubblicazione: (2023)
di: Gebhard, Alexander, et al.
Pubblicazione: (2023)
Synthetic data enables context-aware bioacoustic sound event detection
di: Hoffman, Benjamin, et al.
Pubblicazione: (2025)
di: Hoffman, Benjamin, et al.
Pubblicazione: (2025)
AudioLCM: Text-to-Audio Generation with Latent Consistency Models
di: Liu, Huadai, et al.
Pubblicazione: (2024)
di: Liu, Huadai, et al.
Pubblicazione: (2024)
Resonate: Reinforcing Text-to-Audio Generation via Online Feedback from Large Audio Language Models
di: Li, Xiquan, et al.
Pubblicazione: (2026)
di: Li, Xiquan, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Compact Hypercube Embeddings for Fast Text-based Wildlife Observation Retrieval
di: Moummad, Ilyass, et al.
Pubblicazione: (2026) -
Can Masked Autoencoders Also Listen to Birds?
di: Rauch, Lukas, et al.
Pubblicazione: (2025) -
NatureLM-audio: an Audio-Language Foundation Model for Bioacoustics
di: Robinson, David, et al.
Pubblicazione: (2024) -
Unmute the Patch Tokens: Rethinking Probing in Multi-Label Audio Classification
di: Rauch, Lukas, et al.
Pubblicazione: (2025) -
MUKA: Multi Kernel Audio Adaptation Of Audio-Language Models
di: Bensaid, Reda, et al.
Pubblicazione: (2026)