NatureLM-audio: an Audio-Language Foundation Model for Bioacoustics
Fuente:
arXiv
Salvato in:
| Autori principali: | Robinson, David, Miron, Marius, Hagiwara, Masato, Weck, Benno, Keen, Sara, Alizadeh, Milad, Narula, Gagan, Geist, Matthieu, Pietquin, Olivier |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Beyond the Baseband: Adaptive Multi-Band Encoding for Full-Spectrum Bioacoustics Classification
di: Sarkar, Eklavya, et al.
Pubblicazione: (2026)
di: Sarkar, Eklavya, et al.
Pubblicazione: (2026)
Biodenoising: Animal Vocalization Denoising without Access to Clean Data
di: Miron, Marius, et al.
Pubblicazione: (2024)
di: Miron, Marius, et al.
Pubblicazione: (2024)
BAGEL: Benchmarking Animal Knowledge Expertise in Language Models
di: Shen, Jiacheng, et al.
Pubblicazione: (2026)
di: Shen, Jiacheng, et al.
Pubblicazione: (2026)
Multi-layer attentive probing improves transfer of audio representations for bioacoustics
di: Miron, Marius, et al.
Pubblicazione: (2026)
di: Miron, Marius, et al.
Pubblicazione: (2026)
ISPA: Inter-Species Phonetic Alphabet for Transcribing Animal Sounds
di: Hagiwara, Masato, et al.
Pubblicazione: (2024)
di: Hagiwara, Masato, et al.
Pubblicazione: (2024)
Synthetic data enables context-aware bioacoustic sound event detection
di: Hoffman, Benjamin, et al.
Pubblicazione: (2025)
di: Hoffman, Benjamin, et al.
Pubblicazione: (2025)
The language of sound search: Examining User Queries in Audio Search Engines
di: Weck, Benno, et al.
Pubblicazione: (2024)
di: Weck, Benno, et al.
Pubblicazione: (2024)
WikiMuTe: A web-sourced dataset of semantic descriptions for music audio
di: Weck, Benno, et al.
Pubblicazione: (2023)
di: Weck, Benno, et al.
Pubblicazione: (2023)
Robust detection of overlapping bioacoustic sound events
di: Mahon, Louis, et al.
Pubblicazione: (2025)
di: Mahon, Louis, et al.
Pubblicazione: (2025)
AVEX: What Matters for Animal Vocalization Encoding
di: Miron, Marius, et al.
Pubblicazione: (2025)
di: Miron, Marius, et al.
Pubblicazione: (2025)
Audio-to-Image Bird Species Retrieval without Audio-Image Pairs via Text Distillation
di: Moummad, Ilyass, et al.
Pubblicazione: (2026)
di: Moummad, Ilyass, et al.
Pubblicazione: (2026)
WavLM model ensemble for audio deepfake detection
di: Combei, David, et al.
Pubblicazione: (2024)
di: Combei, David, et al.
Pubblicazione: (2024)
MuChoMusic: Evaluating Music Understanding in Multimodal Audio-Language Models
di: Weck, Benno, et al.
Pubblicazione: (2024)
di: Weck, Benno, et al.
Pubblicazione: (2024)
Foundation Models for Bioacoustics -- a Comparative Review
di: Schwinger, Raphael, et al.
Pubblicazione: (2025)
di: Schwinger, Raphael, et al.
Pubblicazione: (2025)
BioME: A Resource-Efficient Bioacoustic Foundational Model for IoT Applications
di: Guimarães, Heitor R., et al.
Pubblicazione: (2026)
di: Guimarães, Heitor R., et al.
Pubblicazione: (2026)
The Role of Large Language Models in Musicology: Are We Ready to Trust the Machines?
di: Ramoneda, Pedro, et al.
Pubblicazione: (2024)
di: Ramoneda, Pedro, et al.
Pubblicazione: (2024)
BirdSet: A Large-Scale Dataset for Audio Classification in Avian Bioacoustics
di: Rauch, Lukas, et al.
Pubblicazione: (2024)
di: Rauch, Lukas, et al.
Pubblicazione: (2024)
CrossMuSim: A Cross-Modal Framework for Music Similarity Retrieval with LLM-Powered Text Description Sourcing and Mining
di: Tsoi, Tristan, et al.
Pubblicazione: (2025)
di: Tsoi, Tristan, et al.
Pubblicazione: (2025)
The Search for Squawk: Agile Modeling in Bioacoustics
di: Dumoulin, Vincent, et al.
Pubblicazione: (2025)
di: Dumoulin, Vincent, et al.
Pubblicazione: (2025)
MiDashengLM: Efficient Audio Understanding with General Audio Captions
di: Dinkel, Heinrich, et al.
Pubblicazione: (2025)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2025)
AudioMorphix: Training-free audio editing with diffusion probabilistic models
di: Liang, Jinhua, et al.
Pubblicazione: (2025)
di: Liang, Jinhua, et al.
Pubblicazione: (2025)
MusicRL: Aligning Music Generation to Human Preferences
di: Cideron, Geoffrey, et al.
Pubblicazione: (2024)
di: Cideron, Geoffrey, et al.
Pubblicazione: (2024)
Audio Dialogues: Dialogues dataset for audio and music understanding
di: Goel, Arushi, et al.
Pubblicazione: (2024)
di: Goel, Arushi, et al.
Pubblicazione: (2024)
Crossing the Species Divide: Transfer Learning from Speech to Animal Sounds
di: Cauzinille, Jules, et al.
Pubblicazione: (2025)
di: Cauzinille, Jules, et al.
Pubblicazione: (2025)
audio2chart: End to End Audio Transcription into playable Guitar Hero charts
di: Tripodi, Riccardo
Pubblicazione: (2025)
di: Tripodi, Riccardo
Pubblicazione: (2025)
Audio Deepfake Detection with Self-Supervised WavLM and Multi-Fusion Attentive Classifier
di: Guo, Yinlin, et al.
Pubblicazione: (2023)
di: Guo, Yinlin, et al.
Pubblicazione: (2023)
FiPA-SR -- FiLM-Conditioned Perceptually Informed Audio Super-Resolution
di: Abreu, Wallace, et al.
Pubblicazione: (2026)
di: Abreu, Wallace, et al.
Pubblicazione: (2026)
Mind the Domain Gap: a Systematic Analysis on Bioacoustic Sound Event Detection
di: Liang, Jinhua, et al.
Pubblicazione: (2024)
di: Liang, Jinhua, et al.
Pubblicazione: (2024)
Towards Deep Active Learning in Avian Bioacoustics
di: Rauch, Lukas, et al.
Pubblicazione: (2024)
di: Rauch, Lukas, et al.
Pubblicazione: (2024)
Perch 2.0: The Bittern Lesson for Bioacoustics
di: van Merriënboer, Bart, et al.
Pubblicazione: (2025)
di: van Merriënboer, Bart, et al.
Pubblicazione: (2025)
Online incremental learning for audio classification using a pretrained audio model
di: Mulimani, Manjunath, et al.
Pubblicazione: (2025)
di: Mulimani, Manjunath, et al.
Pubblicazione: (2025)
AudioMAE++: learning better masked audio representations with SwiGLU FFNs
di: Yadav, Sarthak, et al.
Pubblicazione: (2025)
di: Yadav, Sarthak, et al.
Pubblicazione: (2025)
U-SAM: An audio language Model for Unified Speech, Audio, and Music Understanding
di: Wang, Ziqian, et al.
Pubblicazione: (2025)
di: Wang, Ziqian, et al.
Pubblicazione: (2025)
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
di: Yang, Dongchao, et al.
Pubblicazione: (2023)
di: Yang, Dongchao, et al.
Pubblicazione: (2023)
AudioRepInceptionNeXt: A lightweight single-stream architecture for efficient audio recognition
di: Lau, Kin Wai, et al.
Pubblicazione: (2024)
di: Lau, Kin Wai, et al.
Pubblicazione: (2024)
Robust Bioacoustic Detection via Richly Labelled Synthetic Soundscape Augmentation
di: Soltero, Kaspar, et al.
Pubblicazione: (2025)
di: Soltero, Kaspar, et al.
Pubblicazione: (2025)
MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
di: Gong, Yitian, et al.
Pubblicazione: (2026)
di: Gong, Yitian, et al.
Pubblicazione: (2026)
PicoAudio: Enabling Precise Timestamp and Frequency Controllability of Audio Events in Text-to-audio Generation
di: Xie, Zeyu, et al.
Pubblicazione: (2024)
di: Xie, Zeyu, et al.
Pubblicazione: (2024)
Scaling up masked audio encoder learning for general audio classification
di: Dinkel, Heinrich, et al.
Pubblicazione: (2024)
di: Dinkel, Heinrich, et al.
Pubblicazione: (2024)
Towards High-Fidelity and Controllable Bioacoustic Generation via Enhanced Diffusion Learning
di: Song, Tianyu, et al.
Pubblicazione: (2025)
di: Song, Tianyu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Beyond the Baseband: Adaptive Multi-Band Encoding for Full-Spectrum Bioacoustics Classification
di: Sarkar, Eklavya, et al.
Pubblicazione: (2026) -
Biodenoising: Animal Vocalization Denoising without Access to Clean Data
di: Miron, Marius, et al.
Pubblicazione: (2024) -
BAGEL: Benchmarking Animal Knowledge Expertise in Language Models
di: Shen, Jiacheng, et al.
Pubblicazione: (2026) -
Multi-layer attentive probing improves transfer of audio representations for bioacoustics
di: Miron, Marius, et al.
Pubblicazione: (2026) -
ISPA: Inter-Species Phonetic Alphabet for Transcribing Animal Sounds
di: Hagiwara, Masato, et al.
Pubblicazione: (2024)