Salvato in:
| Autori principali: | Lerbourg, Louis, Peyret, Paul, Linossier, Juliette, Malfante, Marielle |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2605.03412 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
NBM: an Open Dataset for the Acoustic Monitoring of Nocturnal Migratory Birds in Europe
di: Airale, Louis, et al.
Pubblicazione: (2024)
di: Airale, Louis, et al.
Pubblicazione: (2024)
Graph Embedding with Mel-spectrograms for Underwater Acoustic Target Recognition
di: Feng, Sheng, et al.
Pubblicazione: (2025)
di: Feng, Sheng, et al.
Pubblicazione: (2025)
Towards Explicit Acoustic Evidence Perception in Audio LLMs for Speech Deepfake Detection
di: Guo, Xiaoxuan, et al.
Pubblicazione: (2026)
di: Guo, Xiaoxuan, et al.
Pubblicazione: (2026)
No Free Lunch from Audio Pretraining in Bioacoustics: A Benchmark Study of Embeddings
di: Chen, Chenggang, et al.
Pubblicazione: (2025)
di: Chen, Chenggang, et al.
Pubblicazione: (2025)
AND: Audio Network Dissection for Interpreting Deep Acoustic Models
di: Wu, Tung-Yu, et al.
Pubblicazione: (2024)
di: Wu, Tung-Yu, et al.
Pubblicazione: (2024)
AAT: Adapting Audio Transformer for Various Acoustics Recognition Tasks
di: Liang, Yun, et al.
Pubblicazione: (2024)
di: Liang, Yun, et al.
Pubblicazione: (2024)
EnCLAP: Combining Neural Audio Codec and Audio-Text Joint Embedding for Automated Audio Captioning
di: Kim, Jaeyeon, et al.
Pubblicazione: (2024)
di: Kim, Jaeyeon, et al.
Pubblicazione: (2024)
MAEB: Massive Audio Embedding Benchmark
di: Assadi, Adnan El, et al.
Pubblicazione: (2026)
di: Assadi, Adnan El, et al.
Pubblicazione: (2026)
Embedding Alignment in Code Generation for Audio
di: Kouteili, Sam, et al.
Pubblicazione: (2025)
di: Kouteili, Sam, et al.
Pubblicazione: (2025)
DEAF: A Benchmark for Diagnostic Evaluation of Acoustic Faithfulness in Audio Language Models
di: Xiong, Jiaqi, et al.
Pubblicazione: (2026)
di: Xiong, Jiaqi, et al.
Pubblicazione: (2026)
Are Audio-Language Models Listening? Audio-Specialist Heads for Adaptive Audio Steering
di: Glazer, Neta, et al.
Pubblicazione: (2026)
di: Glazer, Neta, et al.
Pubblicazione: (2026)
Quantum-Inspired Genetic Algorithm for Robust Source Separation in Smart City Acoustics
di: Quan, Minh K., et al.
Pubblicazione: (2025)
di: Quan, Minh K., et al.
Pubblicazione: (2025)
Eureka-Audio: Triggering Audio Intelligence in Compact Language Models
di: Zhang, Dan, et al.
Pubblicazione: (2026)
di: Zhang, Dan, et al.
Pubblicazione: (2026)
AudioMoG: Guiding Audio Generation with Mixture-of-Guidance
di: Wang, Junyou, et al.
Pubblicazione: (2025)
di: Wang, Junyou, et al.
Pubblicazione: (2025)
The Sonar Moment: Benchmarking Audio-Language Models in Audio Geo-Localization
di: Zhang, Ruixing, et al.
Pubblicazione: (2026)
di: Zhang, Ruixing, et al.
Pubblicazione: (2026)
LoSATok: Low-dimensional Semantic-Acoustic Tokenizer for Cross-Domain Audio Understanding and Generation
di: Zhang, Zhisheng, et al.
Pubblicazione: (2026)
di: Zhang, Zhisheng, et al.
Pubblicazione: (2026)
MeanAudio: Fast and Faithful Text-to-Audio Generation with Mean Flows
di: Li, Xiquan, et al.
Pubblicazione: (2025)
di: Li, Xiquan, et al.
Pubblicazione: (2025)
AudioMotionBench: Evaluating Auditory Motion Perception in Audio LLMs
di: Sun, Zhe, et al.
Pubblicazione: (2025)
di: Sun, Zhe, et al.
Pubblicazione: (2025)
Evaluating Hallucinations in Audio-Visual Multimodal LLMs with Spoken Queries under Diverse Acoustic Conditions
di: Park, Hansol, et al.
Pubblicazione: (2025)
di: Park, Hansol, et al.
Pubblicazione: (2025)
The Computation of Generalized Embeddings for Underwater Acoustic Target Recognition using Contrastive Learning
di: Hummel, Hilde I., et al.
Pubblicazione: (2025)
di: Hummel, Hilde I., et al.
Pubblicazione: (2025)
Stable Audio 3
di: Evans, Zach, et al.
Pubblicazione: (2026)
di: Evans, Zach, et al.
Pubblicazione: (2026)
Tuning In: Analysis of Audio Classifier Performance in Clinical Settings with Limited Data
di: Mahdi, Hamza, et al.
Pubblicazione: (2024)
di: Mahdi, Hamza, et al.
Pubblicazione: (2024)
AudioSAE: Towards Understanding of Audio-Processing Models with Sparse AutoEncoders
di: Aparin, Georgii, et al.
Pubblicazione: (2026)
di: Aparin, Georgii, et al.
Pubblicazione: (2026)
Audio-Maestro: Enhancing Large Audio-Language Models with Tool-Augmented Reasoning
di: Lee, Kuan-Yi, et al.
Pubblicazione: (2025)
di: Lee, Kuan-Yi, et al.
Pubblicazione: (2025)
Do Joint Language-Audio Embeddings Encode Perceptual Timbre Semantics?
di: Deng, Qixin, et al.
Pubblicazione: (2025)
di: Deng, Qixin, et al.
Pubblicazione: (2025)
Towards Leveraging Contrastively Pretrained Neural Audio Embeddings for Recommender Tasks
di: Grötschla, Florian, et al.
Pubblicazione: (2024)
di: Grötschla, Florian, et al.
Pubblicazione: (2024)
AudioCapBench: Quick Evaluation on Audio Captioning across Sound, Music, and Speech
di: Qiu, Jielin, et al.
Pubblicazione: (2026)
di: Qiu, Jielin, et al.
Pubblicazione: (2026)
AudioGuard: Toward Comprehensive Audio Safety Protection Across Diverse Threat Models
di: Kang, Mintong, et al.
Pubblicazione: (2026)
di: Kang, Mintong, et al.
Pubblicazione: (2026)
HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models
di: Zhao, Feiyu, et al.
Pubblicazione: (2026)
di: Zhao, Feiyu, et al.
Pubblicazione: (2026)
Audio-Guided Dynamic Modality Fusion with Stereo-Aware Attention for Audio-Visual Navigation
di: Li, Jia, et al.
Pubblicazione: (2025)
di: Li, Jia, et al.
Pubblicazione: (2025)
Explaining Deep Learning Embeddings for Speech Emotion Recognition by Predicting Interpretable Acoustic Features
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
MOSS-Audio Technical Report
di: Yang, Chen, et al.
Pubblicazione: (2026)
di: Yang, Chen, et al.
Pubblicazione: (2026)
CTC-aligned Audio-Text Embedding for Streaming Open-vocabulary Keyword Spotting
di: Jin, Sichen, et al.
Pubblicazione: (2024)
di: Jin, Sichen, et al.
Pubblicazione: (2024)
Interpretable All-Type Audio Deepfake Detection with Audio LLMs via Frequency-Time Reinforcement Learning
di: Xie, Yuankun, et al.
Pubblicazione: (2026)
di: Xie, Yuankun, et al.
Pubblicazione: (2026)
Codec-Robust Attacks on Audio LLMs
di: Roh, Jaechul, et al.
Pubblicazione: (2026)
di: Roh, Jaechul, et al.
Pubblicazione: (2026)
Exploring Musical Roots: Applying Audio Embeddings to Empower Influence Attribution for a Generative Music Model
di: Barnett, Julia, et al.
Pubblicazione: (2024)
di: Barnett, Julia, et al.
Pubblicazione: (2024)
PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation
di: Xie, Tianxin, et al.
Pubblicazione: (2025)
di: Xie, Tianxin, et al.
Pubblicazione: (2025)
WoW-Bench: Evaluating Fine-Grained Acoustic Perception in Audio-Language Models via Marine Mammal Vocalizations
di: Kim, Jaeyeon, et al.
Pubblicazione: (2025)
di: Kim, Jaeyeon, et al.
Pubblicazione: (2025)
VidAudio-Bench: Benchmarking V2A and VT2A Generation across Four Audio Categories
di: Zhang, Qian, et al.
Pubblicazione: (2026)
di: Zhang, Qian, et al.
Pubblicazione: (2026)
Towards Fine-grained Temporal Perception: Post-Training Large Audio-Language Models with Audio-Side Time Prompt
di: Shi, Yanfeng, et al.
Pubblicazione: (2026)
di: Shi, Yanfeng, et al.
Pubblicazione: (2026)
Documenti analoghi
-
NBM: an Open Dataset for the Acoustic Monitoring of Nocturnal Migratory Birds in Europe
di: Airale, Louis, et al.
Pubblicazione: (2024) -
Graph Embedding with Mel-spectrograms for Underwater Acoustic Target Recognition
di: Feng, Sheng, et al.
Pubblicazione: (2025) -
Towards Explicit Acoustic Evidence Perception in Audio LLMs for Speech Deepfake Detection
di: Guo, Xiaoxuan, et al.
Pubblicazione: (2026) -
No Free Lunch from Audio Pretraining in Bioacoustics: A Benchmark Study of Embeddings
di: Chen, Chenggang, et al.
Pubblicazione: (2025) -
AND: Audio Network Dissection for Interpreting Deep Acoustic Models
di: Wu, Tung-Yu, et al.
Pubblicazione: (2024)