An Evaluation of Interleaved Instruction Tuning on Semantic Reasoning Performance in an Audio MLLM
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Jiawei, Çoban, Enis Berk, Schevchenko, Zarina, Tang, Hao, Zhu, Zhigang, Mandel, Michael I, Devaney, Johanna |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
What do MLLMs hear? Examining reasoning with text and sound components in Multimodal Large Language Models
par: Çoban, Enis Berk, et autres
Publié: (2024)
par: Çoban, Enis Berk, et autres
Publié: (2024)
pyAMPACT: A Score-Audio Alignment Toolkit for Performance Data Estimation and Multi-modal Processing
par: Devaney, Johanna, et autres
Publié: (2024)
par: Devaney, Johanna, et autres
Publié: (2024)
The Interspeech 2026 Audio Reasoning Challenge: Evaluating Reasoning Process Quality for Audio Reasoning Models and Agents
par: Ma, Ziyang, et autres
Publié: (2026)
par: Ma, Ziyang, et autres
Publié: (2026)
Listen, Pause, and Reason: Toward Perception-Grounded Hybrid Reasoning for Audio Understanding
par: Wang, Jieyi, et autres
Publié: (2026)
par: Wang, Jieyi, et autres
Publié: (2026)
AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues
par: Zhou, Dingkun, et autres
Publié: (2025)
par: Zhou, Dingkun, et autres
Publié: (2025)
Manipulated Regions Localization For Partially Deepfake Audio: A Survey
par: He, Jiayi, et autres
Publié: (2025)
par: He, Jiayi, et autres
Publié: (2025)
Generative Audio Extension and Morphing
par: Seetharaman, Prem, et autres
Publié: (2026)
par: Seetharaman, Prem, et autres
Publié: (2026)
MixFake: Benchmarking and Enhancing Audio Deepfake Detection in Diverse Real-world Mixed Audio
par: Li, Qingcao, et autres
Publié: (2026)
par: Li, Qingcao, et autres
Publié: (2026)
SarcasmMiner: A Dual-Track Post-Training Framework for Robust Audio-Visual Sarcasm Reasoning
par: Li, Zhu, et autres
Publié: (2026)
par: Li, Zhu, et autres
Publié: (2026)
MTAVG-Bench: A Diagnostic Benchmark for Multi-Talker Dialogue-Centric Audio-Video Generation
par: Zhou, Yang-Hao, et autres
Publié: (2026)
par: Zhou, Yang-Hao, et autres
Publié: (2026)
Audio-Visual Separation with Hierarchical Fusion and Representation Alignment
par: Hu, Han, et autres
Publié: (2025)
par: Hu, Han, et autres
Publié: (2025)
MusiCRS: Benchmarking Audio-Centric Conversational Recommendation
par: Surana, Rohan, et autres
Publié: (2025)
par: Surana, Rohan, et autres
Publié: (2025)
STCTS: Generative Semantic Compression for Ultra-Low Bitrate Speech via Explicit Text-Prosody-Timbre Decomposition
par: Wang, Siyu, et autres
Publié: (2025)
par: Wang, Siyu, et autres
Publié: (2025)
Video Echoed in Music: Semantic, Temporal, and Rhythmic Alignment for Video-to-Music Generation
par: Tong, Xinyi, et autres
Publié: (2025)
par: Tong, Xinyi, et autres
Publié: (2025)
Delayed Commitment for Representation Readiness in Stage-wise Audio-Visual Learning
par: Xu, Xinmeng, et autres
Publié: (2026)
par: Xu, Xinmeng, et autres
Publié: (2026)
DreamFoley: Scalable VLMs for High-Fidelity Video-to-Audio Generation
par: Li, Fu, et autres
Publié: (2025)
par: Li, Fu, et autres
Publié: (2025)
Building Audio-Visual Digital Twins with Smartphones
par: Lan, Zitong, et autres
Publié: (2025)
par: Lan, Zitong, et autres
Publié: (2025)
MMED: A Multimodal Micro-Expression Dataset based on Audio-Visual Fusion
par: Wang, Junbo, et autres
Publié: (2025)
par: Wang, Junbo, et autres
Publié: (2025)
SpotSound: Enhancing Large Audio-Language Models with Fine-Grained Temporal Grounding
par: Sun, Luoyi, et autres
Publié: (2026)
par: Sun, Luoyi, et autres
Publié: (2026)
Enkidu: Universal Frequential Perturbation for Real-Time Audio Privacy Protection against Voice Deepfakes
par: Feng, Zhou, et autres
Publié: (2025)
par: Feng, Zhou, et autres
Publié: (2025)
XGC-AVis: Towards Audio-Visual Content Understanding with a Multi-Agent Collaborative System
par: Cao, Yuqin, et autres
Publié: (2025)
par: Cao, Yuqin, et autres
Publié: (2025)
Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities
par: Sudarsanam, Parthasaarathy, et autres
Publié: (2025)
par: Sudarsanam, Parthasaarathy, et autres
Publié: (2025)
MIDI-LLaMA: An Instruction-Following Multimodal LLM for Symbolic Music Understanding
par: Yang, Meng, et autres
Publié: (2026)
par: Yang, Meng, et autres
Publié: (2026)
MoLEx: Mixture of LoRA Experts in Speech Self-Supervised Models for Audio Deepfake Detection
par: Pan, Zihan, et autres
Publié: (2025)
par: Pan, Zihan, et autres
Publié: (2025)
3MDiT: Unified Tri-Modal Diffusion Transformer for Text-Driven Synchronized Audio-Video Generation
par: Li, Yaoru, et autres
Publié: (2025)
par: Li, Yaoru, et autres
Publié: (2025)
MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions
par: Li, Junjie, et autres
Publié: (2025)
par: Li, Junjie, et autres
Publié: (2025)
VERSA: A Versatile Evaluation Toolkit for Speech, Audio, and Music
par: Shi, Jiatong, et autres
Publié: (2024)
par: Shi, Jiatong, et autres
Publié: (2024)
Voice Evaluation of Reasoning Ability: Diagnosing the Modality-Induced Performance Gap
par: Lin, Yueqian, et autres
Publié: (2025)
par: Lin, Yueqian, et autres
Publié: (2025)
Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model
par: Ren, Yong, et autres
Publié: (2025)
par: Ren, Yong, et autres
Publié: (2025)
STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment
par: Ren, Yong, et autres
Publié: (2024)
par: Ren, Yong, et autres
Publié: (2024)
Semantically consistent Video-to-Audio Generation using Multimodal Language Large Model
par: Chen, Gehui, et autres
Publié: (2024)
par: Chen, Gehui, et autres
Publié: (2024)
AHA: Aligning Large Audio-Language Models for Reasoning Hallucinations via Counterfactual Hard Negatives
par: Chen, Yanxi, et autres
Publié: (2025)
par: Chen, Yanxi, et autres
Publié: (2025)
ZO-ASR: Zeroth-Order Fine-Tuning of Speech Foundation Models without Back-Propagation
par: Peng, Yuezhang, et autres
Publié: (2025)
par: Peng, Yuezhang, et autres
Publié: (2025)
HDA-SELD: Hierarchical Cross-Modal Distillation with Multi-Level Data Augmentation for Low-Resource Audio-Visual Sound Event Localization and Detection
par: Wang, Qing, et autres
Publié: (2025)
par: Wang, Qing, et autres
Publié: (2025)
Resource-Efficient Reference-Free Evaluation of Audio Captions
par: Mahfuz, Rehana, et autres
Publié: (2024)
par: Mahfuz, Rehana, et autres
Publié: (2024)
MusicSem: A Semantically Rich Language--Audio Dataset of Natural Music Descriptions
par: Salganik, Rebecca, et autres
Publié: (2026)
par: Salganik, Rebecca, et autres
Publié: (2026)
Coherent Audio-Visual Editing via Conditional Audio Generation Following Video Edits
par: Ishii, Masato, et autres
Publié: (2025)
par: Ishii, Masato, et autres
Publié: (2025)
Trusted Fake Audio Detection Based on Dirichlet Distribution
par: Ding, Chi, et autres
Publié: (2025)
par: Ding, Chi, et autres
Publié: (2025)
RenCon 2025: Revival of the Expressive Performance Rendering Competition
par: Zhang, Huan, et autres
Publié: (2026)
par: Zhang, Huan, et autres
Publié: (2026)
Variable-Length Audio Fingerprinting
par: Chen, Hongjie, et autres
Publié: (2026)
par: Chen, Hongjie, et autres
Publié: (2026)
Documents similaires
-
What do MLLMs hear? Examining reasoning with text and sound components in Multimodal Large Language Models
par: Çoban, Enis Berk, et autres
Publié: (2024) -
pyAMPACT: A Score-Audio Alignment Toolkit for Performance Data Estimation and Multi-modal Processing
par: Devaney, Johanna, et autres
Publié: (2024) -
The Interspeech 2026 Audio Reasoning Challenge: Evaluating Reasoning Process Quality for Audio Reasoning Models and Agents
par: Ma, Ziyang, et autres
Publié: (2026) -
Listen, Pause, and Reason: Toward Perception-Grounded Hybrid Reasoning for Audio Understanding
par: Wang, Jieyi, et autres
Publié: (2026) -
AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues
par: Zhou, Dingkun, et autres
Publié: (2025)