EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Xing, Zhenghao, Hu, Xiaowei, Fu, Chi-Wing, Wang, Wenhai, Dai, Jifeng, Heng, Pheng-Ann |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Survey of Audio Reasoning in Multimodal Foundation Models
di: Guo, Zhihan, et al.
Pubblicazione: (2026)
di: Guo, Zhihan, et al.
Pubblicazione: (2026)
Interpretable Audio Editing Evaluation via Chain-of-Thought Difference-Commonality Reasoning with Multimodal LLMs
di: Jia, Yuhang, et al.
Pubblicazione: (2025)
di: Jia, Yuhang, et al.
Pubblicazione: (2025)
EchoFree: Towards Ultra Lightweight and Efficient Neural Acoustic Echo Cancellation
di: Li, Xingchen, et al.
Pubblicazione: (2025)
di: Li, Xingchen, et al.
Pubblicazione: (2025)
Audio-Agent: Leveraging LLMs For Audio Generation, Editing and Composition
di: Wang, Zixuan, et al.
Pubblicazione: (2024)
di: Wang, Zixuan, et al.
Pubblicazione: (2024)
Towards Multimodal Query-Based Spatial Audio Source Extraction
di: Yu, Chenxin, et al.
Pubblicazione: (2025)
di: Yu, Chenxin, et al.
Pubblicazione: (2025)
Audio Atlas: Visualizing and Exploring Audio Datasets
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2024)
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2024)
Audio-Cogito: Towards Deep Audio Reasoning in Large Audio Language Models
di: Li, Longhao, et al.
Pubblicazione: (2026)
di: Li, Longhao, et al.
Pubblicazione: (2026)
Audio-Visual Speech Enhancement for Spatial Audio - Spatial-VisualVoice and the MAVE Database
di: Yaffe, Danielle, et al.
Pubblicazione: (2025)
di: Yaffe, Danielle, et al.
Pubblicazione: (2025)
From Contrast to Commonality: Audio Commonality Captioning for Enhanced Audio-Text Cross-modal Understanding in Multimodal LLMs
di: Jia, Yuhang, et al.
Pubblicazione: (2025)
di: Jia, Yuhang, et al.
Pubblicazione: (2025)
Evaluating Hallucinations in Audio-Visual Multimodal LLMs with Spoken Queries under Diverse Acoustic Conditions
di: Park, Hansol, et al.
Pubblicazione: (2025)
di: Park, Hansol, et al.
Pubblicazione: (2025)
Probing Cross-modal Information Hubs in Audio-Visual LLMs
di: Jung, Jihoo, et al.
Pubblicazione: (2026)
di: Jung, Jihoo, et al.
Pubblicazione: (2026)
Multimodal Assessment of Speech Impairment in ALS Using Audio-Visual and Machine Learning Approaches
di: Pierotti, Francesco, et al.
Pubblicazione: (2025)
di: Pierotti, Francesco, et al.
Pubblicazione: (2025)
AudioLog: LLMs-Powered Long Audio Logging with Hybrid Token-Semantic Contrastive Learning
di: Bai, Jisheng, et al.
Pubblicazione: (2023)
di: Bai, Jisheng, et al.
Pubblicazione: (2023)
Audio Entailment: Assessing Deductive Reasoning for Audio Understanding
di: Deshmukh, Soham, et al.
Pubblicazione: (2024)
di: Deshmukh, Soham, et al.
Pubblicazione: (2024)
Multimodal Emotion Recognition from Raw Audio with Sinc-convolution
di: Zhang, Xiaohui, et al.
Pubblicazione: (2024)
di: Zhang, Xiaohui, et al.
Pubblicazione: (2024)
SAM Audio Judge: A Unified Multimodal Framework for Perceptual Evaluation of Audio Separation
di: Wang, Helin, et al.
Pubblicazione: (2026)
di: Wang, Helin, et al.
Pubblicazione: (2026)
Interpreting the Role of Visemes in Audio-Visual Speech Recognition
di: Papadopoulos, Aristeidis, et al.
Pubblicazione: (2025)
di: Papadopoulos, Aristeidis, et al.
Pubblicazione: (2025)
Audio-Visual Approach For Multimodal Concurrent Speaker Detection
di: Eliav, Amit, et al.
Pubblicazione: (2024)
di: Eliav, Amit, et al.
Pubblicazione: (2024)
Step-Audio-R1.5 Technical Report
di: Zhang, Yuxin, et al.
Pubblicazione: (2026)
di: Zhang, Yuxin, et al.
Pubblicazione: (2026)
AudioRAG: A Challenging Benchmark for Audio Reasoning and Information Retrieval
di: Lin, Jingru, et al.
Pubblicazione: (2026)
di: Lin, Jingru, et al.
Pubblicazione: (2026)
Uncovering the Visual Contribution in Audio-Visual Speech Recognition
di: Lin, Zhaofeng, et al.
Pubblicazione: (2024)
di: Lin, Zhaofeng, et al.
Pubblicazione: (2024)
Multi-View Based Audio Visual Target Speaker Extraction
di: Yang, Peijun, et al.
Pubblicazione: (2026)
di: Yang, Peijun, et al.
Pubblicazione: (2026)
AudioGenie-Reasoner: A Training-Free Multi-Agent Framework for Coarse-to-Fine Audio Deep Reasoning
di: Rong, Yan, et al.
Pubblicazione: (2025)
di: Rong, Yan, et al.
Pubblicazione: (2025)
Leveraging Mamba with Full-Face Vision for Audio-Visual Speech Enhancement
di: Chao, Rong, et al.
Pubblicazione: (2025)
di: Chao, Rong, et al.
Pubblicazione: (2025)
Audio-Visual Feature Synchronization for Robust Speech Enhancement in Hearing Aids
di: Saleem, Nasir, et al.
Pubblicazione: (2025)
di: Saleem, Nasir, et al.
Pubblicazione: (2025)
Multimodal Representation Loss Between Timed Text and Audio for Regularized Speech Separation
di: Hsieh, Tsun-An, et al.
Pubblicazione: (2024)
di: Hsieh, Tsun-An, et al.
Pubblicazione: (2024)
LLM-Guided Reinforcement Learning for Audio-Visual Speech Enhancement
di: Chen, Chih-Ning, et al.
Pubblicazione: (2026)
di: Chen, Chih-Ning, et al.
Pubblicazione: (2026)
Measuring Audio's Impact on Correctness: Audio-Contribution-Aware Post-Training of Large Audio Language Models
di: He, Haolin, et al.
Pubblicazione: (2025)
di: He, Haolin, et al.
Pubblicazione: (2025)
FlashAudio: Rectified Flows for Fast and High-Fidelity Text-to-Audio Generation
di: Liu, Huadai, et al.
Pubblicazione: (2024)
di: Liu, Huadai, et al.
Pubblicazione: (2024)
Seeing the Context: Rich Visual Context-Aware Speech Recognition via Multimodal Reasoning
di: Tian, Wenjie, et al.
Pubblicazione: (2026)
di: Tian, Wenjie, et al.
Pubblicazione: (2026)
Beyond Classification: Towards Speech Emotion Reasoning with Multitask AudioLLMs
di: Zhang, Wenyu, et al.
Pubblicazione: (2025)
di: Zhang, Wenyu, et al.
Pubblicazione: (2025)
Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Model
di: Ma, Ziyang, et al.
Pubblicazione: (2025)
di: Ma, Ziyang, et al.
Pubblicazione: (2025)
Online Audio-Visual Autoregressive Speaker Extraction
di: Pan, Zexu, et al.
Pubblicazione: (2025)
di: Pan, Zexu, et al.
Pubblicazione: (2025)
Tracking Listener Attention: Gaze-Guided Audio-Visual Speech Enhancement Framework
di: Yang, Hsiang-Cheng, et al.
Pubblicazione: (2026)
di: Yang, Hsiang-Cheng, et al.
Pubblicazione: (2026)
Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation
di: Zhang, Jing-Xuan, et al.
Pubblicazione: (2025)
di: Zhang, Jing-Xuan, et al.
Pubblicazione: (2025)
Cross-Modal Bottleneck Fusion For Noise Robust Audio-Visual Speech Recognition
di: Ok, Seaone, et al.
Pubblicazione: (2026)
di: Ok, Seaone, et al.
Pubblicazione: (2026)
Leveraging Audio-Visual Data to Reduce the Multilingual Gap in Self-Supervised Speech Models
di: Blandón, María Andrea Cruz, et al.
Pubblicazione: (2025)
di: Blandón, María Andrea Cruz, et al.
Pubblicazione: (2025)
Exploring Perceptual Audio Quality Measurement on Stereo Processing Using the Open Dataset of Audio Quality
di: Delgado, Pablo M., et al.
Pubblicazione: (2025)
di: Delgado, Pablo M., et al.
Pubblicazione: (2025)
SemanticAudio: Audio Generation and Editing in Semantic Space
di: Dai, Zheqi, et al.
Pubblicazione: (2026)
di: Dai, Zheqi, et al.
Pubblicazione: (2026)
AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning
di: Zhang, Haoyu, et al.
Pubblicazione: (2025)
di: Zhang, Haoyu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
A Survey of Audio Reasoning in Multimodal Foundation Models
di: Guo, Zhihan, et al.
Pubblicazione: (2026) -
Interpretable Audio Editing Evaluation via Chain-of-Thought Difference-Commonality Reasoning with Multimodal LLMs
di: Jia, Yuhang, et al.
Pubblicazione: (2025) -
EchoFree: Towards Ultra Lightweight and Efficient Neural Acoustic Echo Cancellation
di: Li, Xingchen, et al.
Pubblicazione: (2025) -
Audio-Agent: Leveraging LLMs For Audio Generation, Editing and Composition
di: Wang, Zixuan, et al.
Pubblicazione: (2024) -
Towards Multimodal Query-Based Spatial Audio Source Extraction
di: Yu, Chenxin, et al.
Pubblicazione: (2025)