JAEGER: Joint 3D Audio-Visual Grounding and Reasoning in Simulated Physical Environments
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Zhan, Tang, Changli, Wang, Yuxin, Zhu, Zhiyuan, Chen, Youjun, Shao, Yiwen, Wang, Tianzi, Ke, Lei, Jin, Zengrui, Zhang, Chao |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Joint Speaker Features Learning for Audio-visual Multichannel Speech Separation and Recognition
par: Li, Guinan, et autres
Publié: (2024)
par: Li, Guinan, et autres
Publié: (2024)
WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM
par: Tang, Changli, et autres
Publié: (2025)
par: Tang, Changli, et autres
Publié: (2025)
Audio-Conditioned Diffusion LLMs for ASR and Deliberation Processing
par: Wang, Mengqi, et autres
Publié: (2025)
par: Wang, Mengqi, et autres
Publié: (2025)
Towards One-bit ASR: Extremely Low-bit Conformer Quantization Using Co-training and Stochastic Precision
par: Li, Zhaoqing, et autres
Publié: (2025)
par: Li, Zhaoqing, et autres
Publié: (2025)
Unfolding A Few Structures for The Many: Memory-Efficient Compression of Conformer and Speech Foundation Models
par: Li, Zhaoqing, et autres
Publié: (2025)
par: Li, Zhaoqing, et autres
Publié: (2025)
Speech-Audio Compositional Attacks on Multimodal LLMs and Their Mitigation with SALMONN-Guard
par: Yang, Yudong, et autres
Publié: (2025)
par: Yang, Yudong, et autres
Publié: (2025)
Enhancing Pre-trained ASR System Fine-tuning for Dysarthric Speech Recognition using Adversarial Data Augmentation
par: Wang, Huimeng, et autres
Publié: (2024)
par: Wang, Huimeng, et autres
Publié: (2024)
Listen, Pause, and Reason: Toward Perception-Grounded Hybrid Reasoning for Audio Understanding
par: Wang, Jieyi, et autres
Publié: (2026)
par: Wang, Jieyi, et autres
Publié: (2026)
video-SALMONN 2: Caption-Enhanced Audio-Visual Large Language Models
par: Tang, Changli, et autres
Publié: (2025)
par: Tang, Changli, et autres
Publié: (2025)
Optimising Neural Speech Codecs for 300bps Communication using Reinforcement Learning
par: Wang, Junyi, et autres
Publié: (2026)
par: Wang, Junyi, et autres
Publié: (2026)
Robust Audio-Visual Speech Enhancement: Correcting Misassignments in Complex Environments with Advanced Post-Processing
par: Ren, Wenze, et autres
Publié: (2024)
par: Ren, Wenze, et autres
Publié: (2024)
PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation
par: Xie, Tianxin, et autres
Publié: (2025)
par: Xie, Tianxin, et autres
Publié: (2025)
From Coarse to Fine: Recursive Audio-Visual Semantic Enhancement for Speech Separation
par: Xue, Ke, et autres
Publié: (2025)
par: Xue, Ke, et autres
Publié: (2025)
Can Large Language Models Understand Spatial Audio?
par: Tang, Changli, et autres
Publié: (2024)
par: Tang, Changli, et autres
Publié: (2024)
What Are They Doing? Joint Audio-Speech Co-Reasoning
par: Wang, Yingzhi, et autres
Publié: (2024)
par: Wang, Yingzhi, et autres
Publié: (2024)
Semantic Audio-Visual Navigation in Continuous Environments
par: Zeng, Yichen, et autres
Publié: (2026)
par: Zeng, Yichen, et autres
Publié: (2026)
AzeroS: Extending LLM to Speech with Self-Generated Instruction-Free Tuning
par: Shao, Yiwen, et autres
Publié: (2025)
par: Shao, Yiwen, et autres
Publié: (2025)
Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training
par: Sun, Houmin, et autres
Publié: (2026)
par: Sun, Houmin, et autres
Publié: (2026)
EmotionThinker: Prosody-Aware Reinforcement Learning for Explainable Speech Emotion Reasoning
par: Wang, Dingdong, et autres
Publié: (2026)
par: Wang, Dingdong, et autres
Publié: (2026)
Audio-Visual Speech Enhancement In Complex Scenarios With Separation And Dereverberation Joint Modeling
par: Du, Jiarong, et autres
Publié: (2025)
par: Du, Jiarong, et autres
Publié: (2025)
ClariCodec: Optimising Neural Speech Codes for 200bps Communication using Reinforcement Learning
par: Wang, Junyi, et autres
Publié: (2026)
par: Wang, Junyi, et autres
Publié: (2026)
Structured Speaker-Deficiency Adaptation of Foundation Models for Dysarthric and Elderly Speech Recognition
par: Hu, Shujie, et autres
Publié: (2024)
par: Hu, Shujie, et autres
Publié: (2024)
MiDashengLM: Efficient Audio Understanding with General Audio Captions
par: Dinkel, Heinrich, et autres
Publié: (2025)
par: Dinkel, Heinrich, et autres
Publié: (2025)
Empowering Whisper as a Joint Multi-Talker and Target-Talker Speech Recognition System
par: Meng, Lingwei, et autres
Publié: (2024)
par: Meng, Lingwei, et autres
Publié: (2024)
UNISON: A Unified Sound Generation and Editing Framework via Deep LLM Fusion
par: Li, Zhaoqing, et autres
Publié: (2026)
par: Li, Zhaoqing, et autres
Publié: (2026)
Apollo: Unified Multi-Task Audio-Video Joint Generation
par: Wang, Jun, et autres
Publié: (2026)
par: Wang, Jun, et autres
Publié: (2026)
ASM: Audio Spectrogram Mixer
par: Ji, Qingfeng, et autres
Publié: (2024)
par: Ji, Qingfeng, et autres
Publié: (2024)
Before the Mic: Physical-Layer Voiceprint Anonymization with Acoustic Metamaterials
par: Ning, Zhiyuan, et autres
Publié: (2026)
par: Ning, Zhiyuan, et autres
Publié: (2026)
One-pass Multiple Conformer and Foundation Speech Systems Compression and Quantization Using An All-in-one Neural Model
par: Li, Zhaoqing, et autres
Publié: (2024)
par: Li, Zhaoqing, et autres
Publié: (2024)
TSE-PI: Target Sound Extraction under Reverberant Environments with Pitch Information
par: Wang, Yiwen, et autres
Publié: (2024)
par: Wang, Yiwen, et autres
Publié: (2024)
Self-supervised ASR Models and Features For Dysarthric and Elderly Speech Recognition
par: Hu, Shujie, et autres
Publié: (2024)
par: Hu, Shujie, et autres
Publié: (2024)
The Interspeech 2026 Audio Reasoning Challenge: Evaluating Reasoning Process Quality for Audio Reasoning Models and Agents
par: Ma, Ziyang, et autres
Publié: (2026)
par: Ma, Ziyang, et autres
Publié: (2026)
ALMGuard: Safety Shortcuts and Where to Find Them as Guardrails for Audio-Language Models
par: Jin, Weifei, et autres
Publié: (2025)
par: Jin, Weifei, et autres
Publié: (2025)
A Sensitivity Analysis of Multi-Event Audio Grounding in Audio LLMs
par: Lee, Taehan, et autres
Publié: (2026)
par: Lee, Taehan, et autres
Publié: (2026)
MetaSICL: Adapting Audiroty LLM via Meta Speech In-Context Learning
par: Zheng, Haolong, et autres
Publié: (2026)
par: Zheng, Haolong, et autres
Publié: (2026)
Effective and Efficient Mixed Precision Quantization of Speech Foundation Models
par: Xu, Haoning, et autres
Publié: (2025)
par: Xu, Haoning, et autres
Publié: (2025)
TAC: Timestamped Audio Captioning
par: Kumar, Sonal, et autres
Publié: (2026)
par: Kumar, Sonal, et autres
Publié: (2026)
MMEDIT: A Unified Framework for Multi-Type Audio Editing via Audio Language Model
par: Tao, Ye, et autres
Publié: (2025)
par: Tao, Ye, et autres
Publié: (2025)
Building Audio-Visual Digital Twins with Smartphones
par: Lan, Zitong, et autres
Publié: (2025)
par: Lan, Zitong, et autres
Publié: (2025)
SCENEBench: An Audio Understanding Benchmark Grounded in Assistive and Industrial Use Cases
par: Iyer, Laya, et autres
Publié: (2026)
par: Iyer, Laya, et autres
Publié: (2026)
Documents similaires
-
Joint Speaker Features Learning for Audio-visual Multichannel Speech Separation and Recognition
par: Li, Guinan, et autres
Publié: (2024) -
WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM
par: Tang, Changli, et autres
Publié: (2025) -
Audio-Conditioned Diffusion LLMs for ASR and Deliberation Processing
par: Wang, Mengqi, et autres
Publié: (2025) -
Towards One-bit ASR: Extremely Low-bit Conformer Quantization Using Co-training and Stochastic Precision
par: Li, Zhaoqing, et autres
Publié: (2025) -
Unfolding A Few Structures for The Many: Memory-Efficient Compression of Conformer and Speech Foundation Models
par: Li, Zhaoqing, et autres
Publié: (2025)