AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Araujo, Edson, Bhati, Saurabhchand, Mirza, M. Jehanzeb, Kingsbury, Brian, Thomas, Samuel, Feris, Rogerio, Glass, James R., Kuehne, Hilde |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment
von: Araujo, Edson, et al.
Veröffentlicht: (2025)
von: Araujo, Edson, et al.
Veröffentlicht: (2025)
Omni-R1: Do You Really Need Audio to Fine-Tune Your Audio LLM?
von: Rouditchenko, Andrew, et al.
Veröffentlicht: (2025)
von: Rouditchenko, Andrew, et al.
Veröffentlicht: (2025)
CALM: Class-Conditional Sparse Attention Vectors for Large Audio-Language Models
von: Mehta, Videet, et al.
Veröffentlicht: (2026)
von: Mehta, Videet, et al.
Veröffentlicht: (2026)
Towards Audio Token Compression in Large Audio Language Models
von: Bhati, Saurabhchand, et al.
Veröffentlicht: (2025)
von: Bhati, Saurabhchand, et al.
Veröffentlicht: (2025)
mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition
von: Rouditchenko, Andrew, et al.
Veröffentlicht: (2025)
von: Rouditchenko, Andrew, et al.
Veröffentlicht: (2025)
TTA-Vid: Generalized Test-Time Adaptation for Video Reasoning
von: Jahagirdar, Soumya Shamarao, et al.
Veröffentlicht: (2026)
von: Jahagirdar, Soumya Shamarao, et al.
Veröffentlicht: (2026)
State-Space Large Audio Language Models
von: Bhati, Saurabhchand, et al.
Veröffentlicht: (2024)
von: Bhati, Saurabhchand, et al.
Veröffentlicht: (2024)
Whisper-Flamingo: Integrating Visual Features into Whisper for Audio-Visual Speech Recognition and Translation
von: Rouditchenko, Andrew, et al.
Veröffentlicht: (2024)
von: Rouditchenko, Andrew, et al.
Veröffentlicht: (2024)
DASS: Distilled Audio State Space Models Are Stronger and More Duration-Scalable Learners
von: Bhati, Saurabhchand, et al.
Veröffentlicht: (2024)
von: Bhati, Saurabhchand, et al.
Veröffentlicht: (2024)
Schrodinger Audio-Visual Editor: Object-Level Audiovisual Removal
von: Xu, Weihan, et al.
Veröffentlicht: (2025)
von: Xu, Weihan, et al.
Veröffentlicht: (2025)
HDA-SELD: Hierarchical Cross-Modal Distillation with Multi-Level Data Augmentation for Low-Resource Audio-Visual Sound Event Localization and Detection
von: Wang, Qing, et al.
Veröffentlicht: (2025)
von: Wang, Qing, et al.
Veröffentlicht: (2025)
Listen, Pause, and Reason: Toward Perception-Grounded Hybrid Reasoning for Audio Understanding
von: Wang, Jieyi, et al.
Veröffentlicht: (2026)
von: Wang, Jieyi, et al.
Veröffentlicht: (2026)
Audio-Visual Separation with Hierarchical Fusion and Representation Alignment
von: Hu, Han, et al.
Veröffentlicht: (2025)
von: Hu, Han, et al.
Veröffentlicht: (2025)
Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities
von: Sudarsanam, Parthasaarathy, et al.
Veröffentlicht: (2025)
von: Sudarsanam, Parthasaarathy, et al.
Veröffentlicht: (2025)
AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues
von: Zhou, Dingkun, et al.
Veröffentlicht: (2025)
von: Zhou, Dingkun, et al.
Veröffentlicht: (2025)
Delayed Commitment for Representation Readiness in Stage-wise Audio-Visual Learning
von: Xu, Xinmeng, et al.
Veröffentlicht: (2026)
von: Xu, Xinmeng, et al.
Veröffentlicht: (2026)
3MDiT: Unified Tri-Modal Diffusion Transformer for Text-Driven Synchronized Audio-Video Generation
von: Li, Yaoru, et al.
Veröffentlicht: (2025)
von: Li, Yaoru, et al.
Veröffentlicht: (2025)
MMED: A Multimodal Micro-Expression Dataset based on Audio-Visual Fusion
von: Wang, Junbo, et al.
Veröffentlicht: (2025)
von: Wang, Junbo, et al.
Veröffentlicht: (2025)
The Interspeech 2026 Audio Reasoning Challenge: Evaluating Reasoning Process Quality for Audio Reasoning Models and Agents
von: Ma, Ziyang, et al.
Veröffentlicht: (2026)
von: Ma, Ziyang, et al.
Veröffentlicht: (2026)
XGC-AVis: Towards Audio-Visual Content Understanding with a Multi-Agent Collaborative System
von: Cao, Yuqin, et al.
Veröffentlicht: (2025)
von: Cao, Yuqin, et al.
Veröffentlicht: (2025)
Robust LLM-based Audio-Visual Speech Recognition with Sparse Modality Alignment and Visual Unit-Guided Refinement
von: Su, Fei, et al.
Veröffentlicht: (2026)
von: Su, Fei, et al.
Veröffentlicht: (2026)
MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions
von: Li, Junjie, et al.
Veröffentlicht: (2025)
von: Li, Junjie, et al.
Veröffentlicht: (2025)
SarcasmMiner: A Dual-Track Post-Training Framework for Robust Audio-Visual Sarcasm Reasoning
von: Li, Zhu, et al.
Veröffentlicht: (2026)
von: Li, Zhu, et al.
Veröffentlicht: (2026)
Robust Wake Word Spotting With Frame-Level Cross-Modal Attention Based Audio-Visual Conformer
von: Wang, Haoxu, et al.
Veröffentlicht: (2024)
von: Wang, Haoxu, et al.
Veröffentlicht: (2024)
A Survey on Music Generation from Single-Modal, Cross-Modal, and Multi-Modal Perspectives
von: Li, Shuyu, et al.
Veröffentlicht: (2025)
von: Li, Shuyu, et al.
Veröffentlicht: (2025)
Generative Audio Extension and Morphing
von: Seetharaman, Prem, et al.
Veröffentlicht: (2026)
von: Seetharaman, Prem, et al.
Veröffentlicht: (2026)
MixFake: Benchmarking and Enhancing Audio Deepfake Detection in Diverse Real-world Mixed Audio
von: Li, Qingcao, et al.
Veröffentlicht: (2026)
von: Li, Qingcao, et al.
Veröffentlicht: (2026)
Coherent Audio-Visual Editing via Conditional Audio Generation Following Video Edits
von: Ishii, Masato, et al.
Veröffentlicht: (2025)
von: Ishii, Masato, et al.
Veröffentlicht: (2025)
USAD: Universal Speech and Audio Representation via Distillation
von: Chang, Heng-Jui, et al.
Veröffentlicht: (2025)
von: Chang, Heng-Jui, et al.
Veröffentlicht: (2025)
Bridging The Multi-Modality Gaps of Audio, Visual and Linguistic for Speech Enhancement
von: Lin, Meng-Ping, et al.
Veröffentlicht: (2025)
von: Lin, Meng-Ping, et al.
Veröffentlicht: (2025)
MusiCRS: Benchmarking Audio-Centric Conversational Recommendation
von: Surana, Rohan, et al.
Veröffentlicht: (2025)
von: Surana, Rohan, et al.
Veröffentlicht: (2025)
Manipulated Regions Localization For Partially Deepfake Audio: A Survey
von: He, Jiayi, et al.
Veröffentlicht: (2025)
von: He, Jiayi, et al.
Veröffentlicht: (2025)
An Evaluation of Interleaved Instruction Tuning on Semantic Reasoning Performance in an Audio MLLM
von: Liu, Jiawei, et al.
Veröffentlicht: (2025)
von: Liu, Jiawei, et al.
Veröffentlicht: (2025)
DreamFoley: Scalable VLMs for High-Fidelity Video-to-Audio Generation
von: Li, Fu, et al.
Veröffentlicht: (2025)
von: Li, Fu, et al.
Veröffentlicht: (2025)
Multimodal Self-Attention Network with Temporal Alignment for Audio-Visual Emotion Recognition
von: Koo, Inyong, et al.
Veröffentlicht: (2026)
von: Koo, Inyong, et al.
Veröffentlicht: (2026)
From Talking to Singing: A New Challenge for Audio-Visual Deepfake Detection
von: Liu, Ke, et al.
Veröffentlicht: (2026)
von: Liu, Ke, et al.
Veröffentlicht: (2026)
Rhythmic Foley: A Framework For Seamless Audio-Visual Alignment In Video-to-Audio Synthesis
von: Huang, Zhiqi, et al.
Veröffentlicht: (2024)
von: Huang, Zhiqi, et al.
Veröffentlicht: (2024)
Building Audio-Visual Digital Twins with Smartphones
von: Lan, Zitong, et al.
Veröffentlicht: (2025)
von: Lan, Zitong, et al.
Veröffentlicht: (2025)
SpotSound: Enhancing Large Audio-Language Models with Fine-Grained Temporal Grounding
von: Sun, Luoyi, et al.
Veröffentlicht: (2026)
von: Sun, Luoyi, et al.
Veröffentlicht: (2026)
MTAVG-Bench: A Diagnostic Benchmark for Multi-Talker Dialogue-Centric Audio-Video Generation
von: Zhou, Yang-Hao, et al.
Veröffentlicht: (2026)
von: Zhou, Yang-Hao, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment
von: Araujo, Edson, et al.
Veröffentlicht: (2025) -
Omni-R1: Do You Really Need Audio to Fine-Tune Your Audio LLM?
von: Rouditchenko, Andrew, et al.
Veröffentlicht: (2025) -
CALM: Class-Conditional Sparse Attention Vectors for Large Audio-Language Models
von: Mehta, Videet, et al.
Veröffentlicht: (2026) -
Towards Audio Token Compression in Large Audio Language Models
von: Bhati, Saurabhchand, et al.
Veröffentlicht: (2025) -
mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition
von: Rouditchenko, Andrew, et al.
Veröffentlicht: (2025)