SAVEn-Vid: Synergistic Audio-Visual Integration for Enhanced Understanding in Long Video Context
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Jungang, Tao, Sicheng, Yan, Yibo, Gu, Xiaojie, Xu, Haodong, Zheng, Xu, Lyu, Yuanhuiyi, Zhang, Linfeng, Hu, Xuming |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Don't Just Chase "Highlighted Tokens" in MLLMs: Revisiting Visual Holistic Context Retention
di: Zou, Xin, et al.
Pubblicazione: (2025)
di: Zou, Xin, et al.
Pubblicazione: (2025)
VSI: Visual Subtitle Integration for Keyframe Selection to enhance Long Video Understanding
di: He, Jianxiang, et al.
Pubblicazione: (2025)
di: He, Jianxiang, et al.
Pubblicazione: (2025)
RealRAG: Retrieval-augmented Realistic Image Generation via Self-reflective Contrastive Learning
di: Lyu, Yuanhuiyi, et al.
Pubblicazione: (2025)
di: Lyu, Yuanhuiyi, et al.
Pubblicazione: (2025)
Understanding-in-Generation: Reinforcing Generative Capability of Unified Model via Infusing Understanding into Generation
di: Lyu, Yuanhuiyi, et al.
Pubblicazione: (2025)
di: Lyu, Yuanhuiyi, et al.
Pubblicazione: (2025)
Learning Robust Anymodal Segmentor with Unimodal and Cross-modal Distillation
di: Zheng, Xu, et al.
Pubblicazione: (2024)
di: Zheng, Xu, et al.
Pubblicazione: (2024)
MMUnlearner: Reformulating Multimodal Machine Unlearning in the Era of Multimodal Large Language Models
di: Huo, Jiahao, et al.
Pubblicazione: (2025)
di: Huo, Jiahao, et al.
Pubblicazione: (2025)
OmniSAM: Omnidirectional Segment Anything Model for UDA in Panoramic Semantic Segmentation
di: Zhong, Ding, et al.
Pubblicazione: (2025)
di: Zhong, Ding, et al.
Pubblicazione: (2025)
MAGIC++: Efficient and Resilient Modality-Agnostic Semantic Segmentation via Hierarchical Modality Selection
di: Zheng, Xu, et al.
Pubblicazione: (2024)
di: Zheng, Xu, et al.
Pubblicazione: (2024)
RTV-Bench: Benchmarking MLLM Continuous Perception, Understanding and Reasoning through Real-Time Video
di: Xun, Shuhang, et al.
Pubblicazione: (2025)
di: Xun, Shuhang, et al.
Pubblicazione: (2025)
StruVis: Enhancing Reasoning-based Text-to-Image Generation via Thinking with Structured Vision
di: Lyu, Yuanhuiyi, et al.
Pubblicazione: (2026)
di: Lyu, Yuanhuiyi, et al.
Pubblicazione: (2026)
Unlocking Multimodal Document Intelligence: From Current Triumphs to Future Frontiers of Visual Document Retrieval
di: Yan, Yibo, et al.
Pubblicazione: (2026)
di: Yan, Yibo, et al.
Pubblicazione: (2026)
CoheMark: A Novel Sentence-Level Watermark for Enhanced Text Quality
di: Zhang, Junyan, et al.
Pubblicazione: (2025)
di: Zhang, Junyan, et al.
Pubblicazione: (2025)
EventBind: Learning a Unified Representation to Bind Them All for Event-based Open-world Understanding
di: Zhou, Jiazhou, et al.
Pubblicazione: (2023)
di: Zhou, Jiazhou, et al.
Pubblicazione: (2023)
Long-Video Audio Synthesis with Multi-Agent Collaboration
di: Zhang, Yehang, et al.
Pubblicazione: (2025)
di: Zhang, Yehang, et al.
Pubblicazione: (2025)
Learning Modality-agnostic Representation for Semantic Segmentation from Any Modalities
di: Zheng, Xu, et al.
Pubblicazione: (2024)
di: Zheng, Xu, et al.
Pubblicazione: (2024)
Image Anything: Towards Reasoning-coherent and Training-free Multi-modal Image Generation
di: Lyu, Yuanhuiyi, et al.
Pubblicazione: (2024)
di: Lyu, Yuanhuiyi, et al.
Pubblicazione: (2024)
PyraVid: Hierarchical Multimodal Memory for Long-Horizon Video Reasoning
di: Yan, Sikuan, et al.
Pubblicazione: (2026)
di: Yan, Sikuan, et al.
Pubblicazione: (2026)
Reducing Unimodal Bias in Multi-Modal Semantic Segmentation with Multi-Scale Functional Entropy Regularization
di: Zheng, Xu, et al.
Pubblicazione: (2025)
di: Zheng, Xu, et al.
Pubblicazione: (2025)
EgoIntent: An Egocentric Step-level Benchmark for Understanding What, Why, and Next
di: Pan, Ye, et al.
Pubblicazione: (2026)
di: Pan, Ye, et al.
Pubblicazione: (2026)
MOSS-ChatV: Reinforcement Learning with Process Reasoning Reward for Video Temporal Reasoning
di: Tao, Sicheng, et al.
Pubblicazione: (2025)
di: Tao, Sicheng, et al.
Pubblicazione: (2025)
StreamMeCo: Long-Term Agent Memory Compression for Efficient Streaming Video Understanding
di: Wang, Junxi, et al.
Pubblicazione: (2026)
di: Wang, Junxi, et al.
Pubblicazione: (2026)
A Survey of Mathematical Reasoning in the Era of Multimodal Large Language Model: Benchmark, Method & Challenges
di: Yan, Yibo, et al.
Pubblicazione: (2024)
di: Yan, Yibo, et al.
Pubblicazione: (2024)
Are We Using the Right Benchmark: An Evaluation Framework for Visual Token Compression Methods
di: Liao, Chenfei, et al.
Pubblicazione: (2025)
di: Liao, Chenfei, et al.
Pubblicazione: (2025)
Retrieval Augmented Generation and Understanding in Vision: A Survey and New Outlook
di: Zheng, Xu, et al.
Pubblicazione: (2025)
di: Zheng, Xu, et al.
Pubblicazione: (2025)
AudioMarathon: A Comprehensive Benchmark for Long-Context Audio Understanding and Efficiency in Audio LLMs
di: He, Peize, et al.
Pubblicazione: (2025)
di: He, Peize, et al.
Pubblicazione: (2025)
Look Twice Before You Answer: Memory-Space Visual Retracing for Hallucination Mitigation in Multimodal Large Language Models
di: Zou, Xin, et al.
Pubblicazione: (2024)
di: Zou, Xin, et al.
Pubblicazione: (2024)
MemorySAM: Memorize Modalities and Semantics with Segment Anything Model 2 for Multi-modal Semantic Segmentation
di: Liao, Chenfei, et al.
Pubblicazione: (2025)
di: Liao, Chenfei, et al.
Pubblicazione: (2025)
VidEgoThink: Assessing Egocentric Video Understanding Capabilities for Embodied AI
di: Cheng, Sijie, et al.
Pubblicazione: (2024)
di: Cheng, Sijie, et al.
Pubblicazione: (2024)
Sharp Eyes and Memory for VideoLLMs: Information-Aware Visual Token Pruning for Efficient and Reliable VideoLLM Reasoning
di: Qin, Jialong, et al.
Pubblicazione: (2025)
di: Qin, Jialong, et al.
Pubblicazione: (2025)
Centering the Value of Every Modality: Towards Efficient and Resilient Modality-agnostic Semantic Segmentation
di: Zheng, Xu, et al.
Pubblicazione: (2024)
di: Zheng, Xu, et al.
Pubblicazione: (2024)
OmniBind: Teach to Build Unequal-Scale Modality Interaction for Omni-Bind of All
di: Lyu, Yuanhuiyi, et al.
Pubblicazione: (2024)
di: Lyu, Yuanhuiyi, et al.
Pubblicazione: (2024)
UniBind: LLM-Augmented Unified and Balanced Representation Space to Bind Them All
di: Lyu, Yuanhuiyi, et al.
Pubblicazione: (2024)
di: Lyu, Yuanhuiyi, et al.
Pubblicazione: (2024)
ExACT: Language-guided Conceptual Reasoning and Uncertainty Estimation for Event-based Action Recognition and More
di: Zhou, Jiazhou, et al.
Pubblicazione: (2024)
di: Zhou, Jiazhou, et al.
Pubblicazione: (2024)
VideoCompressa: Data-Efficient Video Understanding via Joint Temporal Compression and Spatial Reconstruction
di: Wang, Shaobo, et al.
Pubblicazione: (2025)
di: Wang, Shaobo, et al.
Pubblicazione: (2025)
TextVidBench: A Benchmark for Long Video Scene Text Understanding
di: Zhong, Yangyang, et al.
Pubblicazione: (2025)
di: Zhong, Yangyang, et al.
Pubblicazione: (2025)
EIT-1M: One Million EEG-Image-Text Pairs for Human Visual-textual Recognition and More
di: Zheng, Xu, et al.
Pubblicazione: (2024)
di: Zheng, Xu, et al.
Pubblicazione: (2024)
Are Multimodal Large Language Models Ready for Omnidirectional Spatial Reasoning?
di: Dongfang, Zihao, et al.
Pubblicazione: (2025)
di: Dongfang, Zihao, et al.
Pubblicazione: (2025)
PhysicsArena: The First Multimodal Physics Reasoning Benchmark Exploring Variable, Process, and Solution Dimensions
di: Dai, Song, et al.
Pubblicazione: (2025)
di: Dai, Song, et al.
Pubblicazione: (2025)
Unveiling Instruction-Specific Neurons & Experts: An Analytical Framework for LLM's Instruction-Following Capabilities
di: Zhang, Junyan, et al.
Pubblicazione: (2025)
di: Zhang, Junyan, et al.
Pubblicazione: (2025)
ExpVid: A Benchmark for Experiment Video Understanding & Reasoning
di: Xu, Yicheng, et al.
Pubblicazione: (2025)
di: Xu, Yicheng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Don't Just Chase "Highlighted Tokens" in MLLMs: Revisiting Visual Holistic Context Retention
di: Zou, Xin, et al.
Pubblicazione: (2025) -
VSI: Visual Subtitle Integration for Keyframe Selection to enhance Long Video Understanding
di: He, Jianxiang, et al.
Pubblicazione: (2025) -
RealRAG: Retrieval-augmented Realistic Image Generation via Self-reflective Contrastive Learning
di: Lyu, Yuanhuiyi, et al.
Pubblicazione: (2025) -
Understanding-in-Generation: Reinforcing Generative Capability of Unified Model via Infusing Understanding into Generation
di: Lyu, Yuanhuiyi, et al.
Pubblicazione: (2025) -
Learning Robust Anymodal Segmentor with Unimodal and Cross-modal Distillation
di: Zheng, Xu, et al.
Pubblicazione: (2024)