Salvato in:
| Autori principali: | Jiang, Yifan, Wang, Yueying, Zhao, Rui, Parag, Toufiq, Chen, Zhimin, Liao, Zhenyu, Unnikrishnan, Jayakrishnan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2511.11113 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VeRVE: Versatile Retrieval for Videos via Unified Embeddings
di: Halbe, Shaunak, et al.
Pubblicazione: (2026)
di: Halbe, Shaunak, et al.
Pubblicazione: (2026)
Modality Agnostic Efficient Long Range Encoder
di: Parag, Toufiq, et al.
Pubblicazione: (2025)
di: Parag, Toufiq, et al.
Pubblicazione: (2025)
Perception, Understanding and Reasoning, A Multimodal Benchmark for Video Fake News Detection
di: Yakun, Cui, et al.
Pubblicazione: (2025)
di: Yakun, Cui, et al.
Pubblicazione: (2025)
Reasoning-Guided Grounding: Elevating Video Anomaly Detection through Multimodal Large Language Models
di: Agarwal, Sakshi, et al.
Pubblicazione: (2026)
di: Agarwal, Sakshi, et al.
Pubblicazione: (2026)
Improved Visual-Spatial Reasoning via R1-Zero-Like Training
di: Liao, Zhenyi, et al.
Pubblicazione: (2025)
di: Liao, Zhenyi, et al.
Pubblicazione: (2025)
Semantic-Geometric Dual Compression: Training-Free Visual Token Reduction for Ultra-High-Resolution Remote Sensing Understanding
di: Li, Yueying, et al.
Pubblicazione: (2026)
di: Li, Yueying, et al.
Pubblicazione: (2026)
Benchmarking Scientific Understanding and Reasoning for Video Generation using VideoScience-Bench
di: Hu, Lanxiang, et al.
Pubblicazione: (2025)
di: Hu, Lanxiang, et al.
Pubblicazione: (2025)
AD-MIR: Bridging the Gap from Perception to Persuasion in Advertising Video Understanding via Structured Reasoning
di: Xu, Binxiao, et al.
Pubblicazione: (2026)
di: Xu, Binxiao, et al.
Pubblicazione: (2026)
Think with Grounding: Curriculum Reinforced Reasoning with Video Grounding for Long Video Understanding
di: Chen, Houlun, et al.
Pubblicazione: (2026)
di: Chen, Houlun, et al.
Pubblicazione: (2026)
Personalized Video Summarization by Multimodal Video Understanding
di: Chen, Brian, et al.
Pubblicazione: (2024)
di: Chen, Brian, et al.
Pubblicazione: (2024)
Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition
di: Fei, Hao, et al.
Pubblicazione: (2024)
di: Fei, Hao, et al.
Pubblicazione: (2024)
Abductive Ego-View Accident Video Understanding for Safe Driving Perception
di: Fang, Jianwu, et al.
Pubblicazione: (2024)
di: Fang, Jianwu, et al.
Pubblicazione: (2024)
DAVID-XR1: Detecting AI-Generated Videos with Explainable Reasoning
di: Gao, Yifeng, et al.
Pubblicazione: (2025)
di: Gao, Yifeng, et al.
Pubblicazione: (2025)
Motion-Grounded Video Reasoning: Understanding and Perceiving Motion at Pixel Level
di: Deng, Andong, et al.
Pubblicazione: (2024)
di: Deng, Andong, et al.
Pubblicazione: (2024)
Robust-R1: Degradation-Aware Reasoning for Robust Visual Understanding
di: Tang, Jiaqi, et al.
Pubblicazione: (2025)
di: Tang, Jiaqi, et al.
Pubblicazione: (2025)
A Large-Scale Multimodal Dataset and Benchmarks for Human Activity Scene Understanding and Reasoning
di: Jiang, Siyang, et al.
Pubblicazione: (2025)
di: Jiang, Siyang, et al.
Pubblicazione: (2025)
CrashSight: A Phase-Aware, Infrastructure-Centric Video Benchmark for Traffic Crash Scene Understanding and Reasoning
di: Gan, Rui, et al.
Pubblicazione: (2026)
di: Gan, Rui, et al.
Pubblicazione: (2026)
SIV-Bench: A Video Benchmark for Social Interaction Understanding and Reasoning
di: Kong, Fanqi, et al.
Pubblicazione: (2025)
di: Kong, Fanqi, et al.
Pubblicazione: (2025)
Universal Visuo-Tactile Video Understanding for Embodied Interaction
di: Xie, Yifan, et al.
Pubblicazione: (2025)
di: Xie, Yifan, et al.
Pubblicazione: (2025)
Audio-centric Video Understanding Benchmark without Text Shortcut
di: Yang, Yudong, et al.
Pubblicazione: (2025)
di: Yang, Yudong, et al.
Pubblicazione: (2025)
EgoEsportsQA: An Egocentric Video Benchmark for Perception and Reasoning in Esports
di: Ma, Jianzhe, et al.
Pubblicazione: (2026)
di: Ma, Jianzhe, et al.
Pubblicazione: (2026)
R3G: A Reasoning--Retrieval--Reranking Framework for Vision-Centric Answer Generation
di: Chen, Zhuohong, et al.
Pubblicazione: (2026)
di: Chen, Zhuohong, et al.
Pubblicazione: (2026)
Benchmarking Multi-Image Understanding in Vision and Language Models: Perception, Knowledge, Reasoning, and Multi-Hop Reasoning
di: Zhao, Bingchen, et al.
Pubblicazione: (2024)
di: Zhao, Bingchen, et al.
Pubblicazione: (2024)
Automated Segmentation of Ischemic Stroke Lesions in Non-Contrast Computed Tomography Images for Enhanced Treatment and Prognosis
di: Musah, Toufiq, et al.
Pubblicazione: (2024)
di: Musah, Toufiq, et al.
Pubblicazione: (2024)
VideoVista: A Versatile Benchmark for Video Understanding and Reasoning
di: Li, Yunxin, et al.
Pubblicazione: (2024)
di: Li, Yunxin, et al.
Pubblicazione: (2024)
Em-Garde: A Propose-Match Framework for Proactive Streaming Video Understanding
di: Zheng, Yikai, et al.
Pubblicazione: (2026)
di: Zheng, Yikai, et al.
Pubblicazione: (2026)
Place-it-R1: Unlocking Environment-aware Reasoning Potential of MLLM for Video Object Insertion
di: Gu, Bohai, et al.
Pubblicazione: (2026)
di: Gu, Bohai, et al.
Pubblicazione: (2026)
Enhancing Long Video Understanding via Hierarchical Event-Based Memory
di: Cheng, Dingxin, et al.
Pubblicazione: (2024)
di: Cheng, Dingxin, et al.
Pubblicazione: (2024)
QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design
di: Schneider, Benjamin, et al.
Pubblicazione: (2025)
di: Schneider, Benjamin, et al.
Pubblicazione: (2025)
GeoEyes: On-Demand Visual Focusing for Evidence-Grounded Understanding of Ultra-High-Resolution Remote Sensing Imagery
di: Wang, Fengxiang, et al.
Pubblicazione: (2026)
di: Wang, Fengxiang, et al.
Pubblicazione: (2026)
VisionCoach: Reinforcing Grounded Video Reasoning via Visual-Perception Prompting
di: Lee, Daeun, et al.
Pubblicazione: (2026)
di: Lee, Daeun, et al.
Pubblicazione: (2026)
H2VU-Benchmark: A Comprehensive Benchmark for Hierarchical Holistic Video Understanding
di: Wu, Qi, et al.
Pubblicazione: (2025)
di: Wu, Qi, et al.
Pubblicazione: (2025)
VideoPrism: A Foundational Visual Encoder for Video Understanding
di: Zhao, Long, et al.
Pubblicazione: (2024)
di: Zhao, Long, et al.
Pubblicazione: (2024)
CoF-T2I: Video Models as Pure Visual Reasoners for Text-to-Image Generation
di: Tong, Chengzhuo, et al.
Pubblicazione: (2026)
di: Tong, Chengzhuo, et al.
Pubblicazione: (2026)
Perception-R1: Advancing Multimodal Reasoning Capabilities of MLLMs via Visual Perception Reward
di: Xiao, Tong, et al.
Pubblicazione: (2025)
di: Xiao, Tong, et al.
Pubblicazione: (2025)
Vamos: Versatile Action Models for Video Understanding
di: Wang, Shijie, et al.
Pubblicazione: (2023)
di: Wang, Shijie, et al.
Pubblicazione: (2023)
RAVU: Retrieval Augmented Video Understanding with Compositional Reasoning over Graph
di: Malik, Sameer, et al.
Pubblicazione: (2025)
di: Malik, Sameer, et al.
Pubblicazione: (2025)
Fact-R1: Towards Explainable Video Misinformation Detection with Deep Reasoning
di: Zhang, Fanrui, et al.
Pubblicazione: (2025)
di: Zhang, Fanrui, et al.
Pubblicazione: (2025)
TimeSearch-R: Adaptive Temporal Search for Long-Form Video Understanding via Self-Verification Reinforcement Learning
di: Pan, Junwen, et al.
Pubblicazione: (2025)
di: Pan, Junwen, et al.
Pubblicazione: (2025)
R^3-VQA: "Read the Room" by Video Social Reasoning
di: Niu, Lixing, et al.
Pubblicazione: (2025)
di: Niu, Lixing, et al.
Pubblicazione: (2025)
Documenti analoghi
-
VeRVE: Versatile Retrieval for Videos via Unified Embeddings
di: Halbe, Shaunak, et al.
Pubblicazione: (2026) -
Modality Agnostic Efficient Long Range Encoder
di: Parag, Toufiq, et al.
Pubblicazione: (2025) -
Perception, Understanding and Reasoning, A Multimodal Benchmark for Video Fake News Detection
di: Yakun, Cui, et al.
Pubblicazione: (2025) -
Reasoning-Guided Grounding: Elevating Video Anomaly Detection through Multimodal Large Language Models
di: Agarwal, Sakshi, et al.
Pubblicazione: (2026) -
Improved Visual-Spatial Reasoning via R1-Zero-Like Training
di: Liao, Zhenyi, et al.
Pubblicazione: (2025)