Guardado en:
| Autores principales: | Jiang, Yifan, Wang, Yueying, Zhao, Rui, Parag, Toufiq, Chen, Zhimin, Liao, Zhenyu, Unnikrishnan, Jayakrishnan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2511.11113 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
VeRVE: Versatile Retrieval for Videos via Unified Embeddings
por: Halbe, Shaunak, et al.
Publicado: (2026)
por: Halbe, Shaunak, et al.
Publicado: (2026)
Modality Agnostic Efficient Long Range Encoder
por: Parag, Toufiq, et al.
Publicado: (2025)
por: Parag, Toufiq, et al.
Publicado: (2025)
Perception, Understanding and Reasoning, A Multimodal Benchmark for Video Fake News Detection
por: Yakun, Cui, et al.
Publicado: (2025)
por: Yakun, Cui, et al.
Publicado: (2025)
Reasoning-Guided Grounding: Elevating Video Anomaly Detection through Multimodal Large Language Models
por: Agarwal, Sakshi, et al.
Publicado: (2026)
por: Agarwal, Sakshi, et al.
Publicado: (2026)
Improved Visual-Spatial Reasoning via R1-Zero-Like Training
por: Liao, Zhenyi, et al.
Publicado: (2025)
por: Liao, Zhenyi, et al.
Publicado: (2025)
Semantic-Geometric Dual Compression: Training-Free Visual Token Reduction for Ultra-High-Resolution Remote Sensing Understanding
por: Li, Yueying, et al.
Publicado: (2026)
por: Li, Yueying, et al.
Publicado: (2026)
Benchmarking Scientific Understanding and Reasoning for Video Generation using VideoScience-Bench
por: Hu, Lanxiang, et al.
Publicado: (2025)
por: Hu, Lanxiang, et al.
Publicado: (2025)
AD-MIR: Bridging the Gap from Perception to Persuasion in Advertising Video Understanding via Structured Reasoning
por: Xu, Binxiao, et al.
Publicado: (2026)
por: Xu, Binxiao, et al.
Publicado: (2026)
Think with Grounding: Curriculum Reinforced Reasoning with Video Grounding for Long Video Understanding
por: Chen, Houlun, et al.
Publicado: (2026)
por: Chen, Houlun, et al.
Publicado: (2026)
Personalized Video Summarization by Multimodal Video Understanding
por: Chen, Brian, et al.
Publicado: (2024)
por: Chen, Brian, et al.
Publicado: (2024)
Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition
por: Fei, Hao, et al.
Publicado: (2024)
por: Fei, Hao, et al.
Publicado: (2024)
Abductive Ego-View Accident Video Understanding for Safe Driving Perception
por: Fang, Jianwu, et al.
Publicado: (2024)
por: Fang, Jianwu, et al.
Publicado: (2024)
DAVID-XR1: Detecting AI-Generated Videos with Explainable Reasoning
por: Gao, Yifeng, et al.
Publicado: (2025)
por: Gao, Yifeng, et al.
Publicado: (2025)
Motion-Grounded Video Reasoning: Understanding and Perceiving Motion at Pixel Level
por: Deng, Andong, et al.
Publicado: (2024)
por: Deng, Andong, et al.
Publicado: (2024)
Robust-R1: Degradation-Aware Reasoning for Robust Visual Understanding
por: Tang, Jiaqi, et al.
Publicado: (2025)
por: Tang, Jiaqi, et al.
Publicado: (2025)
A Large-Scale Multimodal Dataset and Benchmarks for Human Activity Scene Understanding and Reasoning
por: Jiang, Siyang, et al.
Publicado: (2025)
por: Jiang, Siyang, et al.
Publicado: (2025)
CrashSight: A Phase-Aware, Infrastructure-Centric Video Benchmark for Traffic Crash Scene Understanding and Reasoning
por: Gan, Rui, et al.
Publicado: (2026)
por: Gan, Rui, et al.
Publicado: (2026)
SIV-Bench: A Video Benchmark for Social Interaction Understanding and Reasoning
por: Kong, Fanqi, et al.
Publicado: (2025)
por: Kong, Fanqi, et al.
Publicado: (2025)
Universal Visuo-Tactile Video Understanding for Embodied Interaction
por: Xie, Yifan, et al.
Publicado: (2025)
por: Xie, Yifan, et al.
Publicado: (2025)
Audio-centric Video Understanding Benchmark without Text Shortcut
por: Yang, Yudong, et al.
Publicado: (2025)
por: Yang, Yudong, et al.
Publicado: (2025)
EgoEsportsQA: An Egocentric Video Benchmark for Perception and Reasoning in Esports
por: Ma, Jianzhe, et al.
Publicado: (2026)
por: Ma, Jianzhe, et al.
Publicado: (2026)
R3G: A Reasoning--Retrieval--Reranking Framework for Vision-Centric Answer Generation
por: Chen, Zhuohong, et al.
Publicado: (2026)
por: Chen, Zhuohong, et al.
Publicado: (2026)
Benchmarking Multi-Image Understanding in Vision and Language Models: Perception, Knowledge, Reasoning, and Multi-Hop Reasoning
por: Zhao, Bingchen, et al.
Publicado: (2024)
por: Zhao, Bingchen, et al.
Publicado: (2024)
Automated Segmentation of Ischemic Stroke Lesions in Non-Contrast Computed Tomography Images for Enhanced Treatment and Prognosis
por: Musah, Toufiq, et al.
Publicado: (2024)
por: Musah, Toufiq, et al.
Publicado: (2024)
VideoVista: A Versatile Benchmark for Video Understanding and Reasoning
por: Li, Yunxin, et al.
Publicado: (2024)
por: Li, Yunxin, et al.
Publicado: (2024)
Em-Garde: A Propose-Match Framework for Proactive Streaming Video Understanding
por: Zheng, Yikai, et al.
Publicado: (2026)
por: Zheng, Yikai, et al.
Publicado: (2026)
Place-it-R1: Unlocking Environment-aware Reasoning Potential of MLLM for Video Object Insertion
por: Gu, Bohai, et al.
Publicado: (2026)
por: Gu, Bohai, et al.
Publicado: (2026)
Enhancing Long Video Understanding via Hierarchical Event-Based Memory
por: Cheng, Dingxin, et al.
Publicado: (2024)
por: Cheng, Dingxin, et al.
Publicado: (2024)
QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design
por: Schneider, Benjamin, et al.
Publicado: (2025)
por: Schneider, Benjamin, et al.
Publicado: (2025)
GeoEyes: On-Demand Visual Focusing for Evidence-Grounded Understanding of Ultra-High-Resolution Remote Sensing Imagery
por: Wang, Fengxiang, et al.
Publicado: (2026)
por: Wang, Fengxiang, et al.
Publicado: (2026)
VisionCoach: Reinforcing Grounded Video Reasoning via Visual-Perception Prompting
por: Lee, Daeun, et al.
Publicado: (2026)
por: Lee, Daeun, et al.
Publicado: (2026)
H2VU-Benchmark: A Comprehensive Benchmark for Hierarchical Holistic Video Understanding
por: Wu, Qi, et al.
Publicado: (2025)
por: Wu, Qi, et al.
Publicado: (2025)
VideoPrism: A Foundational Visual Encoder for Video Understanding
por: Zhao, Long, et al.
Publicado: (2024)
por: Zhao, Long, et al.
Publicado: (2024)
CoF-T2I: Video Models as Pure Visual Reasoners for Text-to-Image Generation
por: Tong, Chengzhuo, et al.
Publicado: (2026)
por: Tong, Chengzhuo, et al.
Publicado: (2026)
Perception-R1: Advancing Multimodal Reasoning Capabilities of MLLMs via Visual Perception Reward
por: Xiao, Tong, et al.
Publicado: (2025)
por: Xiao, Tong, et al.
Publicado: (2025)
Vamos: Versatile Action Models for Video Understanding
por: Wang, Shijie, et al.
Publicado: (2023)
por: Wang, Shijie, et al.
Publicado: (2023)
RAVU: Retrieval Augmented Video Understanding with Compositional Reasoning over Graph
por: Malik, Sameer, et al.
Publicado: (2025)
por: Malik, Sameer, et al.
Publicado: (2025)
Fact-R1: Towards Explainable Video Misinformation Detection with Deep Reasoning
por: Zhang, Fanrui, et al.
Publicado: (2025)
por: Zhang, Fanrui, et al.
Publicado: (2025)
TimeSearch-R: Adaptive Temporal Search for Long-Form Video Understanding via Self-Verification Reinforcement Learning
por: Pan, Junwen, et al.
Publicado: (2025)
por: Pan, Junwen, et al.
Publicado: (2025)
R^3-VQA: "Read the Room" by Video Social Reasoning
por: Niu, Lixing, et al.
Publicado: (2025)
por: Niu, Lixing, et al.
Publicado: (2025)
Ejemplares similares
-
VeRVE: Versatile Retrieval for Videos via Unified Embeddings
por: Halbe, Shaunak, et al.
Publicado: (2026) -
Modality Agnostic Efficient Long Range Encoder
por: Parag, Toufiq, et al.
Publicado: (2025) -
Perception, Understanding and Reasoning, A Multimodal Benchmark for Video Fake News Detection
por: Yakun, Cui, et al.
Publicado: (2025) -
Reasoning-Guided Grounding: Elevating Video Anomaly Detection through Multimodal Large Language Models
por: Agarwal, Sakshi, et al.
Publicado: (2026) -
Improved Visual-Spatial Reasoning via R1-Zero-Like Training
por: Liao, Zhenyi, et al.
Publicado: (2025)