EXPLORE-Bench: Egocentric Scene Prediction with Long-Horizon Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Yu, Chengjun, Zhu, Xuhan, Du, Chaoqun, Yu, Pengfei, Zhai, Wei, Cao, Yang, Zha, Zheng-Jun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Self-Consistent Latent Reasoning: Long Latent Sequence Reasoning for Vision-Language Model
di: Wang, Chenfeng, et al.
Pubblicazione: (2026)
di: Wang, Chenfeng, et al.
Pubblicazione: (2026)
EgoChoir: Capturing 3D Human-Object Interaction Regions from Egocentric Views
di: Yang, Yuhang, et al.
Pubblicazione: (2024)
di: Yang, Yuhang, et al.
Pubblicazione: (2024)
EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video Understanding
di: Wang, Ziyang, et al.
Pubblicazione: (2026)
di: Wang, Ziyang, et al.
Pubblicazione: (2026)
HERO: Human Reaction Generation from Videos
di: Yu, Chengjun, et al.
Pubblicazione: (2025)
di: Yu, Chengjun, et al.
Pubblicazione: (2025)
Grounding 3D Scene Affordance From Egocentric Interactions
di: Liu, Cuiyu, et al.
Pubblicazione: (2024)
di: Liu, Cuiyu, et al.
Pubblicazione: (2024)
CubeBench: Diagnosing Interactive, Long-Horizon Spatial Reasoning Under Partial Observations
di: Gao, Huan-ang, et al.
Pubblicazione: (2025)
di: Gao, Huan-ang, et al.
Pubblicazione: (2025)
MMR-Life: Piecing Together Real-life Scenes for Multimodal Multi-image Reasoning
di: Li, Jiachun, et al.
Pubblicazione: (2026)
di: Li, Jiachun, et al.
Pubblicazione: (2026)
Dual-Pathway Geometry-Aware MLLM for Spatial Intelligence
di: Zheng, Yufei, et al.
Pubblicazione: (2026)
di: Zheng, Yufei, et al.
Pubblicazione: (2026)
IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs
di: Ma, David, et al.
Pubblicazione: (2025)
di: Ma, David, et al.
Pubblicazione: (2025)
CameraBench: Benchmarking Visual Reasoning in MLLMs via Photography
di: Fang, I-Sheng, et al.
Pubblicazione: (2025)
di: Fang, I-Sheng, et al.
Pubblicazione: (2025)
VLABench: A Large-Scale Benchmark for Language-Conditioned Robotics Manipulation with Long-Horizon Reasoning Tasks
di: Zhang, Shiduo, et al.
Pubblicazione: (2024)
di: Zhang, Shiduo, et al.
Pubblicazione: (2024)
MMLongBench-Doc: Benchmarking Long-context Document Understanding with Visualizations
di: Ma, Yubo, et al.
Pubblicazione: (2024)
di: Ma, Yubo, et al.
Pubblicazione: (2024)
MMLongBench: Benchmarking Long-Context Vision-Language Models Effectively and Thoroughly
di: Wang, Zhaowei, et al.
Pubblicazione: (2025)
di: Wang, Zhaowei, et al.
Pubblicazione: (2025)
MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos
di: Zhu, Kejian, et al.
Pubblicazione: (2025)
di: Zhu, Kejian, et al.
Pubblicazione: (2025)
TemMed-Bench: Evaluating Temporal Medical Image Reasoning in Vision-Language Models
di: Zhang, Junyi, et al.
Pubblicazione: (2025)
di: Zhang, Junyi, et al.
Pubblicazione: (2025)
Benchmarking and Improving Large Vision-Language Models for Fundamental Visual Graph Understanding and Reasoning
di: Zhu, Yingjie, et al.
Pubblicazione: (2024)
di: Zhu, Yingjie, et al.
Pubblicazione: (2024)
GRACE: Estimating Geometry-level 3D Human-Scene Contact from 2D Images
di: Wang, Chengfeng, et al.
Pubblicazione: (2025)
di: Wang, Chengfeng, et al.
Pubblicazione: (2025)
HorizonBench: Long-Horizon Personalization with Evolving Preferences
di: Li, Shuyue Stella, et al.
Pubblicazione: (2026)
di: Li, Shuyue Stella, et al.
Pubblicazione: (2026)
FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark
di: Fang, Rongyao, et al.
Pubblicazione: (2025)
di: Fang, Rongyao, et al.
Pubblicazione: (2025)
MindGPT-4ov: An Enhanced MLLM via a Multi-Stage Post-Training Paradigm
di: Chen, Wei, et al.
Pubblicazione: (2025)
di: Chen, Wei, et al.
Pubblicazione: (2025)
X-LeBench: A Benchmark for Extremely Long Egocentric Video Understanding
di: Zhou, Wenqi, et al.
Pubblicazione: (2025)
di: Zhou, Wenqi, et al.
Pubblicazione: (2025)
VideoSeek: Long-Horizon Video Agent with Tool-Guided Seeking
di: Lin, Jingyang, et al.
Pubblicazione: (2026)
di: Lin, Jingyang, et al.
Pubblicazione: (2026)
GDI-Bench: A Benchmark for General Document Intelligence with Vision and Reasoning Decoupling
di: Li, Siqi, et al.
Pubblicazione: (2025)
di: Li, Siqi, et al.
Pubblicazione: (2025)
Benchmarking Egocentric Clinical Intent Understanding Capability for Medical Multimodal Large Language Models
di: Liu, Shaonan, et al.
Pubblicazione: (2026)
di: Liu, Shaonan, et al.
Pubblicazione: (2026)
ViewPoint: Panoramic Video Generation with Pretrained Diffusion Models
di: Fang, Zixun, et al.
Pubblicazione: (2025)
di: Fang, Zixun, et al.
Pubblicazione: (2025)
MileBench: Benchmarking MLLMs in Long Context
di: Song, Dingjie, et al.
Pubblicazione: (2024)
di: Song, Dingjie, et al.
Pubblicazione: (2024)
LEMON: Learning 3D Human-Object Interaction Relation from 2D Images
di: Yang, Yuhang, et al.
Pubblicazione: (2023)
di: Yang, Yuhang, et al.
Pubblicazione: (2023)
End-to-End Spatial-Temporal Transformer for Real-time 4D HOI Reconstruction
di: Zhang, Haoyu, et al.
Pubblicazione: (2026)
di: Zhang, Haoyu, et al.
Pubblicazione: (2026)
TOUCH: Text-guided Controllable Generation of Free-Form Hand-Object Interactions
di: Han, Guangyi, et al.
Pubblicazione: (2025)
di: Han, Guangyi, et al.
Pubblicazione: (2025)
MGM-Omni: Scaling Omni LLMs to Personalized Long-Horizon Speech
di: Wang, Chengyao, et al.
Pubblicazione: (2025)
di: Wang, Chengyao, et al.
Pubblicazione: (2025)
AesBench: An Expert Benchmark for Multimodal Large Language Models on Image Aesthetics Perception
di: Huang, Yipo, et al.
Pubblicazione: (2024)
di: Huang, Yipo, et al.
Pubblicazione: (2024)
VULCA-Bench: A Multicultural Vision-Language Benchmark for Evaluating Cultural Understanding
di: Yu, Haorui, et al.
Pubblicazione: (2026)
di: Yu, Haorui, et al.
Pubblicazione: (2026)
ColorConceptBench: A Benchmark for Probabilistic Color-Concept Understanding in Text-to-Image Models
di: Ruan, Chenxi, et al.
Pubblicazione: (2026)
di: Ruan, Chenxi, et al.
Pubblicazione: (2026)
EMemBench: Interactive Benchmarking of Episodic Memory for VLM Agents
di: Li, Xinze, et al.
Pubblicazione: (2026)
di: Li, Xinze, et al.
Pubblicazione: (2026)
SceneAlign: Aligning Multimodal Reasoning to Scene Graphs in Complex Visual Scenes
di: Wang, Chuhan, et al.
Pubblicazione: (2026)
di: Wang, Chuhan, et al.
Pubblicazione: (2026)
Rethinking Visual Dependency in Long-Context Reasoning for Large Vision-Language Models
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
VideoARM: Agentic Reasoning over Hierarchical Memory for Long-Form Video Understanding
di: Yin, Yufei, et al.
Pubblicazione: (2025)
di: Yin, Yufei, et al.
Pubblicazione: (2025)
VidEgoThink: Assessing Egocentric Video Understanding Capabilities for Embodied AI
di: Cheng, Sijie, et al.
Pubblicazione: (2024)
di: Cheng, Sijie, et al.
Pubblicazione: (2024)
Ego2Web: A Web Agent Benchmark Grounded in Egocentric Videos
di: Yu, Shoubin, et al.
Pubblicazione: (2026)
di: Yu, Shoubin, et al.
Pubblicazione: (2026)
VCR-Bench: A Comprehensive Evaluation Framework for Video Chain-of-Thought Reasoning
di: Qi, Yukun, et al.
Pubblicazione: (2025)
di: Qi, Yukun, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Self-Consistent Latent Reasoning: Long Latent Sequence Reasoning for Vision-Language Model
di: Wang, Chenfeng, et al.
Pubblicazione: (2026) -
EgoChoir: Capturing 3D Human-Object Interaction Regions from Egocentric Views
di: Yang, Yuhang, et al.
Pubblicazione: (2024) -
EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video Understanding
di: Wang, Ziyang, et al.
Pubblicazione: (2026) -
HERO: Human Reaction Generation from Videos
di: Yu, Chengjun, et al.
Pubblicazione: (2025) -
Grounding 3D Scene Affordance From Egocentric Interactions
di: Liu, Cuiyu, et al.
Pubblicazione: (2024)