OmniGround: A Comprehensive Spatio-Temporal Grounding Benchmark for Real-World Complex Scenarios
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gao, Hong, Wu, Jingyu, Xu, Xiangkai, Xie, Kangni, Zhang, Yunchen, Zhong, Bin, Gao, Xurui, Zhang, Min-Ling |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
OmniSTVG: Toward Spatio-Temporal Omni-Object Video Grounding
par: Yao, Jiali, et autres
Publié: (2025)
par: Yao, Jiali, et autres
Publié: (2025)
RGBT-Ground Benchmark: Visual Grounding Beyond RGB in Complex Real-World Scenarios
par: Zhao, Tianyi, et autres
Publié: (2025)
par: Zhao, Tianyi, et autres
Publié: (2025)
Bridging Time and Space: Decoupled Spatio-Temporal Alignment for Video Grounding
par: Tu, Xuezhen, et autres
Publié: (2026)
par: Tu, Xuezhen, et autres
Publié: (2026)
DecompileBench: A Comprehensive Benchmark for Evaluating Decompilers in Real-World Scenarios
par: Gao, Zeyu, et autres
Publié: (2025)
par: Gao, Zeyu, et autres
Publié: (2025)
Planning, Creation, Usage: Benchmarking LLMs for Comprehensive Tool Utilization in Real-World Complex Scenarios
par: Huang, Shijue, et autres
Publié: (2024)
par: Huang, Shijue, et autres
Publié: (2024)
Context-Guided Spatio-Temporal Video Grounding
par: Gu, Xin, et autres
Publié: (2024)
par: Gu, Xin, et autres
Publié: (2024)
MoChat: Joints-Grouped Spatio-Temporal Grounding LLM for Multi-Turn Motion Comprehension and Description
par: Mo, Jiawei, et autres
Publié: (2024)
par: Mo, Jiawei, et autres
Publié: (2024)
Towards Long-Form Spatio-Temporal Video Grounding
par: Gu, Xin, et autres
Publié: (2026)
par: Gu, Xin, et autres
Publié: (2026)
AGC-Drive: A Large-Scale Dataset for Real-World Aerial-Ground Collaboration in Driving Scenarios
par: Hou, Yunhao, et autres
Publié: (2025)
par: Hou, Yunhao, et autres
Publié: (2025)
ToolOmni: Enabling Open-World Tool Use via Agentic learning with Proactive Retrieval and Grounded Execution
par: Huang, Shouzheng, et autres
Publié: (2026)
par: Huang, Shouzheng, et autres
Publié: (2026)
Detector-Empowered Video Large Language Model for Efficient Spatio-Temporal Grounding
par: Gao, Shida, et autres
Publié: (2025)
par: Gao, Shida, et autres
Publié: (2025)
Know-Show: Benchmarking Video-Language Models on Spatio-Temporal Grounded Reasoning
par: Sugandhika, Chinthani, et autres
Publié: (2025)
par: Sugandhika, Chinthani, et autres
Publié: (2025)
SpaceVLLM: Endowing Multimodal Large Language Model with Spatio-Temporal Video Grounding Capability
par: Wang, Jiankang, et autres
Publié: (2025)
par: Wang, Jiankang, et autres
Publié: (2025)
Video-GroundingDINO: Towards Open-Vocabulary Spatio-Temporal Video Grounding
par: Wasim, Syed Talal, et autres
Publié: (2023)
par: Wasim, Syed Talal, et autres
Publié: (2023)
MolGround: A Benchmark for Molecular Grounding
par: Wu, Jiaxin, et autres
Publié: (2025)
par: Wu, Jiaxin, et autres
Publié: (2025)
RecipeGen: A Step-Aligned Multimodal Benchmark for Real-World Recipe Generation
par: Zhang, Ruoxuan, et autres
Publié: (2025)
par: Zhang, Ruoxuan, et autres
Publié: (2025)
DV-World: Benchmarking Data Visualization Agents in Real-World Scenarios
par: Meng, Jinxiang, et autres
Publié: (2026)
par: Meng, Jinxiang, et autres
Publié: (2026)
CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering
par: Zhang, Mingfang, et autres
Publié: (2026)
par: Zhang, Mingfang, et autres
Publié: (2026)
OmniVGGT: Omni-Modality Driven Visual Geometry Grounded Transformer
par: Peng, Haosong, et autres
Publié: (2025)
par: Peng, Haosong, et autres
Publié: (2025)
Agentic Spatio-Temporal Grounding via Collaborative Reasoning
par: Zhao, Heng, et autres
Publié: (2026)
par: Zhao, Heng, et autres
Publié: (2026)
VideoMolmo: Spatio-Temporal Grounding Meets Pointing
par: Ahmad, Ghazi Shazan, et autres
Publié: (2025)
par: Ahmad, Ghazi Shazan, et autres
Publié: (2025)
OmniVTG: A Large-Scale Dataset and Training Paradigm for Open-World Video Temporal Grounding
par: Zheng, Minghang, et autres
Publié: (2026)
par: Zheng, Minghang, et autres
Publié: (2026)
OmniACBench: A Benchmark for Evaluating Context-Grounded Acoustic Control in Omni-Modal Models
par: Kim, Seunghee, et autres
Publié: (2026)
par: Kim, Seunghee, et autres
Publié: (2026)
Beyond Referring Expressions: Scenario Comprehension Visual Grounding
par: He, Ruozhen, et autres
Publié: (2026)
par: He, Ruozhen, et autres
Publié: (2026)
Paladin-mini: A Compact and Efficient Grounding Model Excelling in Real-World Scenarios
par: Ivry, Dror, et autres
Publié: (2025)
par: Ivry, Dror, et autres
Publié: (2025)
OMHBench: Benchmarking Balanced and Grounded Omni-Modal Multi-Hop Reasoning
par: Kim, Seunghee, et autres
Publié: (2025)
par: Kim, Seunghee, et autres
Publié: (2025)
Interacted Object Grounding in Spatio-Temporal Human-Object Interactions
par: Liu, Xiaoyang, et autres
Publié: (2024)
par: Liu, Xiaoyang, et autres
Publié: (2024)
ToG-Bench: Task-Oriented Spatio-Temporal Grounding in Egocentric Videos
par: Xu, Qi'ao, et autres
Publié: (2025)
par: Xu, Qi'ao, et autres
Publié: (2025)
ReasonTabQA: A Comprehensive Benchmark for Table Question Answering from Real World Industrial Scenarios
par: Pan, Changzai, et autres
Publié: (2026)
par: Pan, Changzai, et autres
Publié: (2026)
WorldCoder-Bench: Benchmarking Physically Grounded 3D World Synthesis
par: Lu, Shuo, et autres
Publié: (2026)
par: Lu, Shuo, et autres
Publié: (2026)
Grounding-MD: Grounded Video-language Pre-training for Open-World Moment Detection
par: Zhuang, Weijun, et autres
Publié: (2025)
par: Zhuang, Weijun, et autres
Publié: (2025)
STPro: Spatial and Temporal Progressive Learning for Weakly Supervised Spatio-Temporal Grounding
par: Garg, Aaryan, et autres
Publié: (2025)
par: Garg, Aaryan, et autres
Publié: (2025)
Thinking With Bounding Boxes: Enhancing Spatio-Temporal Video Grounding via Reinforcement Fine-Tuning
par: Gu, Xin, et autres
Publié: (2025)
par: Gu, Xin, et autres
Publié: (2025)
OmniCompliance-100K: A Multi-Domain, Rule-Grounded, Real-World Safety Compliance Dataset
par: Hu, Wenbin, et autres
Publié: (2026)
par: Hu, Wenbin, et autres
Publié: (2026)
Towards Robust Sensor-Fusion Ground SLAM: A Comprehensive Benchmark and A Resilient Framework
par: Zhang, Deteng, et autres
Publié: (2025)
par: Zhang, Deteng, et autres
Publié: (2025)
Grounding World Simulation Models in a Real-World Metropolis
par: Seo, Junyoung, et autres
Publié: (2026)
par: Seo, Junyoung, et autres
Publié: (2026)
A Cross Spatio-Temporal Pathology-based Lung Nodule Dataset
par: Jian, Muwei, et autres
Publié: (2024)
par: Jian, Muwei, et autres
Publié: (2024)
ShoppingBench: A Real-World Intent-Grounded Shopping Benchmark for LLM-based Agents
par: Wang, Jiangyuan, et autres
Publié: (2025)
par: Wang, Jiangyuan, et autres
Publié: (2025)
MDPBench: A Benchmark for Multilingual Document Parsing in Real-World Scenarios
par: Li, Zhang, et autres
Publié: (2026)
par: Li, Zhang, et autres
Publié: (2026)
Spatio-Temporal Grounding of Large Language Models from Perception Streams
par: Anderson, Jacob, et autres
Publié: (2026)
par: Anderson, Jacob, et autres
Publié: (2026)
Documents similaires
-
OmniSTVG: Toward Spatio-Temporal Omni-Object Video Grounding
par: Yao, Jiali, et autres
Publié: (2025) -
RGBT-Ground Benchmark: Visual Grounding Beyond RGB in Complex Real-World Scenarios
par: Zhao, Tianyi, et autres
Publié: (2025) -
Bridging Time and Space: Decoupled Spatio-Temporal Alignment for Video Grounding
par: Tu, Xuezhen, et autres
Publié: (2026) -
DecompileBench: A Comprehensive Benchmark for Evaluating Decompilers in Real-World Scenarios
par: Gao, Zeyu, et autres
Publié: (2025) -
Planning, Creation, Usage: Benchmarking LLMs for Comprehensive Tool Utilization in Real-World Complex Scenarios
par: Huang, Shijue, et autres
Publié: (2024)