Motion-o: Trajectory-Grounded Video Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Galoaa, Bishoy, Moezzi, Shayda, Bai, Xiangyu, Ostadabbas, Sarah |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MoReGen: Multi-Agent Motion-Reasoning Engine for Code-based Text-to-Video Synthesis
par: Bai, Xiangyu, et autres
Publié: (2025)
par: Bai, Xiangyu, et autres
Publié: (2025)
Structure Over Scale: Learning Visual Reasoning from Pedagogical Video
par: Galoaa, Bishoy, et autres
Publié: (2026)
par: Galoaa, Bishoy, et autres
Publié: (2026)
Track and Caption Any Motion: Query-Free Motion Discovery and Description in Videos
par: Galoaa, Bishoy, et autres
Publié: (2025)
par: Galoaa, Bishoy, et autres
Publié: (2025)
Lang2Motion: Bridging Language and Motion through Joint Embedding Spaces
par: Galoaa, Bishoy, et autres
Publié: (2025)
par: Galoaa, Bishoy, et autres
Publié: (2025)
PanoWorld: Geometry-Consistent Panoramic Video World Modeling
par: Jiang, Le, et autres
Publié: (2026)
par: Jiang, Le, et autres
Publié: (2026)
HORNet: Task-Guided Frame Selection for Video Question Answering with Vision-Language Models
par: Bai, Xiangyu, et autres
Publié: (2026)
par: Bai, Xiangyu, et autres
Publié: (2026)
Look Around and Pay Attention: Multi-camera Point Tracking Reimagined with Transformers
par: Galoaa, Bishoy, et autres
Publié: (2025)
par: Galoaa, Bishoy, et autres
Publié: (2025)
K-Track: Kalman-Enhanced Tracking for Accelerating Deep Point Trackers on Edge Devices
par: Galoaa, Bishoy, et autres
Publié: (2025)
par: Galoaa, Bishoy, et autres
Publié: (2025)
Broadening View Synthesis of Dynamic Scenes from Constrained Monocular Videos
par: Jiang, Le, et autres
Publié: (2025)
par: Jiang, Le, et autres
Publié: (2025)
UniTrack: Differentiable Graph Representation Learning for Multi-Object Tracking
par: Galoaa, Bishoy, et autres
Publié: (2026)
par: Galoaa, Bishoy, et autres
Publié: (2026)
Motion-Grounded Video Reasoning: Understanding and Perceiving Motion at Pixel Level
par: Deng, Andong, et autres
Publié: (2024)
par: Deng, Andong, et autres
Publié: (2024)
Physics-Grounded Motion Forecasting via Equation Discovery for Trajectory-Guided Image-to-Video Generation
par: Feng, Tao, et autres
Publié: (2025)
par: Feng, Tao, et autres
Publié: (2025)
Think with Grounding: Curriculum Reinforced Reasoning with Video Grounding for Long Video Understanding
par: Chen, Houlun, et autres
Publié: (2026)
par: Chen, Houlun, et autres
Publié: (2026)
PhyMotion: Structured 3D Motion Reward for Physics-Grounded Human Video Generation
par: Huang, Yidong, et autres
Publié: (2026)
par: Huang, Yidong, et autres
Publié: (2026)
Motion Dreamer: Boundary Conditional Motion Reasoning for Physically Coherent Video Generation
par: Xu, Tianshuo, et autres
Publié: (2024)
par: Xu, Tianshuo, et autres
Publié: (2024)
PhyGround: Benchmarking Physical Reasoning in Generative World Models
par: Lin, Juyi, et autres
Publié: (2026)
par: Lin, Juyi, et autres
Publié: (2026)
Open-o3-Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidence
par: Meng, Jiahao, et autres
Publié: (2025)
par: Meng, Jiahao, et autres
Publié: (2025)
Commonsense Video Question Answering through Video-Grounded Entailment Tree Reasoning
par: Liu, Huabin, et autres
Publié: (2025)
par: Liu, Huabin, et autres
Publié: (2025)
When Thinking Drifts: Evidential Grounding for Robust Video Reasoning
par: Luo, Mi, et autres
Publié: (2025)
par: Luo, Mi, et autres
Publié: (2025)
Flowing from Reasoning to Motion: Learning 3D Hand Trajectory Prediction from Egocentric Human Interaction Videos
par: Chen, Mingfei, et autres
Publié: (2025)
par: Chen, Mingfei, et autres
Publié: (2025)
VideoMind: A Chain-of-LoRA Agent for Temporal-Grounded Video Reasoning
par: Liu, Ye, et autres
Publié: (2025)
par: Liu, Ye, et autres
Publié: (2025)
PhyT2V: LLM-Guided Iterative Self-Refinement for Physics-Grounded Text-to-Video Generation
par: Xue, Qiyao, et autres
Publié: (2024)
par: Xue, Qiyao, et autres
Publié: (2024)
VisionCoach: Reinforcing Grounded Video Reasoning via Visual-Perception Prompting
par: Lee, Daeun, et autres
Publié: (2026)
par: Lee, Daeun, et autres
Publié: (2026)
MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering
par: Dang, Jisheng, et autres
Publié: (2025)
par: Dang, Jisheng, et autres
Publié: (2025)
VideoTemp-o3: Harmonizing Temporal Grounding and Video Understanding in Agentic Thinking-with-Videos
par: Liu, Wenqi, et autres
Publié: (2026)
par: Liu, Wenqi, et autres
Publié: (2026)
TAR-TVG: Enhancing VLMs with Timestamp Anchor-Constrained Reasoning for Temporal Video Grounding
par: Guo, Chaohong, et autres
Publié: (2025)
par: Guo, Chaohong, et autres
Publié: (2025)
VEGGIE: Instructional Editing and Reasoning Video Concepts with Grounded Generation
par: Yu, Shoubin, et autres
Publié: (2025)
par: Yu, Shoubin, et autres
Publié: (2025)
WorldReel: 4D Video Generation with Consistent Geometry and Motion Modeling
par: Fang, Shaoheng, et autres
Publié: (2025)
par: Fang, Shaoheng, et autres
Publié: (2025)
Joint Flow Trajectory Optimization For Feasible Robot Motion Generation from Video Demonstrations
par: Dong, Xiaoxiang, et autres
Publié: (2025)
par: Dong, Xiaoxiang, et autres
Publié: (2025)
Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation
par: Yariv, Guy, et autres
Publié: (2025)
par: Yariv, Guy, et autres
Publié: (2025)
Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models
par: Wang, Haibo, et autres
Publié: (2024)
par: Wang, Haibo, et autres
Publié: (2024)
Coordinating Multiple Conditions for Trajectory-Controlled Human Motion Generation
par: Cai, Deli, et autres
Publié: (2026)
par: Cai, Deli, et autres
Publié: (2026)
MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs
par: Yuan, Jiakang, et autres
Publié: (2025)
par: Yuan, Jiakang, et autres
Publié: (2025)
VideoITG: Multimodal Video Understanding with Instructed Temporal Grounding
par: Wang, Shihao, et autres
Publié: (2025)
par: Wang, Shihao, et autres
Publié: (2025)
3DAxisPrompt: Promoting the 3D Grounding and Reasoning in GPT-4o
par: Liu, Dingning, et autres
Publié: (2025)
par: Liu, Dingning, et autres
Publié: (2025)
MotionFlow: Attention-Driven Motion Transfer in Video Diffusion Models
par: Meral, Tuna Han Salih, et autres
Publié: (2024)
par: Meral, Tuna Han Salih, et autres
Publié: (2024)
One Trajectory, One Token: Grounded Video Tokenization via Panoptic Sub-object Trajectory
par: Zheng, Chenhao, et autres
Publié: (2025)
par: Zheng, Chenhao, et autres
Publié: (2025)
Enhancing Bandwidth Efficiency for Video Motion Transfer Applications using Deep Learning Based Keypoint Prediction
par: Bai, Xue, et autres
Publié: (2024)
par: Bai, Xue, et autres
Publié: (2024)
Towards Efficient Real-Time Video Motion Transfer via Generative Time Series Modeling
par: Haque, Tasmiah, et autres
Publié: (2025)
par: Haque, Tasmiah, et autres
Publié: (2025)
Reasoning Matters for 3D Visual Grounding
par: Huang, Hsiang-Wei, et autres
Publié: (2026)
par: Huang, Hsiang-Wei, et autres
Publié: (2026)
Documents similaires
-
MoReGen: Multi-Agent Motion-Reasoning Engine for Code-based Text-to-Video Synthesis
par: Bai, Xiangyu, et autres
Publié: (2025) -
Structure Over Scale: Learning Visual Reasoning from Pedagogical Video
par: Galoaa, Bishoy, et autres
Publié: (2026) -
Track and Caption Any Motion: Query-Free Motion Discovery and Description in Videos
par: Galoaa, Bishoy, et autres
Publié: (2025) -
Lang2Motion: Bridging Language and Motion through Joint Embedding Spaces
par: Galoaa, Bishoy, et autres
Publié: (2025) -
PanoWorld: Geometry-Consistent Panoramic Video World Modeling
par: Jiang, Le, et autres
Publié: (2026)