LMM-Track4D: Eliciting 4D Dynamic Reasoning in LMMs via Trajectory-Grounded Dialogue
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Chaoyue, Xu, Yongxue, Feng, Jie, Ding, Jiayu |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
LMM4LMM: Benchmarking and Evaluating Large-multimodal Image Generation with LMMs
by: Wang, Jiarui, et al.
Published: (2025)
by: Wang, Jiarui, et al.
Published: (2025)
LMM4Edit: Benchmarking and Evaluating Multimodal Image Editing with LMMs
by: Xu, Zitong, et al.
Published: (2025)
by: Xu, Zitong, et al.
Published: (2025)
How Good is my Video LMM? Complex Video Reasoning and Robustness Evaluation Suite for Video-LMMs
by: Khattak, Muhammad Uzair, et al.
Published: (2024)
by: Khattak, Muhammad Uzair, et al.
Published: (2024)
CrossLMM: Decoupling Long Video Sequences from LMMs via Dual Cross-Attention Mechanisms
by: Yan, Shilin, et al.
Published: (2025)
by: Yan, Shilin, et al.
Published: (2025)
LLaVA-4D: Embedding SpatioTemporal Prompt into LMMs for 4D Scene Understanding
by: Zhou, Hanyu, et al.
Published: (2025)
by: Zhou, Hanyu, et al.
Published: (2025)
Disturbing Image Detection Using LMM-Elicited Emotion Embeddings
by: Tzelepi, Maria, et al.
Published: (2024)
by: Tzelepi, Maria, et al.
Published: (2024)
Thinking in Dynamics: How Multimodal Large Language Models Perceive, Track, and Reason Dynamics in Physical 4D World
by: Huang, Yuzhi, et al.
Published: (2026)
by: Huang, Yuzhi, et al.
Published: (2026)
F-LMM: Grounding Frozen Large Multimodal Models
by: Wu, Size, et al.
Published: (2024)
by: Wu, Size, et al.
Published: (2024)
Sync4D: Video Guided Controllable Dynamics for Physics-Based 4D Generation
by: Fu, Zhoujie, et al.
Published: (2024)
by: Fu, Zhoujie, et al.
Published: (2024)
Bayesian Approximation-Based Trajectory Prediction and Tracking with 4D Radar
by: Kim, Dong-In, et al.
Published: (2025)
by: Kim, Dong-In, et al.
Published: (2025)
SceneCOT: Eliciting Grounded Chain-of-Thought Reasoning in 3D Scenes
by: Linghu, Xiongkun, et al.
Published: (2025)
by: Linghu, Xiongkun, et al.
Published: (2025)
PoreTrack3D: A Benchmark for Dynamic 3D Gaussian Splatting in Pore-Scale Facial Trajectory Tracking
by: Li, Dong, et al.
Published: (2025)
by: Li, Dong, et al.
Published: (2025)
3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer
by: Deng, Jiajun, et al.
Published: (2025)
by: Deng, Jiajun, et al.
Published: (2025)
Predicting 4D Hand Trajectory from Monocular Videos
by: Ye, Yufei, et al.
Published: (2025)
by: Ye, Yufei, et al.
Published: (2025)
Trace Anything: Representing Any Video in 4D via Trajectory Fields
by: Liu, Xinhang, et al.
Published: (2025)
by: Liu, Xinhang, et al.
Published: (2025)
TC4D: Trajectory-Conditioned Text-to-4D Generation
by: Bahmani, Sherwin, et al.
Published: (2024)
by: Bahmani, Sherwin, et al.
Published: (2024)
Resonance4D: Frequency-Domain Motion Supervision for Preset-Free Physical Parameter Learning in 4D Dynamic Physical Scene Simulation
by: Zhang, Changshe, et al.
Published: (2026)
by: Zhang, Changshe, et al.
Published: (2026)
St4RTrack: Simultaneous 4D Reconstruction and Tracking in the World
by: Feng, Haiwen, et al.
Published: (2025)
by: Feng, Haiwen, et al.
Published: (2025)
Ground4D: Spatially-Grounded Feedforward 4D Reconstruction for Unstructured Off-Road Scenes
by: Wang, Shuo, et al.
Published: (2026)
by: Wang, Shuo, et al.
Published: (2026)
TrackOcc: Camera-based 4D Panoptic Occupancy Tracking
by: Chen, Zhuoguang, et al.
Published: (2025)
by: Chen, Zhuoguang, et al.
Published: (2025)
Learning to Wander: Improving the Global Image Geolocation Ability of LMMs via Actionable Reasoning
by: Zheng, Yushuo, et al.
Published: (2026)
by: Zheng, Yushuo, et al.
Published: (2026)
Catalyst4D: High-Fidelity 3D-to-4D Scene Editing via Dynamic Propagation
by: Chen, Shifeng, et al.
Published: (2026)
by: Chen, Shifeng, et al.
Published: (2026)
Inst3D-LMM: Instance-Aware 3D Scene Understanding with Multi-modal Instruction Tuning
by: Yu, Hanxun, et al.
Published: (2025)
by: Yu, Hanxun, et al.
Published: (2025)
Dyna3DGR: 4D Cardiac Motion Tracking with Dynamic 3D Gaussian Representation
by: Fu, Xueming, et al.
Published: (2025)
by: Fu, Xueming, et al.
Published: (2025)
Idea23D: Collaborative LMM Agents Enable 3D Model Generation from Interleaved Multimodal Inputs
by: Chen, Junhao, et al.
Published: (2024)
by: Chen, Junhao, et al.
Published: (2024)
4D Gaussian Splatting: Modeling Dynamic Scenes with Native 4D Primitives
by: Yang, Zeyu, et al.
Published: (2024)
by: Yang, Zeyu, et al.
Published: (2024)
4DGen: Grounded 4D Content Generation with Spatial-temporal Consistency
by: Yin, Yuyang, et al.
Published: (2023)
by: Yin, Yuyang, et al.
Published: (2023)
MOAT: Evaluating LMMs for Capability Integration and Instruction Grounding
by: Ye, Zhoutong, et al.
Published: (2025)
by: Ye, Zhoutong, et al.
Published: (2025)
TRASE: Tracking-free 4D Segmentation and Editing
by: Li, Yun-Jin, et al.
Published: (2024)
by: Li, Yun-Jin, et al.
Published: (2024)
4DVGGT-D: 4D Visual Geometry Transformer with Improved Dynamic Depth Estimation
by: Zang, Ying, et al.
Published: (2026)
by: Zang, Ying, et al.
Published: (2026)
Mesh4D: 4D Mesh Reconstruction and Tracking from Monocular Video
by: Jiang, Zeren, et al.
Published: (2026)
by: Jiang, Zeren, et al.
Published: (2026)
4Dynamic: Text-to-4D Generation with Hybrid Priors
by: Yuan, Yu-Jie, et al.
Published: (2024)
by: Yuan, Yu-Jie, et al.
Published: (2024)
LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness
by: Zhu, Chenming, et al.
Published: (2024)
by: Zhu, Chenming, et al.
Published: (2024)
4DLangVGGT: 4D Language-Visual Geometry Grounded Transformer
by: Wu, Xianfeng, et al.
Published: (2025)
by: Wu, Xianfeng, et al.
Published: (2025)
Exploring the Potential of Encoder-free Architectures in 3D LMMs
by: Tang, Yiwen, et al.
Published: (2025)
by: Tang, Yiwen, et al.
Published: (2025)
VisioMath: Benchmarking Figure-based Mathematical Reasoning in LMMs
by: Li, Can, et al.
Published: (2025)
by: Li, Can, et al.
Published: (2025)
An LMM for Efficient Video Understanding via Reinforced Compression of Video Cubes
by: Qi, Ji, et al.
Published: (2025)
by: Qi, Ji, et al.
Published: (2025)
LMM-PCQA: Assisting Point Cloud Quality Assessment with LMM
by: Zhang, Zicheng, et al.
Published: (2024)
by: Zhang, Zicheng, et al.
Published: (2024)
Trajectory Consistency Distillation: Improved Latent Consistency Distillation by Semi-Linear Consistency Function with Trajectory Mapping
by: Zheng, Jianbin, et al.
Published: (2024)
by: Zheng, Jianbin, et al.
Published: (2024)
EgoReasoner: Learning Egocentric 4D Reasoning via Task-Adaptive Structured Thinking
by: Zhu, Fangrui, et al.
Published: (2026)
by: Zhu, Fangrui, et al.
Published: (2026)
Similar Items
-
LMM4LMM: Benchmarking and Evaluating Large-multimodal Image Generation with LMMs
by: Wang, Jiarui, et al.
Published: (2025) -
LMM4Edit: Benchmarking and Evaluating Multimodal Image Editing with LMMs
by: Xu, Zitong, et al.
Published: (2025) -
How Good is my Video LMM? Complex Video Reasoning and Robustness Evaluation Suite for Video-LMMs
by: Khattak, Muhammad Uzair, et al.
Published: (2024) -
CrossLMM: Decoupling Long Video Sequences from LMMs via Dual Cross-Attention Mechanisms
by: Yan, Shilin, et al.
Published: (2025) -
LLaVA-4D: Embedding SpatioTemporal Prompt into LMMs for 4D Scene Understanding
by: Zhou, Hanyu, et al.
Published: (2025)