Thinking in Dynamics: How Multimodal Large Language Models Perceive, Track, and Reason Dynamics in Physical 4D World
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Huang, Yuzhi, Wen, Kairun, Gao, Rongxin, Liu, Dongxuan, Lou, Yibin, Wu, Jie, Xu, Jing, Zhang, Jian, Yang, Zheng, Lin, Yunlong, Li, Chenxin, Pan, Panwang, Lu, Junbin, Jiang, Jingyan, Ding, Xinghao, Huang, Yue, Wang, Zhi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DynamicVerse: A Physically-Aware Multimodal Framework for 4D World Modeling
par: Wen, Kairun, et autres
Publié: (2025)
par: Wen, Kairun, et autres
Publié: (2025)
HumanCrafter: Synergizing Generalizable Human Reconstruction and Semantic 3D Segmentation
par: Pan, Panwang, et autres
Publié: (2025)
par: Pan, Panwang, et autres
Publié: (2025)
Diff4Splat: Controllable 4D Scene Generation with Latent Dynamic Reconstruction Models
par: Pan, Panwang, et autres
Publié: (2025)
par: Pan, Panwang, et autres
Publié: (2025)
Pan-LUT: Efficient Pan-sharpening via Learnable Look-Up Tables
par: Cai, Zhongnan, et autres
Publié: (2025)
par: Cai, Zhongnan, et autres
Publié: (2025)
Track Any Anomalous Object: A Granular Video Anomaly Detection Pipeline
par: Huang, Yuzhi, et autres
Publié: (2025)
par: Huang, Yuzhi, et autres
Publié: (2025)
JarvisIR: Elevating Autonomous Driving Perception with Intelligent Image Restoration
par: Lin, Yunlong, et autres
Publié: (2025)
par: Lin, Yunlong, et autres
Publié: (2025)
PCMamba: Physics-Informed Cross-Modal State Space Model for Dual-Camera Compressive Hyperspectral Imaging
par: Meng, Ge, et autres
Publié: (2025)
par: Meng, Ge, et autres
Publié: (2025)
JarvisArt: Liberating Human Artistic Creativity via an Intelligent Photo Retouching Agent
par: Lin, Yunlong, et autres
Publié: (2025)
par: Lin, Yunlong, et autres
Publié: (2025)
Unsupervised Low-light Image Enhancement with Lookup Tables and Diffusion Priors
par: Lin, Yunlong, et autres
Publié: (2024)
par: Lin, Yunlong, et autres
Publié: (2024)
World2VLM: Distilling World Model Imagination into VLMs for Dynamic Spatial Reasoning
par: Zhang, Wanyue, et autres
Publié: (2026)
par: Zhang, Wanyue, et autres
Publié: (2026)
FRN: Fractal-Based Recursive Spectral Reconstruction Network
par: Meng, Ge, et autres
Publié: (2025)
par: Meng, Ge, et autres
Publié: (2025)
Dissecting Generalized Category Discovery: Multiplex Consensus under Self-Deconstruction
par: Tang, Luyao, et autres
Publié: (2025)
par: Tang, Luyao, et autres
Publié: (2025)
Think in Safety: Unveiling and Mitigating Safety Alignment Collapse in Multimodal Large Reasoning Model
par: Lou, Xinyue, et autres
Publié: (2025)
par: Lou, Xinyue, et autres
Publié: (2025)
RoboStream: Weaving Spatio-Temporal Reasoning with Memory in Vision-Language Models for Robotics
par: Huang, Yuzhi, et autres
Publié: (2026)
par: Huang, Yuzhi, et autres
Publié: (2026)
Beyond English-Centric Training: How Reinforcement Learning Improves Cross-Lingual Reasoning in LLMs
par: Huang, Shulin, et autres
Publié: (2025)
par: Huang, Shulin, et autres
Publié: (2025)
Boosting Accelerated Proximal Gradient Method with Adaptive Sampling for Stochastic Composite Optimization
par: Zhu, Dongxuan, et autres
Publié: (2025)
par: Zhu, Dongxuan, et autres
Publié: (2025)
CheXWorld: Exploring Image World Modeling for Radiograph Representation Learning
par: Yue, Yang, et autres
Publié: (2025)
par: Yue, Yang, et autres
Publié: (2025)
Discover Your Neighbors: Advanced Stable Test-Time Adaptation in Dynamic World
par: Jiang, Qinting, et autres
Publié: (2024)
par: Jiang, Qinting, et autres
Publié: (2024)
SAT: Balancing Reasoning Accuracy and Efficiency with Stepwise Adaptive Thinking
par: Huang, Weiyang, et autres
Publié: (2026)
par: Huang, Weiyang, et autres
Publié: (2026)
ThinkBench: Dynamic Out-of-Distribution Evaluation for Robust LLM Reasoning
par: Huang, Shulin, et autres
Publié: (2025)
par: Huang, Shulin, et autres
Publié: (2025)
AtomThink: Multimodal Slow Thinking with Atomic Step Reasoning
par: Xiang, Kun, et autres
Publié: (2024)
par: Xiang, Kun, et autres
Publié: (2024)
Detection of a Sparse Change in High-Dimensional Time Series
par: Huang, Jingyan
Publié: (2025)
par: Huang, Jingyan
Publié: (2025)
GaussianStego: A Generalizable Stenography Pipeline for Generative 3D Gaussians Splatting
par: Li, Chenxin, et autres
Publié: (2024)
par: Li, Chenxin, et autres
Publié: (2024)
DynOPETs: A Versatile Benchmark for Dynamic Object Pose Estimation and Tracking in Moving Camera Scenarios
par: Meng, Xiangting, et autres
Publié: (2025)
par: Meng, Xiangting, et autres
Publié: (2025)
Fully Dynamic Spectral and Cut Sparsifiers for Directed Graphs
par: Zhao, Yibin
Publié: (2025)
par: Zhao, Yibin
Publié: (2025)
Feature-Based Instance Neighbor Discovery: Advanced Stable Test-Time Adaptation in Dynamic World
par: Jiang, Qinting, et autres
Publié: (2025)
par: Jiang, Qinting, et autres
Publié: (2025)
Test-time Diverse Reasoning by Riemannian Activation Steering
par: Khanh, Ly Tran Ho, et autres
Publié: (2025)
par: Khanh, Ly Tran Ho, et autres
Publié: (2025)
TwiSTAR:Think Fast, Think Slow, Then Act,Generative Recommendation with Adaptive Reasoning
par: Cao, Shiteng, et autres
Publié: (2026)
par: Cao, Shiteng, et autres
Publié: (2026)
Think Dense, Not Long: Dynamic Decoupled Conditional Advantage for Efficient Reasoning
par: Peng, Keqin, et autres
Publié: (2026)
par: Peng, Keqin, et autres
Publié: (2026)
MM-UAVBench: How Well Do Multimodal Large Language Models See, Think, and Plan in Low-Altitude UAV Scenarios?
par: Dai, Shiqi, et autres
Publié: (2025)
par: Dai, Shiqi, et autres
Publié: (2025)
The Dynamics of Relational Innovation Leadership: A Case Study of Lip‐Bu Tan
par: Eric Li, et autres
Publié: (2026)
par: Eric Li, et autres
Publié: (2026)
WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning
par: Yeo, Woongyeong, et autres
Publié: (2025)
par: Yeo, Woongyeong, et autres
Publié: (2025)
DASICS White Paper: Enhancing Memory Protection with Dynamic Compartmentalization
par: Jin, Yue, et autres
Publié: (2023)
par: Jin, Yue, et autres
Publié: (2023)
Think Natively: Unlocking Multilingual Reasoning with Consistency-Enhanced Reinforcement Learning
par: Zhang, Xue, et autres
Publié: (2025)
par: Zhang, Xue, et autres
Publié: (2025)
Don't Think Longer, Think Wisely: Optimizing Thinking Dynamics for Large Reasoning Models
par: An, Sohyun, et autres
Publié: (2025)
par: An, Sohyun, et autres
Publié: (2025)
Modeling LLM Agent Reviewer Dynamics in Elo-Ranked Review System
par: Huang, Hsiang-Wei, et autres
Publié: (2026)
par: Huang, Hsiang-Wei, et autres
Publié: (2026)
How Emotional Appeals and Deliberative Thinking Relate to Perceived Effectiveness
par: Shuichiro Kawaguchi, et autres
Publié: (2026)
par: Shuichiro Kawaguchi, et autres
Publié: (2026)
An optimization-based equilibrium measure describes non-equilibrium steady state dynamics: application to edge of chaos
par: Qiu, Junbin, et autres
Publié: (2024)
par: Qiu, Junbin, et autres
Publié: (2024)
ThinkQE: Query Expansion via an Evolving Thinking Process
par: Lei, Yibin, et autres
Publié: (2025)
par: Lei, Yibin, et autres
Publié: (2025)
ID-Crafter: VLM-Grounded Online RL for Compositional Multi-Subject Video Generation
par: Pan, Panwang, et autres
Publié: (2025)
par: Pan, Panwang, et autres
Publié: (2025)
Documents similaires
-
DynamicVerse: A Physically-Aware Multimodal Framework for 4D World Modeling
par: Wen, Kairun, et autres
Publié: (2025) -
HumanCrafter: Synergizing Generalizable Human Reconstruction and Semantic 3D Segmentation
par: Pan, Panwang, et autres
Publié: (2025) -
Diff4Splat: Controllable 4D Scene Generation with Latent Dynamic Reconstruction Models
par: Pan, Panwang, et autres
Publié: (2025) -
Pan-LUT: Efficient Pan-sharpening via Learnable Look-Up Tables
par: Cai, Zhongnan, et autres
Publié: (2025) -
Track Any Anomalous Object: A Granular Video Anomaly Detection Pipeline
par: Huang, Yuzhi, et autres
Publié: (2025)