Token Predictors Are Not Planners: Building Physically Grounded Causal Reasoners
Fuente:
arXiv
Saved in:
| Main Authors: | Lu, Zheng, Gao, Mingqi, Xie, Qinlei, Zhong, Wanqi, Cui, Hanwen, Cao, Heng, Song, Zirui, Yang, Yifan, Luo, Chong, Liu, Bei, Li, Yiming |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Large Trajectory Models are Scalable Motion Predictors and Planners
by: Sun, Qiao, et al.
Published: (2023)
by: Sun, Qiao, et al.
Published: (2023)
Learning Trajectory-Aware Multimodal Large Language Models for Video Reasoning Segmentation
by: Luo, Jingnan, et al.
Published: (2026)
by: Luo, Jingnan, et al.
Published: (2026)
Correct Is Not Enough: Training Reasoning Planners with Executor-Grounded Rewards
by: Han, Tianyang, et al.
Published: (2026)
by: Han, Tianyang, et al.
Published: (2026)
MMCR: Benchmarking Cross-Source Reasoning in Scientific Papers
by: Tian, Yang, et al.
Published: (2025)
by: Tian, Yang, et al.
Published: (2025)
Dialogue Action Tokens: Steering Language Models in Goal-Directed Dialogue with a Multi-Turn Planner
by: Li, Kenneth, et al.
Published: (2024)
by: Li, Kenneth, et al.
Published: (2024)
ProTrix: Building Models for Planning and Reasoning over Tables with Sentence Context
by: Wu, Zirui, et al.
Published: (2024)
by: Wu, Zirui, et al.
Published: (2024)
CodeAgents: A Token-Efficient Framework for Codified Multi-Agent Reasoning in LLMs
by: Yang, Bruce, et al.
Published: (2025)
by: Yang, Bruce, et al.
Published: (2025)
Grounding Multi-Hop Reasoning in Structural Causal Models via Group Relative Policy Optimization
by: Bu, Yunhan, et al.
Published: (2026)
by: Bu, Yunhan, et al.
Published: (2026)
OmniEVA: Embodied Versatile Planner via Task-Adaptive 3D-Grounded and Embodiment-aware Reasoning
by: Liu, Yuecheng, et al.
Published: (2025)
by: Liu, Yuecheng, et al.
Published: (2025)
A Simple yet Effective Layout Token in Large Language Models for Document Understanding
by: Zhu, Zhaoqing, et al.
Published: (2025)
by: Zhu, Zhaoqing, et al.
Published: (2025)
TokenCompose: Text-to-Image Diffusion with Token-level Supervision
by: Wang, Zirui, et al.
Published: (2023)
by: Wang, Zirui, et al.
Published: (2023)
Collapsing Categories for Regression with Mixed Predictors
by: Song, Chaegeun, et al.
Published: (2025)
by: Song, Chaegeun, et al.
Published: (2025)
Video-in-the-Loop: Span-Grounded Long Video QA with Interleaved Reasoning
by: Wang, Chendong, et al.
Published: (2025)
by: Wang, Chendong, et al.
Published: (2025)
GameVerse: Can Vision-Language Models Learn from Video-based Reflection?
by: Zhang, Kuan, et al.
Published: (2026)
by: Zhang, Kuan, et al.
Published: (2026)
InsightBuild: LLM-Powered Causal Reasoning in Smart Building Systems
by: Neogi, Pinaki Prasad Guha, et al.
Published: (2025)
by: Neogi, Pinaki Prasad Guha, et al.
Published: (2025)
Few-Shot Referring Video Single- and Multi-Object Segmentation via Cross-Modal Affinity with Instance Sequence Matching
by: Liu, Heng, et al.
Published: (2025)
by: Liu, Heng, et al.
Published: (2025)
1st Place Solution for MeViS Track in CVPR 2024 PVUW Workshop: Motion Expression guided Video Segmentation
by: Gao, Mingqi, et al.
Published: (2024)
by: Gao, Mingqi, et al.
Published: (2024)
Effectively Prompting Small-sized Language Models for Cross-lingual Tasks via Winning Tickets
by: Li, Mingqi, et al.
Published: (2024)
by: Li, Mingqi, et al.
Published: (2024)
Grounding Generative Planners in Verifiable Logic: A Hybrid Architecture for Trustworthy Embodied AI
by: Wu, Feiyu, et al.
Published: (2026)
by: Wu, Feiyu, et al.
Published: (2026)
ArtiWorld: LLM-Driven Articulation of 3D Objects in Scenes
by: Yang, Yixuan, et al.
Published: (2025)
by: Yang, Yixuan, et al.
Published: (2025)
Intention-Aware Planner for Robust and Safe Aerial Tracking
by: Ren, Qiuyu, et al.
Published: (2023)
by: Ren, Qiuyu, et al.
Published: (2023)
OmniVLN: Omnidirectional 3D Perception and Token-Efficient LLM Reasoning for Visual-Language Navigation across Air and Ground Platforms
by: Liu, Zhongyuang, et al.
Published: (2026)
by: Liu, Zhongyuang, et al.
Published: (2026)
Token-Guard: Towards Token-Level Hallucination Control via Self-Checking Decoding
by: Zhu, Yifan, et al.
Published: (2026)
by: Zhu, Yifan, et al.
Published: (2026)
Learning Multi-graph Structure for Temporal Knowledge Graph Reasoning
by: Zhang, Jinchuan, et al.
Published: (2023)
by: Zhang, Jinchuan, et al.
Published: (2023)
CausalVQA: A Physically Grounded Causal Reasoning Benchmark for Video Models
by: Foss, Aaron, et al.
Published: (2025)
by: Foss, Aaron, et al.
Published: (2025)
KnowDiffuser: A Knowledge-Guided Diffusion Planner with LLM Reasoning
by: Ding, Fan, et al.
Published: (2026)
by: Ding, Fan, et al.
Published: (2026)
One Trajectory, One Token: Grounded Video Tokenization via Panoptic Sub-object Trajectory
by: Zheng, Chenhao, et al.
Published: (2025)
by: Zheng, Chenhao, et al.
Published: (2025)
One Token Is Enough: Improving Diffusion Language Models with a Sink Token
by: Zhang, Zihou, et al.
Published: (2026)
by: Zhang, Zihou, et al.
Published: (2026)
Feature-Aware One-Shot Federated Learning via Hierarchical Token Sequences
by: Liu, Shudong, et al.
Published: (2026)
by: Liu, Shudong, et al.
Published: (2026)
Are LLMs Capable of Data-based Statistical and Causal Reasoning? Benchmarking Advanced Quantitative Reasoning with Data
by: Liu, Xiao, et al.
Published: (2024)
by: Liu, Xiao, et al.
Published: (2024)
Fine-Grained Instruction-Guided Graph Reasoning for Vision-and-Language Navigation
by: Liu, Yaohua, et al.
Published: (2025)
by: Liu, Yaohua, et al.
Published: (2025)
Hybrid Classical/RL Local Planner for Ground Robot Navigation
by: Sharma, Vishnu D., et al.
Published: (2024)
by: Sharma, Vishnu D., et al.
Published: (2024)
Coverage Route Planner of Ground Rovers Considering Hilly Terrains
by: Jonghoek Kim
Published: (2026)
by: Jonghoek Kim
Published: (2026)
EventGround: Narrative Reasoning by Grounding to Eventuality-centric Knowledge Graphs
by: Jiayang, Cheng, et al.
Published: (2024)
by: Jiayang, Cheng, et al.
Published: (2024)
DualMap: Online Open-Vocabulary Semantic Mapping for Natural Language Navigation in Dynamic Changing Scenes
by: Jiang, Jiajun, et al.
Published: (2025)
by: Jiang, Jiajun, et al.
Published: (2025)
Reasoning in Space via Grounding in the World
by: Chen, Yiming, et al.
Published: (2025)
by: Chen, Yiming, et al.
Published: (2025)
Jacobian Regularizer-based Neural Granger Causality
by: Zhou, Wanqi, et al.
Published: (2024)
by: Zhou, Wanqi, et al.
Published: (2024)
CoPlanner: An Interactive Motion Planner with Contingency-Aware Diffusion for Autonomous Driving
by: Zhong, Ruiguo, et al.
Published: (2025)
by: Zhong, Ruiguo, et al.
Published: (2025)
ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning
by: Xu, Ziqiang, et al.
Published: (2025)
by: Xu, Ziqiang, et al.
Published: (2025)
MaP-AVR: A Meta-Action Planner for Agents Leveraging Vision Language Models and Retrieval-Augmented Generation
by: Guo, Zhenglong, et al.
Published: (2025)
by: Guo, Zhenglong, et al.
Published: (2025)
Similar Items
-
Large Trajectory Models are Scalable Motion Predictors and Planners
by: Sun, Qiao, et al.
Published: (2023) -
Learning Trajectory-Aware Multimodal Large Language Models for Video Reasoning Segmentation
by: Luo, Jingnan, et al.
Published: (2026) -
Correct Is Not Enough: Training Reasoning Planners with Executor-Grounded Rewards
by: Han, Tianyang, et al.
Published: (2026) -
MMCR: Benchmarking Cross-Source Reasoning in Scientific Papers
by: Tian, Yang, et al.
Published: (2025) -
Dialogue Action Tokens: Steering Language Models in Goal-Directed Dialogue with a Multi-Turn Planner
by: Li, Kenneth, et al.
Published: (2024)