Enregistré dans:
| Auteurs principaux: | Yuan, Tianyuan, Dong, Zibin, Liu, Yicheng, Zhao, Hang |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2603.16666 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Self-Correcting VLA: Online Action Refinement via Sparse World Imagination
par: Liu, Chenyv, et autres
Publié: (2026)
par: Liu, Chenyv, et autres
Publié: (2026)
DepthVLA: Enhancing Vision-Language-Action Models with Depth-Aware Spatial Reasoning
par: Yuan, Tianyuan, et autres
Publié: (2025)
par: Yuan, Tianyuan, et autres
Publié: (2025)
NEBULA: Do We Evaluate Vision-Language-Action Agents Correctly?
par: Peng, Jierui, et autres
Publié: (2025)
par: Peng, Jierui, et autres
Publié: (2025)
From Summary to Action: Enhancing Large Language Models for Complex Tasks with Open World APIs
par: Liu, Yulong, et autres
Publié: (2024)
par: Liu, Yulong, et autres
Publié: (2024)
When and How Much to Imagine: Adaptive Test-Time Scaling with World Models for Visual Spatial Reasoning
par: Yu, Shoubin, et autres
Publié: (2026)
par: Yu, Shoubin, et autres
Publié: (2026)
Latent-WAM: Latent World Action Modeling for End-to-End Autonomous Driving
par: Wang, Linbo, et autres
Publié: (2026)
par: Wang, Linbo, et autres
Publié: (2026)
Sparse Imagination for Efficient Visual World Model Planning
par: Chun, Junha, et autres
Publié: (2025)
par: Chun, Junha, et autres
Publié: (2025)
Capsule Networks Do Not Need to Model Everything
par: Renzulli, Riccardo, et autres
Publié: (2022)
par: Renzulli, Riccardo, et autres
Publié: (2022)
Do We Need Large VLMs for Spotting Soccer Actions?
par: Chakraborty, Ritabrata, et autres
Publié: (2025)
par: Chakraborty, Ritabrata, et autres
Publié: (2025)
WAM-Flow: Parallel Coarse-to-Fine Motion Planning via Discrete Flow Matching for Autonomous Driving
par: Xu, Yifang, et autres
Publié: (2025)
par: Xu, Yifang, et autres
Publié: (2025)
Percept-WAM: Perception-Enhanced World-Awareness-Action Model for Robust End-to-End Autonomous Driving
par: Han, Jianhua, et autres
Publié: (2025)
par: Han, Jianhua, et autres
Publié: (2025)
Schrödinger's Navigator: Imagining an Ensemble of Futures for Zero-Shot Object Navigation
par: He, Yu, et autres
Publié: (2025)
par: He, Yu, et autres
Publié: (2025)
WAM-Diff: A Masked Diffusion VLA Framework with MoE and Online Reinforcement Learning for Autonomous Driving
par: Xu, Mingwang, et autres
Publié: (2025)
par: Xu, Mingwang, et autres
Publié: (2025)
Learning Vision-Language-Action World Models for Autonomous Driving
par: Wang, Guoqing, et autres
Publié: (2026)
par: Wang, Guoqing, et autres
Publié: (2026)
Highly Efficient Test-Time Scaling for T2I Diffusion Models with Text Embedding Perturbation
par: Xu, Hang, et autres
Publié: (2025)
par: Xu, Hang, et autres
Publié: (2025)
MIND: Benchmarking Memory Consistency and Action Control in World Models
par: Ye, Yixuan, et autres
Publié: (2026)
par: Ye, Yixuan, et autres
Publié: (2026)
Interpretable and Sparse Linear Attention with Decoupled Membership-Subspace Modeling via MCR2 Objective
par: Liu, Tianyuan, et autres
Publié: (2026)
par: Liu, Tianyuan, et autres
Publié: (2026)
Learning Latent Action World Models In The Wild
par: Garrido, Quentin, et autres
Publié: (2026)
par: Garrido, Quentin, et autres
Publié: (2026)
Probing the effectiveness of World Models for Spatial Reasoning through Test-time Scaling
par: Jha, Saurav, et autres
Publié: (2025)
par: Jha, Saurav, et autres
Publié: (2025)
iWorld-Bench: A Benchmark for Interactive World Models with a Unified Action Generation Framework
par: Fang, Jianjie, et autres
Publié: (2026)
par: Fang, Jianjie, et autres
Publié: (2026)
Do Visual Imaginations Improve Vision-and-Language Navigation Agents?
par: Perincherry, Akhil, et autres
Publié: (2025)
par: Perincherry, Akhil, et autres
Publié: (2025)
FASTer: Toward Efficient Autoregressive Vision Language Action Modeling via Neural Action Tokenization
par: Liu, Yicheng, et autres
Publié: (2025)
par: Liu, Yicheng, et autres
Publié: (2025)
Ideal Registration? Segmentation is All You Need
par: Chen, Xiang, et autres
Publié: (2025)
par: Chen, Xiang, et autres
Publié: (2025)
Do We Really Need a Complex Agent System? Distill Embodied Agent into a Single Model
par: Zhao, Zhonghan, et autres
Publié: (2024)
par: Zhao, Zhonghan, et autres
Publié: (2024)
Unified 4D World Action Modeling from Video Priors with Asynchronous Denoising
par: Guo, Jun, et autres
Publié: (2026)
par: Guo, Jun, et autres
Publié: (2026)
DriveWAM: Video Generative Priors Enable Scalable World-Action Modeling for Autonomous Driving
par: Shi, Chen, et autres
Publié: (2026)
par: Shi, Chen, et autres
Publié: (2026)
SFMViT: SlowFast Meet ViT in Chaotic World
par: Lin, Jiaying, et autres
Publié: (2024)
par: Lin, Jiaying, et autres
Publié: (2024)
FR-TTS: Test-Time Scaling for NTP-based Image Generation with Effective Filling-based Reward Signal
par: Xu, Hang, et autres
Publié: (2025)
par: Xu, Hang, et autres
Publié: (2025)
Reason--Imagine--Act: Closed-Loop LLM Decision Making with World Models for Autonomous Driving
par: Sun, Zhengqi, et autres
Publié: (2026)
par: Sun, Zhengqi, et autres
Publié: (2026)
DiLA: Disentangled Latent Action World Models
par: Zhang, Tianqiu, et autres
Publié: (2026)
par: Zhang, Tianqiu, et autres
Publié: (2026)
Do We Really Need a Large Number of Visual Prompts?
par: Kim, Youngeun, et autres
Publié: (2023)
par: Kim, Youngeun, et autres
Publié: (2023)
REFINE-CONTROL: A Semi-supervised Distillation Method For Conditional Image Generation
par: Jiang, Yicheng, et autres
Publié: (2025)
par: Jiang, Yicheng, et autres
Publié: (2025)
Towards Robust Physical-world Backdoor Attacks on Lane Detection
par: Zhang, Xinwei, et autres
Publié: (2024)
par: Zhang, Xinwei, et autres
Publié: (2024)
How Many Visual Tokens Do Multimodal Language Models Need? Scaling Visual Token Pruning with F^3A
par: Huang, YiJie, et autres
Publié: (2026)
par: Huang, YiJie, et autres
Publié: (2026)
Pandora: Towards General World Model with Natural Language Actions and Video States
par: Xiang, Jiannan, et autres
Publié: (2024)
par: Xiang, Jiannan, et autres
Publié: (2024)
Olaf-World: Orienting Latent Actions for Video World Modeling
par: Jiang, Yuxin, et autres
Publié: (2026)
par: Jiang, Yuxin, et autres
Publié: (2026)
SANA-Streaming: Real-time Streaming Video Editing with Hybrid Diffusion Transformer
par: Zhao, Yuyang, et autres
Publié: (2026)
par: Zhao, Yuyang, et autres
Publié: (2026)
RenderWorld: World Model with Self-Supervised 3D Label
par: Yan, Ziyang, et autres
Publié: (2024)
par: Yan, Ziyang, et autres
Publié: (2024)
DualFast: Dual-Speedup Framework for Fast Sampling of Diffusion Models
par: Yu, Hu, et autres
Publié: (2025)
par: Yu, Hu, et autres
Publié: (2025)
OMGSR: You Only Need One Mid-timestep Guidance for Real-World Image Super-Resolution
par: Wu, Zhiqiang, et autres
Publié: (2025)
par: Wu, Zhiqiang, et autres
Publié: (2025)
Documents similaires
-
Self-Correcting VLA: Online Action Refinement via Sparse World Imagination
par: Liu, Chenyv, et autres
Publié: (2026) -
DepthVLA: Enhancing Vision-Language-Action Models with Depth-Aware Spatial Reasoning
par: Yuan, Tianyuan, et autres
Publié: (2025) -
NEBULA: Do We Evaluate Vision-Language-Action Agents Correctly?
par: Peng, Jierui, et autres
Publié: (2025) -
From Summary to Action: Enhancing Large Language Models for Complex Tasks with Open World APIs
par: Liu, Yulong, et autres
Publié: (2024) -
When and How Much to Imagine: Adaptive Test-Time Scaling with World Models for Visual Spatial Reasoning
par: Yu, Shoubin, et autres
Publié: (2026)