DualCoT-VLA: Visual-Linguistic Chain of Thought via Parallel Reasoning for Vision-Language-Action Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhong, Zhide, Li, Junfeng, He, Junjie, Yan, Haodong, Gong, Xin, Zhao, Guanyi, Cai, Yingjie, Gao, Jiantao, Yan, Xu, Liu, Bingbing, Chen, Yingcong, Yang, Liuqing, Li, Haoang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
VLA-OPD: Bridging Offline SFT and Online RL for Vision-Language-Action Models via On-Policy Distillation
por: Zhong, Zhide, et al.
Publicado: (2026)
por: Zhong, Zhide, et al.
Publicado: (2026)
FlowVLA: Visual Chain of Thought-based Motion Reasoning for Vision-Language-Action Models
por: Zhong, Zhide, et al.
Publicado: (2025)
por: Zhong, Zhide, et al.
Publicado: (2025)
S-VAM: Shortcut Video-Action Model by Self-Distilling Geometric and Semantic Foresight
por: Yan, Haodong, et al.
Publicado: (2026)
por: Yan, Haodong, et al.
Publicado: (2026)
DualCoTs: Dual Chain-of-Thoughts Prompting for Sentiment Lexicon Expansion of Idioms
por: Niu, Fuqiang, et al.
Publicado: (2024)
por: Niu, Fuqiang, et al.
Publicado: (2024)
PD-VLA: Accelerating Vision-Language-Action Model Integrated with Action Chunking via Parallel Decoding
por: Song, Wenxuan, et al.
Publicado: (2025)
por: Song, Wenxuan, et al.
Publicado: (2025)
Advancing high-fidelity 3D and Texture Generation with 2.5D latents
por: Yang, Xin, et al.
Publicado: (2025)
por: Yang, Xin, et al.
Publicado: (2025)
ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models
por: Zhong, Linqing, et al.
Publicado: (2026)
por: Zhong, Linqing, et al.
Publicado: (2026)
CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models
por: Zhao, Qingqing, et al.
Publicado: (2025)
por: Zhao, Qingqing, et al.
Publicado: (2025)
ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver
por: Song, Wenxuan, et al.
Publicado: (2025)
por: Song, Wenxuan, et al.
Publicado: (2025)
dVLA: Diffusion Vision-Language-Action Model with Multimodal Chain-of-Thought
por: Wen, Junjie, et al.
Publicado: (2025)
por: Wen, Junjie, et al.
Publicado: (2025)
Open-world Hand-Object Interaction Video Generation Based on Structure and Contact-aware Representation
por: Yan, Haodong, et al.
Publicado: (2025)
por: Yan, Haodong, et al.
Publicado: (2025)
CoA-VLA: Improving Vision-Language-Action Models via Visual-Textual Chain-of-Affordance
por: Li, Jinming, et al.
Publicado: (2024)
por: Li, Jinming, et al.
Publicado: (2024)
RationalVLA: A Rational Vision-Language-Action Model with Dual System
por: Song, Wenxuan, et al.
Publicado: (2025)
por: Song, Wenxuan, et al.
Publicado: (2025)
CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding
por: Song, Wenxuan, et al.
Publicado: (2025)
por: Song, Wenxuan, et al.
Publicado: (2025)
PointVLA: Injecting the 3D World into Vision-Language-Action Models
por: Li, Chengmeng, et al.
Publicado: (2025)
por: Li, Chengmeng, et al.
Publicado: (2025)
CoTGuard: Using Chain-of-Thought Triggering for Copyright Protection in Multi-Agent LLM Systems
por: Wen, Yan, et al.
Publicado: (2025)
por: Wen, Yan, et al.
Publicado: (2025)
Altered Thoughts, Altered Actions: Probing Chain-of-Thought Vulnerabilities in VLA Robotic Manipulation
por: Trinh, Tuan Duong, et al.
Publicado: (2026)
por: Trinh, Tuan Duong, et al.
Publicado: (2026)
UnderwaterVLA: Dual-brain Vision-Language-Action architecture for Autonomous Underwater Navigation
por: Wang, Zhangyuan, et al.
Publicado: (2025)
por: Wang, Zhangyuan, et al.
Publicado: (2025)
Occ-LLM: Enhancing Autonomous Driving with Occupancy-Based Large Language Models
por: Xu, Tianshuo, et al.
Publicado: (2025)
por: Xu, Tianshuo, et al.
Publicado: (2025)
RotVLA: Rotational Latent Action for Vision-Language-Action Model
por: Li, Qiwei, et al.
Publicado: (2026)
por: Li, Qiwei, et al.
Publicado: (2026)
DFM-VLA: Iterative Action Refinement for Robot Manipulation via Discrete Flow Matching
por: Chen, Jiayi, et al.
Publicado: (2026)
por: Chen, Jiayi, et al.
Publicado: (2026)
Unified Diffusion VLA: Vision-Language-Action Model via Joint Discrete Denoising Diffusion Process
por: Chen, Jiayi, et al.
Publicado: (2025)
por: Chen, Jiayi, et al.
Publicado: (2025)
DyGeoVLN: Infusing Dynamic Geometry Foundation Model into Vision-Language Navigation
por: Liu, Xiangchen, et al.
Publicado: (2026)
por: Liu, Xiangchen, et al.
Publicado: (2026)
VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving
por: Zhang, Haiming, et al.
Publicado: (2024)
por: Zhang, Haiming, et al.
Publicado: (2024)
Rethinking the Practicality of Vision-language-action Model: A Comprehensive Benchmark and An Improved Baseline
por: Song, Wenxuan, et al.
Publicado: (2026)
por: Song, Wenxuan, et al.
Publicado: (2026)
ManualVLA: A Unified VLA Model for Chain-of-Thought Manual Generation and Robotic Manipulation
por: Gu, Chenyang, et al.
Publicado: (2025)
por: Gu, Chenyang, et al.
Publicado: (2025)
HALO: A Unified Vision-Language-Action Model for Embodied Multimodal Chain-of-Thought Reasoning
por: Shou, Quanxin, et al.
Publicado: (2026)
por: Shou, Quanxin, et al.
Publicado: (2026)
D-VLA: A High-Concurrency Distributed Asynchronous Reinforcement Learning Framework for Vision-Language-Action Models
por: Guo, Yucheng, et al.
Publicado: (2026)
por: Guo, Yucheng, et al.
Publicado: (2026)
FreezeVLA: Action-Freezing Attacks against Vision-Language-Action Models
por: Wang, Xin, et al.
Publicado: (2025)
por: Wang, Xin, et al.
Publicado: (2025)
StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision
por: Deng, Shengliang, et al.
Publicado: (2025)
por: Deng, Shengliang, et al.
Publicado: (2025)
AsyncVLA: Asynchronous Flow Matching for Vision-Language-Action Models
por: Jiang, Yuhua, et al.
Publicado: (2025)
por: Jiang, Yuhua, et al.
Publicado: (2025)
Fast-dVLA: Accelerating Discrete Diffusion VLA to Real-Time Performance
por: Song, Wenxuan, et al.
Publicado: (2026)
por: Song, Wenxuan, et al.
Publicado: (2026)
MemCoT: Test-Time Scaling through Memory-Driven Chain-of-Thought
por: Lei, Haodong, et al.
Publicado: (2026)
por: Lei, Haodong, et al.
Publicado: (2026)
PaCo-VLA: Passivity-Shielded Compliance Prior for Contact-Rich Vision-Language-Action Manipulation
por: Cao, Haofan, et al.
Publicado: (2026)
por: Cao, Haofan, et al.
Publicado: (2026)
AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention
por: Xiao, Lei, et al.
Publicado: (2025)
por: Xiao, Lei, et al.
Publicado: (2025)
FedVLA: Federated Vision-Language-Action Learning with Dual Gating Mixture-of-Experts for Robotic Manipulation
por: Miao, Cui, et al.
Publicado: (2025)
por: Miao, Cui, et al.
Publicado: (2025)
CoVLA: Comprehensive Vision-Language-Action Dataset for Autonomous Driving
por: Arai, Hidehisa, et al.
Publicado: (2024)
por: Arai, Hidehisa, et al.
Publicado: (2024)
Step-CoT: Stepwise Visual Chain-of-Thought for Medical Visual Question Answering
por: Fan, Lin, et al.
Publicado: (2026)
por: Fan, Lin, et al.
Publicado: (2026)
AT-VLA: Adaptive Tactile Injection for Enhanced Feedback Reaction in Vision-Language-Action Models
por: Li, Xiaoqi, et al.
Publicado: (2026)
por: Li, Xiaoqi, et al.
Publicado: (2026)
AIM-CoT: Active Information-driven Multimodal Chain-of-Thought for Vision-Language Reasoning
por: Li, Xiping, et al.
Publicado: (2025)
por: Li, Xiping, et al.
Publicado: (2025)
Ejemplares similares
-
VLA-OPD: Bridging Offline SFT and Online RL for Vision-Language-Action Models via On-Policy Distillation
por: Zhong, Zhide, et al.
Publicado: (2026) -
FlowVLA: Visual Chain of Thought-based Motion Reasoning for Vision-Language-Action Models
por: Zhong, Zhide, et al.
Publicado: (2025) -
S-VAM: Shortcut Video-Action Model by Self-Distilling Geometric and Semantic Foresight
por: Yan, Haodong, et al.
Publicado: (2026) -
DualCoTs: Dual Chain-of-Thoughts Prompting for Sentiment Lexicon Expansion of Idioms
por: Niu, Fuqiang, et al.
Publicado: (2024) -
PD-VLA: Accelerating Vision-Language-Action Model Integrated with Action Chunking via Parallel Decoding
por: Song, Wenxuan, et al.
Publicado: (2025)