Fast-ThinkAct: Efficient Vision-Language-Action Reasoning via Verbalizable Latent Planning
Fuente:
arXiv
Guardado en:
| Autores principales: | Huang, Chi-Pin, Man, Yunze, Yu, Zhiding, Chen, Min-Hung, Kautz, Jan, Wang, Yu-Chiang Frank, Yang, Fu-En |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning
por: Huang, Chi-Pin, et al.
Publicado: (2025)
por: Huang, Chi-Pin, et al.
Publicado: (2025)
Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought
por: Man, Yunze, et al.
Publicado: (2025)
por: Man, Yunze, et al.
Publicado: (2025)
LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding
por: Wang, Shihao, et al.
Publicado: (2026)
por: Wang, Shihao, et al.
Publicado: (2026)
Mitigating Object and Action Hallucinations in Multimodal LLMs via Self-Augmented Contrastive Alignment
por: Chang, Kai-Po, et al.
Publicado: (2025)
por: Chang, Kai-Po, et al.
Publicado: (2025)
LocateAnything3D: Vision-Language 3D Detection with Chain-of-Sight
por: Man, Yunze, et al.
Publicado: (2025)
por: Man, Yunze, et al.
Publicado: (2025)
Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models
por: Bai, Shuanghao, et al.
Publicado: (2026)
por: Bai, Shuanghao, et al.
Publicado: (2026)
Situational Awareness Matters in 3D Vision Language Reasoning
por: Man, Yunze, et al.
Publicado: (2024)
por: Man, Yunze, et al.
Publicado: (2024)
MotionMatcher: Motion Customization of Text-to-Video Diffusion Models via Motion Feature Matching
por: Wu, Yen-Siang, et al.
Publicado: (2025)
por: Wu, Yen-Siang, et al.
Publicado: (2025)
FRAG: Frame Selection Augmented Generation for Long Video and Long Document Understanding
por: Huang, De-An, et al.
Publicado: (2025)
por: Huang, De-An, et al.
Publicado: (2025)
Guide, Think, Act: Interactive Embodied Reasoning in Vision-Language-Action Models
por: Ling, Yiran, et al.
Publicado: (2026)
por: Ling, Yiran, et al.
Publicado: (2026)
OmniDrive: A Holistic Vision-Language Dataset for Autonomous Driving with Counterfactual Reasoning
por: Wang, Shihao, et al.
Publicado: (2025)
por: Wang, Shihao, et al.
Publicado: (2025)
OmniDrive: A Holistic Vision-Language Dataset for Autonomous Driving with Counterfactual Reasoning
por: Wang, Shihao, et al.
Publicado: (2024)
por: Wang, Shihao, et al.
Publicado: (2024)
Select and Distill: Selective Dual-Teacher Knowledge Transfer for Continual Learning on Vision-Language Models
por: Yu, Yu-Chu, et al.
Publicado: (2024)
por: Yu, Yu-Chu, et al.
Publicado: (2024)
VideoMage: Multi-Subject and Motion Customization of Text-to-Video Diffusion Models
por: Huang, Chi-Pin, et al.
Publicado: (2025)
por: Huang, Chi-Pin, et al.
Publicado: (2025)
TA-Prompting: Enhancing Video Large Language Models for Dense Video Captioning via Temporal Anchors
por: Cheng, Wei-Yuan, et al.
Publicado: (2026)
por: Cheng, Wei-Yuan, et al.
Publicado: (2026)
TwiSTAR:Think Fast, Think Slow, Then Act,Generative Recommendation with Adaptive Reasoning
por: Cao, Shiteng, et al.
Publicado: (2026)
por: Cao, Shiteng, et al.
Publicado: (2026)
Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models
por: Tan, Xudong, et al.
Publicado: (2025)
por: Tan, Xudong, et al.
Publicado: (2025)
ThinkRouter: Efficient Reasoning via Routing Thinking between Latent and Discrete Spaces
por: Xu, Xin, et al.
Publicado: (2026)
por: Xu, Xin, et al.
Publicado: (2026)
Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation
por: Yue, Junrong, et al.
Publicado: (2025)
por: Yue, Junrong, et al.
Publicado: (2025)
QuarterMap: Efficient Post-Training Token Pruning for Visual State Space Models
por: Chi, Tien-Yu, et al.
Publicado: (2025)
por: Chi, Tien-Yu, et al.
Publicado: (2025)
Think Silently, Think Fast: Dynamic Latent Compression of LLM Reasoning Chains
por: Tan, Wenhui, et al.
Publicado: (2025)
por: Tan, Wenhui, et al.
Publicado: (2025)
TPA3D: Triplane Attention for Fast Text-to-3D Generation
por: Wu, Bin-Shih, et al.
Publicado: (2023)
por: Wu, Bin-Shih, et al.
Publicado: (2023)
Receler: Reliable Concept Erasing of Text-to-Image Diffusion Models via Lightweight Erasers
por: Huang, Chi-Pin, et al.
Publicado: (2023)
por: Huang, Chi-Pin, et al.
Publicado: (2023)
Histopathology Image Report Generation by Vision Language Model with Multimodal In-Context Learning
por: Liu, Shih-Wen, et al.
Publicado: (2025)
por: Liu, Shih-Wen, et al.
Publicado: (2025)
Think-at-Hard: Selective Latent Iterations to Improve Reasoning Language Models
por: Fu, Tianyu, et al.
Publicado: (2025)
por: Fu, Tianyu, et al.
Publicado: (2025)
LEAML: Label-Efficient Adaptation to Out-of-Distribution Visual Tasks for Multimodal Large Language Models
por: Lin, Ci-Siang, et al.
Publicado: (2025)
por: Lin, Ci-Siang, et al.
Publicado: (2025)
Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models
por: Izzo, Riccardo Andrea, et al.
Publicado: (2026)
por: Izzo, Riccardo Andrea, et al.
Publicado: (2026)
VITA-VLA: Efficiently Teaching Vision-Language Models to Act via Action Expert Distillation
por: Dong, Shaoqi, et al.
Publicado: (2025)
por: Dong, Shaoqi, et al.
Publicado: (2025)
ThinkJEPA: Empowering Latent World Models with Large Vision-Language Reasoning Model
por: Zhang, Haichao, et al.
Publicado: (2026)
por: Zhang, Haichao, et al.
Publicado: (2026)
VLA-Thinker: Boosting Vision-Language-Action Models through Thinking-with-Image Reasoning
por: Wang, Chaoyang, et al.
Publicado: (2026)
por: Wang, Chaoyang, et al.
Publicado: (2026)
Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning
por: Zhang, Shaokun, et al.
Publicado: (2025)
por: Zhang, Shaokun, et al.
Publicado: (2025)
R2SM: Referring and Reasoning for Selective Masks
por: Shih, Yu-Lin, et al.
Publicado: (2025)
por: Shih, Yu-Lin, et al.
Publicado: (2025)
MambaVision: A Hybrid Mamba-Transformer Vision Backbone
por: Hatamizadeh, Ali, et al.
Publicado: (2024)
por: Hatamizadeh, Ali, et al.
Publicado: (2024)
VGAS: Value-Guided Action-Chunk Selection for Few-Shot Vision-Language-Action Adaptation
por: Xu, Changhua, et al.
Publicado: (2026)
por: Xu, Changhua, et al.
Publicado: (2026)
PaintScene4D: Consistent 4D Scene Generation from Text Prompts
por: Gupta, Vinayak, et al.
Publicado: (2024)
por: Gupta, Vinayak, et al.
Publicado: (2024)
LITA: Language Instructed Temporal-Localization Assistant
por: Huang, De-An, et al.
Publicado: (2024)
por: Huang, De-An, et al.
Publicado: (2024)
Learning to Act Robustly with View-Invariant Latent Actions
por: Jeong, Youngjoon, et al.
Publicado: (2026)
por: Jeong, Youngjoon, et al.
Publicado: (2026)
Understanding and Improving Training-Free AI-Generated Image Detections with Vision Foundation Models
por: Tsai, Chung-Ting, et al.
Publicado: (2024)
por: Tsai, Chung-Ting, et al.
Publicado: (2024)
Self-Supervised Speech Quality Estimation and Enhancement Using Only Clean Speech
por: Fu, Szu-Wei, et al.
Publicado: (2024)
por: Fu, Szu-Wei, et al.
Publicado: (2024)
Fast-Slow Thinking GRPO for Large Vision-Language Model Reasoning
por: Xiao, Wenyi, et al.
Publicado: (2025)
por: Xiao, Wenyi, et al.
Publicado: (2025)
Ejemplares similares
-
ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning
por: Huang, Chi-Pin, et al.
Publicado: (2025) -
Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought
por: Man, Yunze, et al.
Publicado: (2025) -
LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding
por: Wang, Shihao, et al.
Publicado: (2026) -
Mitigating Object and Action Hallucinations in Multimodal LLMs via Self-Augmented Contrastive Alignment
por: Chang, Kai-Po, et al.
Publicado: (2025) -
LocateAnything3D: Vision-Language 3D Detection with Chain-of-Sight
por: Man, Yunze, et al.
Publicado: (2025)