Making Large Language Models Better Planners with Reasoning-Decision Alignment
Fuente:
arXiv
Guardado en:
| Autores principales: | Huang, Zhijian, Tang, Tao, Chen, Shaoxiang, Lin, Sihao, Jie, Zequn, Ma, Lin, Wang, Guangrun, Liang, Xiaodan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LLaVA-MoLE: Sparse Mixture of LoRA Experts for Mitigating Data Conflicts in Instruction Finetuning MLLMs
por: Chen, Shaoxiang, et al.
Publicado: (2024)
por: Chen, Shaoxiang, et al.
Publicado: (2024)
Fewer Tokens and Fewer Videos: Extending Video Understanding Abilities in Large Vision-Language Models
por: Chen, Shimin, et al.
Publicado: (2024)
por: Chen, Shimin, et al.
Publicado: (2024)
RoboTron-Drive: All-in-One Large Multimodal Model for Autonomous Driving
por: Huang, Zhijian, et al.
Publicado: (2024)
por: Huang, Zhijian, et al.
Publicado: (2024)
Lumen: Unleashing Versatile Vision-Centric Capabilities of Large Multimodal Models
por: Jiao, Yang, et al.
Publicado: (2024)
por: Jiao, Yang, et al.
Publicado: (2024)
AlignMiF: Geometry-Aligned Multimodal Implicit Field for LiDAR-Camera Joint Synthesis
por: Tang, Tao, et al.
Publicado: (2024)
por: Tang, Tao, et al.
Publicado: (2024)
VidCompress: Memory-Enhanced Temporal Compression for Video Understanding in Large Language Models
por: Lan, Xiaohan, et al.
Publicado: (2024)
por: Lan, Xiaohan, et al.
Publicado: (2024)
Feature Projection Learning for Better Vision-Language Reasoning
por: Zhang, Yi, et al.
Publicado: (2026)
por: Zhang, Yi, et al.
Publicado: (2026)
X-SAM: From Segment Anything to Any Segmentation
por: Wang, Hao, et al.
Publicado: (2025)
por: Wang, Hao, et al.
Publicado: (2025)
SIRI-Bench: Challenging VLMs' Spatial Intelligence through Complex Reasoning Tasks
por: Song, Zijian, et al.
Publicado: (2025)
por: Song, Zijian, et al.
Publicado: (2025)
MindBench: A Comprehensive Benchmark for Mind Map Structure Recognition and Analysis
por: Chen, Lei, et al.
Publicado: (2024)
por: Chen, Lei, et al.
Publicado: (2024)
MLP Can Be A Good Transformer Learner
por: Lin, Sihao, et al.
Publicado: (2024)
por: Lin, Sihao, et al.
Publicado: (2024)
Efficient Training of Large Vision Models via Advanced Automated Progressive Learning
por: Li, Changlin, et al.
Publicado: (2024)
por: Li, Changlin, et al.
Publicado: (2024)
UniToken: Harmonizing Multimodal Understanding and Generation through Unified Visual Encoding
por: Jiao, Yang, et al.
Publicado: (2025)
por: Jiao, Yang, et al.
Publicado: (2025)
ACD: Direct Conditional Control for Video Diffusion Models via Attention Supervision
por: Li, Weiqi, et al.
Publicado: (2025)
por: Li, Weiqi, et al.
Publicado: (2025)
HumanGenesis: Agent-Based Geometric and Generative Modeling for Synthetic Human Dynamics
por: Li, Weiqi, et al.
Publicado: (2025)
por: Li, Weiqi, et al.
Publicado: (2025)
AnimateZoo: Zero-shot Video Generation of Cross-Species Animation via Subject Alignment
por: Xu, Yuanfeng, et al.
Publicado: (2024)
por: Xu, Yuanfeng, et al.
Publicado: (2024)
Enhancing Robustness of Vision-Language Models through Orthogonality Learning and Self-Regularization
por: Li, Jinlong, et al.
Publicado: (2024)
por: Li, Jinlong, et al.
Publicado: (2024)
Weakly-Supervised 3D Visual Grounding based on Visual Language Alignment
por: Xu, Xiaoxu, et al.
Publicado: (2023)
por: Xu, Xiaoxu, et al.
Publicado: (2023)
AlignSAM: Aligning Segment Anything Model to Open Context via Reinforcement Learning
por: Huang, Duojun, et al.
Publicado: (2024)
por: Huang, Duojun, et al.
Publicado: (2024)
Human-Centric Open-Future Task Discovery: Formulation, Benchmark, and Scalable Tree-Based Search
por: Song, Zijian, et al.
Publicado: (2025)
por: Song, Zijian, et al.
Publicado: (2025)
UML-CoT: Structured Reasoning and Planning with Unified Modeling Language for Robotic Room Cleaning
por: Chen, Hongyu, et al.
Publicado: (2025)
por: Chen, Hongyu, et al.
Publicado: (2025)
DNA Family: Boosting Weight-Sharing NAS with Block-Wise Supervisions
por: Wang, Guangrun, et al.
Publicado: (2024)
por: Wang, Guangrun, et al.
Publicado: (2024)
OV-DINO: Unified Open-Vocabulary Detection with Language-Aware Selective Fusion
por: Wang, Hao, et al.
Publicado: (2024)
por: Wang, Hao, et al.
Publicado: (2024)
GS: Generative Segmentation via Label Diffusion
por: Chen, Yuhao, et al.
Publicado: (2025)
por: Chen, Yuhao, et al.
Publicado: (2025)
Physical Autoregressive Model for Robotic Manipulation without Action Pretraining
por: Song, Zijian, et al.
Publicado: (2025)
por: Song, Zijian, et al.
Publicado: (2025)
One Model for All: Unified Try-On and Try-Off in Any Pose via LLM-Inspired Bidirectional Tweedie Diffusion
por: Liu, Jinxi, et al.
Publicado: (2025)
por: Liu, Jinxi, et al.
Publicado: (2025)
Semantic Alignment for Multimodal Large Language Models
por: Wu, Tao, et al.
Publicado: (2024)
por: Wu, Tao, et al.
Publicado: (2024)
ChainV: Atomic Visual Hints Make Multimodal Reasoning Shorter and Better
por: Zhang, Yuan, et al.
Publicado: (2025)
por: Zhang, Yuan, et al.
Publicado: (2025)
Matten: Video Generation with Mamba-Attention
por: Gao, Yu, et al.
Publicado: (2024)
por: Gao, Yu, et al.
Publicado: (2024)
MRStyle: A Unified Framework for Color Style Transfer with Multi-Modality Reference
por: Huang, Jiancheng, et al.
Publicado: (2024)
por: Huang, Jiancheng, et al.
Publicado: (2024)
InstaGen: Enhancing Object Detection by Training on Synthetic Dataset
por: Feng, Chengjian, et al.
Publicado: (2024)
por: Feng, Chengjian, et al.
Publicado: (2024)
Knowledge Distillation via the Target-aware Transformer
por: Lin, Sihao, et al.
Publicado: (2022)
por: Lin, Sihao, et al.
Publicado: (2022)
Learning Spatial-Temporal Coherent Correlations for Speech-Preserving Facial Expression Manipulation
por: Chen, Tianshui, et al.
Publicado: (2026)
por: Chen, Tianshui, et al.
Publicado: (2026)
World Modeling Makes a Better Planner: Dual Preference Optimization for Embodied Task Planning
por: Wang, Siyin, et al.
Publicado: (2025)
por: Wang, Siyin, et al.
Publicado: (2025)
3D Weakly Supervised Semantic Segmentation with 2D Vision-Language Guidance
por: Xu, Xiaoxu, et al.
Publicado: (2024)
por: Xu, Xiaoxu, et al.
Publicado: (2024)
WildVidFit: Video Virtual Try-On in the Wild via Image-Based Controlled Diffusion Models
por: He, Zijian, et al.
Publicado: (2024)
por: He, Zijian, et al.
Publicado: (2024)
Actional Atomic-Concept Learning for Demystifying Vision-Language Navigation
por: Lin, Bingqian, et al.
Publicado: (2023)
por: Lin, Bingqian, et al.
Publicado: (2023)
Delving Deeper: Hierarchical Visual Perception for Robust Video-Text Retrieval
por: Xie, Zequn, et al.
Publicado: (2026)
por: Xie, Zequn, et al.
Publicado: (2026)
TAG: Target-Agnostic Guidance for Stable Object-Centric Inference in Vision-Language-Action Models
por: Zhou, Jiaying, et al.
Publicado: (2026)
por: Zhou, Jiaying, et al.
Publicado: (2026)
EAGLE: Towards Efficient Arbitrary Referring Visual Prompts Comprehension for Multimodal Large Language Models
por: Zhang, Jiacheng, et al.
Publicado: (2024)
por: Zhang, Jiacheng, et al.
Publicado: (2024)
Ejemplares similares
-
LLaVA-MoLE: Sparse Mixture of LoRA Experts for Mitigating Data Conflicts in Instruction Finetuning MLLMs
por: Chen, Shaoxiang, et al.
Publicado: (2024) -
Fewer Tokens and Fewer Videos: Extending Video Understanding Abilities in Large Vision-Language Models
por: Chen, Shimin, et al.
Publicado: (2024) -
RoboTron-Drive: All-in-One Large Multimodal Model for Autonomous Driving
por: Huang, Zhijian, et al.
Publicado: (2024) -
Lumen: Unleashing Versatile Vision-Centric Capabilities of Large Multimodal Models
por: Jiao, Yang, et al.
Publicado: (2024) -
AlignMiF: Geometry-Aligned Multimodal Implicit Field for LiDAR-Camera Joint Synthesis
por: Tang, Tao, et al.
Publicado: (2024)