Controllable Navigation Instruction Generation with Chain of Thought Prompting
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kong, Xianghao, Chen, Jinyu, Wang, Wenguan, Su, Hang, Hu, Xiaolin, Yang, Yi, Liu, Si |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
General and Task-Oriented Video Segmentation
par: Chen, Mu, et autres
Publié: (2024)
par: Chen, Mu, et autres
Publié: (2024)
Pseudo-Unification: Entropy Probing Reveals Divergent Information Patterns in Unified Multimodal Models
par: Yang, Songlin, et autres
Publié: (2026)
par: Yang, Songlin, et autres
Publié: (2026)
RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought
par: Lu, Yi, et autres
Publié: (2025)
par: Lu, Yi, et autres
Publié: (2025)
Navigation Instruction Generation with BEV Perception and Large Language Models
par: Fan, Sheng, et autres
Publié: (2024)
par: Fan, Sheng, et autres
Publié: (2024)
CoT-Drive: Efficient Motion Forecasting for Autonomous Driving with LLMs and Chain-of-Thought Prompting
par: Liao, Haicheng, et autres
Publié: (2025)
par: Liao, Haicheng, et autres
Publié: (2025)
Nonverbal Interaction Detection
par: Wei, Jianan, et autres
Publié: (2024)
par: Wei, Jianan, et autres
Publié: (2024)
Moving Beyond Diffusion: Hierarchy-to-Hierarchy Autoregression for fMRI-to-Image Reconstruction
par: Zhang, Xu, et autres
Publié: (2025)
par: Zhang, Xu, et autres
Publié: (2025)
Shape2Scene: 3D Scene Representation Learning Through Pre-training on Shape Data
par: Feng, Tuo, et autres
Publié: (2024)
par: Feng, Tuo, et autres
Publié: (2024)
Better Eyes, Better Thoughts: Why Vision Chain-of-Thought Fails in Medicine
par: Wu, Yuan, et autres
Publié: (2026)
par: Wu, Yuan, et autres
Publié: (2026)
ProFashion: Prototype-guided Fashion Video Generation with Multiple Reference Images
par: Kong, Xianghao, et autres
Publié: (2025)
par: Kong, Xianghao, et autres
Publié: (2025)
Towards Enhanced Image Generation Via Multi-modal Chain of Thought in Unified Generative Models
par: Wang, Yi, et autres
Publié: (2025)
par: Wang, Yi, et autres
Publié: (2025)
Visual Knowledge in the Big Model Era: Retrospect and Prospect
par: Wang, Wenguan, et autres
Publié: (2024)
par: Wang, Wenguan, et autres
Publié: (2024)
Towards Data-and Knowledge-Driven Artificial Intelligence: A Survey on Neuro-Symbolic Computing
par: Wang, Wenguan, et autres
Publié: (2022)
par: Wang, Wenguan, et autres
Publié: (2022)
GoViG: Goal-Conditioned Visual Navigation Instruction Generation via Multimodal Reasoning
par: Wu, Fengyi, et autres
Publié: (2025)
par: Wu, Fengyi, et autres
Publié: (2025)
Theorem-Validated Reverse Chain-of-Thought Problem Generation for Geometric Reasoning
par: Deng, Linger, et autres
Publié: (2024)
par: Deng, Linger, et autres
Publié: (2024)
Chain-of-Memory: Enhancing GUI Agents for Cross-Application Navigation
par: Gao, Xinzge, et autres
Publié: (2025)
par: Gao, Xinzge, et autres
Publié: (2025)
CoRGI: Verified Chain-of-Thought Reasoning with Post-hoc Visual Grounding
par: Yi, Shixin, et autres
Publié: (2025)
par: Yi, Shixin, et autres
Publié: (2025)
Let's Think with Images Efficiently! An Interleaved-Modal Chain-of-Thought Reasoning Framework with Dynamic and Precise Visual Thoughts
par: Liu, Xu, et autres
Publié: (2026)
par: Liu, Xu, et autres
Publié: (2026)
A Survey on 3D Gaussian Splatting
par: Chen, Guikun, et autres
Publié: (2024)
par: Chen, Guikun, et autres
Publié: (2024)
Revisiting the Necessity of Lengthy Chain-of-Thought in Vision-centric Reasoning Generalization
par: Du, Yifan, et autres
Publié: (2025)
par: Du, Yifan, et autres
Publié: (2025)
ClinCoT: Clinical-Aware Visual Chain-of-Thought for Medical Vision Language Models
par: Liu, Xiwei, et autres
Publié: (2026)
par: Liu, Xiwei, et autres
Publié: (2026)
CPA-Enhancer: Chain-of-Thought Prompted Adaptive Enhancer for Object Detection under Unknown Degradations
par: Zhang, Yuwei, et autres
Publié: (2024)
par: Zhang, Yuwei, et autres
Publié: (2024)
V2Xum-LLM: Cross-Modal Video Summarization with Temporal Prompt Instruction Tuning
par: Hua, Hang, et autres
Publié: (2024)
par: Hua, Hang, et autres
Publié: (2024)
MM-CoT:A Benchmark for Probing Visual Chain-of-Thought Reasoning in Multimodal Models
par: Zhang, Jusheng, et autres
Publié: (2025)
par: Zhang, Jusheng, et autres
Publié: (2025)
Reinforcing Structured Chain-of-Thought for Video Understanding
par: Wang, Peiyao, et autres
Publié: (2026)
par: Wang, Peiyao, et autres
Publié: (2026)
Compositional Chain-of-Thought Prompting for Large Multimodal Models
par: Mitra, Chancharik, et autres
Publié: (2023)
par: Mitra, Chancharik, et autres
Publié: (2023)
SDIGLM: Leveraging Large Language Models and Multi-Modal Chain of Thought for Structural Damage Identification
par: Zhang, Yunkai, et autres
Publié: (2025)
par: Zhang, Yunkai, et autres
Publié: (2025)
DanceCrafter: Fine-Grained Text-Driven Controllable Dance Generation via Choreographic Syntax
par: Yuan, Hang, et autres
Publié: (2026)
par: Yuan, Hang, et autres
Publié: (2026)
Dynamic Cross-Modal Prompt Generation for Multimodal Continual Instruction Tuning
par: Hu, Tao, et autres
Publié: (2026)
par: Hu, Tao, et autres
Publié: (2026)
MAGIC: Meta-Ability Guided Interactive Chain-of-Distillation for Effective-and-Efficient Vision-and-Language Navigation
par: Wang, Liuyi, et autres
Publié: (2024)
par: Wang, Liuyi, et autres
Publié: (2024)
Can Segmentation Models Understand the World? Towards Proactive Affordance Reasoning via Visual Chain-of-Thought
par: Guo, Yuchen, et autres
Publié: (2026)
par: Guo, Yuchen, et autres
Publié: (2026)
ATI: Any Trajectory Instruction for Controllable Video Generation
par: Wang, Angtian, et autres
Publié: (2025)
par: Wang, Angtian, et autres
Publié: (2025)
CoV: Chain-of-View Prompting for Spatial Reasoning
par: Zhao, Haoyu, et autres
Publié: (2026)
par: Zhao, Haoyu, et autres
Publié: (2026)
Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning
par: Tian, Shulin, et autres
Publié: (2025)
par: Tian, Shulin, et autres
Publié: (2025)
Improving Chain-of-Thought Efficiency for Autoregressive Image Generation
par: Gu, Zeqi, et autres
Publié: (2025)
par: Gu, Zeqi, et autres
Publié: (2025)
Imitation Game for Adversarial Disillusion with Chain-of-Thought Reasoning in Generative AI
par: Chang, Ching-Chun, et autres
Publié: (2025)
par: Chang, Ching-Chun, et autres
Publié: (2025)
Chart-R1: Chain-of-Thought Supervision and Reinforcement for Advanced Chart Reasoner
par: Chen, Lei, et autres
Publié: (2025)
par: Chen, Lei, et autres
Publié: (2025)
VideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame Selection
par: Han, Songhao, et autres
Publié: (2024)
par: Han, Songhao, et autres
Publié: (2024)
GEMeX-RMCoT: An Enhanced Med-VQA Dataset for Region-Aware Multimodal Chain-of-Thought Reasoning
par: Liu, Bo, et autres
Publié: (2025)
par: Liu, Bo, et autres
Publié: (2025)
ImgCoT: Compressing Long Chain of Thought into Compact Visual Tokens for Efficient Reasoning of Large Language Model
par: Chen, Xiaoshu, et autres
Publié: (2026)
par: Chen, Xiaoshu, et autres
Publié: (2026)
Documents similaires
-
General and Task-Oriented Video Segmentation
par: Chen, Mu, et autres
Publié: (2024) -
Pseudo-Unification: Entropy Probing Reveals Divergent Information Patterns in Unified Multimodal Models
par: Yang, Songlin, et autres
Publié: (2026) -
RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought
par: Lu, Yi, et autres
Publié: (2025) -
Navigation Instruction Generation with BEV Perception and Large Language Models
par: Fan, Sheng, et autres
Publié: (2024) -
CoT-Drive: Efficient Motion Forecasting for Autonomous Driving with LLMs and Chain-of-Thought Prompting
par: Liao, Haicheng, et autres
Publié: (2025)