DriVLMe: Enhancing LLM-based Autonomous Driving Agents with Embodied and Social Experiences
Fuente:
arXiv
Guardado en:
| Autores principales: | Huang, Yidong, Sansom, Jacob, Ma, Ziqiao, Gervits, Felix, Chai, Joyce |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Towards A Holistic Landscape of Situated Theory of Mind in Large Language Models
por: Ma, Ziqiao, et al.
Publicado: (2023)
por: Ma, Ziqiao, et al.
Publicado: (2023)
World-to-Words: Grounded Open Vocabulary Acquisition through Fast Mapping in Vision-Language Models
por: Ma, Ziqiao, et al.
Publicado: (2023)
por: Ma, Ziqiao, et al.
Publicado: (2023)
The Mechanistic Emergence of Symbol Grounding in Language Models
por: Wu, Shuyu, et al.
Publicado: (2025)
por: Wu, Shuyu, et al.
Publicado: (2025)
Do Vision-Language Models Represent Space and How? Evaluating Spatial Frame of Reference Under Ambiguities
por: Zhang, Zheyuan, et al.
Publicado: (2024)
por: Zhang, Zheyuan, et al.
Publicado: (2024)
GROUNDHOG: Grounding Large Language Models to Holistic Segmentation
por: Zhang, Yichi, et al.
Publicado: (2024)
por: Zhang, Yichi, et al.
Publicado: (2024)
CycleNet: Rethinking Cycle Consistency in Text-Guided Diffusion for Image Manipulation
por: Xu, Sihan, et al.
Publicado: (2023)
por: Xu, Sihan, et al.
Publicado: (2023)
Teaching Embodied Reinforcement Learning Agents: Informativeness and Diversity of Language Use
por: Xi, Jiajun, et al.
Publicado: (2024)
por: Xi, Jiajun, et al.
Publicado: (2024)
Babysit A Language Model From Scratch: Interactive Language Learning by Trials and Demonstrations
por: Ma, Ziqiao, et al.
Publicado: (2024)
por: Ma, Ziqiao, et al.
Publicado: (2024)
Ella: Embodied Social Agents with Lifelong Memory
por: Zhang, Hongxin, et al.
Publicado: (2025)
por: Zhang, Hongxin, et al.
Publicado: (2025)
Vision-and-Language Navigation Today and Tomorrow: A Survey in the Era of Foundation Models
por: Zhang, Yue, et al.
Publicado: (2024)
por: Zhang, Yue, et al.
Publicado: (2024)
VEGGIE: Instructional Editing and Reasoning Video Concepts with Grounded Generation
por: Yu, Shoubin, et al.
Publicado: (2025)
por: Yu, Shoubin, et al.
Publicado: (2025)
Multi-Object Hallucination in Vision-Language Models
por: Chen, Xuweiyi, et al.
Publicado: (2024)
por: Chen, Xuweiyi, et al.
Publicado: (2024)
EmbodiedEval: Evaluate Multimodal LLMs as Embodied Agents
por: Cheng, Zhili, et al.
Publicado: (2025)
por: Cheng, Zhili, et al.
Publicado: (2025)
A Language Agent for Autonomous Driving
por: Mao, Jiageng, et al.
Publicado: (2023)
por: Mao, Jiageng, et al.
Publicado: (2023)
Training Turn-by-Turn Verifiers for Dialogue Tutoring Agents: The Curious Case of LLMs as Your Coding Tutors
por: Wang, Jian, et al.
Publicado: (2025)
por: Wang, Jian, et al.
Publicado: (2025)
Communication and Verification in LLM Agents towards Collaboration under Information Asymmetry
por: Peng, Run, et al.
Publicado: (2025)
por: Peng, Run, et al.
Publicado: (2025)
ComfyBench: Benchmarking LLM-based Agents in ComfyUI for Autonomously Designing Collaborative AI Systems
por: Xue, Xiangyuan, et al.
Publicado: (2024)
por: Xue, Xiangyuan, et al.
Publicado: (2024)
An Embodied Generalist Agent in 3D World
por: Huang, Jiangyong, et al.
Publicado: (2023)
por: Huang, Jiangyong, et al.
Publicado: (2023)
AgentThink: A Unified Framework for Tool-Augmented Chain-of-Thought Reasoning in Vision-Language Models for Autonomous Driving
por: Qian, Kangan, et al.
Publicado: (2025)
por: Qian, Kangan, et al.
Publicado: (2025)
ICR-Drive: Instruction Counterfactual Robustness for End-to-End Language-Driven Autonomous Driving
por: Hamid, Kaiser, et al.
Publicado: (2026)
por: Hamid, Kaiser, et al.
Publicado: (2026)
ALN-P3: Unified Language Alignment for Perception, Prediction, and Planning in Autonomous Driving
por: Ma, Yunsheng, et al.
Publicado: (2025)
por: Ma, Yunsheng, et al.
Publicado: (2025)
RACER: Rich Language-Guided Failure Recovery Policies for Imitation Learning
por: Dai, Yinpei, et al.
Publicado: (2024)
por: Dai, Yinpei, et al.
Publicado: (2024)
Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception
por: Wang, Junyang, et al.
Publicado: (2024)
por: Wang, Junyang, et al.
Publicado: (2024)
EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents
por: Yang, Rui, et al.
Publicado: (2025)
por: Yang, Rui, et al.
Publicado: (2025)
BEAT: Visual Backdoor Attacks on VLM-based Embodied Agents via Contrastive Trigger Learning
por: Zhan, Qiusi, et al.
Publicado: (2025)
por: Zhan, Qiusi, et al.
Publicado: (2025)
Fine-Grained Evaluation of Large Vision-Language Models in Autonomous Driving
por: Li, Yue, et al.
Publicado: (2025)
por: Li, Yue, et al.
Publicado: (2025)
ADAM: An Embodied Causal Agent in Open-World Environments
por: Yu, Shu, et al.
Publicado: (2024)
por: Yu, Shu, et al.
Publicado: (2024)
MiMo-Embodied: X-Embodied Foundation Model Technical Report
por: Hao, Xiaoshuai, et al.
Publicado: (2025)
por: Hao, Xiaoshuai, et al.
Publicado: (2025)
A Superalignment Framework in Autonomous Driving with Large Language Models
por: Kong, Xiangrui, et al.
Publicado: (2024)
por: Kong, Xiangrui, et al.
Publicado: (2024)
Context-based Motion Retrieval using Open Vocabulary Methods for Autonomous Driving
por: Englmeier, Stefan, et al.
Publicado: (2025)
por: Englmeier, Stefan, et al.
Publicado: (2025)
Embodied-Reasoner: Synergizing Visual Search, Reasoning, and Action for Embodied Interactive Tasks
por: Zhang, Wenqi, et al.
Publicado: (2025)
por: Zhang, Wenqi, et al.
Publicado: (2025)
Embodied Agents for Efficient Exploration and Smart Scene Description
por: Bigazzi, Roberto, et al.
Publicado: (2023)
por: Bigazzi, Roberto, et al.
Publicado: (2023)
Vision-Language Models Are Not Pragmatically Competent in Referring Expression Generation
por: Ma, Ziqiao, et al.
Publicado: (2025)
por: Ma, Ziqiao, et al.
Publicado: (2025)
CAMON: Cooperative Agents for Multi-Object Navigation with LLM-based Conversations
por: Wu, Pengying, et al.
Publicado: (2024)
por: Wu, Pengying, et al.
Publicado: (2024)
LEGENT: Open Platform for Embodied Agents
por: Cheng, Zhili, et al.
Publicado: (2024)
por: Cheng, Zhili, et al.
Publicado: (2024)
A Survey of LLM-based Agents in Medicine: How far are we from Baymax?
por: Wang, Wenxuan, et al.
Publicado: (2025)
por: Wang, Wenxuan, et al.
Publicado: (2025)
Building Cooperative Embodied Agents Modularly with Large Language Models
por: Zhang, Hongxin, et al.
Publicado: (2023)
por: Zhang, Hongxin, et al.
Publicado: (2023)
CorNav: Autonomous Agent with Self-Corrected Planning for Zero-Shot Vision-and-Language Navigation
por: Liang, Xiwen, et al.
Publicado: (2023)
por: Liang, Xiwen, et al.
Publicado: (2023)
Eliciting In-Context Learning in Vision-Language Models for Videos Through Curated Data Distributional Properties
por: Yu, Keunwoo Peter, et al.
Publicado: (2023)
por: Yu, Keunwoo Peter, et al.
Publicado: (2023)
From Human Intention to Action Prediction: Intention-Driven End-to-End Autonomous Driving
por: Zheng, Huan, et al.
Publicado: (2025)
por: Zheng, Huan, et al.
Publicado: (2025)
Ejemplares similares
-
Towards A Holistic Landscape of Situated Theory of Mind in Large Language Models
por: Ma, Ziqiao, et al.
Publicado: (2023) -
World-to-Words: Grounded Open Vocabulary Acquisition through Fast Mapping in Vision-Language Models
por: Ma, Ziqiao, et al.
Publicado: (2023) -
The Mechanistic Emergence of Symbol Grounding in Language Models
por: Wu, Shuyu, et al.
Publicado: (2025) -
Do Vision-Language Models Represent Space and How? Evaluating Spatial Frame of Reference Under Ambiguities
por: Zhang, Zheyuan, et al.
Publicado: (2024) -
GROUNDHOG: Grounding Large Language Models to Holistic Segmentation
por: Zhang, Yichi, et al.
Publicado: (2024)