Social-LLaVA: Enhancing Robot Navigation through Human-Language Reasoning in Social Spaces
Fuente:
arXiv
Guardado en:
| Autores principales: | Payandeh, Amirreza, Song, Daeun, Nazeri, Mohammad, Liang, Jing, Mukherjee, Praneel, Raj, Amir Hossain, Kong, Yangzhe, Manocha, Dinesh, Xiao, Xuesu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
VLM-Social-Nav: Socially Aware Robot Navigation through Scoring using Vision-Language Models
por: Song, Daeun, et al.
Publicado: (2024)
por: Song, Daeun, et al.
Publicado: (2024)
VANP: Learning Where to See for Navigation with Self-Supervised Vision-Action Pre-Training
por: Nazeri, Mohammad, et al.
Publicado: (2024)
por: Nazeri, Mohammad, et al.
Publicado: (2024)
AutoSpatial: Visual-Language Reasoning for Social Robot Navigation through Efficient Spatial Reasoning Learning
por: Kong, Yangzhe, et al.
Publicado: (2025)
por: Kong, Yangzhe, et al.
Publicado: (2025)
DTG : Diffusion-based Trajectory Generation for Mapless Global Navigation
por: Liang, Jing, et al.
Publicado: (2024)
por: Liang, Jing, et al.
Publicado: (2024)
Narrate2Nav: Real-Time Visual Navigation with Implicit Language Reasoning in Human-Centric Environments
por: Payandeh, Amirreza, et al.
Publicado: (2025)
por: Payandeh, Amirreza, et al.
Publicado: (2025)
Rethinking Social Robot Navigation: Leveraging the Best of Two Worlds
por: Raj, Amir Hossain, et al.
Publicado: (2023)
por: Raj, Amir Hossain, et al.
Publicado: (2023)
Cosmos-LLaVA: Chatting with the Visual Cosmos-LLaVA: Görselle Sohbet Etmek
por: Zeer, Ahmed, et al.
Publicado: (2024)
por: Zeer, Ahmed, et al.
Publicado: (2024)
TG-LLaVA: Text Guided LLaVA via Learnable Latent Embeddings
por: Yan, Dawei, et al.
Publicado: (2024)
por: Yan, Dawei, et al.
Publicado: (2024)
LLaVA-MoD: Making LLaVA Tiny via MoE Knowledge Distillation
por: Shu, Fangxun, et al.
Publicado: (2024)
por: Shu, Fangxun, et al.
Publicado: (2024)
LLaVA-Critic: Learning to Evaluate Multimodal Models
por: Xiong, Tianyi, et al.
Publicado: (2024)
por: Xiong, Tianyi, et al.
Publicado: (2024)
Face-LLaVA: Facial Expression and Attribute Understanding through Instruction Tuning
por: Chaubey, Ashutosh, et al.
Publicado: (2025)
por: Chaubey, Ashutosh, et al.
Publicado: (2025)
Math-LLaVA: Bootstrapping Mathematical Reasoning for Multimodal Large Language Models
por: Shi, Wenhao, et al.
Publicado: (2024)
por: Shi, Wenhao, et al.
Publicado: (2024)
LLaVAC: Fine-tuning LLaVA as a Multimodal Sentiment Classifier
por: Chay-intr, T., et al.
Publicado: (2025)
por: Chay-intr, T., et al.
Publicado: (2025)
Amharic LLaMA and LLaVA: Multimodal LLMs for Low Resource Languages
por: Andersland, Michael
Publicado: (2024)
por: Andersland, Michael
Publicado: (2024)
LLaVA-Video: Video Instruction Tuning With Synthetic Data
por: Zhang, Yuanhan, et al.
Publicado: (2024)
por: Zhang, Yuanhan, et al.
Publicado: (2024)
NOVO: Bridging LLaVA and SAM with Visual-only Prompts for Reasoning Segmentation
por: Yoon, Kyung-Yoon, et al.
Publicado: (2025)
por: Yoon, Kyung-Yoon, et al.
Publicado: (2025)
Spatial Reasoning is Not a Free Lunch: A Controlled Study on LLaVA
por: Alam, Nahid, et al.
Publicado: (2026)
por: Alam, Nahid, et al.
Publicado: (2026)
LLaVA-CoT: Let Vision Language Models Reason Step-by-Step
por: Xu, Guowei, et al.
Publicado: (2024)
por: Xu, Guowei, et al.
Publicado: (2024)
How susceptible are LLMs to Logical Fallacies?
por: Payandeh, Amirreza, et al.
Publicado: (2023)
por: Payandeh, Amirreza, et al.
Publicado: (2023)
LLaVA-OneVision: Easy Visual Task Transfer
por: Li, Bo, et al.
Publicado: (2024)
por: Li, Bo, et al.
Publicado: (2024)
HACL: History-Aware Curriculum Learning for Fast Locomotion
por: Mishra, Prakhar, et al.
Publicado: (2025)
por: Mishra, Prakhar, et al.
Publicado: (2025)
MorFiC: Fixing Value Miscalibration for Zero-Shot Quadruped Transfer
por: Mishra, Prakhar, et al.
Publicado: (2026)
por: Mishra, Prakhar, et al.
Publicado: (2026)
McARL:Morphology-Control-Aware Reinforcement Learning for Generalizable Quadrupedal Locomotion
por: Mishra, Prakhar, et al.
Publicado: (2025)
por: Mishra, Prakhar, et al.
Publicado: (2025)
TransCurriculum: Multi-Dimensional Curriculum Learning for Fast & Stable Locomotion
por: Mishra, Prakhar, et al.
Publicado: (2026)
por: Mishra, Prakhar, et al.
Publicado: (2026)
MOSU: Autonomous Long-range Robot Navigation with Multi-modal Scene Understanding
por: Liang, Jing, et al.
Publicado: (2025)
por: Liang, Jing, et al.
Publicado: (2025)
G-LLaVA: Solving Geometric Problem with Multi-Modal Large Language Model
por: Gao, Jiahui, et al.
Publicado: (2023)
por: Gao, Jiahui, et al.
Publicado: (2023)
Enhance Image-to-Image Generation with LLaVA-generated Prompts
por: Ding, Zhicheng, et al.
Publicado: (2024)
por: Ding, Zhicheng, et al.
Publicado: (2024)
LLaVA-c: Continual Improved Visual Instruction Tuning
por: Liu, Wenzhuo, et al.
Publicado: (2025)
por: Liu, Wenzhuo, et al.
Publicado: (2025)
Wiki-LLaVA: Hierarchical Retrieval-Augmented Generation for Multimodal LLMs
por: Caffagni, Davide, et al.
Publicado: (2024)
por: Caffagni, Davide, et al.
Publicado: (2024)
X-LLaVA: Optimizing Bilingual Large Vision-Language Alignment
por: Shin, Dongjae, et al.
Publicado: (2024)
por: Shin, Dongjae, et al.
Publicado: (2024)
ViDRiP-LLaVA: A Dataset and Benchmark for Diagnostic Reasoning from Pathology Videos
por: Vuong, Trinh T. L., et al.
Publicado: (2025)
por: Vuong, Trinh T. L., et al.
Publicado: (2025)
SQ-LLaVA: Self-Questioning for Large Vision-Language Assistant
por: Sun, Guohao, et al.
Publicado: (2024)
por: Sun, Guohao, et al.
Publicado: (2024)
Dr-LLaVA: Visual Instruction Tuning with Symbolic Clinical Grounding
por: Sun, Shenghuan, et al.
Publicado: (2024)
por: Sun, Shenghuan, et al.
Publicado: (2024)
LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model
por: Zhu, Yichen, et al.
Publicado: (2024)
por: Zhu, Yichen, et al.
Publicado: (2024)
Why do LLaVA Vision-Language Models Reply to Images in English?
por: Hinck, Musashi, et al.
Publicado: (2024)
por: Hinck, Musashi, et al.
Publicado: (2024)
OMG-LLaVA: Bridging Image-level, Object-level, Pixel-level Reasoning and Understanding
por: Zhang, Tao, et al.
Publicado: (2024)
por: Zhang, Tao, et al.
Publicado: (2024)
AVG-LLaVA: An Efficient Large Multimodal Model with Adaptive Visual Granularity
por: Lan, Zhibin, et al.
Publicado: (2024)
por: Lan, Zhibin, et al.
Publicado: (2024)
LLaVA-SLT: Visual Language Tuning for Sign Language Translation
por: Liang, Han, et al.
Publicado: (2024)
por: Liang, Han, et al.
Publicado: (2024)
LLaVA-LE: Large Language-and-Vision Assistant for Lunar Exploration
por: Inal, Gokce, et al.
Publicado: (2026)
por: Inal, Gokce, et al.
Publicado: (2026)
MG-LLaVA: Towards Multi-Granularity Visual Instruction Tuning
por: Zhao, Xiangyu, et al.
Publicado: (2024)
por: Zhao, Xiangyu, et al.
Publicado: (2024)
Ejemplares similares
-
VLM-Social-Nav: Socially Aware Robot Navigation through Scoring using Vision-Language Models
por: Song, Daeun, et al.
Publicado: (2024) -
VANP: Learning Where to See for Navigation with Self-Supervised Vision-Action Pre-Training
por: Nazeri, Mohammad, et al.
Publicado: (2024) -
AutoSpatial: Visual-Language Reasoning for Social Robot Navigation through Efficient Spatial Reasoning Learning
por: Kong, Yangzhe, et al.
Publicado: (2025) -
DTG : Diffusion-based Trajectory Generation for Mapless Global Navigation
por: Liang, Jing, et al.
Publicado: (2024) -
Narrate2Nav: Real-Time Visual Navigation with Implicit Language Reasoning in Human-Centric Environments
por: Payandeh, Amirreza, et al.
Publicado: (2025)