WalkGPT: Grounded Vision-Language Conversation with Depth-Aware Segmentation for Pedestrian Navigation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sultan, Rafi Ibn, Zhu, Hui, Zhou, Xiangyu, Li, Chengyin, Khanduri, Prashant, Brocanelli, Marco, Zhu, Dongxiao |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
GeoSAM: Fine-tuning SAM with Multi-Modal Prompts for Mobility Infrastructure Segmentation
par: Sultan, Rafi Ibn, et autres
Publié: (2023)
par: Sultan, Rafi Ibn, et autres
Publié: (2023)
BiPVL-Seg: Bidirectional Progressive Vision-Language Fusion with Global-Local Alignment for Medical Image Segmentation
par: Sultan, Rafi Ibn, et autres
Publié: (2025)
par: Sultan, Rafi Ibn, et autres
Publié: (2025)
AutoProSAM: Automated Prompting SAM for 3D Multi-Organ Segmentation
par: Li, Chengyin, et autres
Publié: (2023)
par: Li, Chengyin, et autres
Publié: (2023)
Interpretability-Aware Vision Transformer
par: Qiang, Yao, et autres
Publié: (2023)
par: Qiang, Yao, et autres
Publié: (2023)
MulModSeg: Enhancing Unpaired Multi-Modal Medical Image Segmentation with Modality-Conditioned Text Embedding and Alternating Training
par: Li, Chengyin, et autres
Publié: (2024)
par: Li, Chengyin, et autres
Publié: (2024)
Fairness-aware Vision Transformer via Debiased Self-Attention
par: Qiang, Yao, et autres
Publié: (2023)
par: Qiang, Yao, et autres
Publié: (2023)
Hijacking Large Language Models via Adversarial In-Context Learning
par: Zhou, Xiangyu, et autres
Publié: (2023)
par: Zhou, Xiangyu, et autres
Publié: (2023)
Robustness of Transformer-Based Fluence Map Prediction Under Clinically Realistic Perturbations
par: Mgboh, Ujunwa, et autres
Publié: (2026)
par: Mgboh, Ujunwa, et autres
Publié: (2026)
FluenceFormer: Transformer-Driven Multi-Beam Fluence Map Regression for Radiotherapy Planning
par: Mgboh, Ujunwa, et autres
Publié: (2025)
par: Mgboh, Ujunwa, et autres
Publié: (2025)
Learning to Poison Large Language Models for Downstream Manipulation
par: Zhou, Xiangyu, et autres
Publié: (2024)
par: Zhou, Xiangyu, et autres
Publié: (2024)
Fluence Map Prediction with Deep Learning: A Transformer-based Approach
par: Mgboh, Ujunwa, et autres
Publié: (2025)
par: Mgboh, Ujunwa, et autres
Publié: (2025)
MSR-Align: Policy-Grounded Multimodal Alignment for Safety-Aware Reasoning in Vision-Language Models
par: Xia, Yinan, et autres
Publié: (2025)
par: Xia, Yinan, et autres
Publié: (2025)
Automatic Calibration for Membership Inference Attack on Large Language Models
par: Zade, Saleh Zare, et autres
Publié: (2025)
par: Zade, Saleh Zare, et autres
Publié: (2025)
Not All Tokens Are Meant to Be Forgotten
par: Zhou, Xiangyu, et autres
Publié: (2025)
par: Zhou, Xiangyu, et autres
Publié: (2025)
Multi-View Black-Box Physical Attacks on Infrared Pedestrian Detectors Using Adversarial Infrared Grid
par: Tiliwalidi, Kalibinuer, et autres
Publié: (2024)
par: Tiliwalidi, Kalibinuer, et autres
Publié: (2024)
Temporal-Spatial Object Relations Modeling for Vision-and-Language Navigation
par: Huang, Bowen, et autres
Publié: (2024)
par: Huang, Bowen, et autres
Publié: (2024)
FlightGPT: Towards Generalizable and Interpretable UAV Vision-and-Language Navigation with Vision-Language Models
par: Cai, Hengxing, et autres
Publié: (2025)
par: Cai, Hengxing, et autres
Publié: (2025)
AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation
par: Guo, Wenxuan, et autres
Publié: (2026)
par: Guo, Wenxuan, et autres
Publié: (2026)
Ground-level Viewpoint Vision-and-Language Navigation in Continuous Environments
par: Li, Zerui, et autres
Publié: (2025)
par: Li, Zerui, et autres
Publié: (2025)
RetinalGPT: A Retinal Clinical Preference Conversational Assistant Powered by Large Vision-Language Models
par: Zhu, Wenhui, et autres
Publié: (2025)
par: Zhu, Wenhui, et autres
Publié: (2025)
MC-GPT: Empowering Vision-and-Language Navigation with Memory Map and Reasoning Chains
par: Zhan, Zhaohuan, et autres
Publié: (2024)
par: Zhan, Zhaohuan, et autres
Publié: (2024)
WalkVLM:Aid Visually Impaired People Walking by Vision Language Model
par: Yuan, Zhiqiang, et autres
Publié: (2024)
par: Yuan, Zhiqiang, et autres
Publié: (2024)
Generative LLM Powered Conversational AI Application for Personalized Risk Assessment: A Case Study in COVID-19
par: Roshani, Mohammad Amin, et autres
Publié: (2024)
par: Roshani, Mohammad Amin, et autres
Publié: (2024)
Grounded 3D-Aware Spatial Vision-Language Modeling
par: Cheng, An-Chieh, et autres
Publié: (2026)
par: Cheng, An-Chieh, et autres
Publié: (2026)
NAVCON: A Cognitively Inspired and Linguistically Grounded Corpus for Vision and Language Navigation
par: Wanchoo, Karan, et autres
Publié: (2024)
par: Wanchoo, Karan, et autres
Publié: (2024)
Understanding Server-Assisted Federated Learning in the Presence of Incomplete Client Participation
par: Yang, Haibo, et autres
Publié: (2024)
par: Yang, Haibo, et autres
Publié: (2024)
GA-VLN: Geometry-Aware BEV Representation for Efficient Vision-Language Navigation
par: Yang, Jiahao, et autres
Publié: (2026)
par: Yang, Jiahao, et autres
Publié: (2026)
GroundingGPT:Language Enhanced Multi-modal Grounding Model
par: Li, Zhaowei, et autres
Publié: (2024)
par: Li, Zhaowei, et autres
Publié: (2024)
Attention Smoothing Is All You Need For Unlearning
par: Zade, Saleh Zare, et autres
Publié: (2026)
par: Zade, Saleh Zare, et autres
Publié: (2026)
Structured Chain-of-Thought Prompting for Few-Shot Generation of Content-Grounded QA Conversations
par: Sultan, Md Arafat, et autres
Publié: (2024)
par: Sultan, Md Arafat, et autres
Publié: (2024)
NavGPT-2: Unleashing Navigational Reasoning Capability for Large Vision-Language Models
par: Zhou, Gengze, et autres
Publié: (2024)
par: Zhou, Gengze, et autres
Publié: (2024)
Ground-Truth Depth in Vision Language Models: Spatial Context Understanding in Conversational AI for XR-Robotic Support in Emergency First Response
par: Maquilon, Rodrigo Gutierrez, et autres
Publié: (2026)
par: Maquilon, Rodrigo Gutierrez, et autres
Publié: (2026)
Meanings and Measurements: Multi-Agent Probabilistic Grounding for Vision-Language Navigation
par: Padhan, Swagat, et autres
Publié: (2026)
par: Padhan, Swagat, et autres
Publié: (2026)
A Morphologically-Aware Dictionary-based Data Augmentation Technique for Machine Translation of Under-Represented Languages
par: Alam, Md Mahfuz Ibn, et autres
Publié: (2024)
par: Alam, Md Mahfuz Ibn, et autres
Publié: (2024)
VIGNETTE: Socially Grounded Bias Evaluation for Vision-Language Models
par: Raj, Chahat, et autres
Publié: (2025)
par: Raj, Chahat, et autres
Publié: (2025)
Uncertainty-Aware Pedestrian Attribute Recognition via Evidential Deep Learning
par: Lou, Zhuofan, et autres
Publié: (2026)
par: Lou, Zhuofan, et autres
Publié: (2026)
Uncertainty-Aware Gaussian Map for Vision-Language Navigation
par: Gao, Jianzhe, et autres
Publié: (2026)
par: Gao, Jianzhe, et autres
Publié: (2026)
DepthVLA: Enhancing Vision-Language-Action Models with Depth-Aware Spatial Reasoning
par: Yuan, Tianyuan, et autres
Publié: (2025)
par: Yuan, Tianyuan, et autres
Publié: (2025)
Unsupervised Segmentation by Diffusing, Walking and Cutting
par: Ivanova, Daniela, et autres
Publié: (2024)
par: Ivanova, Daniela, et autres
Publié: (2024)
Swarm Intelligence in Geo-Localization: A Multi-Agent Large Vision-Language Model Collaborative Framework
par: Han, Xiao, et autres
Publié: (2024)
par: Han, Xiao, et autres
Publié: (2024)
Documents similaires
-
GeoSAM: Fine-tuning SAM with Multi-Modal Prompts for Mobility Infrastructure Segmentation
par: Sultan, Rafi Ibn, et autres
Publié: (2023) -
BiPVL-Seg: Bidirectional Progressive Vision-Language Fusion with Global-Local Alignment for Medical Image Segmentation
par: Sultan, Rafi Ibn, et autres
Publié: (2025) -
AutoProSAM: Automated Prompting SAM for 3D Multi-Organ Segmentation
par: Li, Chengyin, et autres
Publié: (2023) -
Interpretability-Aware Vision Transformer
par: Qiang, Yao, et autres
Publié: (2023) -
MulModSeg: Enhancing Unpaired Multi-Modal Medical Image Segmentation with Modality-Conditioned Text Embedding and Alternating Training
par: Li, Chengyin, et autres
Publié: (2024)