CitySeeker: How Do VLMS Explore Embodied Urban Navigation With Implicit Human Needs?
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Siqi, Liang, Chao, Gao, Yunfan, Yu, Erxin, Li, Sen, Li, Yushi, Li, Jing, Wang, Haofen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Decoding Urban Industrial Complexity: Enhancing Knowledge-Driven Insights via IndustryScopeGPT
di: Wang, Siqi, et al.
Pubblicazione: (2024)
di: Wang, Siqi, et al.
Pubblicazione: (2024)
StePO-Rec: Towards Personalized Outfit Styling Assistant via Knowledge-Guided Multi-Step Reasoning
di: Bi, Yuxi, et al.
Pubblicazione: (2025)
di: Bi, Yuxi, et al.
Pubblicazione: (2025)
HingeMem: Boundary Guided Long-Term Memory with Query Adaptive Retrieval for Scalable Dialogues
di: Zhong, Yijie, et al.
Pubblicazione: (2026)
di: Zhong, Yijie, et al.
Pubblicazione: (2026)
CityWalker: Learning Embodied Urban Navigation from Web-Scale Videos
di: Liu, Xinhao, et al.
Pubblicazione: (2024)
di: Liu, Xinhao, et al.
Pubblicazione: (2024)
"Less is More": Reducing Cognitive Load and Task Drift in Real-Time Multimodal Assistive Agents for the Visually Impaired
di: Zhao, Yi, et al.
Pubblicazione: (2025)
di: Zhao, Yi, et al.
Pubblicazione: (2025)
Modular RAG: Transforming RAG Systems into LEGO-like Reconfigurable Frameworks
di: Gao, Yunfan, et al.
Pubblicazione: (2024)
di: Gao, Yunfan, et al.
Pubblicazione: (2024)
Hierarchical Textual Knowledge for Enhanced Image Clustering
di: Zhong, Yijie, et al.
Pubblicazione: (2026)
di: Zhong, Yijie, et al.
Pubblicazione: (2026)
CoSafe: Evaluating Large Language Model Safety in Multi-Turn Dialogue Coreference
di: Yu, Erxin, et al.
Pubblicazione: (2024)
di: Yu, Erxin, et al.
Pubblicazione: (2024)
U-NIAH: Unified RAG and LLM Evaluation for Long Context Needle-In-A-Haystack
di: Gao, Yunfan, et al.
Pubblicazione: (2025)
di: Gao, Yunfan, et al.
Pubblicazione: (2025)
PopALM: Popularity-Aligned Language Models for Social Media Trendy Response Prediction
di: Yu, Erxin, et al.
Pubblicazione: (2024)
di: Yu, Erxin, et al.
Pubblicazione: (2024)
Embodied Science: Closing the Discovery Loop with Agentic Embodied AI
di: Zhuang, Xiang, et al.
Pubblicazione: (2026)
di: Zhuang, Xiang, et al.
Pubblicazione: (2026)
A Visually Impaired Assistance Benchmark for VLM-as-a-Judge Evaluation
di: Zhao, Yi, et al.
Pubblicazione: (2026)
di: Zhao, Yi, et al.
Pubblicazione: (2026)
Embodied Navigation Foundation Model
di: Zhang, Jiazhao, et al.
Pubblicazione: (2025)
di: Zhang, Jiazhao, et al.
Pubblicazione: (2025)
How Far Are Large Multimodal Models from Human-Level Spatial Action? A Benchmark for Goal-Oriented Embodied Navigation in Urban Airspace
di: Zhao, Baining, et al.
Pubblicazione: (2026)
di: Zhao, Baining, et al.
Pubblicazione: (2026)
How Do Humans Write Code? Large Models Do It the Same Way Too
di: Li, Long, et al.
Pubblicazione: (2024)
di: Li, Long, et al.
Pubblicazione: (2024)
LaF-GRPO: In-Situ Navigation Instruction Generation for the Visually Impaired via GRPO with LLM-as-Follower Reward
di: Zhao, Yi, et al.
Pubblicazione: (2025)
di: Zhao, Yi, et al.
Pubblicazione: (2025)
Synergizing RAG and Reasoning: A Systematic Review
di: Gao, Yunfan, et al.
Pubblicazione: (2025)
di: Gao, Yunfan, et al.
Pubblicazione: (2025)
Search is All You Need for Few-shot Anomaly Detection
di: Wang, Qishan, et al.
Pubblicazione: (2025)
di: Wang, Qishan, et al.
Pubblicazione: (2025)
PathSeeker: Exploring LLM Security Vulnerabilities with a Reinforcement Learning-Based Jailbreak Approach
di: Lin, Zhihao, et al.
Pubblicazione: (2024)
di: Lin, Zhihao, et al.
Pubblicazione: (2024)
Agentic Self-Evolutionary Replanning for Embodied Navigation
di: Li, Guoliang, et al.
Pubblicazione: (2026)
di: Li, Guoliang, et al.
Pubblicazione: (2026)
OctoNav: Towards Generalist Embodied Navigation
di: Gao, Chen, et al.
Pubblicazione: (2025)
di: Gao, Chen, et al.
Pubblicazione: (2025)
FloNa: Floor Plan Guided Embodied Visual Navigation
di: Li, Jiaxin, et al.
Pubblicazione: (2024)
di: Li, Jiaxin, et al.
Pubblicazione: (2024)
Vision-Language Navigation with Embodied Intelligence: A Survey
di: Gao, Peng, et al.
Pubblicazione: (2024)
di: Gao, Peng, et al.
Pubblicazione: (2024)
Triple-BERT: Do We Really Need MARL for Order Dispatch on Ride-Sharing Platforms?
di: Zhao, Zijian, et al.
Pubblicazione: (2025)
di: Zhao, Zijian, et al.
Pubblicazione: (2025)
HCSG: Human-Centric Semantic-Geometric Reasoning for Vision-Language Navigation
di: Xu, Haoxuan, et al.
Pubblicazione: (2026)
di: Xu, Haoxuan, et al.
Pubblicazione: (2026)
EmbodiedCity: A Benchmark Platform for Embodied Agent in Real-world City Environment
di: Gao, Chen, et al.
Pubblicazione: (2024)
di: Gao, Chen, et al.
Pubblicazione: (2024)
HIMM: Human-Inspired Long-Term Memory Modeling for Embodied Exploration and Question Answering
di: Li, Ji, et al.
Pubblicazione: (2026)
di: Li, Ji, et al.
Pubblicazione: (2026)
MetaUrban: An Embodied AI Simulation Platform for Urban Micromobility
di: Wu, Wayne, et al.
Pubblicazione: (2024)
di: Wu, Wayne, et al.
Pubblicazione: (2024)
IndustryNav: Exploring Spatial Reasoning of Embodied Agents in Dynamic Industrial Navigation
di: Li, Yifan, et al.
Pubblicazione: (2025)
di: Li, Yifan, et al.
Pubblicazione: (2025)
CityGPT: Empowering Urban Spatial Cognition of Large Language Models
di: Feng, Jie, et al.
Pubblicazione: (2024)
di: Feng, Jie, et al.
Pubblicazione: (2024)
UrbanVideo-Bench: Benchmarking Vision-Language Models on Embodied Intelligence with Video Data in Urban Spaces
di: Zhao, Baining, et al.
Pubblicazione: (2025)
di: Zhao, Baining, et al.
Pubblicazione: (2025)
How Does the Uncertainty of Regulatory Policy in Exchange Rates Affect Firm Innovation Performance? Evidence From China
di: Mengjun Huo, et al.
Pubblicazione: (2025)
di: Mengjun Huo, et al.
Pubblicazione: (2025)
Performance is not All You Need: Sustainability Considerations for Algorithms
di: Li, Xiang, et al.
Pubblicazione: (2025)
di: Li, Xiang, et al.
Pubblicazione: (2025)
NavBench: Probing Multimodal Large Language Models for Embodied Navigation
di: Qiao, Yanyuan, et al.
Pubblicazione: (2025)
di: Qiao, Yanyuan, et al.
Pubblicazione: (2025)
Revisit Event Generation Model: Self-Supervised Learning of Event-to-Video Reconstruction with Implicit Neural Representations
di: Wang, Zipeng, et al.
Pubblicazione: (2024)
di: Wang, Zipeng, et al.
Pubblicazione: (2024)
How do Transformers Learn Implicit Reasoning?
di: Ye, Jiaran, et al.
Pubblicazione: (2025)
di: Ye, Jiaran, et al.
Pubblicazione: (2025)
Advances in Embodied Navigation Using Large Language Models: A Survey
di: Lin, Jinzhou, et al.
Pubblicazione: (2023)
di: Lin, Jinzhou, et al.
Pubblicazione: (2023)
UrbanNav: Learning Language-Guided Urban Navigation from Web-Scale Human Trajectories
di: Mei, Yanghong, et al.
Pubblicazione: (2025)
di: Mei, Yanghong, et al.
Pubblicazione: (2025)
NavTrust: Benchmarking Trustworthiness for Embodied Navigation
di: Jiang, Huaide, et al.
Pubblicazione: (2026)
di: Jiang, Huaide, et al.
Pubblicazione: (2026)
AToM-Bot: Embodied Fulfillment of Unspoken Human Needs with Affective Theory of Mind
di: Ding, Wei, et al.
Pubblicazione: (2024)
di: Ding, Wei, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Decoding Urban Industrial Complexity: Enhancing Knowledge-Driven Insights via IndustryScopeGPT
di: Wang, Siqi, et al.
Pubblicazione: (2024) -
StePO-Rec: Towards Personalized Outfit Styling Assistant via Knowledge-Guided Multi-Step Reasoning
di: Bi, Yuxi, et al.
Pubblicazione: (2025) -
HingeMem: Boundary Guided Long-Term Memory with Query Adaptive Retrieval for Scalable Dialogues
di: Zhong, Yijie, et al.
Pubblicazione: (2026) -
CityWalker: Learning Embodied Urban Navigation from Web-Scale Videos
di: Liu, Xinhao, et al.
Pubblicazione: (2024) -
"Less is More": Reducing Cognitive Load and Task Drift in Real-Time Multimodal Assistive Agents for the Visually Impaired
di: Zhao, Yi, et al.
Pubblicazione: (2025)