Can Large Vision Language Models Read Maps Like a Human?
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xing, Shuo, Sun, Zezhou, Xie, Shuangyu, Chen, Kaiyuan, Huang, Yanjia, Wang, Yuping, Li, Jiachen, Song, Dezhen, Tu, Zhengzhong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VISTAv2: World Imagination for Indoor Vision-and-Language Navigation
par: Huang, Yanjia, et autres
Publié: (2025)
par: Huang, Yanjia, et autres
Publié: (2025)
UniOcc: A Unified Benchmark for Occupancy Forecasting and Prediction in Autonomous Driving
par: Wang, Yuping, et autres
Publié: (2025)
par: Wang, Yuping, et autres
Publié: (2025)
Re-Align: Aligning Vision Language Models via Retrieval-Augmented Direct Preference Optimization
par: Xing, Shuo, et autres
Publié: (2025)
par: Xing, Shuo, et autres
Publié: (2025)
MVP-Bench: Can Large Vision--Language Models Conduct Multi-level Visual Perception Like Humans?
par: Li, Guanzhen, et autres
Publié: (2024)
par: Li, Guanzhen, et autres
Publié: (2024)
OpenEMMA: Open-Source Multimodal Model for End-to-End Autonomous Driving
par: Xing, Shuo, et autres
Publié: (2024)
par: Xing, Shuo, et autres
Publié: (2024)
Unraveling Cross-Modality Knowledge Conflicts in Large Vision-Language Models
par: Zhu, Tinghui, et autres
Publié: (2024)
par: Zhu, Tinghui, et autres
Publié: (2024)
DecAlign: Hierarchical Cross-Modal Alignment for Decoupled Multimodal Representation Learning
par: Qian, Chengxuan, et autres
Publié: (2025)
par: Qian, Chengxuan, et autres
Publié: (2025)
Demystifying the Visual Quality Paradox in Multimodal Large Language Models
par: Xing, Shuo, et autres
Publié: (2025)
par: Xing, Shuo, et autres
Publié: (2025)
AutoTrust: Benchmarking Trustworthiness in Large Vision Language Models for Autonomous Driving
par: Xing, Shuo, et autres
Publié: (2024)
par: Xing, Shuo, et autres
Publié: (2024)
AdaRing: Towards Ultra-Light Vision-Language Adaptation via Cross-Layer Tensor Ring Decomposition
par: Huang, Ying, et autres
Publié: (2025)
par: Huang, Ying, et autres
Publié: (2025)
VISTA: Generative Visual Imagination for Vision-and-Language Navigation
par: Huang, Yanjia, et autres
Publié: (2025)
par: Huang, Yanjia, et autres
Publié: (2025)
Let the Abyss Stare Back Adaptive Falsification for Autonomous Scientific Discovery
par: Li, Peiran, et autres
Publié: (2026)
par: Li, Peiran, et autres
Publié: (2026)
Reading Images Like Texts: Sequential Image Understanding in Vision-Language Models
par: Li, Yueyan, et autres
Publié: (2025)
par: Li, Yueyan, et autres
Publié: (2025)
DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models
par: Pan, Chenbin, et autres
Publié: (2025)
par: Pan, Chenbin, et autres
Publié: (2025)
CoMamba: Real-time Cooperative Perception Unlocked with State Space Models
par: Li, Jinlong, et autres
Publié: (2024)
par: Li, Jinlong, et autres
Publié: (2024)
NuScenes-SpatialQA: A Spatial Understanding and Reasoning Benchmark for Vision-Language Models in Autonomous Driving
par: Tian, Kexin, et autres
Publié: (2025)
par: Tian, Kexin, et autres
Publié: (2025)
Q-Router: Agentic Video Quality Assessment with Expert Model Routing and Artifact Localization
par: Xing, Shuo, et autres
Publié: (2025)
par: Xing, Shuo, et autres
Publié: (2025)
ConsID-Gen: View-Consistent and Identity-Preserving Image-to-Video Generation
par: Wu, Mingyang, et autres
Publié: (2026)
par: Wu, Mingyang, et autres
Publié: (2026)
A Large Vision-Language Model based Environment Perception System for Visually Impaired People
par: Chen, Zezhou, et autres
Publié: (2025)
par: Chen, Zezhou, et autres
Publié: (2025)
TraceVision: Trajectory-Aware Vision-Language Model for Human-Like Spatial Understanding
par: Yang, Fan, et autres
Publié: (2026)
par: Yang, Fan, et autres
Publié: (2026)
JECA^2: Judgment-Explanation Consistent Adversarial Attack against Forensic Vision-Language Models
par: Qian, Jiachen
Publié: (2026)
par: Qian, Jiachen
Publié: (2026)
RayMap3R: Inference-Time RayMap for Dynamic 3D Reconstruction
par: Wang, Feiran, et autres
Publié: (2026)
par: Wang, Feiran, et autres
Publié: (2026)
PLPHP: Per-Layer Per-Head Vision Token Pruning for Efficient Large Vision-Language Models
par: Meng, Yu, et autres
Publié: (2025)
par: Meng, Yu, et autres
Publié: (2025)
Probing the Mid-level Vision Capabilities of Self-Supervised Learning
par: Chen, Xuweiyi, et autres
Publié: (2024)
par: Chen, Xuweiyi, et autres
Publié: (2024)
STAMP: Scalable Task And Model-agnostic Collaborative Perception
par: Gao, Xiangbo, et autres
Publié: (2025)
par: Gao, Xiangbo, et autres
Publié: (2025)
MiVLA: Towards Generalizable Vision-Language-Action Model with Human-Robot Mutual Imitation Pre-training
par: Yin, Zhenhan, et autres
Publié: (2025)
par: Yin, Zhenhan, et autres
Publié: (2025)
CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences
par: Lin, Fangzhou, et autres
Publié: (2026)
par: Lin, Fangzhou, et autres
Publié: (2026)
Energy Efficient Planning for Repetitive Heterogeneous Tasks in Precision Agriculture
par: Xie, Shuangyu, et autres
Publié: (2025)
par: Xie, Shuangyu, et autres
Publié: (2025)
Bilateral Collaboration with Large Vision-Language Models for Open Vocabulary Human-Object Interaction Detection
par: Hu, Yupeng, et autres
Publié: (2025)
par: Hu, Yupeng, et autres
Publié: (2025)
HulluEdit: Single-Pass Evidence-Consistent Subspace Editing for Mitigating Hallucinations in Large Vision-Language Models
par: Lin, Yangguang, et autres
Publié: (2026)
par: Lin, Yangguang, et autres
Publié: (2026)
NexusFlow: Unifying Disparate Tasks under Partial Supervision via Invertible Flow Networks
par: Lin, Fangzhou, et autres
Publié: (2025)
par: Lin, Fangzhou, et autres
Publié: (2025)
Dynamic Pyramid Network for Efficient Multimodal Large Language Model
par: Ai, Hao, et autres
Publié: (2025)
par: Ai, Hao, et autres
Publié: (2025)
3D4D: An Interactive, Editable, 4D World Model via 3D Video Generation
par: He, Yunhong, et autres
Publié: (2025)
par: He, Yunhong, et autres
Publié: (2025)
Contour Integration Underlies Human-Like Vision
par: Lonnqvist, Ben, et autres
Publié: (2025)
par: Lonnqvist, Ben, et autres
Publié: (2025)
Do Vision Models Develop Human-Like Progressive Difficulty Understanding?
par: Huang, Zeyi, et autres
Publié: (2025)
par: Huang, Zeyi, et autres
Publié: (2025)
Region-R1: Reinforcing Query-Side Region Cropping for Multi-Modal Re-Ranking
par: Hu, Chan-Wei, et autres
Publié: (2026)
par: Hu, Chan-Wei, et autres
Publié: (2026)
Geolocation with Real Human Gameplay Data: A Large-Scale Dataset and Human-Like Reasoning Framework
par: Song, Zirui, et autres
Publié: (2025)
par: Song, Zirui, et autres
Publié: (2025)
TRINS: Towards Multimodal Language Models that Can Read
par: Zhang, Ruiyi, et autres
Publié: (2024)
par: Zhang, Ruiyi, et autres
Publié: (2024)
HeadsUp! High-Fidelity Portrait Image Super-Resolution
par: Li, Renjie, et autres
Publié: (2025)
par: Li, Renjie, et autres
Publié: (2025)
WildRayZer: Self-supervised Large View Synthesis in Dynamic Environments
par: Chen, Xuweiyi, et autres
Publié: (2026)
par: Chen, Xuweiyi, et autres
Publié: (2026)
Documents similaires
-
VISTAv2: World Imagination for Indoor Vision-and-Language Navigation
par: Huang, Yanjia, et autres
Publié: (2025) -
UniOcc: A Unified Benchmark for Occupancy Forecasting and Prediction in Autonomous Driving
par: Wang, Yuping, et autres
Publié: (2025) -
Re-Align: Aligning Vision Language Models via Retrieval-Augmented Direct Preference Optimization
par: Xing, Shuo, et autres
Publié: (2025) -
MVP-Bench: Can Large Vision--Language Models Conduct Multi-level Visual Perception Like Humans?
par: Li, Guanzhen, et autres
Publié: (2024) -
OpenEMMA: Open-Source Multimodal Model for End-to-End Autonomous Driving
par: Xing, Shuo, et autres
Publié: (2024)