TraceVision: Trajectory-Aware Vision-Language Model for Human-Like Spatial Understanding
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Yang, Fan, Zheng, Shurong, Zhao, Hongyin, Zhan, Yufei, Li, Xin, Zhu, Yousong, Tang, Chaoyang Zhao Ming, Wang, Jinqiao |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning
von: Zhan, Yufei, et al.
Veröffentlicht: (2025)
von: Zhan, Yufei, et al.
Veröffentlicht: (2025)
Griffon-G: Bridging Vision-Language and Vision-Centric Tasks via Large Multimodal Models
von: Zhan, Yufei, et al.
Veröffentlicht: (2024)
von: Zhan, Yufei, et al.
Veröffentlicht: (2024)
Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models
von: Zhan, Yufei, et al.
Veröffentlicht: (2025)
von: Zhan, Yufei, et al.
Veröffentlicht: (2025)
FOCUS: Unified Vision-Language Modeling for Interactive Editing Driven by Referential Segmentation
von: Yang, Fan, et al.
Veröffentlicht: (2025)
von: Yang, Fan, et al.
Veröffentlicht: (2025)
Griffon v2: Advancing Multimodal Perception with High-Resolution Scaling and Visual-Language Co-Referring
von: Zhan, Yufei, et al.
Veröffentlicht: (2024)
von: Zhan, Yufei, et al.
Veröffentlicht: (2024)
GeM-VG: Towards Generalized Multi-image Visual Grounding with Multimodal Large Language Models
von: Zheng, Shurong, et al.
Veröffentlicht: (2026)
von: Zheng, Shurong, et al.
Veröffentlicht: (2026)
From Seeing to Predicting: A Vision-Language Framework for Trajectory Forecasting and Controlled Video Generation
von: Yang, Fan, et al.
Veröffentlicht: (2025)
von: Yang, Fan, et al.
Veröffentlicht: (2025)
Griffon: Spelling out All Object Locations at Any Granularity with Large Language Models
von: Zhan, Yufei, et al.
Veröffentlicht: (2023)
von: Zhan, Yufei, et al.
Veröffentlicht: (2023)
Efficient Masked Autoencoders with Self-Consistency
von: Li, Zhaowen, et al.
Veröffentlicht: (2023)
von: Li, Zhaowen, et al.
Veröffentlicht: (2023)
FOCUS: Fine-grained Optimization with Semantic Guided Understanding for Pedestrian Attributes Recognition
von: An, Hongyan, et al.
Veröffentlicht: (2025)
von: An, Hongyan, et al.
Veröffentlicht: (2025)
VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?
von: Yu, Jiachen, et al.
Veröffentlicht: (2025)
von: Yu, Jiachen, et al.
Veröffentlicht: (2025)
PhysVLM: Enabling Visual Language Models to Understand Robotic Physical Reachability
von: Zhou, Weijie, et al.
Veröffentlicht: (2025)
von: Zhou, Weijie, et al.
Veröffentlicht: (2025)
ReST-KV: Robust KV Cache Eviction with Layer-wise Output Reconstruction and Spatial-Temporal Smoothing
von: An, Yongqi, et al.
Veröffentlicht: (2026)
von: An, Yongqi, et al.
Veröffentlicht: (2026)
LightPlanner: Unleashing the Reasoning Capabilities of Lightweight Large Language Models in Task Planning
von: Zhou, Weijie, et al.
Veröffentlicht: (2025)
von: Zhou, Weijie, et al.
Veröffentlicht: (2025)
MROVSeg: Breaking the Resolution Curse of Vision-Language Models in Open-Vocabulary Image Segmentation
von: Zhu, Yuanbing, et al.
Veröffentlicht: (2024)
von: Zhu, Yuanbing, et al.
Veröffentlicht: (2024)
SpatialBot: Precise Spatial Understanding with Vision Language Models
von: Cai, Wenxiao, et al.
Veröffentlicht: (2024)
von: Cai, Wenxiao, et al.
Veröffentlicht: (2024)
Information-Theoretic Constraints for Continual Vision-Language-Action Alignment
von: Zhao, Libang, et al.
Veröffentlicht: (2026)
von: Zhao, Libang, et al.
Veröffentlicht: (2026)
Optimization of Prompt Learning via Multi-Knowledge Representation for Vision-Language Models
von: Zhang, Enming, et al.
Veröffentlicht: (2024)
von: Zhang, Enming, et al.
Veröffentlicht: (2024)
Sparkle: Mastering Basic Spatial Capabilities in Vision Language Models Elicits Generalization to Spatial Reasoning
von: Tang, Yihong, et al.
Veröffentlicht: (2024)
von: Tang, Yihong, et al.
Veröffentlicht: (2024)
Beyond Semantics: Rediscovering Spatial Awareness in Vision-Language Models
von: Qi, Jianing, et al.
Veröffentlicht: (2025)
von: Qi, Jianing, et al.
Veröffentlicht: (2025)
Grounded 3D-Aware Spatial Vision-Language Modeling
von: Cheng, An-Chieh, et al.
Veröffentlicht: (2026)
von: Cheng, An-Chieh, et al.
Veröffentlicht: (2026)
Reading Images Like Texts: Sequential Image Understanding in Vision-Language Models
von: Li, Yueyan, et al.
Veröffentlicht: (2025)
von: Li, Yueyan, et al.
Veröffentlicht: (2025)
Decoupled Similarity for Task-Aware Token Pruning in Large Vision-Language Models
von: Ma, Kexin, et al.
Veröffentlicht: (2026)
von: Ma, Kexin, et al.
Veröffentlicht: (2026)
SUM-AgriVLN: Spatial Understanding Memory for Agricultural Vision-and-Language Navigation
von: Zhao, Xiaobei, et al.
Veröffentlicht: (2025)
von: Zhao, Xiaobei, et al.
Veröffentlicht: (2025)
ECVL-ROUTER: Scenario-Aware Routing for Vision-Language Models
von: Tang, Xin, et al.
Veröffentlicht: (2025)
von: Tang, Xin, et al.
Veröffentlicht: (2025)
Quality-Aware Language-Conditioned Local Auto-Regressive Anomaly Synthesis and Detection
von: Qian, Long, et al.
Veröffentlicht: (2025)
von: Qian, Long, et al.
Veröffentlicht: (2025)
PhysVLM-AVR: Active Visual Reasoning for Multimodal Large Language Models in Physical Environments
von: Zhou, Weijie, et al.
Veröffentlicht: (2025)
von: Zhou, Weijie, et al.
Veröffentlicht: (2025)
CRL-VLA: Continual Vision-Language-Action Learning
von: Zeng, Qixin, et al.
Veröffentlicht: (2026)
von: Zeng, Qixin, et al.
Veröffentlicht: (2026)
Terrain-Aware Stride-Level Trajectory Forecasting for a Powered Hip Exoskeleton via Vision and Kinematics Fusion
von: Zhao, Ruoqi, et al.
Veröffentlicht: (2024)
von: Zhao, Ruoqi, et al.
Veröffentlicht: (2024)
GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking
von: Zhan, Yufei, et al.
Veröffentlicht: (2025)
von: Zhan, Yufei, et al.
Veröffentlicht: (2025)
Systematic Outliers in Large Language Models
von: An, Yongqi, et al.
Veröffentlicht: (2025)
von: An, Yongqi, et al.
Veröffentlicht: (2025)
Evo-0: Vision-Language-Action Model with Implicit Spatial Understanding
von: Lin, Tao, et al.
Veröffentlicht: (2025)
von: Lin, Tao, et al.
Veröffentlicht: (2025)
RobustVLA: Robustness-Aware Reinforcement Post-Training for Vision-Language-Action Models
von: Zhang, Hongyin, et al.
Veröffentlicht: (2025)
von: Zhang, Hongyin, et al.
Veröffentlicht: (2025)
VEGA: Visual Encoder Grounding Alignment for Spatially-Aware Vision-Language-Action Models
von: Wang, Hao, et al.
Veröffentlicht: (2026)
von: Wang, Hao, et al.
Veröffentlicht: (2026)
Reasoning under Vision: Understanding Visual-Spatial Cognition in Vision-Language Models for CAPTCHA
von: Song, Python, et al.
Veröffentlicht: (2025)
von: Song, Python, et al.
Veröffentlicht: (2025)
Challenges and Responses in the Practice of Large Language Models
von: Zhu, Hongyin
Veröffentlicht: (2024)
von: Zhu, Hongyin
Veröffentlicht: (2024)
Architectural Foundations for the Large Language Model Infrastructures
von: Zhu, Hongyin
Veröffentlicht: (2024)
von: Zhu, Hongyin
Veröffentlicht: (2024)
Understanding Degradation with Vision Language Model
von: Lan, Guanzhou, et al.
Veröffentlicht: (2026)
von: Lan, Guanzhou, et al.
Veröffentlicht: (2026)
Do Vision Models Develop Human-Like Progressive Difficulty Understanding?
von: Huang, Zeyi, et al.
Veröffentlicht: (2025)
von: Huang, Zeyi, et al.
Veröffentlicht: (2025)
SD-VLM: Spatial Measuring and Understanding with Depth-Encoded Vision-Language Models
von: Chen, Pingyi, et al.
Veröffentlicht: (2025)
von: Chen, Pingyi, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning
von: Zhan, Yufei, et al.
Veröffentlicht: (2025) -
Griffon-G: Bridging Vision-Language and Vision-Centric Tasks via Large Multimodal Models
von: Zhan, Yufei, et al.
Veröffentlicht: (2024) -
Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models
von: Zhan, Yufei, et al.
Veröffentlicht: (2025) -
FOCUS: Unified Vision-Language Modeling for Interactive Editing Driven by Referential Segmentation
von: Yang, Fan, et al.
Veröffentlicht: (2025) -
Griffon v2: Advancing Multimodal Perception with High-Resolution Scaling and Visual-Language Co-Referring
von: Zhan, Yufei, et al.
Veröffentlicht: (2024)