Which Pretraining Paradigm Better Serves Spatial Intelligence? An Empirical Comparison of Vision-Language and Video Generation Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Shen, Haozhan, Zhao, Tiancheng, Zhao, Kangjia, Yin, Jianwei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ZoomEye: Enhancing Multimodal LLMs with Human-Like Zooming Capabilities through Tree-Based Image Exploration
di: Shen, Haozhan, et al.
Pubblicazione: (2024)
di: Shen, Haozhan, et al.
Pubblicazione: (2024)
VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model
di: Shen, Haozhan, et al.
Pubblicazione: (2025)
di: Shen, Haozhan, et al.
Pubblicazione: (2025)
GeoRSMLLM: A Multimodal Large Language Model for Vision-Language Tasks in Geoscience and Remote Sensing
di: Zhang, Zilun, et al.
Pubblicazione: (2025)
di: Zhang, Zilun, et al.
Pubblicazione: (2025)
RS5M and GeoRSCLIP: A Large Scale Vision-Language Dataset and A Large Vision-Language Model for Remote Sensing
di: Zhang, Zilun, et al.
Pubblicazione: (2023)
di: Zhang, Zilun, et al.
Pubblicazione: (2023)
MM-CondChain: A Programmatically Verified Benchmark for Visually Grounded Deep Compositional Reasoning
di: Shen, Haozhan, et al.
Pubblicazione: (2026)
di: Shen, Haozhan, et al.
Pubblicazione: (2026)
VLM-FO1: Bridging the Gap Between High-Level Reasoning and Fine-Grained Perception in VLMs
di: Liu, Peng, et al.
Pubblicazione: (2025)
di: Liu, Peng, et al.
Pubblicazione: (2025)
Geo-R1: Improving Few-Shot Geospatial Referring Expression Understanding with Reinforcement Fine-Tuning
di: Zhang, Zilun, et al.
Pubblicazione: (2025)
di: Zhang, Zilun, et al.
Pubblicazione: (2025)
ImageRAG: Enhancing Ultra High Resolution Remote Sensing Imagery Analysis with ImageRAG
di: Zhang, Zilun, et al.
Pubblicazione: (2024)
di: Zhang, Zilun, et al.
Pubblicazione: (2024)
DetailCLIP: Injecting Image Details into CLIP's Feature Space
di: Zhang, Zilun, et al.
Pubblicazione: (2022)
di: Zhang, Zilun, et al.
Pubblicazione: (2022)
Privacy-Shielded Image Compression: Defending Against Exploitation from Vision-Language Pretrained Models
di: Shen, Xuelin, et al.
Pubblicazione: (2025)
di: Shen, Xuelin, et al.
Pubblicazione: (2025)
Can Vision-Language Models Handle Long-Context Code? An Empirical Study on Visual Compression
di: Zhong, Jianping, et al.
Pubblicazione: (2026)
di: Zhong, Jianping, et al.
Pubblicazione: (2026)
Preserving Knowledge in Large Language Model with Model-Agnostic Self-Decompression
di: Zhang, Zilun, et al.
Pubblicazione: (2024)
di: Zhang, Zilun, et al.
Pubblicazione: (2024)
SimLabel: Consistency-Guided OOD Detection with Pretrained Vision-Language Models
di: Zou, Shu, et al.
Pubblicazione: (2025)
di: Zou, Shu, et al.
Pubblicazione: (2025)
Sparkle: Mastering Basic Spatial Capabilities in Vision Language Models Elicits Generalization to Spatial Reasoning
di: Tang, Yihong, et al.
Pubblicazione: (2024)
di: Tang, Yihong, et al.
Pubblicazione: (2024)
SpatialBot: Precise Spatial Understanding with Vision Language Models
di: Cai, Wenxiao, et al.
Pubblicazione: (2024)
di: Cai, Wenxiao, et al.
Pubblicazione: (2024)
CT-1: Vision-Language-Camera Models Transfer Spatial Reasoning Knowledge to Camera-Controllable Video Generation
di: Zhao, Haoyu, et al.
Pubblicazione: (2026)
di: Zhao, Haoyu, et al.
Pubblicazione: (2026)
Enhance-A-Video: Better Generated Video for Free
di: Luo, Yang, et al.
Pubblicazione: (2025)
di: Luo, Yang, et al.
Pubblicazione: (2025)
From Macro to Micro: Benchmarking Microscopic Spatial Intelligence on Molecules via Vision-Language Models
di: Li, Zongzhao, et al.
Pubblicazione: (2025)
di: Li, Zongzhao, et al.
Pubblicazione: (2025)
TraceVision: Trajectory-Aware Vision-Language Model for Human-Like Spatial Understanding
di: Yang, Fan, et al.
Pubblicazione: (2026)
di: Yang, Fan, et al.
Pubblicazione: (2026)
Revisiting Prompt Pretraining of Vision-Language Models
di: Chen, Zhenyuan, et al.
Pubblicazione: (2024)
di: Chen, Zhenyuan, et al.
Pubblicazione: (2024)
Distilling Vision-Language Models on Millions of Videos
di: Zhao, Yue, et al.
Pubblicazione: (2024)
di: Zhao, Yue, et al.
Pubblicazione: (2024)
Abstract 3D Perception for Spatial Intelligence in Vision-Language Models
di: Liu, Yifan, et al.
Pubblicazione: (2025)
di: Liu, Yifan, et al.
Pubblicazione: (2025)
SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models
di: Cheng, An-Chieh, et al.
Pubblicazione: (2024)
di: Cheng, An-Chieh, et al.
Pubblicazione: (2024)
Harnessing Vision-Language Pretrained Models with Temporal-Aware Adaptation for Referring Video Object Segmentation
di: Zhou, Zikun, et al.
Pubblicazione: (2024)
di: Zhou, Zikun, et al.
Pubblicazione: (2024)
Lynx: Towards High-Fidelity Personalized Video Generation
di: Sang, Shen, et al.
Pubblicazione: (2025)
di: Sang, Shen, et al.
Pubblicazione: (2025)
ArchSIBench: Benchmarking the Architectural Spatial Intelligence of Vision-Language Models
di: Shen, Qirui, et al.
Pubblicazione: (2026)
di: Shen, Qirui, et al.
Pubblicazione: (2026)
SRMF: A Data Augmentation and Multimodal Fusion Approach for Long-Tail UHR Satellite Image Segmentation
di: Guo, Yulong, et al.
Pubblicazione: (2025)
di: Guo, Yulong, et al.
Pubblicazione: (2025)
SkinGEN: an Explainable Dermatology Diagnosis-to-Generation Framework with Interactive Vision-Language Models
di: Lin, Bo, et al.
Pubblicazione: (2024)
di: Lin, Bo, et al.
Pubblicazione: (2024)
Temporal-Spatial Object Relations Modeling for Vision-and-Language Navigation
di: Huang, Bowen, et al.
Pubblicazione: (2024)
di: Huang, Bowen, et al.
Pubblicazione: (2024)
ForensicZip: More Tokens are Better but Not Necessary in Forensic Vision-Language Models
di: Lai, Yingxin, et al.
Pubblicazione: (2026)
di: Lai, Yingxin, et al.
Pubblicazione: (2026)
Language-Pretraining-Induced Bias: A Strong Foundation for General Vision Tasks
di: Luo, Yaxin, et al.
Pubblicazione: (2026)
di: Luo, Yaxin, et al.
Pubblicazione: (2026)
Video4Spatial: Towards Visuospatial Intelligence with Context-Guided Video Generation
di: Xiao, Zeqi, et al.
Pubblicazione: (2025)
di: Xiao, Zeqi, et al.
Pubblicazione: (2025)
Perceptio: Perception Enhanced Vision Language Models via Spatial Token Generation
di: Li, Yuchen, et al.
Pubblicazione: (2026)
di: Li, Yuchen, et al.
Pubblicazione: (2026)
Embodied3DBench: Benchmarking Low-Level Embodied Spatial Intelligence of Vision Language Models
di: Zhang, Jiyao, et al.
Pubblicazione: (2026)
di: Zhang, Jiyao, et al.
Pubblicazione: (2026)
EVE: Towards End-to-End Video Subtitle Extraction with Vision-Language Models
di: Yu, Haiyang, et al.
Pubblicazione: (2025)
di: Yu, Haiyang, et al.
Pubblicazione: (2025)
Structured Video-Language Modeling with Temporal Grouping and Spatial Grounding
di: Xiong, Yuanhao, et al.
Pubblicazione: (2023)
di: Xiong, Yuanhao, et al.
Pubblicazione: (2023)
UrbanVideo-Bench: Benchmarking Vision-Language Models on Embodied Intelligence with Video Data in Urban Spaces
di: Zhao, Baining, et al.
Pubblicazione: (2025)
di: Zhao, Baining, et al.
Pubblicazione: (2025)
Scaling Up Video Summarization Pretraining with Large Language Models
di: Argaw, Dawit Mureja, et al.
Pubblicazione: (2024)
di: Argaw, Dawit Mureja, et al.
Pubblicazione: (2024)
AutoTVG: A New Vision-language Pre-training Paradigm for Temporal Video Grounding
di: Zhang, Xing, et al.
Pubblicazione: (2024)
di: Zhang, Xing, et al.
Pubblicazione: (2024)
Towards A Better Metric for Text-to-Video Generation
di: Wu, Jay Zhangjie, et al.
Pubblicazione: (2024)
di: Wu, Jay Zhangjie, et al.
Pubblicazione: (2024)
Documenti analoghi
-
ZoomEye: Enhancing Multimodal LLMs with Human-Like Zooming Capabilities through Tree-Based Image Exploration
di: Shen, Haozhan, et al.
Pubblicazione: (2024) -
VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model
di: Shen, Haozhan, et al.
Pubblicazione: (2025) -
GeoRSMLLM: A Multimodal Large Language Model for Vision-Language Tasks in Geoscience and Remote Sensing
di: Zhang, Zilun, et al.
Pubblicazione: (2025) -
RS5M and GeoRSCLIP: A Large Scale Vision-Language Dataset and A Large Vision-Language Model for Remote Sensing
di: Zhang, Zilun, et al.
Pubblicazione: (2023) -
MM-CondChain: A Programmatically Verified Benchmark for Visually Grounded Deep Compositional Reasoning
di: Shen, Haozhan, et al.
Pubblicazione: (2026)