OpenVision: A Fully-Open, Cost-Effective Family of Advanced Vision Encoders for Multimodal Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Xianhang, Liu, Yanqing, Tu, Haoqin, Zhu, Hongru, Xie, Cihang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning
di: Liu, Yanqing, et al.
Pubblicazione: (2025)
di: Liu, Yanqing, et al.
Pubblicazione: (2025)
Revisiting Adversarial Training at Scale
di: Wang, Zeyu, et al.
Pubblicazione: (2024)
di: Wang, Zeyu, et al.
Pubblicazione: (2024)
CLIPS: An Enhanced CLIP Framework for Learning with Synthetic Captions
di: Liu, Yanqing, et al.
Pubblicazione: (2024)
di: Liu, Yanqing, et al.
Pubblicazione: (2024)
OpenVision 3: A Family of Unified Visual Encoder for Both Understanding and Generation
di: Zhang, Letian, et al.
Pubblicazione: (2026)
di: Zhang, Letian, et al.
Pubblicazione: (2026)
Autoregressive Pretraining with Mamba in Vision
di: Ren, Sucheng, et al.
Pubblicazione: (2024)
di: Ren, Sucheng, et al.
Pubblicazione: (2024)
ViLBench: A Suite for Vision-Language Process Reward Modeling
di: Tu, Haoqin, et al.
Pubblicazione: (2025)
di: Tu, Haoqin, et al.
Pubblicazione: (2025)
Scaling White-Box Transformers for Vision
di: Yang, Jinrui, et al.
Pubblicazione: (2024)
di: Yang, Jinrui, et al.
Pubblicazione: (2024)
Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs
di: Tong, Shengbang, et al.
Pubblicazione: (2024)
di: Tong, Shengbang, et al.
Pubblicazione: (2024)
LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training
di: An, Xiang, et al.
Pubblicazione: (2025)
di: An, Xiang, et al.
Pubblicazione: (2025)
From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models
di: Wu, Juncheng, et al.
Pubblicazione: (2026)
di: Wu, Juncheng, et al.
Pubblicazione: (2026)
Where on Earth? A Vision-Language Benchmark for Probing Model Geolocation Skills Across Scales
di: Qian, Zhaofang, et al.
Pubblicazione: (2025)
di: Qian, Zhaofang, et al.
Pubblicazione: (2025)
ARVideo: Autoregressive Pretraining for Self-Supervised Video Representation Learning
di: Ren, Sucheng, et al.
Pubblicazione: (2024)
di: Ren, Sucheng, et al.
Pubblicazione: (2024)
SpatialThinker: Reinforcing 3D Reasoning in Multimodal LLMs via Spatial Rewards
di: Batra, Hunar, et al.
Pubblicazione: (2025)
di: Batra, Hunar, et al.
Pubblicazione: (2025)
What If We Recaption Billions of Web Images with LLaMA-3?
di: Li, Xianhang, et al.
Pubblicazione: (2024)
di: Li, Xianhang, et al.
Pubblicazione: (2024)
LightFusion: A Light-weighted, Double Fusion Framework for Unified Multimodal Understanding and Generation
di: Wang, Zeyu, et al.
Pubblicazione: (2025)
di: Wang, Zeyu, et al.
Pubblicazione: (2025)
VHELM: A Holistic Evaluation of Vision Language Models
di: Lee, Tony, et al.
Pubblicazione: (2024)
di: Lee, Tony, et al.
Pubblicazione: (2024)
SPFormer: Enhancing Vision Transformer with Superpixel Representation
di: Mei, Jieru, et al.
Pubblicazione: (2024)
di: Mei, Jieru, et al.
Pubblicazione: (2024)
MedTrinity-25M: A Large-scale Multimodal Dataset with Multigranular Annotations for Medicine
di: Xie, Yunfei, et al.
Pubblicazione: (2024)
di: Xie, Yunfei, et al.
Pubblicazione: (2024)
BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset
di: Chen, Jiuhai, et al.
Pubblicazione: (2025)
di: Chen, Jiuhai, et al.
Pubblicazione: (2025)
Beyond-Labels: Advancing Open-Vocabulary Segmentation With Vision-Language Models
di: Rahman, Muhammad Atta ur, et al.
Pubblicazione: (2025)
di: Rahman, Muhammad Atta ur, et al.
Pubblicazione: (2025)
Rejuvenating image-GPT as Strong Visual Representation Learners
di: Ren, Sucheng, et al.
Pubblicazione: (2023)
di: Ren, Sucheng, et al.
Pubblicazione: (2023)
Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness
di: Wang, Zeyu, et al.
Pubblicazione: (2025)
di: Wang, Zeyu, et al.
Pubblicazione: (2025)
Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models
di: Chi, Haohan, et al.
Pubblicazione: (2025)
di: Chi, Haohan, et al.
Pubblicazione: (2025)
OneVision-Encoder: Codec-Aligned Sparsity as a Foundational Principle for Multimodal Intelligence
di: Tang, Feilong, et al.
Pubblicazione: (2026)
di: Tang, Feilong, et al.
Pubblicazione: (2026)
L2B: Learning to Bootstrap Robust Models for Combating Label Noise
di: Zhou, Yuyin, et al.
Pubblicazione: (2022)
di: Zhou, Yuyin, et al.
Pubblicazione: (2022)
Stealthy Backdoor Attack in Self-Supervised Learning Vision Encoders for Large Vision Language Models
di: Liu, Zhaoyi, et al.
Pubblicazione: (2025)
di: Liu, Zhaoyi, et al.
Pubblicazione: (2025)
Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation
di: Liu, Zhiheng, et al.
Pubblicazione: (2026)
di: Liu, Zhiheng, et al.
Pubblicazione: (2026)
3D-TransUNet for Brain Metastases Segmentation in the BraTS2023 Challenge
di: Yang, Siwei, et al.
Pubblicazione: (2024)
di: Yang, Siwei, et al.
Pubblicazione: (2024)
CAST: Modeling Visual State Transitions for Consistent Video Retrieval
di: Liu, Yanqing, et al.
Pubblicazione: (2026)
di: Liu, Yanqing, et al.
Pubblicazione: (2026)
SED: A Simple Encoder-Decoder for Open-Vocabulary Semantic Segmentation
di: Xie, Bin, et al.
Pubblicazione: (2023)
di: Xie, Bin, et al.
Pubblicazione: (2023)
ViT-5: Vision Transformers for The Mid-2020s
di: Wang, Feng, et al.
Pubblicazione: (2026)
di: Wang, Feng, et al.
Pubblicazione: (2026)
Towards Robust and Fair Vision Learning in Open-World Environments
di: Truong, Thanh-Dat
Pubblicazione: (2024)
di: Truong, Thanh-Dat
Pubblicazione: (2024)
Multimodal Autoregressive Pre-training of Large Vision Encoders
di: Fini, Enrico, et al.
Pubblicazione: (2024)
di: Fini, Enrico, et al.
Pubblicazione: (2024)
CVP: Central-Peripheral Vision-Inspired Multimodal Model for Spatial Reasoning
di: Chen, Zeyuan, et al.
Pubblicazione: (2025)
di: Chen, Zeyuan, et al.
Pubblicazione: (2025)
Collaborative Vision-Text Representation Optimizing for Open-Vocabulary Segmentation
di: Jiao, Siyu, et al.
Pubblicazione: (2024)
di: Jiao, Siyu, et al.
Pubblicazione: (2024)
Open-Vocabulary Camouflaged Object Segmentation with Cascaded Vision Language Models
di: Zhao, Kai, et al.
Pubblicazione: (2025)
di: Zhao, Kai, et al.
Pubblicazione: (2025)
Advanced Vision Transformers and Open-Set Learning for Robust Mosquito Classification: A Novel Approach to Entomological Studies
di: Karim, Ahmed Akib Jawad, et al.
Pubblicazione: (2024)
di: Karim, Ahmed Akib Jawad, et al.
Pubblicazione: (2024)
An Efficient and Effective Encoder Model for Vision and Language Tasks in the Remote Sensing Domain
di: Silva, João Daniel, et al.
Pubblicazione: (2025)
di: Silva, João Daniel, et al.
Pubblicazione: (2025)
Dynamic Multimodal Prototype Learning in Vision-Language Models
di: Zhu, Xingyu, et al.
Pubblicazione: (2025)
di: Zhu, Xingyu, et al.
Pubblicazione: (2025)
Active Learning via Vision-Language Model Adaptation with Open Data
di: Wang, Tong, et al.
Pubblicazione: (2025)
di: Wang, Tong, et al.
Pubblicazione: (2025)
Documenti analoghi
-
OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning
di: Liu, Yanqing, et al.
Pubblicazione: (2025) -
Revisiting Adversarial Training at Scale
di: Wang, Zeyu, et al.
Pubblicazione: (2024) -
CLIPS: An Enhanced CLIP Framework for Learning with Synthetic Captions
di: Liu, Yanqing, et al.
Pubblicazione: (2024) -
OpenVision 3: A Family of Unified Visual Encoder for Both Understanding and Generation
di: Zhang, Letian, et al.
Pubblicazione: (2026) -
Autoregressive Pretraining with Mamba in Vision
di: Ren, Sucheng, et al.
Pubblicazione: (2024)