GLID: Pre-training a Generalist Encoder-Decoder Vision Model
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Jihao, Zheng, Jinliang, Liu, Yu, Li, Hongsheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Enhancing Vision-Language Model with Unmasked Token Alignment
di: Liu, Jihao, et al.
Pubblicazione: (2024)
di: Liu, Jihao, et al.
Pubblicazione: (2024)
VITAL: Vision-Encoder-centered Pre-training for LMMs in Visual Quality Assessment
di: Jia, Ziheng, et al.
Pubblicazione: (2025)
di: Jia, Ziheng, et al.
Pubblicazione: (2025)
MM-Instruct: Generated Visual Instructions for Large Multimodal Model Alignment
di: Liu, Jihao, et al.
Pubblicazione: (2024)
di: Liu, Jihao, et al.
Pubblicazione: (2024)
Multimodal Autoregressive Pre-training of Large Vision Encoders
di: Fini, Enrico, et al.
Pubblicazione: (2024)
di: Fini, Enrico, et al.
Pubblicazione: (2024)
Securely Fine-tuning Pre-trained Encoders Against Adversarial Examples
di: Zhou, Ziqi, et al.
Pubblicazione: (2024)
di: Zhou, Ziqi, et al.
Pubblicazione: (2024)
Vision Generalist Model: A Survey
di: Wang, Ziyi, et al.
Pubblicazione: (2025)
di: Wang, Ziyi, et al.
Pubblicazione: (2025)
Unleashing the Power of Pre-trained Encoders for Universal Adversarial Attack Detection
di: Zhang, Yinghe, et al.
Pubblicazione: (2025)
di: Zhang, Yinghe, et al.
Pubblicazione: (2025)
GiT: Towards Generalist Vision Transformer through Universal Language Interface
di: Wang, Haiyang, et al.
Pubblicazione: (2024)
di: Wang, Haiyang, et al.
Pubblicazione: (2024)
Masked AutoDecoder is Effective Multi-Task Vision Generalist
di: Qiu, Han, et al.
Pubblicazione: (2024)
di: Qiu, Han, et al.
Pubblicazione: (2024)
Sample-agnostic Adversarial Perturbation for Vision-Language Pre-training Models
di: Zheng, Haonan, et al.
Pubblicazione: (2024)
di: Zheng, Haonan, et al.
Pubblicazione: (2024)
Vision Foundation Models as Generalist Tokenizers for Image Generation
di: Zheng, Anlin, et al.
Pubblicazione: (2026)
di: Zheng, Anlin, et al.
Pubblicazione: (2026)
Beyond the Encoder: Joint Encoder-Decoder Contrastive Pre-Training Improves Dense Prediction
di: Quetin, Sébastien, et al.
Pubblicazione: (2025)
di: Quetin, Sébastien, et al.
Pubblicazione: (2025)
Exploiting the Semantic Knowledge of Pre-trained Text-Encoders for Continual Learning
di: Yu, Lu, et al.
Pubblicazione: (2024)
di: Yu, Lu, et al.
Pubblicazione: (2024)
Revisiting Continual Semantic Segmentation with Pre-trained Vision Models
di: Zhang, Duzhen, et al.
Pubblicazione: (2025)
di: Zhang, Duzhen, et al.
Pubblicazione: (2025)
Muskie: Multi-view Masked Image Modeling for 3D Vision Pre-training
di: Li, Wenyu, et al.
Pubblicazione: (2025)
di: Li, Wenyu, et al.
Pubblicazione: (2025)
What Matters in Building Vision-Language-Action Models for Generalist Robots
di: Li, Xinghang, et al.
Pubblicazione: (2024)
di: Li, Xinghang, et al.
Pubblicazione: (2024)
Continual Forgetting for Pre-trained Vision Models
di: Zhao, Hongbo, et al.
Pubblicazione: (2024)
di: Zhao, Hongbo, et al.
Pubblicazione: (2024)
I-Max: Maximize the Resolution Potential of Pre-trained Rectified Flow Transformers with Projected Flow
di: Du, Ruoyi, et al.
Pubblicazione: (2024)
di: Du, Ruoyi, et al.
Pubblicazione: (2024)
WeakSupCon: Weakly Supervised Contrastive Learning for Encoder Pre-training
di: Zhang, Bodong, et al.
Pubblicazione: (2025)
di: Zhang, Bodong, et al.
Pubblicazione: (2025)
Centroid-centered Modeling for Efficient Vision Transformer Pre-training
di: Yan, Xin, et al.
Pubblicazione: (2023)
di: Yan, Xin, et al.
Pubblicazione: (2023)
3D Scene Graph Guided Vision-Language Pre-training
di: Liu, Hao, et al.
Pubblicazione: (2024)
di: Liu, Hao, et al.
Pubblicazione: (2024)
An Empirical Study of Parameter Efficient Fine-tuning on Vision-Language Pre-train Model
di: Tian, Yuxin, et al.
Pubblicazione: (2024)
di: Tian, Yuxin, et al.
Pubblicazione: (2024)
Omniview-Tuning: Boosting Viewpoint Invariance of Vision-Language Pre-training Models
di: Ruan, Shouwei, et al.
Pubblicazione: (2024)
di: Ruan, Shouwei, et al.
Pubblicazione: (2024)
Understanding the Multi-modal Prompts of the Pre-trained Vision-Language Model
di: Ma, Shuailei, et al.
Pubblicazione: (2023)
di: Ma, Shuailei, et al.
Pubblicazione: (2023)
Semantics-enhanced Cross-modal Masked Image Modeling for Vision-Language Pre-training
di: Liu, Haowei, et al.
Pubblicazione: (2024)
di: Liu, Haowei, et al.
Pubblicazione: (2024)
CoMP: Continual Multimodal Pre-training for Vision Foundation Models
di: Chen, Yitong, et al.
Pubblicazione: (2025)
di: Chen, Yitong, et al.
Pubblicazione: (2025)
Modality-Specialized Synergizers for Interleaved Vision-Language Generalists
di: Xu, Zhiyang, et al.
Pubblicazione: (2024)
di: Xu, Zhiyang, et al.
Pubblicazione: (2024)
Efficient and Effective Universal Adversarial Attack against Vision-Language Pre-training Models
di: Yang, Fan, et al.
Pubblicazione: (2024)
di: Yang, Fan, et al.
Pubblicazione: (2024)
HyperVision: A Channel-Adaptive Ground-Based Hyperspectral Vision Pre-trained Backbone
di: Fu, Guanyiman, et al.
Pubblicazione: (2026)
di: Fu, Guanyiman, et al.
Pubblicazione: (2026)
VisionTS++: Cross-Modal Time Series Foundation Model with Continual Pre-trained Vision Backbones
di: Shen, Lefei, et al.
Pubblicazione: (2025)
di: Shen, Lefei, et al.
Pubblicazione: (2025)
Unsupervised Pre-training with Language-Vision Prompts for Low-Data Instance Segmentation
di: Zhang, Dingwen, et al.
Pubblicazione: (2024)
di: Zhang, Dingwen, et al.
Pubblicazione: (2024)
Stealthy Backdoor Attack in Self-Supervised Learning Vision Encoders for Large Vision Language Models
di: Liu, Zhaoyi, et al.
Pubblicazione: (2025)
di: Liu, Zhaoyi, et al.
Pubblicazione: (2025)
MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models
di: Hua, Hang, et al.
Pubblicazione: (2024)
di: Hua, Hang, et al.
Pubblicazione: (2024)
Learning A Low-Level Vision Generalist via Visual Task Prompt
di: Chen, Xiangyu, et al.
Pubblicazione: (2024)
di: Chen, Xiangyu, et al.
Pubblicazione: (2024)
Efficient and Long-Tailed Generalization for Pre-trained Vision-Language Model
di: Shi, Jiang-Xin, et al.
Pubblicazione: (2024)
di: Shi, Jiang-Xin, et al.
Pubblicazione: (2024)
Scaling Pre-training to One Hundred Billion Data for Vision Language Models
di: Wang, Xiao, et al.
Pubblicazione: (2025)
di: Wang, Xiao, et al.
Pubblicazione: (2025)
Enhancing SAR Object Detection with Self-Supervised Pre-training on Masked Auto-Encoders
di: Pu, Xinyang, et al.
Pubblicazione: (2025)
di: Pu, Xinyang, et al.
Pubblicazione: (2025)
Downstream Transfer Attack: Adversarial Attacks on Downstream Models with Pre-trained Vision Transformers
di: Zheng, Weijie, et al.
Pubblicazione: (2024)
di: Zheng, Weijie, et al.
Pubblicazione: (2024)
Temporal-Consistent Video Restoration with Pre-trained Diffusion Models
di: Wang, Hengkang, et al.
Pubblicazione: (2025)
di: Wang, Hengkang, et al.
Pubblicazione: (2025)
There is No VAE: End-to-End Pixel-Space Generative Modeling via Self-Supervised Pre-training
di: Lei, Jiachen, et al.
Pubblicazione: (2025)
di: Lei, Jiachen, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Enhancing Vision-Language Model with Unmasked Token Alignment
di: Liu, Jihao, et al.
Pubblicazione: (2024) -
VITAL: Vision-Encoder-centered Pre-training for LMMs in Visual Quality Assessment
di: Jia, Ziheng, et al.
Pubblicazione: (2025) -
MM-Instruct: Generated Visual Instructions for Large Multimodal Model Alignment
di: Liu, Jihao, et al.
Pubblicazione: (2024) -
Multimodal Autoregressive Pre-training of Large Vision Encoders
di: Fini, Enrico, et al.
Pubblicazione: (2024) -
Securely Fine-tuning Pre-trained Encoders Against Adversarial Examples
di: Zhou, Ziqi, et al.
Pubblicazione: (2024)