Rejuvenating image-GPT as Strong Visual Representation Learners
Fuente:
arXiv
Salvato in:
| Autori principali: | Ren, Sucheng, Wang, Zeyu, Zhu, Hongru, Xiao, Junfei, Yuille, Alan, Xie, Cihang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ARVideo: Autoregressive Pretraining for Self-Supervised Video Representation Learning
di: Ren, Sucheng, et al.
Pubblicazione: (2024)
di: Ren, Sucheng, et al.
Pubblicazione: (2024)
Spiral RoPE: Rotate Your Rotary Positional Embeddings in the 2D Plane
di: Liu, Haoyu, et al.
Pubblicazione: (2026)
di: Liu, Haoyu, et al.
Pubblicazione: (2026)
M-VAR: Decoupled Scale-wise Autoregressive Modeling for High-Quality Image Generation
di: Ren, Sucheng, et al.
Pubblicazione: (2024)
di: Ren, Sucheng, et al.
Pubblicazione: (2024)
Medical Vision Generalist: Unifying Medical Imaging Tasks in Context
di: Ren, Sucheng, et al.
Pubblicazione: (2024)
di: Ren, Sucheng, et al.
Pubblicazione: (2024)
ViT-5: Vision Transformers for The Mid-2020s
di: Wang, Feng, et al.
Pubblicazione: (2026)
di: Wang, Feng, et al.
Pubblicazione: (2026)
Localization vs. Semantics: Visual Representations in Unimodal and Multimodal Models
di: Li, Zhuowan, et al.
Pubblicazione: (2022)
di: Li, Zhuowan, et al.
Pubblicazione: (2022)
Revisiting Adversarial Training at Scale
di: Wang, Zeyu, et al.
Pubblicazione: (2024)
di: Wang, Zeyu, et al.
Pubblicazione: (2024)
ViMix-14M: A Curated Multi-Source Video-Text Dataset with Long-Form, High-Quality Captions and Crawl-Free Access
di: Yang, Timing, et al.
Pubblicazione: (2025)
di: Yang, Timing, et al.
Pubblicazione: (2025)
SPFormer: Enhancing Vision Transformer with Superpixel Representation
di: Mei, Jieru, et al.
Pubblicazione: (2024)
di: Mei, Jieru, et al.
Pubblicazione: (2024)
Mamba-R: Vision Mamba ALSO Needs Registers
di: Wang, Feng, et al.
Pubblicazione: (2024)
di: Wang, Feng, et al.
Pubblicazione: (2024)
PaLM2-VAdapter: Progressively Aligned Language Model Makes a Strong Vision-language Adapter
di: Xiao, Junfei, et al.
Pubblicazione: (2024)
di: Xiao, Junfei, et al.
Pubblicazione: (2024)
From Pixels to Objects: A Hierarchical Approach for Part and Object Segmentation Using Local and Global Aggregation
di: Xie, Yunfei, et al.
Pubblicazione: (2024)
di: Xie, Yunfei, et al.
Pubblicazione: (2024)
Captain Safari: A World Engine with Pose-Aligned 3D Memory
di: Chou, Yu-Cheng, et al.
Pubblicazione: (2025)
di: Chou, Yu-Cheng, et al.
Pubblicazione: (2025)
Adventurer: Optimizing Vision Mamba Architecture Designs for Efficiency
di: Wang, Feng, et al.
Pubblicazione: (2024)
di: Wang, Feng, et al.
Pubblicazione: (2024)
Beyond Next-Token: Next-X Prediction for Autoregressive Visual Generation
di: Ren, Sucheng, et al.
Pubblicazione: (2025)
di: Ren, Sucheng, et al.
Pubblicazione: (2025)
Large Language Models are Universal Reasoners for Visual Generation
di: Ren, Sucheng, et al.
Pubblicazione: (2026)
di: Ren, Sucheng, et al.
Pubblicazione: (2026)
Grouping First, Attending Smartly: Training-Free Acceleration for Diffusion Transformers
di: Ren, Sucheng, et al.
Pubblicazione: (2025)
di: Ren, Sucheng, et al.
Pubblicazione: (2025)
What If We Recaption Billions of Web Images with LLaMA-3?
di: Li, Xianhang, et al.
Pubblicazione: (2024)
di: Li, Xianhang, et al.
Pubblicazione: (2024)
Autoregressive Pretraining with Mamba in Vision
di: Ren, Sucheng, et al.
Pubblicazione: (2024)
di: Ren, Sucheng, et al.
Pubblicazione: (2024)
Filter & Align: Leveraging Human Knowledge to Curate Image-Text Data
di: Zhang, Lei, et al.
Pubblicazione: (2023)
di: Zhang, Lei, et al.
Pubblicazione: (2023)
Frequency-Aware Flow Matching for High-Quality Image Generation
di: Ren, Sucheng, et al.
Pubblicazione: (2026)
di: Ren, Sucheng, et al.
Pubblicazione: (2026)
FlowAR: Scale-wise Autoregressive Image Generation Meets Flow Matching
di: Ren, Sucheng, et al.
Pubblicazione: (2024)
di: Ren, Sucheng, et al.
Pubblicazione: (2024)
Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness
di: Wang, Zeyu, et al.
Pubblicazione: (2025)
di: Wang, Zeyu, et al.
Pubblicazione: (2025)
Autoregressive Video Generation beyond Next Frames Prediction
di: Ren, Sucheng, et al.
Pubblicazione: (2025)
di: Ren, Sucheng, et al.
Pubblicazione: (2025)
A Semantic Space is Worth 256 Language Descriptions: Make Stronger Segmentation Models with Descriptive Properties
di: Xiao, Junfei, et al.
Pubblicazione: (2023)
di: Xiao, Junfei, et al.
Pubblicazione: (2023)
Play to Generalize: Learning to Reason Through Game Play
di: Xie, Yunfei, et al.
Pubblicazione: (2025)
di: Xie, Yunfei, et al.
Pubblicazione: (2025)
OpenVision: A Fully-Open, Cost-Effective Family of Advanced Vision Encoders for Multimodal Learning
di: Li, Xianhang, et al.
Pubblicazione: (2025)
di: Li, Xianhang, et al.
Pubblicazione: (2025)
RNN as Linear Transformer: A Closer Investigation into Representational Potentials of Visual Mamba Models
di: Yang, Timing, et al.
Pubblicazione: (2025)
di: Yang, Timing, et al.
Pubblicazione: (2025)
Scaling Laws in Patchification: An Image Is Worth 50,176 Tokens And More
di: Wang, Feng, et al.
Pubblicazione: (2025)
di: Wang, Feng, et al.
Pubblicazione: (2025)
Sculpting Holistic 3D Representation in Contrastive Language-Image-3D Pre-training
di: Gao, Yipeng, et al.
Pubblicazione: (2023)
di: Gao, Yipeng, et al.
Pubblicazione: (2023)
HResFormer: Hybrid Residual Transformer for Volumetric Medical Image Segmentation
di: Ren, Sucheng, et al.
Pubblicazione: (2024)
di: Ren, Sucheng, et al.
Pubblicazione: (2024)
On the Adversarial Robustness of Camera-based 3D Object Detection
di: Xie, Shaoyuan, et al.
Pubblicazione: (2023)
di: Xie, Shaoyuan, et al.
Pubblicazione: (2023)
Vision-Language-Vision Auto-Encoder: Scalable Knowledge Distillation from Diffusion Models
di: Zhang, Tiezheng, et al.
Pubblicazione: (2025)
di: Zhang, Tiezheng, et al.
Pubblicazione: (2025)
Unifying Global-Local Representations in Salient Object Detection with Transformer
di: Ren, Sucheng, et al.
Pubblicazione: (2021)
di: Ren, Sucheng, et al.
Pubblicazione: (2021)
OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning
di: Liu, Yanqing, et al.
Pubblicazione: (2025)
di: Liu, Yanqing, et al.
Pubblicazione: (2025)
GPT-IMAGE-EDIT-1.5M: A Million-Scale, GPT-Generated Image Dataset
di: Wang, Yuhan, et al.
Pubblicazione: (2025)
di: Wang, Yuhan, et al.
Pubblicazione: (2025)
ExoViP: Step-by-step Verification and Exploration with Exoskeleton Modules for Compositional Visual Reasoning
di: Wang, Yuxuan, et al.
Pubblicazione: (2024)
di: Wang, Yuxuan, et al.
Pubblicazione: (2024)
CLIPS: An Enhanced CLIP Framework for Learning with Synthetic Captions
di: Liu, Yanqing, et al.
Pubblicazione: (2024)
di: Liu, Yanqing, et al.
Pubblicazione: (2024)
VideoAuteur: Towards Long Narrative Video Generation
di: Xiao, Junfei, et al.
Pubblicazione: (2025)
di: Xiao, Junfei, et al.
Pubblicazione: (2025)
Computer Vision and Its Relationship to Cognitive Science: A perspective from Bayes Decision Theory
di: Yuille, Alan, et al.
Pubblicazione: (2026)
di: Yuille, Alan, et al.
Pubblicazione: (2026)
Documenti analoghi
-
ARVideo: Autoregressive Pretraining for Self-Supervised Video Representation Learning
di: Ren, Sucheng, et al.
Pubblicazione: (2024) -
Spiral RoPE: Rotate Your Rotary Positional Embeddings in the 2D Plane
di: Liu, Haoyu, et al.
Pubblicazione: (2026) -
M-VAR: Decoupled Scale-wise Autoregressive Modeling for High-Quality Image Generation
di: Ren, Sucheng, et al.
Pubblicazione: (2024) -
Medical Vision Generalist: Unifying Medical Imaging Tasks in Context
di: Ren, Sucheng, et al.
Pubblicazione: (2024) -
ViT-5: Vision Transformers for The Mid-2020s
di: Wang, Feng, et al.
Pubblicazione: (2026)