Vision Superalignment: Weak-to-Strong Generalization for Vision Foundation Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Guo, Jianyuan, Chen, Hanting, Wang, Chengcheng, Han, Kai, Xu, Chang, Wang, Yunhe |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Data-efficient Large Vision Models through Sequential Autoregression
por: Guo, Jianyuan, et al.
Publicado: (2024)
por: Guo, Jianyuan, et al.
Publicado: (2024)
Token Compensator: Altering Inference Cost of Vision Transformer without Re-Tuning
por: Jie, Shibo, et al.
Publicado: (2024)
por: Jie, Shibo, et al.
Publicado: (2024)
SAM-DiffSR: Structure-Modulated Diffusion Model for Image Super-Resolution
por: Wang, Chengcheng, et al.
Publicado: (2024)
por: Wang, Chengcheng, et al.
Publicado: (2024)
ParameterNet: Parameters Are All You Need
por: Han, Kai, et al.
Publicado: (2023)
por: Han, Kai, et al.
Publicado: (2023)
GeminiFusion: Efficient Pixel-wise Multimodal Fusion for Vision Transformer
por: Jia, Ding, et al.
Publicado: (2024)
por: Jia, Ding, et al.
Publicado: (2024)
Gold-YOLO: Efficient Object Detector via Gather-and-Distribute Mechanism
por: Wang, Chengcheng, et al.
Publicado: (2023)
por: Wang, Chengcheng, et al.
Publicado: (2023)
PA-Attack: Guiding Gray-Box Attacks on LVLM Vision Encoders with Prototypes and Attention
por: Mei, Hefei, et al.
Publicado: (2026)
por: Mei, Hefei, et al.
Publicado: (2026)
GPT4Image: Large Pre-trained Models Help Vision Models Learn Better on Perception Task
por: Ding, Ning, et al.
Publicado: (2023)
por: Ding, Ning, et al.
Publicado: (2023)
Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts
por: Rang, Miao, et al.
Publicado: (2025)
por: Rang, Miao, et al.
Publicado: (2025)
Revealing the Power of Post-Training for Small Language Models via Knowledge Distillation
por: Rang, Miao, et al.
Publicado: (2025)
por: Rang, Miao, et al.
Publicado: (2025)
DINOReg: Strong Point Cloud Registration with Vision Foundation Model
por: Chen, Congjia, et al.
Publicado: (2025)
por: Chen, Congjia, et al.
Publicado: (2025)
Autoregressive Image Generation with Vision Full-view Prompt
por: Cai, Miaomiao, et al.
Publicado: (2025)
por: Cai, Miaomiao, et al.
Publicado: (2025)
Free Video-LLM: Prompt-guided Visual Perception for Efficient Training-free Video LLMs
por: Han, Kai, et al.
Publicado: (2024)
por: Han, Kai, et al.
Publicado: (2024)
DiC: Rethinking Conv3x3 Designs in Diffusion Models
por: Tian, Yuchuan, et al.
Publicado: (2024)
por: Tian, Yuchuan, et al.
Publicado: (2024)
A Superalignment Framework in Autonomous Driving with Large Language Models
por: Kong, Xiangrui, et al.
Publicado: (2024)
por: Kong, Xiangrui, et al.
Publicado: (2024)
GenHancer: Imperfect Generative Models are Secretly Strong Vision-Centric Enhancers
por: Ma, Shijie, et al.
Publicado: (2025)
por: Ma, Shijie, et al.
Publicado: (2025)
ScaleNet: Scaling up Pretrained Neural Networks with Incremental Parameters
por: Hao, Zhiwei, et al.
Publicado: (2025)
por: Hao, Zhiwei, et al.
Publicado: (2025)
LCGNav: Local Candidate-Aware Geometric Enhancement for General Topological Planning in Vision-Language Navigation
por: Peng, Jiankun, et al.
Publicado: (2026)
por: Peng, Jiankun, et al.
Publicado: (2026)
U-DiTs: Downsample Tokens in U-Shaped Diffusion Transformers
por: Tian, Yuchuan, et al.
Publicado: (2024)
por: Tian, Yuchuan, et al.
Publicado: (2024)
U-REPA: Aligning Diffusion U-Nets to ViTs
por: Tian, Yuchuan, et al.
Publicado: (2025)
por: Tian, Yuchuan, et al.
Publicado: (2025)
ADEM-VL: Adaptive and Embedded Fusion for Efficient Vision-Language Tuning
por: Hao, Zhiwei, et al.
Publicado: (2024)
por: Hao, Zhiwei, et al.
Publicado: (2024)
Vision Foundation Models as Generalist Tokenizers for Image Generation
por: Zheng, Anlin, et al.
Publicado: (2026)
por: Zheng, Anlin, et al.
Publicado: (2026)
GuiDINO: Rethinking Vision Foundation Model in Medical Image Segmentation
por: Liang, Zhuonan, et al.
Publicado: (2026)
por: Liang, Zhuonan, et al.
Publicado: (2026)
M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision
por: Zhou, Kailai, et al.
Publicado: (2025)
por: Zhou, Kailai, et al.
Publicado: (2025)
Dynamic Topology Awareness: Breaking the Granularity Rigidity in Vision-Language Navigation
por: Peng, Jiankun, et al.
Publicado: (2026)
por: Peng, Jiankun, et al.
Publicado: (2026)
Instruct-IPT: All-in-One Image Processing Transformer via Weight Modulation
por: Tian, Yuchuan, et al.
Publicado: (2024)
por: Tian, Yuchuan, et al.
Publicado: (2024)
Set Pivot Learning: Redefining Generalized Segmentation with Vision Foundation Models
por: Li, Xinhui, et al.
Publicado: (2025)
por: Li, Xinhui, et al.
Publicado: (2025)
A Survey on Transformer Compression
por: Tang, Yehui, et al.
Publicado: (2024)
por: Tang, Yehui, et al.
Publicado: (2024)
Weak-Annotation of HAR Datasets using Vision Foundation Models
por: Bock, Marius, et al.
Publicado: (2024)
por: Bock, Marius, et al.
Publicado: (2024)
Enhancing Gaze Reasoning in Vision Foundation Models for Gaze Following
por: Wang, Shijing, et al.
Publicado: (2026)
por: Wang, Shijing, et al.
Publicado: (2026)
Harnessing Vision Foundation Models for High-Performance, Training-Free Open Vocabulary Segmentation
por: Shi, Yuheng, et al.
Publicado: (2024)
por: Shi, Yuheng, et al.
Publicado: (2024)
Generalized Category Discovery under Domain Shifts: From Vision to Vision-Language Models
por: Wang, Hongjun, et al.
Publicado: (2026)
por: Wang, Hongjun, et al.
Publicado: (2026)
Implicit Modeling for Transferability Estimation of Vision Foundation Models
por: Zheng, Yaoyan, et al.
Publicado: (2025)
por: Zheng, Yaoyan, et al.
Publicado: (2025)
Stronger, Fewer, & Superior: Harnessing Vision Foundation Models for Domain Generalized Semantic Segmentation
por: Wei, Zhixiang, et al.
Publicado: (2023)
por: Wei, Zhixiang, et al.
Publicado: (2023)
Memory-Space Visual Prompting for Efficient Vision-Language Fine-Tuning
por: Jie, Shibo, et al.
Publicado: (2024)
por: Jie, Shibo, et al.
Publicado: (2024)
IPT-V2: Efficient Image Processing Transformer using Hierarchical Attentions
por: Tu, Zhijun, et al.
Publicado: (2024)
por: Tu, Zhijun, et al.
Publicado: (2024)
Rein++: Efficient Generalization and Adaptation for Semantic Segmentation with Vision Foundation Models
por: Wei, Zhixiang, et al.
Publicado: (2025)
por: Wei, Zhixiang, et al.
Publicado: (2025)
InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
por: Chen, Zhe, et al.
Publicado: (2023)
por: Chen, Zhe, et al.
Publicado: (2023)
TransAgent: Transfer Vision-Language Foundation Models with Heterogeneous Agent Collaboration
por: Guo, Yiwei, et al.
Publicado: (2024)
por: Guo, Yiwei, et al.
Publicado: (2024)
VEAttack: Downstream-agnostic Vision Encoder Attack against Large Vision Language Models
por: Mei, Hefei, et al.
Publicado: (2025)
por: Mei, Hefei, et al.
Publicado: (2025)
Ejemplares similares
-
Data-efficient Large Vision Models through Sequential Autoregression
por: Guo, Jianyuan, et al.
Publicado: (2024) -
Token Compensator: Altering Inference Cost of Vision Transformer without Re-Tuning
por: Jie, Shibo, et al.
Publicado: (2024) -
SAM-DiffSR: Structure-Modulated Diffusion Model for Image Super-Resolution
por: Wang, Chengcheng, et al.
Publicado: (2024) -
ParameterNet: Parameters Are All You Need
por: Han, Kai, et al.
Publicado: (2023) -
GeminiFusion: Efficient Pixel-wise Multimodal Fusion for Vision Transformer
por: Jia, Ding, et al.
Publicado: (2024)