Chain-of-Models Pre-Training: Rethinking Training Acceleration of Vision Foundation Models
Fuente:
arXiv
Saved in:
| Main Authors: | Fan, Jiawei, Wang, Shigeng, Li, Chao, Liu, Xiaolong, Yao, Anbang |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Morse: Dual-Sampling for Lossless Acceleration of Diffusion Models
by: Li, Chao, et al.
Published: (2025)
by: Li, Chao, et al.
Published: (2025)
ScaleKD: Strong Vision Transformers Could Be Excellent Teachers
by: Fan, Jiawei, et al.
Published: (2024)
by: Fan, Jiawei, et al.
Published: (2024)
KernelWarehouse: Rethinking the Design of Dynamic Convolution
by: Li, Chao, et al.
Published: (2024)
by: Li, Chao, et al.
Published: (2024)
Pre-Trained Vision-Language Models as Partial Annotators
by: Wang, Qian-Wei, et al.
Published: (2024)
by: Wang, Qian-Wei, et al.
Published: (2024)
HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models
by: Liu, Han, et al.
Published: (2026)
by: Liu, Han, et al.
Published: (2026)
Refining Pre-Trained Motion Models
by: Sun, Xinglong, et al.
Published: (2024)
by: Sun, Xinglong, et al.
Published: (2024)
Efficient Training of Large Vision Models via Advanced Automated Progressive Learning
by: Li, Changlin, et al.
Published: (2024)
by: Li, Changlin, et al.
Published: (2024)
SpectralEarth: Training Hyperspectral Foundation Models at Scale
by: Braham, Nassim Ait Ali, et al.
Published: (2024)
by: Braham, Nassim Ait Ali, et al.
Published: (2024)
SF-Mamba: Rethinking State Space Model for Vision
by: Yoshimura, Masakazu, et al.
Published: (2026)
by: Yoshimura, Masakazu, et al.
Published: (2026)
Dataset Distillation for Pre-Trained Self-Supervised Vision Models
by: Cazenavette, George, et al.
Published: (2025)
by: Cazenavette, George, et al.
Published: (2025)
Robust SAM: On the Adversarial Robustness of Vision Foundation Models
by: Long, Jiahuan, et al.
Published: (2025)
by: Long, Jiahuan, et al.
Published: (2025)
Training-Free Unsupervised Prompt for Vision-Language Models
by: Long, Sifan, et al.
Published: (2024)
by: Long, Sifan, et al.
Published: (2024)
GPT-NAS: Evolutionary Neural Architecture Search with the Generative Pre-Trained Model
by: Yu, Caiyang, et al.
Published: (2023)
by: Yu, Caiyang, et al.
Published: (2023)
VLMQ: Token Saliency-Driven Post-Training Quantization for Vision-language Models
by: Xue, Yufei, et al.
Published: (2025)
by: Xue, Yufei, et al.
Published: (2025)
Pre-Trained Video Generative Models as World Simulators
by: He, Haoran, et al.
Published: (2025)
by: He, Haoran, et al.
Published: (2025)
On Equivariance and Fast Sampling in Video Diffusion Models Trained with Warped Noise
by: Liu, Chao, et al.
Published: (2025)
by: Liu, Chao, et al.
Published: (2025)
Parameter-Free Fine-tuning via Redundancy Elimination for Vision Foundation Models
by: Long, Jiahuan, et al.
Published: (2025)
by: Long, Jiahuan, et al.
Published: (2025)
Seaweed-7B: Cost-Effective Training of Video Generation Foundation Model
by: Seawead, Team, et al.
Published: (2025)
by: Seawead, Team, et al.
Published: (2025)
Synthesizing Efficient Data with Diffusion Models for Person Re-Identification Pre-Training
by: Niu, Ke, et al.
Published: (2024)
by: Niu, Ke, et al.
Published: (2024)
Zero-Training Task-Specific Model Synthesis for Few-Shot Medical Image Classification
by: Qin, Yao, et al.
Published: (2025)
by: Qin, Yao, et al.
Published: (2025)
Robotic Environmental State Recognition with Pre-Trained Vision-Language Models and Black-Box Optimization
by: Kawaharazuka, Kento, et al.
Published: (2024)
by: Kawaharazuka, Kento, et al.
Published: (2024)
Multimodal Fusion with Pre-Trained Model Features in Affective Behaviour Analysis In-the-wild
by: Wen, Zhuofan, et al.
Published: (2024)
by: Wen, Zhuofan, et al.
Published: (2024)
SocialNav: Training Human-Inspired Foundation Model for Socially-Aware Embodied Navigation
by: Chen, Ziyi, et al.
Published: (2025)
by: Chen, Ziyi, et al.
Published: (2025)
Trio-ViT: Post-Training Quantization and Acceleration for Softmax-Free Efficient Vision Transformer
by: Shi, Huihong, et al.
Published: (2024)
by: Shi, Huihong, et al.
Published: (2024)
Playing to Vision Foundation Model's Strengths in Stereo Matching
by: Liu, Chuang-Wei, et al.
Published: (2024)
by: Liu, Chuang-Wei, et al.
Published: (2024)
Beyond the Failures: Rethinking Foundation Models in Pathology
by: Tizhoosh, Hamid R.
Published: (2025)
by: Tizhoosh, Hamid R.
Published: (2025)
Rethinking Token Reduction for Large Vision-Language Models
by: Wang, Yi, et al.
Published: (2026)
by: Wang, Yi, et al.
Published: (2026)
Block Cascading: Training Free Acceleration of Block-Causal Video Models
by: Bandyopadhyay, Hmrishav, et al.
Published: (2025)
by: Bandyopadhyay, Hmrishav, et al.
Published: (2025)
FRDiff : Feature Reuse for Universal Training-free Acceleration of Diffusion Models
by: So, Junhyuk, et al.
Published: (2023)
by: So, Junhyuk, et al.
Published: (2023)
Vision Foundry: A System for Training Foundational Vision AI Models
by: Gokmen, Mahmut S., et al.
Published: (2025)
by: Gokmen, Mahmut S., et al.
Published: (2025)
SliderQuant: Accurate Post-Training Quantization for LLMs
by: Wang, Shigeng, et al.
Published: (2026)
by: Wang, Shigeng, et al.
Published: (2026)
Geometric-Guided Few-Shot Dental Landmark Detection with Human-Centric Foundation Model
by: Wang, Anbang, et al.
Published: (2025)
by: Wang, Anbang, et al.
Published: (2025)
Open-Vocabulary Panoptic Segmentation Using BERT Pre-Training of Vision-Language Multiway Transformer Model
by: Chen, Yi-Chia, et al.
Published: (2024)
by: Chen, Yi-Chia, et al.
Published: (2024)
A Multi-Modal Foundation Model to Assist People with Blindness and Low Vision in Environmental Interaction
by: Hao, Yu, et al.
Published: (2023)
by: Hao, Yu, et al.
Published: (2023)
Large-Scale Universal Defect Generation: Foundation Models and Datasets
by: Fan, Yuanting, et al.
Published: (2026)
by: Fan, Yuanting, et al.
Published: (2026)
Pre-Trained CNN Architecture for Transformer-Based Image Caption Generation Model
by: Dufera, Amanuel Tafese
Published: (2025)
by: Dufera, Amanuel Tafese
Published: (2025)
Fine-Grained Post-Training Quantization for Large Vision Language Models with Quantization-Aware Integrated Gradients
by: Xiang, Ziwei, et al.
Published: (2026)
by: Xiang, Ziwei, et al.
Published: (2026)
InstAP: Instance-Aware Vision-Language Pre-Train for Spatial-Temporal Understanding
by: Kumar, Ashutosh, et al.
Published: (2026)
by: Kumar, Ashutosh, et al.
Published: (2026)
SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models
by: Li, Hongxing, et al.
Published: (2025)
by: Li, Hongxing, et al.
Published: (2025)
Training Video Foundation Models with NVIDIA NeMo
by: Patel, Zeeshan, et al.
Published: (2025)
by: Patel, Zeeshan, et al.
Published: (2025)
Similar Items
-
Morse: Dual-Sampling for Lossless Acceleration of Diffusion Models
by: Li, Chao, et al.
Published: (2025) -
ScaleKD: Strong Vision Transformers Could Be Excellent Teachers
by: Fan, Jiawei, et al.
Published: (2024) -
KernelWarehouse: Rethinking the Design of Dynamic Convolution
by: Li, Chao, et al.
Published: (2024) -
Pre-Trained Vision-Language Models as Partial Annotators
by: Wang, Qian-Wei, et al.
Published: (2024) -
HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models
by: Liu, Han, et al.
Published: (2026)