FiTv2: Scalable and Improved Flexible Vision Transformer for Diffusion Model
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, ZiDong, Lu, Zeyu, Huang, Di, Zhou, Cai, Ouyang, Wanli, Bai, and Lei |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
FiT: Flexible Vision Transformer for Diffusion Model
by: Lu, Zeyu, et al.
Published: (2024)
by: Lu, Zeyu, et al.
Published: (2024)
PredBench: Benchmarking Spatio-Temporal Prediction across Diverse Disciplines
by: Wang, ZiDong, et al.
Published: (2024)
by: Wang, ZiDong, et al.
Published: (2024)
SynCast: Synergizing Contradictions in Precipitation Nowcasting via Diffusion Sequential Preference Optimization
by: Xu, Kaiyi, et al.
Published: (2025)
by: Xu, Kaiyi, et al.
Published: (2025)
ComfyBench: Benchmarking LLM-based Agents in ComfyUI for Autonomously Designing Collaborative AI Systems
by: Xue, Xiangyuan, et al.
Published: (2024)
by: Xue, Xiangyuan, et al.
Published: (2024)
Diffusion Models Need Visual Priors for Image Generation
by: Yue, Xiaoyu, et al.
Published: (2024)
by: Yue, Xiaoyu, et al.
Published: (2024)
ChemMLLM: Chemical Multimodal Large Language Model
by: Tan, Qian, et al.
Published: (2025)
by: Tan, Qian, et al.
Published: (2025)
Spark Policy Toolkit: Semantic Contracts and Scalable Execution for Policy Learning in Spark
by: Bai, Zeyu
Published: (2026)
by: Bai, Zeyu
Published: (2026)
MicroViTv2: Beyond the FLOPS for Edge Energy-Friendly Vision Transformers
by: Setyawan, Novendra, et al.
Published: (2026)
by: Setyawan, Novendra, et al.
Published: (2026)
Seeing Delta Parameters as JPEG Images: Data-Free Delta Compression with Discrete Cosine Transform
by: Huang, Chenyu, et al.
Published: (2025)
by: Huang, Chenyu, et al.
Published: (2025)
Native-Resolution Image Synthesis
by: Wang, Zidong, et al.
Published: (2025)
by: Wang, Zidong, et al.
Published: (2025)
SeisMoLLM: Advancing Seismic Monitoring via Cross-modal Transfer with Pre-trained Large Language Model
by: Wang, Xinghao, et al.
Published: (2025)
by: Wang, Xinghao, et al.
Published: (2025)
FengWu-4DVar: Coupling the Data-driven Weather Forecasting Model with 4D Variational Assimilation
by: Xiao, Yi, et al.
Published: (2023)
by: Xiao, Yi, et al.
Published: (2023)
Self-supervised Vision Transformer are Scalable Generative Models for Domain Generalization
by: Doerrich, Sebastian, et al.
Published: (2024)
by: Doerrich, Sebastian, et al.
Published: (2024)
Generalizing Weather Forecast to Fine-grained Temporal Scales via Physics-AI Hybrid Modeling
by: Xu, Wanghan, et al.
Published: (2024)
by: Xu, Wanghan, et al.
Published: (2024)
Satellite Observations Guided Diffusion Model for Accurate Meteorological States at Arbitrary Resolution
by: Tu, Siwei, et al.
Published: (2025)
by: Tu, Siwei, et al.
Published: (2025)
Transition Models: Rethinking the Generative Learning Objective
by: Wang, Zidong, et al.
Published: (2025)
by: Wang, Zidong, et al.
Published: (2025)
ExtremeCast: Boosting Extreme Value Prediction for Global Weather Forecast
by: Xu, Wanghan, et al.
Published: (2024)
by: Xu, Wanghan, et al.
Published: (2024)
Dynamic Base model Shift for Delta Compression
by: Huang, Chenyu, et al.
Published: (2025)
by: Huang, Chenyu, et al.
Published: (2025)
A Scalable Multi-LLM Collaboration System with Retrieval-based Selection and Exploration-Exploitation-Driven Enhancement
by: Tang, Shengji, et al.
Published: (2025)
by: Tang, Shengji, et al.
Published: (2025)
Stratified Knowledge-Density Super-Network for Scalable Vision Transformers
by: Li, Longhua, et al.
Published: (2025)
by: Li, Longhua, et al.
Published: (2025)
Model Decides How to Tokenize: Adaptive DNA Sequence Tokenization with MxDNA
by: Qiao, Lifeng, et al.
Published: (2024)
by: Qiao, Lifeng, et al.
Published: (2024)
CasCast: Skillful High-resolution Precipitation Nowcasting via Cascaded Modelling
by: Gong, Junchao, et al.
Published: (2024)
by: Gong, Junchao, et al.
Published: (2024)
Learning Diffusion Models with Flexible Representation Guidance
by: Wang, Chenyu, et al.
Published: (2025)
by: Wang, Chenyu, et al.
Published: (2025)
Improving Interpretation Faithfulness for Vision Transformers
by: Hu, Lijie, et al.
Published: (2023)
by: Hu, Lijie, et al.
Published: (2023)
ModeTv2: GPU-accelerated Motion Decomposition Transformer for Pairwise Optimization in Medical Image Registration
by: Wang, Haiqiao, et al.
Published: (2024)
by: Wang, Haiqiao, et al.
Published: (2024)
Slicing Vision Transformer for Flexible Inference
by: Zhang, Yitian, et al.
Published: (2024)
by: Zhang, Yitian, et al.
Published: (2024)
FengWu-W2S: A deep learning model for seamless weather-to-subseasonal forecast of global atmosphere
by: Ling, Fenghua, et al.
Published: (2024)
by: Ling, Fenghua, et al.
Published: (2024)
AnchorGT: Efficient and Flexible Attention Architecture for Scalable Graph Transformers
by: Zhu, Wenhao, et al.
Published: (2024)
by: Zhu, Wenhao, et al.
Published: (2024)
Exploring Representation-Aligned Latent Space for Better Generation
by: Xu, Wanghan, et al.
Published: (2025)
by: Xu, Wanghan, et al.
Published: (2025)
Robust Load Prediction of Power Network Clusters Based on Cloud-Model-Improved Transformer
by: Jiang, Cheng, et al.
Published: (2024)
by: Jiang, Cheng, et al.
Published: (2024)
Emulated Disalignment: Safety Alignment for Large Language Models May Backfire!
by: Zhou, Zhanhui, et al.
Published: (2024)
by: Zhou, Zhanhui, et al.
Published: (2024)
Using Interleaved Ensemble Unlearning to Keep Backdoors at Bay for Finetuning Vision Transformers
by: Li, Zeyu Michael
Published: (2024)
by: Li, Zeyu Michael
Published: (2024)
Iterative Length-Regularized Direct Preference Optimization: A Case Study on Improving 7B Language Models to GPT-4 Level
by: Liu, Jie, et al.
Published: (2024)
by: Liu, Jie, et al.
Published: (2024)
Breaking the Compression Ceiling: Data-Free Pipeline for Ultra-Efficient Delta Compression
by: Wang, Xiaohui, et al.
Published: (2025)
by: Wang, Xiaohui, et al.
Published: (2025)
AdaBrain-Bench: Benchmarking Brain Foundation Models for Brain-Computer Interface Applications
by: Wu, Jiamin, et al.
Published: (2025)
by: Wu, Jiamin, et al.
Published: (2025)
Manifold Regularization Classification Model Based On Improved Diffusion Map
by: Guo, Hongfu, et al.
Published: (2024)
by: Guo, Hongfu, et al.
Published: (2024)
SOLO: A Single Transformer for Scalable Vision-Language Modeling
by: Chen, Yangyi, et al.
Published: (2024)
by: Chen, Yangyi, et al.
Published: (2024)
VegeDiff: Latent Diffusion Model for Geospatial Vegetation Forecasting
by: Zhao, Sijie, et al.
Published: (2024)
by: Zhao, Sijie, et al.
Published: (2024)
Elastic Attention Cores for Scalable Vision Transformers
by: Song, Alan Z., et al.
Published: (2026)
by: Song, Alan Z., et al.
Published: (2026)
Expert Race: A Flexible Routing Strategy for Scaling Diffusion Transformer with Mixture of Experts
by: Yuan, Yike, et al.
Published: (2025)
by: Yuan, Yike, et al.
Published: (2025)
Similar Items
-
FiT: Flexible Vision Transformer for Diffusion Model
by: Lu, Zeyu, et al.
Published: (2024) -
PredBench: Benchmarking Spatio-Temporal Prediction across Diverse Disciplines
by: Wang, ZiDong, et al.
Published: (2024) -
SynCast: Synergizing Contradictions in Precipitation Nowcasting via Diffusion Sequential Preference Optimization
by: Xu, Kaiyi, et al.
Published: (2025) -
ComfyBench: Benchmarking LLM-based Agents in ComfyUI for Autonomously Designing Collaborative AI Systems
by: Xue, Xiangyuan, et al.
Published: (2024) -
Diffusion Models Need Visual Priors for Image Generation
by: Yue, Xiaoyu, et al.
Published: (2024)