LinFusion: 1 GPU, 1 Minute, 16K Image
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Songhua, Yu, Weihao, Tan, Zhenxiong, Wang, Xinchao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
OminiControl: Minimal and Universal Control for Diffusion Transformer
di: Tan, Zhenxiong, et al.
Pubblicazione: (2024)
di: Tan, Zhenxiong, et al.
Pubblicazione: (2024)
CLEAR: Conv-Like Linearization Revs Pre-Trained Diffusion Transformers Up
di: Liu, Songhua, et al.
Pubblicazione: (2024)
di: Liu, Songhua, et al.
Pubblicazione: (2024)
Ultra-Resolution Adaptation with Ease
di: Yu, Ruonan, et al.
Pubblicazione: (2025)
di: Yu, Ruonan, et al.
Pubblicazione: (2025)
Image Editing As Programs with Diffusion Models
di: Hu, Yujia, et al.
Pubblicazione: (2025)
di: Hu, Yujia, et al.
Pubblicazione: (2025)
Rethinking Large-scale Dataset Compression: Shifting Focus From Labels to Images
di: Xiao, Lingao, et al.
Pubblicazione: (2025)
di: Xiao, Lingao, et al.
Pubblicazione: (2025)
One-shot Federated Learning via Synthetic Distiller-Distillate Communication
di: Zhang, Junyuan, et al.
Pubblicazione: (2024)
di: Zhang, Junyuan, et al.
Pubblicazione: (2024)
Understanding Dataset Distillation via Spectral Filtering
di: Bo, Deyu, et al.
Pubblicazione: (2025)
di: Bo, Deyu, et al.
Pubblicazione: (2025)
MindBridge: A Cross-Subject Brain Decoding Framework
di: Wang, Shizun, et al.
Pubblicazione: (2024)
di: Wang, Shizun, et al.
Pubblicazione: (2024)
Distilled Datamodel with Reverse Gradient Matching
di: Ye, Jingwen, et al.
Pubblicazione: (2024)
di: Ye, Jingwen, et al.
Pubblicazione: (2024)
ViFeEdit: A Video-Free Tuner of Your Video Diffusion Transformer
di: Yu, Ruonan, et al.
Pubblicazione: (2026)
di: Yu, Ruonan, et al.
Pubblicazione: (2026)
Video-Infinity: Distributed Long Video Generation
di: Tan, Zhenxiong, et al.
Pubblicazione: (2024)
di: Tan, Zhenxiong, et al.
Pubblicazione: (2024)
Gated Condition Injection without Multimodal Attention: Towards Controllable Linear-Attention Transformers
di: Liu, Yuhe, et al.
Pubblicazione: (2026)
di: Liu, Yuhe, et al.
Pubblicazione: (2026)
MambaOut: Do We Really Need Mamba for Vision?
di: Yu, Weihao, et al.
Pubblicazione: (2024)
di: Yu, Weihao, et al.
Pubblicazione: (2024)
Minute-Long Videos with Dual Parallelisms
di: Wang, Zeqing, et al.
Pubblicazione: (2025)
di: Wang, Zeqing, et al.
Pubblicazione: (2025)
SpotEdit: Selective Region Editing in Diffusion Transformers
di: Qin, Zhibin, et al.
Pubblicazione: (2025)
di: Qin, Zhibin, et al.
Pubblicazione: (2025)
Vision Bridge Transformer at Scale
di: Tan, Zhenxiong, et al.
Pubblicazione: (2025)
di: Tan, Zhenxiong, et al.
Pubblicazione: (2025)
OminiControl2: Efficient Conditioning for Diffusion Transformers
di: Tan, Zhenxiong, et al.
Pubblicazione: (2025)
di: Tan, Zhenxiong, et al.
Pubblicazione: (2025)
StyDeSty: Min-Max Stylization and Destylization for Single Domain Generalization
di: Liu, Songhua, et al.
Pubblicazione: (2024)
di: Liu, Songhua, et al.
Pubblicazione: (2024)
Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning
di: li, Bonan, et al.
Pubblicazione: (2025)
di: li, Bonan, et al.
Pubblicazione: (2025)
InceptionNeXt: When Inception Meets ConvNeXt
di: Yu, Weihao, et al.
Pubblicazione: (2023)
di: Yu, Weihao, et al.
Pubblicazione: (2023)
CoDA: From Text-to-Image Diffusion Models to Training-Free Dataset Distillation
di: Zhou, Letian, et al.
Pubblicazione: (2025)
di: Zhou, Letian, et al.
Pubblicazione: (2025)
Reducing Bias and Variance: Generative Semantic Guidance and Bi-Layer Ensemble for Image Clustering
di: Li, Feijiang, et al.
Pubblicazione: (2026)
di: Li, Feijiang, et al.
Pubblicazione: (2026)
Control and Realism: Best of Both Worlds in Layout-to-Image without Training
di: Li, Bonan, et al.
Pubblicazione: (2025)
di: Li, Bonan, et al.
Pubblicazione: (2025)
Introducing Visual Perception Token into Multimodal Large Language Model
di: Yu, Runpeng, et al.
Pubblicazione: (2025)
di: Yu, Runpeng, et al.
Pubblicazione: (2025)
Ungeneralizable Examples
di: Ye, Jingwen, et al.
Pubblicazione: (2024)
di: Ye, Jingwen, et al.
Pubblicazione: (2024)
TinyFusion: Diffusion Transformers Learned Shallow
di: Fang, Gongfan, et al.
Pubblicazione: (2024)
di: Fang, Gongfan, et al.
Pubblicazione: (2024)
FreeSwim: Revisiting Sliding-Window Attention Mechanisms for Training-Free Ultra-High-Resolution Video Generation
di: Wu, Yunfeng, et al.
Pubblicazione: (2025)
di: Wu, Yunfeng, et al.
Pubblicazione: (2025)
LinVT: Empower Your Image-level Large Language Model to Understand Videos
di: Gao, Lishuai, et al.
Pubblicazione: (2024)
di: Gao, Lishuai, et al.
Pubblicazione: (2024)
Teddy: Efficient Large-Scale Dataset Distillation via Taylor-Approximated Matching
di: Yu, Ruonan, et al.
Pubblicazione: (2024)
di: Yu, Ruonan, et al.
Pubblicazione: (2024)
Attention Prompting on Image for Large Vision-Language Models
di: Yu, Runpeng, et al.
Pubblicazione: (2024)
di: Yu, Runpeng, et al.
Pubblicazione: (2024)
Data-Efficient Multimodal Fusion on a Single GPU
di: Vouitsis, Noël, et al.
Pubblicazione: (2023)
di: Vouitsis, Noël, et al.
Pubblicazione: (2023)
LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity
di: Wang, Hongjie, et al.
Pubblicazione: (2024)
di: Wang, Hongjie, et al.
Pubblicazione: (2024)
MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities
di: Yu, Weihao, et al.
Pubblicazione: (2023)
di: Yu, Weihao, et al.
Pubblicazione: (2023)
MetaFormer Baselines for Vision
di: Yu, Weihao, et al.
Pubblicazione: (2022)
di: Yu, Weihao, et al.
Pubblicazione: (2022)
Flash Sculptor: Modular 3D Worlds from Objects
di: Hu, Yujia, et al.
Pubblicazione: (2025)
di: Hu, Yujia, et al.
Pubblicazione: (2025)
Neural Metamorphosis
di: Yang, Xingyi, et al.
Pubblicazione: (2024)
di: Yang, Xingyi, et al.
Pubblicazione: (2024)
ReflexSplit: Single Image Reflection Separation via Layer Fusion-Separation
di: Lee, Chia-Ming, et al.
Pubblicazione: (2026)
di: Lee, Chia-Ming, et al.
Pubblicazione: (2026)
Heavy Labels Out! Dataset Distillation with Label Space Lightening
di: Yu, Ruonan, et al.
Pubblicazione: (2024)
di: Yu, Ruonan, et al.
Pubblicazione: (2024)
Learning-to-Cache: Accelerating Diffusion Transformer via Layer Caching
di: Ma, Xinyin, et al.
Pubblicazione: (2024)
di: Ma, Xinyin, et al.
Pubblicazione: (2024)
CrossFuse: Learning Infrared and Visible Image Fusion by Cross-Sensor Top-K Vision Alignment and Beyond
di: Shi, Yukai, et al.
Pubblicazione: (2025)
di: Shi, Yukai, et al.
Pubblicazione: (2025)
Documenti analoghi
-
OminiControl: Minimal and Universal Control for Diffusion Transformer
di: Tan, Zhenxiong, et al.
Pubblicazione: (2024) -
CLEAR: Conv-Like Linearization Revs Pre-Trained Diffusion Transformers Up
di: Liu, Songhua, et al.
Pubblicazione: (2024) -
Ultra-Resolution Adaptation with Ease
di: Yu, Ruonan, et al.
Pubblicazione: (2025) -
Image Editing As Programs with Diffusion Models
di: Hu, Yujia, et al.
Pubblicazione: (2025) -
Rethinking Large-scale Dataset Compression: Shifting Focus From Labels to Images
di: Xiao, Lingao, et al.
Pubblicazione: (2025)