X2I: Seamless Integration of Multimodal Understanding into Diffusion Transformer via Attention Distillation
Fuente:
arXiv
Guardado en:
| Autores principales: | Ma, Jian, Peng, Qirong, Guo, Xu, Chen, Chen, Lu, Haonan, Yang, Zhenyu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Pluggable Pruning with Contiguous Layer Distillation for Diffusion Transformers
por: Ma, Jian, et al.
Publicado: (2025)
por: Ma, Jian, et al.
Publicado: (2025)
X2Edit: Revisiting Arbitrary-Instruction Image Editing through Self-Constructed Data and Task-Aware Representation Learning
por: Ma, Jian, et al.
Publicado: (2025)
por: Ma, Jian, et al.
Publicado: (2025)
PEA-Diffusion: Parameter-Efficient Adapter with Knowledge Distillation in non-English Text-to-Image Generation
por: Ma, Jian, et al.
Publicado: (2023)
por: Ma, Jian, et al.
Publicado: (2023)
GlyphDraw2: Automatic Generation of Complex Glyph Posters with Diffusion Models and Large Language Models
por: Ma, Jian, et al.
Publicado: (2024)
por: Ma, Jian, et al.
Publicado: (2024)
Subject-Diffusion:Open Domain Personalized Text-to-Image Generation without Test-time Fine-tuning
por: Ma, Jian, et al.
Publicado: (2023)
por: Ma, Jian, et al.
Publicado: (2023)
HermesFlow: Seamlessly Closing the Gap in Multimodal Understanding and Generation
por: Yang, Ling, et al.
Publicado: (2025)
por: Yang, Ling, et al.
Publicado: (2025)
Cross-Resolution Distribution Matching for Diffusion Distillation
por: Chen, Feiyang, et al.
Publicado: (2026)
por: Chen, Feiyang, et al.
Publicado: (2026)
Efficient Dataset Distillation via Minimax Diffusion
por: Gu, Jianyang, et al.
Publicado: (2023)
por: Gu, Jianyang, et al.
Publicado: (2023)
LAPTOP-Diff: Layer Pruning and Normalized Distillation for Compressing Diffusion Models
por: Zhang, Dingkun, et al.
Publicado: (2024)
por: Zhang, Dingkun, et al.
Publicado: (2024)
Simple and Fast Distillation of Diffusion Models
por: Zhou, Zhenyu, et al.
Publicado: (2024)
por: Zhou, Zhenyu, et al.
Publicado: (2024)
Understanding Generalization in Diffusion Distillation via Probability Flow Distance
por: Zhang, Huijie, et al.
Publicado: (2025)
por: Zhang, Huijie, et al.
Publicado: (2025)
FIAS: Feature Imbalance-Aware Medical Image Segmentation with Dynamic Fusion and Mixing Attention
por: Liu, Xiwei, et al.
Publicado: (2024)
por: Liu, Xiwei, et al.
Publicado: (2024)
SCott: Accelerating Diffusion Models with Stochastic Consistency Distillation
por: Liu, Hongjian, et al.
Publicado: (2024)
por: Liu, Hongjian, et al.
Publicado: (2024)
Veda: Scalable Video Diffusion via Distilled Sparse Attention
por: Han, Shihao, et al.
Publicado: (2026)
por: Han, Shihao, et al.
Publicado: (2026)
Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM
por: Liu, Peng, et al.
Publicado: (2025)
por: Liu, Peng, et al.
Publicado: (2025)
Spiking Transformer:Introducing Accurate Addition-Only Spiking Self-Attention for Transformer
por: Guo, Yufei, et al.
Publicado: (2025)
por: Guo, Yufei, et al.
Publicado: (2025)
Breaking the Encoder Barrier for Seamless Video-Language Understanding
por: Li, Handong, et al.
Publicado: (2025)
por: Li, Handong, et al.
Publicado: (2025)
Multimodal Dataset Distillation via Phased Teacher Models
por: Guo, Shengbin, et al.
Publicado: (2026)
por: Guo, Shengbin, et al.
Publicado: (2026)
CONCORD: Concept-Informed Diffusion for Dataset Distillation
por: Gu, Jianyang, et al.
Publicado: (2025)
por: Gu, Jianyang, et al.
Publicado: (2025)
Muon-Accelerated Attention Distillation for Real-Time Edge Synthesis via Optimized Latent Diffusion
por: Chen, Weiye, et al.
Publicado: (2025)
por: Chen, Weiye, et al.
Publicado: (2025)
Distillation Dynamics: Towards Understanding Feature-Based Distillation in Vision Transformers
por: Tian, Huiyuan, et al.
Publicado: (2025)
por: Tian, Huiyuan, et al.
Publicado: (2025)
Efficient Diffusion Distillation via Embedding Loss
por: Ying, Jincheng, et al.
Publicado: (2026)
por: Ying, Jincheng, et al.
Publicado: (2026)
NaTex: Seamless Texture Generation as Latent Color Diffusion
por: Lai, Zeqiang, et al.
Publicado: (2025)
por: Lai, Zeqiang, et al.
Publicado: (2025)
AddSR: Accelerating Diffusion-based Blind Super-Resolution with Adversarial Diffusion Distillation
por: Xie, Rui, et al.
Publicado: (2024)
por: Xie, Rui, et al.
Publicado: (2024)
X-OmniClaw Technical Report: A Unified Mobile Agent for Multimodal Understanding and Interaction
por: Ren, Xiaoming, et al.
Publicado: (2026)
por: Ren, Xiaoming, et al.
Publicado: (2026)
LAMIC: Layout-Aware Multi-Image Composition via Scalability of Multimodal Diffusion Transformer
por: Chen, Yuzhuo, et al.
Publicado: (2025)
por: Chen, Yuzhuo, et al.
Publicado: (2025)
Attention Distillation: A Unified Approach to Visual Characteristics Transfer
por: Zhou, Yang, et al.
Publicado: (2025)
por: Zhou, Yang, et al.
Publicado: (2025)
AMFD: Distillation via Adaptive Multimodal Fusion for Multispectral Pedestrian Detection
por: Chen, Zizhao, et al.
Publicado: (2024)
por: Chen, Zizhao, et al.
Publicado: (2024)
Fine-Grained Prototypes Distillation for Few-Shot Object Detection
por: Wang, Zichen, et al.
Publicado: (2024)
por: Wang, Zichen, et al.
Publicado: (2024)
Exploring Local Memorization in Diffusion Models via Bright Ending Attention
por: Chen, Chen, et al.
Publicado: (2024)
por: Chen, Chen, et al.
Publicado: (2024)
MammothModa2: A Unified AR-Diffusion Framework for Multimodal Understanding and Generation
por: Shen, Tao, et al.
Publicado: (2025)
por: Shen, Tao, et al.
Publicado: (2025)
Channel Attention-Guided Cross-Modal Knowledge Distillation for Referring Image Segmentation
por: Yang, Chen
Publicado: (2026)
por: Yang, Chen
Publicado: (2026)
PaceVGGT: Pre-Alternating-Attention Token Pruning for Visual Geometry Transformers
por: Li, Haotang, et al.
Publicado: (2026)
por: Li, Haotang, et al.
Publicado: (2026)
Noise-Informed Diffusion-Generated Image Detection with Anomaly Attention
por: Guan, Weinan, et al.
Publicado: (2025)
por: Guan, Weinan, et al.
Publicado: (2025)
Vivid-VR: Distilling Concepts from Text-to-Video Diffusion Transformer for Photorealistic Video Restoration
por: Bai, Haoran, et al.
Publicado: (2025)
por: Bai, Haoran, et al.
Publicado: (2025)
Understanding Attention Mechanism in Video Diffusion Models
por: Liu, Bingyan, et al.
Publicado: (2025)
por: Liu, Bingyan, et al.
Publicado: (2025)
Autoregressive Distillation of Diffusion Transformers
por: Kim, Yeongmin, et al.
Publicado: (2025)
por: Kim, Yeongmin, et al.
Publicado: (2025)
UniVidX: A Unified Multimodal Framework for Versatile Video Generation via Diffusion Priors
por: Chen, Houyuan, et al.
Publicado: (2026)
por: Chen, Houyuan, et al.
Publicado: (2026)
HANet: A Hierarchical Attention Network for Change Detection With Bitemporal Very-High-Resolution Remote Sensing Images
por: Han, Chengxi, et al.
Publicado: (2024)
por: Han, Chengxi, et al.
Publicado: (2024)
SlimDiffSR: Toward Lightweight and Efficient Remote Sensing Image Super-Resolution via Diffusion Model Distillation
por: Wang, Ce, et al.
Publicado: (2026)
por: Wang, Ce, et al.
Publicado: (2026)
Ejemplares similares
-
Pluggable Pruning with Contiguous Layer Distillation for Diffusion Transformers
por: Ma, Jian, et al.
Publicado: (2025) -
X2Edit: Revisiting Arbitrary-Instruction Image Editing through Self-Constructed Data and Task-Aware Representation Learning
por: Ma, Jian, et al.
Publicado: (2025) -
PEA-Diffusion: Parameter-Efficient Adapter with Knowledge Distillation in non-English Text-to-Image Generation
por: Ma, Jian, et al.
Publicado: (2023) -
GlyphDraw2: Automatic Generation of Complex Glyph Posters with Diffusion Models and Large Language Models
por: Ma, Jian, et al.
Publicado: (2024) -
Subject-Diffusion:Open Domain Personalized Text-to-Image Generation without Test-time Fine-tuning
por: Ma, Jian, et al.
Publicado: (2023)