Steering Video Diffusion Transformers with Massive Activations
Fuente:
arXiv
Salvato in:
| Autori principali: | Cheng, Xianhang, Zheng, Yujian, Xie, Zhenyu, Liao, Tingting, Li, Hao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LUIVITON: Learned Universal Interoperable VIrtual Try-ON
di: Cao, Cong, et al.
Pubblicazione: (2025)
di: Cao, Cong, et al.
Pubblicazione: (2025)
AnyCrowd: Instance-Isolated Identity-Pose Binding for Arbitrary Multi-Character Animation
di: Xie, Zhenyu, et al.
Pubblicazione: (2026)
di: Xie, Zhenyu, et al.
Pubblicazione: (2026)
Unleashing Diffusion Transformers for Visual Correspondence by Modulating Massive Activations
di: Gan, Chaofan, et al.
Pubblicazione: (2025)
di: Gan, Chaofan, et al.
Pubblicazione: (2025)
HairOrbit: Multi-view Aware 3D Hair Modeling from Single Portraits
di: Jin, Leyang, et al.
Pubblicazione: (2026)
di: Jin, Leyang, et al.
Pubblicazione: (2026)
Massive Activations are the Key to Local Detail Synthesis in Diffusion Transformers
di: Gan, Chaofan, et al.
Pubblicazione: (2025)
di: Gan, Chaofan, et al.
Pubblicazione: (2025)
SOAP: Style-Omniscient Animatable Portraits
di: Liao, Tingting, et al.
Pubblicazione: (2025)
di: Liao, Tingting, et al.
Pubblicazione: (2025)
Video Virtual Try-on with Conditional Diffusion Transformer Inpainter
di: Zou, Cheng, et al.
Pubblicazione: (2025)
di: Zou, Cheng, et al.
Pubblicazione: (2025)
Scaling White-Box Transformers for Vision
di: Yang, Jinrui, et al.
Pubblicazione: (2024)
di: Yang, Jinrui, et al.
Pubblicazione: (2024)
Revisiting Adversarial Training at Scale
di: Wang, Zeyu, et al.
Pubblicazione: (2024)
di: Wang, Zeyu, et al.
Pubblicazione: (2024)
SteeringDiffusion: A Bottlenecked Activation Control Interface for Diffusion Models
di: Wu, Fangzheng, et al.
Pubblicazione: (2026)
di: Wu, Fangzheng, et al.
Pubblicazione: (2026)
Character Mixing for Video Generation
di: Liao, Tingting, et al.
Pubblicazione: (2025)
di: Liao, Tingting, et al.
Pubblicazione: (2025)
AsymRnR: Video Diffusion Transformers Acceleration with Asymmetric Reduction and Restoration
di: Sun, Wenhao, et al.
Pubblicazione: (2024)
di: Sun, Wenhao, et al.
Pubblicazione: (2024)
DiffPortrait360: Consistent Portrait Diffusion for 360 View Synthesis
di: Gu, Yuming, et al.
Pubblicazione: (2025)
di: Gu, Yuming, et al.
Pubblicazione: (2025)
Tora: Trajectory-oriented Diffusion Transformer for Video Generation
di: Zhang, Zhenghao, et al.
Pubblicazione: (2024)
di: Zhang, Zhenghao, et al.
Pubblicazione: (2024)
Causal Physics Steering in Video World Models via Concept Activation Vectors
di: Alam, Nahid
Pubblicazione: (2026)
di: Alam, Nahid
Pubblicazione: (2026)
CLIPS: An Enhanced CLIP Framework for Learning with Synthetic Captions
di: Liu, Yanqing, et al.
Pubblicazione: (2024)
di: Liu, Yanqing, et al.
Pubblicazione: (2024)
OpenVision: A Fully-Open, Cost-Effective Family of Advanced Vision Encoders for Multimodal Learning
di: Li, Xianhang, et al.
Pubblicazione: (2025)
di: Li, Xianhang, et al.
Pubblicazione: (2025)
MagicTryOn: Harnessing Diffusion Transformer for Garment-Preserving Video Virtual Try-on
di: Li, Guangyuan, et al.
Pubblicazione: (2025)
di: Li, Guangyuan, et al.
Pubblicazione: (2025)
AEANet: Affinity Enhanced Attentional Networks for Arbitrary Style Transfer
di: Li, Gen, et al.
Pubblicazione: (2024)
di: Li, Gen, et al.
Pubblicazione: (2024)
OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning
di: Liu, Yanqing, et al.
Pubblicazione: (2025)
di: Liu, Yanqing, et al.
Pubblicazione: (2025)
EraserDiT: Fast Video Inpainting with Diffusion Transformer Model
di: Liu, Jie, et al.
Pubblicazione: (2025)
di: Liu, Jie, et al.
Pubblicazione: (2025)
CPA: Camera-pose-awareness Diffusion Transformer for Video Generation
di: Wang, Yuelei, et al.
Pubblicazione: (2024)
di: Wang, Yuelei, et al.
Pubblicazione: (2024)
Few Channels Draw The Whole Picture: Revealing Massive Activations in Diffusion Transformers
di: Turri, Evelyn, et al.
Pubblicazione: (2026)
di: Turri, Evelyn, et al.
Pubblicazione: (2026)
SteerSeg: Attention Steering for Reasoning Video Segmentation
di: Cheraghian, Ali, et al.
Pubblicazione: (2026)
di: Cheraghian, Ali, et al.
Pubblicazione: (2026)
CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer
di: Yang, Zhuoyi, et al.
Pubblicazione: (2024)
di: Yang, Zhuoyi, et al.
Pubblicazione: (2024)
Decoding Vision Transformers: the Diffusion Steering Lens
di: Takatsuki, Ryota, et al.
Pubblicazione: (2025)
di: Takatsuki, Ryota, et al.
Pubblicazione: (2025)
Video Diffusion Transformers are In-Context Learners
di: Fei, Zhengcong, et al.
Pubblicazione: (2024)
di: Fei, Zhengcong, et al.
Pubblicazione: (2024)
Diffusion-APO: Trajectory-Aware Direct Preference Alignment for Video Diffusion Transformers
di: Zhu, Jingyuan, et al.
Pubblicazione: (2026)
di: Zhu, Jingyuan, et al.
Pubblicazione: (2026)
Adaptive Caching for Faster Video Generation with Diffusion Transformers
di: Kahatapitiya, Kumara, et al.
Pubblicazione: (2024)
di: Kahatapitiya, Kumara, et al.
Pubblicazione: (2024)
Video2BEV: Transforming Drone Videos to BEVs for Video-based Geo-localization
di: Ju, Hao, et al.
Pubblicazione: (2024)
di: Ju, Hao, et al.
Pubblicazione: (2024)
Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile
di: Ding, Hangliang, et al.
Pubblicazione: (2025)
di: Ding, Hangliang, et al.
Pubblicazione: (2025)
VISTA: Triplet-Supervised Video Style Transfer with Diffusion Transformers
di: Song, Yiren, et al.
Pubblicazione: (2026)
di: Song, Yiren, et al.
Pubblicazione: (2026)
Tora2: Motion and Appearance Customized Diffusion Transformer for Multi-Entity Video Generation
di: Zhang, Zhenghao, et al.
Pubblicazione: (2025)
di: Zhang, Zhenghao, et al.
Pubblicazione: (2025)
CountSteer: Steering Attention for Object Counting in Diffusion Models
di: Boo, Hyemin, et al.
Pubblicazione: (2025)
di: Boo, Hyemin, et al.
Pubblicazione: (2025)
Causally Steered Diffusion for Automated Video Counterfactual Generation
di: Spyrou, Nikos, et al.
Pubblicazione: (2025)
di: Spyrou, Nikos, et al.
Pubblicazione: (2025)
GenTron: Diffusion Transformers for Image and Video Generation
di: Chen, Shoufa, et al.
Pubblicazione: (2023)
di: Chen, Shoufa, et al.
Pubblicazione: (2023)
Generative Neural Video Compression via Video Diffusion Prior
di: Mao, Qi, et al.
Pubblicazione: (2025)
di: Mao, Qi, et al.
Pubblicazione: (2025)
MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation
di: Shi, Shuwei, et al.
Pubblicazione: (2024)
di: Shi, Shuwei, et al.
Pubblicazione: (2024)
SEDiT: Mask-Free Video Subtitle Erasure via One-step Diffusion Transformer
di: Hui, Zheng, et al.
Pubblicazione: (2026)
di: Hui, Zheng, et al.
Pubblicazione: (2026)
GenCompositor: Generative Video Compositing with Diffusion Transformer
di: Yang, Shuzhou, et al.
Pubblicazione: (2025)
di: Yang, Shuzhou, et al.
Pubblicazione: (2025)
Documenti analoghi
-
LUIVITON: Learned Universal Interoperable VIrtual Try-ON
di: Cao, Cong, et al.
Pubblicazione: (2025) -
AnyCrowd: Instance-Isolated Identity-Pose Binding for Arbitrary Multi-Character Animation
di: Xie, Zhenyu, et al.
Pubblicazione: (2026) -
Unleashing Diffusion Transformers for Visual Correspondence by Modulating Massive Activations
di: Gan, Chaofan, et al.
Pubblicazione: (2025) -
HairOrbit: Multi-view Aware 3D Hair Modeling from Single Portraits
di: Jin, Leyang, et al.
Pubblicazione: (2026) -
Massive Activations are the Key to Local Detail Synthesis in Diffusion Transformers
di: Gan, Chaofan, et al.
Pubblicazione: (2025)