Massive Activations are the Key to Local Detail Synthesis in Diffusion Transformers
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gan, Chaofan, Zhao, Zicheng, Tu, Yuanpeng, Chen, Xi, Qin, Ziran, Chen, Tieyuan, Harandi, Mehrtash, Lin, Weiyao |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Unleashing Diffusion Transformers for Visual Correspondence by Modulating Massive Activations
par: Gan, Chaofan, et autres
Publié: (2025)
par: Gan, Chaofan, et autres
Publié: (2025)
DAC: 2D-3D Retrieval with Noisy Labels via Divide-and-Conquer Alignment and Correction
par: Gan, Chaofan, et autres
Publié: (2024)
par: Gan, Chaofan, et autres
Publié: (2024)
VidLaDA: Bidirectional Diffusion Large Language Models for Efficient Video Understanding
par: He, Zhihao, et autres
Publié: (2026)
par: He, Zhihao, et autres
Publié: (2026)
Autoregressive Image Generation Needs Only a Few Lines of Cached Tokens
par: Qin, Ziran, et autres
Publié: (2025)
par: Qin, Ziran, et autres
Publié: (2025)
From Priors to Perception: Grounding Video-LLMs in Physical Reality
par: Zhao, Zicheng, et autres
Publié: (2026)
par: Zhao, Zicheng, et autres
Publié: (2026)
HAC++: Towards 100X Compression of 3D Gaussian Splatting
par: Chen, Yihang, et autres
Publié: (2025)
par: Chen, Yihang, et autres
Publié: (2025)
HAC: Hash-grid Assisted Context for 3D Gaussian Splatting Compression
par: Chen, Yihang, et autres
Publié: (2024)
par: Chen, Yihang, et autres
Publié: (2024)
Looking Beyond Visible Cues: Implicit Video Question Answering via Dual-Clue Reasoning
par: Chen, Tieyuan, et autres
Publié: (2025)
par: Chen, Tieyuan, et autres
Publié: (2025)
Fast Feedforward 3D Gaussian Splatting Compression
par: Chen, Yihang, et autres
Publié: (2024)
par: Chen, Yihang, et autres
Publié: (2024)
PCGS: Progressive Compression of 3D Gaussian Splatting
par: Chen, Yihang, et autres
Publié: (2025)
par: Chen, Yihang, et autres
Publié: (2025)
MECD+: Unlocking Event-Level Causal Graph Discovery for Video Reasoning
par: Chen, Tieyuan, et autres
Publié: (2025)
par: Chen, Tieyuan, et autres
Publié: (2025)
Enhancing Video Large Language Models with Structured Multi-Video Collaborative Reasoning
par: He, Zhihao, et autres
Publié: (2025)
par: He, Zhihao, et autres
Publié: (2025)
MUNBa: Machine Unlearning via Nash Bargaining
par: Wu, Jing, et autres
Publié: (2024)
par: Wu, Jing, et autres
Publié: (2024)
Scissorhands: Scrub Data Influence via Connection Sensitivity in Networks
par: Wu, Jing, et autres
Publié: (2024)
par: Wu, Jing, et autres
Publié: (2024)
Erasing Undesirable Influence in Diffusion Models
par: Wu, Jing, et autres
Publié: (2024)
par: Wu, Jing, et autres
Publié: (2024)
How Far Can We Compress Instant-NGP-Based NeRF?
par: Chen, Yihang, et autres
Publié: (2024)
par: Chen, Yihang, et autres
Publié: (2024)
MECD: Unlocking Multi-Event Causal Discovery in Video Reasoning
par: Chen, Tieyuan, et autres
Publié: (2024)
par: Chen, Tieyuan, et autres
Publié: (2024)
Learning from Noisy Labels with Contrastive Co-Transformer
par: Han, Yan, et autres
Publié: (2025)
par: Han, Yan, et autres
Publié: (2025)
MoKD: Multi-Task Optimization for Knowledge Distillation
par: Hayder, Zeeshan, et autres
Publié: (2025)
par: Hayder, Zeeshan, et autres
Publié: (2025)
MCA: 2D-3D Retrieval with Noisy Labels via Multi-level Adaptive Correction and Alignment
par: Zou, Gui, et autres
Publié: (2025)
par: Zou, Gui, et autres
Publié: (2025)
CL-MRI: Self-Supervised Contrastive Learning to Improve the Accuracy of Undersampled MRI Reconstruction
par: Ekanayake, Mevan, et autres
Publié: (2023)
par: Ekanayake, Mevan, et autres
Publié: (2023)
SeCo-INR: Semantically Conditioned Implicit Neural Representations for Improved Medical Image Super-Resolution
par: Ekanayake, Mevan, et autres
Publié: (2024)
par: Ekanayake, Mevan, et autres
Publié: (2024)
DreamMask: Boosting Open-vocabulary Panoptic Segmentation with Synthetic Data
par: Tu, Yuanpeng, et autres
Publié: (2025)
par: Tu, Yuanpeng, et autres
Publié: (2025)
Domain Camera Adaptation and Collaborative Multiple Feature Clustering for Unsupervised Person Re-ID
par: Tu, Yuanpeng
Publié: (2022)
par: Tu, Yuanpeng
Publié: (2022)
CSTA: Spatial-Temporal Causal Adaptive Learning for Exemplar-Free Video Class-Incremental Learning
par: Chen, Tieyuan, et autres
Publié: (2025)
par: Chen, Tieyuan, et autres
Publié: (2025)
Steering Video Diffusion Transformers with Massive Activations
par: Cheng, Xianhang, et autres
Publié: (2026)
par: Cheng, Xianhang, et autres
Publié: (2026)
DoubleDiffusion: Combining Heat Diffusion with Denoising Diffusion for Texture Generation on 3D Meshes
par: Wang, Xuyang, et autres
Publié: (2025)
par: Wang, Xuyang, et autres
Publié: (2025)
Head-Aware KV Cache Compression for Efficient Visual Autoregressive Modeling
par: Qin, Ziran, et autres
Publié: (2025)
par: Qin, Ziran, et autres
Publié: (2025)
Curvature Learning for Generalization of Hyperbolic Neural Networks
par: Fan, Xiaomeng, et autres
Publié: (2025)
par: Fan, Xiaomeng, et autres
Publié: (2025)
Flashbacks to Harmonize Stability and Plasticity in Continual Learning
par: Mahmoodi, Leila, et autres
Publié: (2025)
par: Mahmoodi, Leila, et autres
Publié: (2025)
PlayerOne: Egocentric World Simulator
par: Tu, Yuanpeng, et autres
Publié: (2025)
par: Tu, Yuanpeng, et autres
Publié: (2025)
VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control
par: Tu, Yuanpeng, et autres
Publié: (2025)
par: Tu, Yuanpeng, et autres
Publié: (2025)
LayerFlow: A Unified Model for Layer-aware Video Generation
par: Ji, Sihui, et autres
Publié: (2025)
par: Ji, Sihui, et autres
Publié: (2025)
Explicit Eigenvalue Regularization Improves Sharpness-Aware Minimization
par: Luo, Haocheng, et autres
Publié: (2025)
par: Luo, Haocheng, et autres
Publié: (2025)
Large-Scale Data-Free Knowledge Distillation for ImageNet via Multi-Resolution Data Generation
par: Tran, Minh-Tuan, et autres
Publié: (2024)
par: Tran, Minh-Tuan, et autres
Publié: (2024)
PointCaM: Cut-and-Mix for Open-Set Point Cloud Learning
par: Hong, Jie, et autres
Publié: (2022)
par: Hong, Jie, et autres
Publié: (2022)
Mind the Generative Details: Direct Localized Detail Preference Optimization for Video Diffusion Models
par: Huang, Zitong, et autres
Publié: (2026)
par: Huang, Zitong, et autres
Publié: (2026)
NAYER: Noisy Layer Data Generation for Efficient and Effective Data-free Knowledge Distillation
par: Tran, Minh-Tuan, et autres
Publié: (2023)
par: Tran, Minh-Tuan, et autres
Publié: (2023)
IMU: Influence-guided Machine Unlearning
par: Fan, Xindi, et autres
Publié: (2025)
par: Fan, Xindi, et autres
Publié: (2025)
Text-Enhanced Data-free Approach for Federated Class-Incremental Learning
par: Tran, Minh-Tuan, et autres
Publié: (2024)
par: Tran, Minh-Tuan, et autres
Publié: (2024)
Documents similaires
-
Unleashing Diffusion Transformers for Visual Correspondence by Modulating Massive Activations
par: Gan, Chaofan, et autres
Publié: (2025) -
DAC: 2D-3D Retrieval with Noisy Labels via Divide-and-Conquer Alignment and Correction
par: Gan, Chaofan, et autres
Publié: (2024) -
VidLaDA: Bidirectional Diffusion Large Language Models for Efficient Video Understanding
par: He, Zhihao, et autres
Publié: (2026) -
Autoregressive Image Generation Needs Only a Few Lines of Cached Tokens
par: Qin, Ziran, et autres
Publié: (2025) -
From Priors to Perception: Grounding Video-LLMs in Physical Reality
par: Zhao, Zicheng, et autres
Publié: (2026)