Unleashing Diffusion Transformers for Visual Correspondence by Modulating Massive Activations
Fuente:
arXiv
Saved in:
| Main Authors: | Gan, Chaofan, Tu, Yuanpeng, Chen, Xi, Chen, Tieyuan, Li, Yuxi, Harandi, Mehrtash, Lin, Weiyao |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Massive Activations are the Key to Local Detail Synthesis in Diffusion Transformers
by: Gan, Chaofan, et al.
Published: (2025)
by: Gan, Chaofan, et al.
Published: (2025)
DAC: 2D-3D Retrieval with Noisy Labels via Divide-and-Conquer Alignment and Correction
by: Gan, Chaofan, et al.
Published: (2024)
by: Gan, Chaofan, et al.
Published: (2024)
HAC++: Towards 100X Compression of 3D Gaussian Splatting
by: Chen, Yihang, et al.
Published: (2025)
by: Chen, Yihang, et al.
Published: (2025)
HAC: Hash-grid Assisted Context for 3D Gaussian Splatting Compression
by: Chen, Yihang, et al.
Published: (2024)
by: Chen, Yihang, et al.
Published: (2024)
Fast Feedforward 3D Gaussian Splatting Compression
by: Chen, Yihang, et al.
Published: (2024)
by: Chen, Yihang, et al.
Published: (2024)
PCGS: Progressive Compression of 3D Gaussian Splatting
by: Chen, Yihang, et al.
Published: (2025)
by: Chen, Yihang, et al.
Published: (2025)
MECD+: Unlocking Event-Level Causal Graph Discovery for Video Reasoning
by: Chen, Tieyuan, et al.
Published: (2025)
by: Chen, Tieyuan, et al.
Published: (2025)
Enhancing Video Large Language Models with Structured Multi-Video Collaborative Reasoning
by: He, Zhihao, et al.
Published: (2025)
by: He, Zhihao, et al.
Published: (2025)
MUNBa: Machine Unlearning via Nash Bargaining
by: Wu, Jing, et al.
Published: (2024)
by: Wu, Jing, et al.
Published: (2024)
VidLaDA: Bidirectional Diffusion Large Language Models for Efficient Video Understanding
by: He, Zhihao, et al.
Published: (2026)
by: He, Zhihao, et al.
Published: (2026)
Erasing Undesirable Influence in Diffusion Models
by: Wu, Jing, et al.
Published: (2024)
by: Wu, Jing, et al.
Published: (2024)
Scissorhands: Scrub Data Influence via Connection Sensitivity in Networks
by: Wu, Jing, et al.
Published: (2024)
by: Wu, Jing, et al.
Published: (2024)
From Priors to Perception: Grounding Video-LLMs in Physical Reality
by: Zhao, Zicheng, et al.
Published: (2026)
by: Zhao, Zicheng, et al.
Published: (2026)
Autoregressive Image Generation Needs Only a Few Lines of Cached Tokens
by: Qin, Ziran, et al.
Published: (2025)
by: Qin, Ziran, et al.
Published: (2025)
How Far Can We Compress Instant-NGP-Based NeRF?
by: Chen, Yihang, et al.
Published: (2024)
by: Chen, Yihang, et al.
Published: (2024)
MECD: Unlocking Multi-Event Causal Discovery in Video Reasoning
by: Chen, Tieyuan, et al.
Published: (2024)
by: Chen, Tieyuan, et al.
Published: (2024)
Looking Beyond Visible Cues: Implicit Video Question Answering via Dual-Clue Reasoning
by: Chen, Tieyuan, et al.
Published: (2025)
by: Chen, Tieyuan, et al.
Published: (2025)
Learning from Noisy Labels with Contrastive Co-Transformer
by: Han, Yan, et al.
Published: (2025)
by: Han, Yan, et al.
Published: (2025)
MoKD: Multi-Task Optimization for Knowledge Distillation
by: Hayder, Zeeshan, et al.
Published: (2025)
by: Hayder, Zeeshan, et al.
Published: (2025)
Memory Consistency Guided Divide-and-Conquer Learning for Generalized Category Discovery
by: Tu, Yuanpeng, et al.
Published: (2024)
by: Tu, Yuanpeng, et al.
Published: (2024)
MCA: 2D-3D Retrieval with Noisy Labels via Multi-level Adaptive Correction and Alignment
by: Zou, Gui, et al.
Published: (2025)
by: Zou, Gui, et al.
Published: (2025)
Steering Video Diffusion Transformers with Massive Activations
by: Cheng, Xianhang, et al.
Published: (2026)
by: Cheng, Xianhang, et al.
Published: (2026)
DoubleDiffusion: Combining Heat Diffusion with Denoising Diffusion for Texture Generation on 3D Meshes
by: Wang, Xuyang, et al.
Published: (2025)
by: Wang, Xuyang, et al.
Published: (2025)
COVE: Unleashing the Diffusion Feature Correspondence for Consistent Video Editing
by: Wang, Jiangshan, et al.
Published: (2024)
by: Wang, Jiangshan, et al.
Published: (2024)
Domain Camera Adaptation and Collaborative Multiple Feature Clustering for Unsupervised Person Re-ID
by: Tu, Yuanpeng
Published: (2022)
by: Tu, Yuanpeng
Published: (2022)
CSTA: Spatial-Temporal Causal Adaptive Learning for Exemplar-Free Video Class-Incremental Learning
by: Chen, Tieyuan, et al.
Published: (2025)
by: Chen, Tieyuan, et al.
Published: (2025)
DreamMask: Boosting Open-vocabulary Panoptic Segmentation with Synthetic Data
by: Tu, Yuanpeng, et al.
Published: (2025)
by: Tu, Yuanpeng, et al.
Published: (2025)
CL-MRI: Self-Supervised Contrastive Learning to Improve the Accuracy of Undersampled MRI Reconstruction
by: Ekanayake, Mevan, et al.
Published: (2023)
by: Ekanayake, Mevan, et al.
Published: (2023)
SeCo-INR: Semantically Conditioned Implicit Neural Representations for Improved Medical Image Super-Resolution
by: Ekanayake, Mevan, et al.
Published: (2024)
by: Ekanayake, Mevan, et al.
Published: (2024)
SEGIC: Unleashing the Emergent Correspondence for In-Context Segmentation
by: Meng, Lingchen, et al.
Published: (2023)
by: Meng, Lingchen, et al.
Published: (2023)
Curvature Learning for Generalization of Hyperbolic Neural Networks
by: Fan, Xiaomeng, et al.
Published: (2025)
by: Fan, Xiaomeng, et al.
Published: (2025)
Flashbacks to Harmonize Stability and Plasticity in Continual Learning
by: Mahmoodi, Leila, et al.
Published: (2025)
by: Mahmoodi, Leila, et al.
Published: (2025)
PointCaM: Cut-and-Mix for Open-Set Point Cloud Learning
by: Hong, Jie, et al.
Published: (2022)
by: Hong, Jie, et al.
Published: (2022)
Large-Scale Data-Free Knowledge Distillation for ImageNet via Multi-Resolution Data Generation
by: Tran, Minh-Tuan, et al.
Published: (2024)
by: Tran, Minh-Tuan, et al.
Published: (2024)
Unifying Feature and Cost Aggregation with Transformers for Semantic and Visual Correspondence
by: Hong, Sunghwan, et al.
Published: (2024)
by: Hong, Sunghwan, et al.
Published: (2024)
SD-DiT: Unleashing the Power of Self-supervised Discrimination in Diffusion Transformer
by: Zhu, Rui, et al.
Published: (2024)
by: Zhu, Rui, et al.
Published: (2024)
Incorporating Visual Correspondence into Diffusion Model for Virtual Try-On
by: Wan, Siqi, et al.
Published: (2025)
by: Wan, Siqi, et al.
Published: (2025)
PlayerOne: Egocentric World Simulator
by: Tu, Yuanpeng, et al.
Published: (2025)
by: Tu, Yuanpeng, et al.
Published: (2025)
VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control
by: Tu, Yuanpeng, et al.
Published: (2025)
by: Tu, Yuanpeng, et al.
Published: (2025)
LayerFlow: A Unified Model for Layer-aware Video Generation
by: Ji, Sihui, et al.
Published: (2025)
by: Ji, Sihui, et al.
Published: (2025)
Similar Items
-
Massive Activations are the Key to Local Detail Synthesis in Diffusion Transformers
by: Gan, Chaofan, et al.
Published: (2025) -
DAC: 2D-3D Retrieval with Noisy Labels via Divide-and-Conquer Alignment and Correction
by: Gan, Chaofan, et al.
Published: (2024) -
HAC++: Towards 100X Compression of 3D Gaussian Splatting
by: Chen, Yihang, et al.
Published: (2025) -
HAC: Hash-grid Assisted Context for 3D Gaussian Splatting Compression
by: Chen, Yihang, et al.
Published: (2024) -
Fast Feedforward 3D Gaussian Splatting Compression
by: Chen, Yihang, et al.
Published: (2024)