Hierarchical and Step-Layer-Wise Tuning of Attention Specialty for Multi-Instance Synthesis in Diffusion Transformers
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Chunyang, Sun, Zhenhong, Zhang, Zhicheng, Wang, Junyan, Zhang, Yu, Gong, Dong, Mo, Huadong, Dong, Daoyi |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
3DXTalker: Unifying Identity, Lip Sync, Emotion, and Spatial Dynamics in Expressive 3D Talking Avatars
par: Wang, Zhongju, et autres
Publié: (2026)
par: Wang, Zhongju, et autres
Publié: (2026)
T$^3$-S2S: Training-free Triplet Tuning for Sketch to Scene Synthesis in Controllable Concept Art Generation
par: Sun, Zhenhong, et autres
Publié: (2024)
par: Sun, Zhenhong, et autres
Publié: (2024)
StoryBlender: Inter-Shot Consistent and Editable 3D Storyboard with Spatial-temporal Dynamics
par: Li, Bingliang, et autres
Publié: (2026)
par: Li, Bingliang, et autres
Publié: (2026)
Integrated Energy Management for Operational Cost Optimization in Community Microgrids
par: Uddin, Moslem, et autres
Publié: (2025)
par: Uddin, Moslem, et autres
Publié: (2025)
A review on modelling, evaluation, and optimization of cyber-physical system reliability
par: Uddin, Moslem, et autres
Publié: (2025)
par: Uddin, Moslem, et autres
Publié: (2025)
Real-Time Energy Management Strategies for Community Microgrids
par: Uddin, Moslem, et autres
Publié: (2025)
par: Uddin, Moslem, et autres
Publié: (2025)
Cost-Effective Design of Grid-tied Community Microgrid
par: Uddin, Moslem, et autres
Publié: (2025)
par: Uddin, Moslem, et autres
Publié: (2025)
Learning Informative Latent Representation for Quantum State Tomography
par: Ma, Hailan, et autres
Publié: (2023)
par: Ma, Hailan, et autres
Publié: (2023)
Learning-Based Design of LQG Controllers in Quantum Coherent Feedback
par: Song, Chunxiang, et autres
Publié: (2025)
par: Song, Chunxiang, et autres
Publié: (2025)
Vision Transformers with Hierarchical Attention
par: Liu, Yun, et autres
Publié: (2021)
par: Liu, Yun, et autres
Publié: (2021)
Adaptive BESS and Grid Setpoints Optimization: A Model-Free Framework for Efficient Battery Management under Dynamic Tariff Pricing
par: Selim, Alaa, et autres
Publié: (2024)
par: Selim, Alaa, et autres
Publié: (2024)
Physics‐Informed Neural Networks for Battery Degradation Prediction Under Random Walk Operations
par: Alaa Selim, et autres
Publié: (2026)
par: Alaa Selim, et autres
Publié: (2026)
Fast and Accurate Gigapixel Pathological Image Classification with Hierarchical Distillation Multi-Instance Learning
par: Dong, Jiuyang, et autres
Publié: (2025)
par: Dong, Jiuyang, et autres
Publié: (2025)
InVDriver: Intra-Instance Aware Vectorized Query-Based Autonomous Driving Transformer
par: Zhang, Bo, et autres
Publié: (2025)
par: Zhang, Bo, et autres
Publié: (2025)
Layer-wise Instance Binding for Regional and Occlusion Control in Text-to-Image Diffusion Transformers
par: Chen, Ruidong, et autres
Publié: (2026)
par: Chen, Ruidong, et autres
Publié: (2026)
Beyond the Final Layer: Hierarchical Query Fusion Transformer with Agent-Interpolation Initialization for 3D Instance Segmentation
par: Lu, Jiahao, et autres
Publié: (2025)
par: Lu, Jiahao, et autres
Publié: (2025)
Online Planning of Power Flows for Power Systems Against Bushfires Using Spatial Context
par: Xu, Jianyu, et autres
Publié: (2024)
par: Xu, Jianyu, et autres
Publié: (2024)
AHDMIL: Asymmetric Hierarchical Distillation Multi-Instance Learning for Fast and Accurate Whole-Slide Image Classification
par: Dong, Jiuyang, et autres
Publié: (2025)
par: Dong, Jiuyang, et autres
Publié: (2025)
Attention-Guided Patch-Wise Sparse Adversarial Attacks on Vision-Language-Action Models
par: Zhang, Naifu, et autres
Publié: (2025)
par: Zhang, Naifu, et autres
Publié: (2025)
Few-Step Diffusion Sampling Through Instance-Aware Discretizations
par: Yuan, Liangyu, et autres
Publié: (2026)
par: Yuan, Liangyu, et autres
Publié: (2026)
AttnLRP: Attention-Aware Layer-Wise Relevance Propagation for Transformers
par: Achtibat, Reduan, et autres
Publié: (2024)
par: Achtibat, Reduan, et autres
Publié: (2024)
Bridging the Intention-Expression Gap: Aligning Multi-Dimensional Preferences via Hierarchical Relevance Feedback in Text-to-Image Diffusion
par: Wang, Wenxi, et autres
Publié: (2026)
par: Wang, Wenxi, et autres
Publié: (2026)
Radiology Report Generation with Layer-Wise Anatomical Attention
par: Muñiz-De-León, Emmanuel D., et autres
Publié: (2025)
par: Muñiz-De-León, Emmanuel D., et autres
Publié: (2025)
One-Shot Refiner: Boosting Feed-forward Novel View Synthesis via One-Step Diffusion
par: Dong, Yitong, et autres
Publié: (2026)
par: Dong, Yitong, et autres
Publié: (2026)
DiTCtrl: Exploring Attention Control in Multi-Modal Diffusion Transformer for Tuning-Free Multi-Prompt Longer Video Generation
par: Cai, Minghong, et autres
Publié: (2024)
par: Cai, Minghong, et autres
Publié: (2024)
SALAD: Achieve High-Sparsity Attention via Efficient Linear Attention Tuning for Video Diffusion Transformer
par: Fang, Tongcheng, et autres
Publié: (2026)
par: Fang, Tongcheng, et autres
Publié: (2026)
Optimized CNNs for Rapid 3D Point Cloud Object Recognition
par: Lyu, Tianyi, et autres
Publié: (2024)
par: Lyu, Tianyi, et autres
Publié: (2024)
BinaryAttention: One-Bit QK-Attention for Vision and Diffusion Transformers
par: Xiao, Chaodong, et autres
Publié: (2026)
par: Xiao, Chaodong, et autres
Publié: (2026)
Towards Effective Usage of Human-Centric Priors in Diffusion Models for Text-based Human Image Generation
par: Wang, Junyan, et autres
Publié: (2024)
par: Wang, Junyan, et autres
Publié: (2024)
Learnable Instance Attention Filtering for Adaptive Detector Distillation
par: Liu, Chen, et autres
Publié: (2026)
par: Liu, Chen, et autres
Publié: (2026)
Towards Highly Realistic Artistic Style Transfer via Stable Diffusion with Step-aware and Layer-aware Prompt
par: Zhang, Zhanjie, et autres
Publié: (2024)
par: Zhang, Zhanjie, et autres
Publié: (2024)
DiffDecompose: Layer-Wise Decomposition of Alpha-Composited Images via Diffusion Transformers
par: Wang, Zitong, et autres
Publié: (2025)
par: Wang, Zitong, et autres
Publié: (2025)
DreamVVT: Mastering Realistic Video Virtual Try-On in the Wild via a Stage-Wise Diffusion Transformer Framework
par: Zuo, Tongchun, et autres
Publié: (2025)
par: Zuo, Tongchun, et autres
Publié: (2025)
Efficient Diffusion Transformer with Step-wise Dynamic Attention Mediators
par: Pu, Yifan, et autres
Publié: (2024)
par: Pu, Yifan, et autres
Publié: (2024)
Beyond Point-Wise Matching: Structural Representation Alignment for Accelerating Diffusion Transformers
par: Xu, Shaodong, et autres
Publié: (2026)
par: Xu, Shaodong, et autres
Publié: (2026)
Deep Learning-Based Multi-Modal Fusion for Robust Robot Perception and Navigation
par: Lai, Delun, et autres
Publié: (2025)
par: Lai, Delun, et autres
Publié: (2025)
DiTAS: Quantizing Diffusion Transformers via Enhanced Activation Smoothing
par: Dong, Zhenyuan, et autres
Publié: (2024)
par: Dong, Zhenyuan, et autres
Publié: (2024)
E-MMDiT: Revisiting Multimodal Diffusion Transformer Design for Fast Image Synthesis under Limited Resources
par: Shen, Tong, et autres
Publié: (2025)
par: Shen, Tong, et autres
Publié: (2025)
MAT: Multi-Range Attention Transformer for Efficient Image Super-Resolution
par: Xie, Chengxing, et autres
Publié: (2024)
par: Xie, Chengxing, et autres
Publié: (2024)
Two-Way Garment Transfer: Unified Diffusion Framework for Dressing and Undressing Synthesis
par: Zhang, Angang, et autres
Publié: (2025)
par: Zhang, Angang, et autres
Publié: (2025)
Documents similaires
-
3DXTalker: Unifying Identity, Lip Sync, Emotion, and Spatial Dynamics in Expressive 3D Talking Avatars
par: Wang, Zhongju, et autres
Publié: (2026) -
T$^3$-S2S: Training-free Triplet Tuning for Sketch to Scene Synthesis in Controllable Concept Art Generation
par: Sun, Zhenhong, et autres
Publié: (2024) -
StoryBlender: Inter-Shot Consistent and Editable 3D Storyboard with Spatial-temporal Dynamics
par: Li, Bingliang, et autres
Publié: (2026) -
Integrated Energy Management for Operational Cost Optimization in Community Microgrids
par: Uddin, Moslem, et autres
Publié: (2025) -
A review on modelling, evaluation, and optimization of cyber-physical system reliability
par: Uddin, Moslem, et autres
Publié: (2025)