SEGA: Spectral-Energy Guided Attention for Resolution Extrapolation in Diffusion Transformers
Fuente:
arXiv
Salvato in:
| Autori principali: | Rajabi, Javad, Shaban, Kimia, Roohi, Koorosh, Lindell, David B., Taati, Babak |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
STARS: Self-supervised Tuning for 3D Action Recognition in Skeleton Sequences
di: Mehraban, Soroush, et al.
Pubblicazione: (2024)
di: Mehraban, Soroush, et al.
Pubblicazione: (2024)
When Does RL Help Medical VLMs? Disentangling Vision, SFT, and RL Gains
di: Jeddi, Ahmadreza, et al.
Pubblicazione: (2026)
di: Jeddi, Ahmadreza, et al.
Pubblicazione: (2026)
FastHMR: Accelerating Human Mesh Recovery via Token and Layer Merging with Diffusion Decoding
di: Mehraban, Soroush, et al.
Pubblicazione: (2025)
di: Mehraban, Soroush, et al.
Pubblicazione: (2025)
UltraImage: Rethinking Resolution Extrapolation in Image Diffusion Transformers
di: Zhao, Min, et al.
Pubblicazione: (2025)
di: Zhao, Min, et al.
Pubblicazione: (2025)
SUM: Saliency Unification through Mamba for Visual Attention Modeling
di: Hosseini, Alireza, et al.
Pubblicazione: (2024)
di: Hosseini, Alireza, et al.
Pubblicazione: (2024)
STAF: Sinusoidal Trainable Activation Functions for Implicit Neural Representation
di: Morsali, Alireza, et al.
Pubblicazione: (2025)
di: Morsali, Alireza, et al.
Pubblicazione: (2025)
Similarity-Aware Token Pruning: Your VLM but Faster
di: Jeddi, Ahmadreza, et al.
Pubblicazione: (2025)
di: Jeddi, Ahmadreza, et al.
Pubblicazione: (2025)
PuzzleCraft: Exploration-Aware Curriculum Learning for Puzzle-Based RLVR in VLMs
di: Jeddi, Ahmadreza, et al.
Pubblicazione: (2025)
di: Jeddi, Ahmadreza, et al.
Pubblicazione: (2025)
Mitigating 3D Prostate Biparametric MRI Data Scarcity through Domain Adaptation using Locally-Trained Latent Diffusion Models for Prostate Cancer Detection
di: Grabke, Emerson P., et al.
Pubblicazione: (2025)
di: Grabke, Emerson P., et al.
Pubblicazione: (2025)
Spectral and Trajectory Regularization for Diffusion Transformer Super-Resolution
di: Wang, Jingkai, et al.
Pubblicazione: (2026)
di: Wang, Jingkai, et al.
Pubblicazione: (2026)
LookHere: Vision Transformers with Directed Attention Generalize and Extrapolate
di: Fuller, Anthony, et al.
Pubblicazione: (2024)
di: Fuller, Anthony, et al.
Pubblicazione: (2024)
RAGSR: Regional Attention Guided Diffusion for Image Super-Resolution
di: He, Haodong, et al.
Pubblicazione: (2025)
di: He, Haodong, et al.
Pubblicazione: (2025)
DyPE: Dynamic Position Extrapolation for Ultra High Resolution Diffusion
di: Issachar, Noam, et al.
Pubblicazione: (2025)
di: Issachar, Noam, et al.
Pubblicazione: (2025)
PickStyle: Video-to-Video Style Transfer with Context-Style Adapters
di: Mehraban, Soroush, et al.
Pubblicazione: (2025)
di: Mehraban, Soroush, et al.
Pubblicazione: (2025)
LIFT: Latent Implicit Functions for Task- and Data-Agnostic Encoding
di: Kazerouni, Amirhossein, et al.
Pubblicazione: (2025)
di: Kazerouni, Amirhossein, et al.
Pubblicazione: (2025)
CAP4D: Creating Animatable 4D Portrait Avatars with Morphable Multi-View Diffusion Models
di: Taubner, Felix, et al.
Pubblicazione: (2024)
di: Taubner, Felix, et al.
Pubblicazione: (2024)
Leveraging Clinical Text and Class Conditioning for 3D Prostate MRI Generation
di: Grabke, Emerson P., et al.
Pubblicazione: (2025)
di: Grabke, Emerson P., et al.
Pubblicazione: (2025)
Pain in 3D: Generating Controllable Synthetic Faces for Automated Pain Assessment
di: Lin, Xin Lei, et al.
Pubblicazione: (2025)
di: Lin, Xin Lei, et al.
Pubblicazione: (2025)
AC3D: Analyzing and Improving 3D Camera Control in Video Diffusion Transformers
di: Bahmani, Sherwin, et al.
Pubblicazione: (2024)
di: Bahmani, Sherwin, et al.
Pubblicazione: (2024)
UltraViCo: Breaking Extrapolation Limits in Video Diffusion Transformers
di: Zhao, Min, et al.
Pubblicazione: (2025)
di: Zhao, Min, et al.
Pubblicazione: (2025)
RIFLEx: A Free Lunch for Length Extrapolation in Video Diffusion Transformers
di: Zhao, Min, et al.
Pubblicazione: (2025)
di: Zhao, Min, et al.
Pubblicazione: (2025)
SEGA: A Stepwise Evolution Paradigm for Content-Aware Layout Generation with Design Prior
di: Wang, Haoran, et al.
Pubblicazione: (2025)
di: Wang, Haoran, et al.
Pubblicazione: (2025)
Skewness-Guided Pruning of Multimodal Swin Transformers for Federated Skin Lesion Classification on Edge Devices
di: Paxton, Kuniko, et al.
Pubblicazione: (2025)
di: Paxton, Kuniko, et al.
Pubblicazione: (2025)
Dynamic Attention-Guided Diffusion for Image Super-Resolution
di: Moser, Brian B., et al.
Pubblicazione: (2023)
di: Moser, Brian B., et al.
Pubblicazione: (2023)
Transientangelo: Few-Viewpoint Surface Reconstruction Using Single-Photon Lidar
di: Luo, Weihan, et al.
Pubblicazione: (2024)
di: Luo, Weihan, et al.
Pubblicazione: (2024)
AccDiffusion v2: Towards More Accurate Higher-Resolution Diffusion Extrapolation
di: Lin, Zhihang, et al.
Pubblicazione: (2024)
di: Lin, Zhihang, et al.
Pubblicazione: (2024)
Distilling Latent Manifolds: Resolution Extrapolation by Variational Autoencoders
di: Chu, Jiaming, et al.
Pubblicazione: (2026)
di: Chu, Jiaming, et al.
Pubblicazione: (2026)
Face2Scene: Using Facial Degradation as an Oracle for Diffusion-Based Scene Restoration
di: Kazerouni, Amirhossein, et al.
Pubblicazione: (2026)
di: Kazerouni, Amirhossein, et al.
Pubblicazione: (2026)
SEGA: Drivable 3D Gaussian Head Avatar from a Single Image
di: Guo, Chen, et al.
Pubblicazione: (2025)
di: Guo, Chen, et al.
Pubblicazione: (2025)
TIDE: Text-Informed Dynamic Extrapolation with Step-Aware Temperature Control for Diffusion Transformers
di: Liu, Yihua, et al.
Pubblicazione: (2026)
di: Liu, Yihua, et al.
Pubblicazione: (2026)
Benchmarking Skeleton-based Motion Encoder Models for Clinical Applications: Estimating Parkinson's Disease Severity in Walking Sequences
di: Adeli, Vida, et al.
Pubblicazione: (2024)
di: Adeli, Vida, et al.
Pubblicazione: (2024)
MangaDiT: Reference-Guided Line Art Colorization with Hierarchical Attention in Diffusion Transformers
di: Qiu, Qianru, et al.
Pubblicazione: (2025)
di: Qiu, Qianru, et al.
Pubblicazione: (2025)
One Attention, One Scale: Phase-Aligned Rotary Positional Embeddings for Mixed-Resolution Diffusion Transformer
di: Wu, Haoyu, et al.
Pubblicazione: (2025)
di: Wu, Haoyu, et al.
Pubblicazione: (2025)
Novel View Extrapolation with Video Diffusion Priors
di: Liu, Kunhao, et al.
Pubblicazione: (2024)
di: Liu, Kunhao, et al.
Pubblicazione: (2024)
Automatic Aorta Segmentation with Heavily Augmented, High-Resolution 3-D ResUNet: Contribution to the SEG.A Challenge
di: Wodzinski, Marek, et al.
Pubblicazione: (2023)
di: Wodzinski, Marek, et al.
Pubblicazione: (2023)
SEGA: A Transferable Signed Ensemble Gaussian Black-Box Attack against No-Reference Image Quality Assessment Models
di: Liu, Yujia, et al.
Pubblicazione: (2025)
di: Liu, Yujia, et al.
Pubblicazione: (2025)
IGAF: Incremental Guided Attention Fusion for Depth Super-Resolution
di: Tragakis, Athanasios, et al.
Pubblicazione: (2025)
di: Tragakis, Athanasios, et al.
Pubblicazione: (2025)
FreeText: Training-Free Text Rendering in Diffusion Transformers via Attention Localization and Spectral Glyph Injection
di: Zhang, Ruiqiang, et al.
Pubblicazione: (2026)
di: Zhang, Ruiqiang, et al.
Pubblicazione: (2026)
VD3D: Taming Large Video Diffusion Transformers for 3D Camera Control
di: Bahmani, Sherwin, et al.
Pubblicazione: (2024)
di: Bahmani, Sherwin, et al.
Pubblicazione: (2024)
Analysis of Attention in Video Diffusion Transformers
di: Wen, Yuxin, et al.
Pubblicazione: (2025)
di: Wen, Yuxin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
STARS: Self-supervised Tuning for 3D Action Recognition in Skeleton Sequences
di: Mehraban, Soroush, et al.
Pubblicazione: (2024) -
When Does RL Help Medical VLMs? Disentangling Vision, SFT, and RL Gains
di: Jeddi, Ahmadreza, et al.
Pubblicazione: (2026) -
FastHMR: Accelerating Human Mesh Recovery via Token and Layer Merging with Diffusion Decoding
di: Mehraban, Soroush, et al.
Pubblicazione: (2025) -
UltraImage: Rethinking Resolution Extrapolation in Image Diffusion Transformers
di: Zhao, Min, et al.
Pubblicazione: (2025) -
SUM: Saliency Unification through Mamba for Visual Attention Modeling
di: Hosseini, Alireza, et al.
Pubblicazione: (2024)