RiT: Vanilla Diffusion Transformers Suffice in Representation Space
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Le, Mang, Ning, Agrawal, Aishwarya |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Contrasting Intra-Modal and Ranking Cross-Modal Hard Negatives to Enhance Visio-Linguistic Compositional Understanding
par: Zhang, Le, et autres
Publié: (2023)
par: Zhang, Le, et autres
Publié: (2023)
Assessing and Learning Alignment of Unimodal Vision and Language Models
par: Zhang, Le, et autres
Publié: (2024)
par: Zhang, Le, et autres
Publié: (2024)
Investigating Prompting Techniques for Zero- and Few-Shot Visual Question Answering
par: Awal, Rabiul, et autres
Publié: (2023)
par: Awal, Rabiul, et autres
Publié: (2023)
Representation Learning and Identity Adversarial Training for Facial Behavior Understanding
par: Ning, Mang, et autres
Publié: (2024)
par: Ning, Mang, et autres
Publié: (2024)
Communicating about Space: Language-Mediated Spatial Integration Across Partial Views
par: Sikarwar, Ankur, et autres
Publié: (2026)
par: Sikarwar, Ankur, et autres
Publié: (2026)
Vanilla Group Equivariant Vision Transformer: Simple and Effective
par: Fu, Jiahong, et autres
Publié: (2026)
par: Fu, Jiahong, et autres
Publié: (2026)
Volume Transformer: Revisiting Vanilla Transformers for 3D Scene Understanding
par: Yilmaz, Kadir, et autres
Publié: (2026)
par: Yilmaz, Kadir, et autres
Publié: (2026)
Spectrum Matching: a Unified Perspective for Superior Diffusability in Latent Diffusion
par: Ning, Mang, et autres
Publié: (2026)
par: Ning, Mang, et autres
Publié: (2026)
VisMin: Visual Minimal-Change Understanding
par: Awal, Rabiul, et autres
Publié: (2024)
par: Awal, Rabiul, et autres
Publié: (2024)
How and What to Imagine? Visual Thinking in Unified Multimodal Models for Cross-View Spatial Reasoning
par: Yang, Qian, et autres
Publié: (2026)
par: Yang, Qian, et autres
Publié: (2026)
Decompose and Compare Consistency: Measuring VLMs' Answer Reliability via Task-Decomposition Consistency Comparison
par: Yang, Qian, et autres
Publié: (2024)
par: Yang, Qian, et autres
Publié: (2024)
Predicting Perceived Gloss: Do Weak Labels Suffice?
par: Guerrero-Viu, Julia, et autres
Publié: (2024)
par: Guerrero-Viu, Julia, et autres
Publié: (2024)
Scaling Text-to-Image Diffusion Transformers with Representation Autoencoders
par: Tong, Shengbang, et autres
Publié: (2026)
par: Tong, Shengbang, et autres
Publié: (2026)
An Examination of the Robustness of Reference-Free Image Captioning Evaluation Metrics
par: Ahmadi, Saba, et autres
Publié: (2023)
par: Ahmadi, Saba, et autres
Publié: (2023)
Consistent Story Generation: Unlocking the Potential of Zigzag Sampling
par: Li, Mingxiao, et autres
Publié: (2025)
par: Li, Mingxiao, et autres
Publié: (2025)
No Other Representation Component Is Needed: Diffusion Transformers Can Provide Representation Guidance by Themselves
par: Jiang, Dengyang, et autres
Publié: (2025)
par: Jiang, Dengyang, et autres
Publié: (2025)
CPiRi: Channel Permutation-Invariant Relational Interaction for Multivariate Time Series Forecasting
par: Xu, Jiyuan, et autres
Publié: (2026)
par: Xu, Jiyuan, et autres
Publié: (2026)
Vanilla ViT for Automotive Point Cloud Semantic Segmentation
par: Puy, Gilles, et autres
Publié: (2026)
par: Puy, Gilles, et autres
Publié: (2026)
Registers Matter for Pixel-Space Diffusion Transformers
par: Starodubcev, Nikita, et autres
Publié: (2026)
par: Starodubcev, Nikita, et autres
Publié: (2026)
One Click per Cell Type Suffices: Training-free Group Interaction for Cell Instance Segmentation
par: Jo, Sanghyun, et autres
Publié: (2026)
par: Jo, Sanghyun, et autres
Publié: (2026)
Diffusion-APO: Trajectory-Aware Direct Preference Alignment for Video Diffusion Transformers
par: Zhu, Jingyuan, et autres
Publié: (2026)
par: Zhu, Jingyuan, et autres
Publié: (2026)
CaRiNG: Learning Temporal Causal Representation under Non-Invertible Generation Process
par: Chen, Guangyi, et autres
Publié: (2024)
par: Chen, Guangyi, et autres
Publié: (2024)
RiO-DETR: DETR for Real-time Oriented Object Detection
par: Hu, Zhangchi, et autres
Publié: (2026)
par: Hu, Zhangchi, et autres
Publié: (2026)
Diffusion MRI Transformer with a Diffusion Space Rotary Positional Embedding (D-RoPE)
par: Kung, Gustavo Chau Loo, et autres
Publié: (2026)
par: Kung, Gustavo Chau Loo, et autres
Publié: (2026)
CTRL-O: Language-Controllable Object-Centric Visual Representation Learning
par: Didolkar, Aniket, et autres
Publié: (2025)
par: Didolkar, Aniket, et autres
Publié: (2025)
Diffusion Transformers with Representation Autoencoders
par: Zheng, Boyang, et autres
Publié: (2025)
par: Zheng, Boyang, et autres
Publié: (2025)
UniRiT: Towards Few-Shot Non-Rigid Point Cloud Registration
par: Li, Geng, et autres
Publié: (2024)
par: Li, Geng, et autres
Publié: (2024)
DiverseDiT: Towards Diverse Representation Learning in Diffusion Transformers
par: Yang, Mengping, et autres
Publié: (2026)
par: Yang, Mengping, et autres
Publié: (2026)
Generative Editing in the Joint Vision-Language Space for Zero-Shot Composed Image Retrieval
par: Wang, Xin, et autres
Publié: (2025)
par: Wang, Xin, et autres
Publié: (2025)
Improving Automatic VQA Evaluation Using Large Language Models
par: Mañas, Oscar, et autres
Publié: (2023)
par: Mañas, Oscar, et autres
Publié: (2023)
PackForcing: Short Video Training Suffices for Long Video Sampling and Long Context Inference
par: Mao, Xiaofeng, et autres
Publié: (2026)
par: Mao, Xiaofeng, et autres
Publié: (2026)
Adaptive High-Frequency Transformer for Diverse Wildlife Re-Identification
par: Li, Chenyue, et autres
Publié: (2024)
par: Li, Chenyue, et autres
Publié: (2024)
DirectEdit: Step-Level Accurate Inversion for Flow-Based Image Editing
par: Yang, Desong, et autres
Publié: (2026)
par: Yang, Desong, et autres
Publié: (2026)
Pothole Detection and Recognition based on Transfer Learning
par: Hu, Mang, et autres
Publié: (2025)
par: Hu, Mang, et autres
Publié: (2025)
DiTFastAttn: Attention Compression for Diffusion Transformer Models
par: Yuan, Zhihang, et autres
Publié: (2024)
par: Yuan, Zhihang, et autres
Publié: (2024)
Is Vanilla MLP in Neural Radiance Field Enough for Few-shot View Synthesis?
par: Zhu, Hanxin, et autres
Publié: (2024)
par: Zhu, Hanxin, et autres
Publié: (2024)
Representation Entanglement for Generation: Training Diffusion Transformers Is Much Easier Than You Think
par: Wu, Ge, et autres
Publié: (2025)
par: Wu, Ge, et autres
Publié: (2025)
Beyond Point-Wise Matching: Structural Representation Alignment for Accelerating Diffusion Transformers
par: Xu, Shaodong, et autres
Publié: (2026)
par: Xu, Shaodong, et autres
Publié: (2026)
Generalization of Diffusion Models Arises with a Balanced Representation Space
par: Zhang, Zekai, et autres
Publié: (2025)
par: Zhang, Zekai, et autres
Publié: (2025)
LiteVGGT: Boosting Vanilla VGGT via Geometry-aware Cached Token Merging
par: Shu, Zhijian, et autres
Publié: (2025)
par: Shu, Zhijian, et autres
Publié: (2025)
Documents similaires
-
Contrasting Intra-Modal and Ranking Cross-Modal Hard Negatives to Enhance Visio-Linguistic Compositional Understanding
par: Zhang, Le, et autres
Publié: (2023) -
Assessing and Learning Alignment of Unimodal Vision and Language Models
par: Zhang, Le, et autres
Publié: (2024) -
Investigating Prompting Techniques for Zero- and Few-Shot Visual Question Answering
par: Awal, Rabiul, et autres
Publié: (2023) -
Representation Learning and Identity Adversarial Training for Facial Behavior Understanding
par: Ning, Mang, et autres
Publié: (2024) -
Communicating about Space: Language-Mediated Spatial Integration Across Partial Views
par: Sikarwar, Ankur, et autres
Publié: (2026)