RiT: Vanilla Diffusion Transformers Suffice in Representation Space
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Le, Mang, Ning, Agrawal, Aishwarya |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Contrasting Intra-Modal and Ranking Cross-Modal Hard Negatives to Enhance Visio-Linguistic Compositional Understanding
por: Zhang, Le, et al.
Publicado: (2023)
por: Zhang, Le, et al.
Publicado: (2023)
Assessing and Learning Alignment of Unimodal Vision and Language Models
por: Zhang, Le, et al.
Publicado: (2024)
por: Zhang, Le, et al.
Publicado: (2024)
Investigating Prompting Techniques for Zero- and Few-Shot Visual Question Answering
por: Awal, Rabiul, et al.
Publicado: (2023)
por: Awal, Rabiul, et al.
Publicado: (2023)
Representation Learning and Identity Adversarial Training for Facial Behavior Understanding
por: Ning, Mang, et al.
Publicado: (2024)
por: Ning, Mang, et al.
Publicado: (2024)
Communicating about Space: Language-Mediated Spatial Integration Across Partial Views
por: Sikarwar, Ankur, et al.
Publicado: (2026)
por: Sikarwar, Ankur, et al.
Publicado: (2026)
Vanilla Group Equivariant Vision Transformer: Simple and Effective
por: Fu, Jiahong, et al.
Publicado: (2026)
por: Fu, Jiahong, et al.
Publicado: (2026)
Volume Transformer: Revisiting Vanilla Transformers for 3D Scene Understanding
por: Yilmaz, Kadir, et al.
Publicado: (2026)
por: Yilmaz, Kadir, et al.
Publicado: (2026)
Spectrum Matching: a Unified Perspective for Superior Diffusability in Latent Diffusion
por: Ning, Mang, et al.
Publicado: (2026)
por: Ning, Mang, et al.
Publicado: (2026)
VisMin: Visual Minimal-Change Understanding
por: Awal, Rabiul, et al.
Publicado: (2024)
por: Awal, Rabiul, et al.
Publicado: (2024)
How and What to Imagine? Visual Thinking in Unified Multimodal Models for Cross-View Spatial Reasoning
por: Yang, Qian, et al.
Publicado: (2026)
por: Yang, Qian, et al.
Publicado: (2026)
Decompose and Compare Consistency: Measuring VLMs' Answer Reliability via Task-Decomposition Consistency Comparison
por: Yang, Qian, et al.
Publicado: (2024)
por: Yang, Qian, et al.
Publicado: (2024)
Predicting Perceived Gloss: Do Weak Labels Suffice?
por: Guerrero-Viu, Julia, et al.
Publicado: (2024)
por: Guerrero-Viu, Julia, et al.
Publicado: (2024)
Scaling Text-to-Image Diffusion Transformers with Representation Autoencoders
por: Tong, Shengbang, et al.
Publicado: (2026)
por: Tong, Shengbang, et al.
Publicado: (2026)
An Examination of the Robustness of Reference-Free Image Captioning Evaluation Metrics
por: Ahmadi, Saba, et al.
Publicado: (2023)
por: Ahmadi, Saba, et al.
Publicado: (2023)
Consistent Story Generation: Unlocking the Potential of Zigzag Sampling
por: Li, Mingxiao, et al.
Publicado: (2025)
por: Li, Mingxiao, et al.
Publicado: (2025)
No Other Representation Component Is Needed: Diffusion Transformers Can Provide Representation Guidance by Themselves
por: Jiang, Dengyang, et al.
Publicado: (2025)
por: Jiang, Dengyang, et al.
Publicado: (2025)
CPiRi: Channel Permutation-Invariant Relational Interaction for Multivariate Time Series Forecasting
por: Xu, Jiyuan, et al.
Publicado: (2026)
por: Xu, Jiyuan, et al.
Publicado: (2026)
Vanilla ViT for Automotive Point Cloud Semantic Segmentation
por: Puy, Gilles, et al.
Publicado: (2026)
por: Puy, Gilles, et al.
Publicado: (2026)
Registers Matter for Pixel-Space Diffusion Transformers
por: Starodubcev, Nikita, et al.
Publicado: (2026)
por: Starodubcev, Nikita, et al.
Publicado: (2026)
One Click per Cell Type Suffices: Training-free Group Interaction for Cell Instance Segmentation
por: Jo, Sanghyun, et al.
Publicado: (2026)
por: Jo, Sanghyun, et al.
Publicado: (2026)
Diffusion-APO: Trajectory-Aware Direct Preference Alignment for Video Diffusion Transformers
por: Zhu, Jingyuan, et al.
Publicado: (2026)
por: Zhu, Jingyuan, et al.
Publicado: (2026)
CaRiNG: Learning Temporal Causal Representation under Non-Invertible Generation Process
por: Chen, Guangyi, et al.
Publicado: (2024)
por: Chen, Guangyi, et al.
Publicado: (2024)
RiO-DETR: DETR for Real-time Oriented Object Detection
por: Hu, Zhangchi, et al.
Publicado: (2026)
por: Hu, Zhangchi, et al.
Publicado: (2026)
Diffusion MRI Transformer with a Diffusion Space Rotary Positional Embedding (D-RoPE)
por: Kung, Gustavo Chau Loo, et al.
Publicado: (2026)
por: Kung, Gustavo Chau Loo, et al.
Publicado: (2026)
CTRL-O: Language-Controllable Object-Centric Visual Representation Learning
por: Didolkar, Aniket, et al.
Publicado: (2025)
por: Didolkar, Aniket, et al.
Publicado: (2025)
Diffusion Transformers with Representation Autoencoders
por: Zheng, Boyang, et al.
Publicado: (2025)
por: Zheng, Boyang, et al.
Publicado: (2025)
UniRiT: Towards Few-Shot Non-Rigid Point Cloud Registration
por: Li, Geng, et al.
Publicado: (2024)
por: Li, Geng, et al.
Publicado: (2024)
DiverseDiT: Towards Diverse Representation Learning in Diffusion Transformers
por: Yang, Mengping, et al.
Publicado: (2026)
por: Yang, Mengping, et al.
Publicado: (2026)
Improving Automatic VQA Evaluation Using Large Language Models
por: Mañas, Oscar, et al.
Publicado: (2023)
por: Mañas, Oscar, et al.
Publicado: (2023)
Generative Editing in the Joint Vision-Language Space for Zero-Shot Composed Image Retrieval
por: Wang, Xin, et al.
Publicado: (2025)
por: Wang, Xin, et al.
Publicado: (2025)
PackForcing: Short Video Training Suffices for Long Video Sampling and Long Context Inference
por: Mao, Xiaofeng, et al.
Publicado: (2026)
por: Mao, Xiaofeng, et al.
Publicado: (2026)
Adaptive High-Frequency Transformer for Diverse Wildlife Re-Identification
por: Li, Chenyue, et al.
Publicado: (2024)
por: Li, Chenyue, et al.
Publicado: (2024)
DirectEdit: Step-Level Accurate Inversion for Flow-Based Image Editing
por: Yang, Desong, et al.
Publicado: (2026)
por: Yang, Desong, et al.
Publicado: (2026)
Pothole Detection and Recognition based on Transfer Learning
por: Hu, Mang, et al.
Publicado: (2025)
por: Hu, Mang, et al.
Publicado: (2025)
DiTFastAttn: Attention Compression for Diffusion Transformer Models
por: Yuan, Zhihang, et al.
Publicado: (2024)
por: Yuan, Zhihang, et al.
Publicado: (2024)
Is Vanilla MLP in Neural Radiance Field Enough for Few-shot View Synthesis?
por: Zhu, Hanxin, et al.
Publicado: (2024)
por: Zhu, Hanxin, et al.
Publicado: (2024)
Representation Entanglement for Generation: Training Diffusion Transformers Is Much Easier Than You Think
por: Wu, Ge, et al.
Publicado: (2025)
por: Wu, Ge, et al.
Publicado: (2025)
Beyond Point-Wise Matching: Structural Representation Alignment for Accelerating Diffusion Transformers
por: Xu, Shaodong, et al.
Publicado: (2026)
por: Xu, Shaodong, et al.
Publicado: (2026)
Generalization of Diffusion Models Arises with a Balanced Representation Space
por: Zhang, Zekai, et al.
Publicado: (2025)
por: Zhang, Zekai, et al.
Publicado: (2025)
LiteVGGT: Boosting Vanilla VGGT via Geometry-aware Cached Token Merging
por: Shu, Zhijian, et al.
Publicado: (2025)
por: Shu, Zhijian, et al.
Publicado: (2025)
Ejemplares similares
-
Contrasting Intra-Modal and Ranking Cross-Modal Hard Negatives to Enhance Visio-Linguistic Compositional Understanding
por: Zhang, Le, et al.
Publicado: (2023) -
Assessing and Learning Alignment of Unimodal Vision and Language Models
por: Zhang, Le, et al.
Publicado: (2024) -
Investigating Prompting Techniques for Zero- and Few-Shot Visual Question Answering
por: Awal, Rabiul, et al.
Publicado: (2023) -
Representation Learning and Identity Adversarial Training for Facial Behavior Understanding
por: Ning, Mang, et al.
Publicado: (2024) -
Communicating about Space: Language-Mediated Spatial Integration Across Partial Views
por: Sikarwar, Ankur, et al.
Publicado: (2026)