MonoFormer: One Transformer for Both Diffusion and Autoregression
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhao, Chuyang, Song, Yuxing, Wang, Wenhao, Feng, Haocheng, Ding, Errui, Sun, Yifan, Xiao, Xinyan, Wang, Jingdong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MS-DETR: Efficient DETR Training with Mixed Supervision
por: Zhao, Chuyang, et al.
Publicado: (2024)
por: Zhao, Chuyang, et al.
Publicado: (2024)
Re-HOLD: Video Hand Object Interaction Reenactment via adaptive Layout-instructed Diffusion Model
por: Fan, Yingying, et al.
Publicado: (2025)
por: Fan, Yingying, et al.
Publicado: (2025)
GVA: Reconstructing Vivid 3D Gaussian Avatars from Monocular Videos
por: Liu, Xinqi, et al.
Publicado: (2024)
por: Liu, Xinqi, et al.
Publicado: (2024)
XLD: A Cross-Lane Dataset for Benchmarking Novel Driving View Synthesis
por: Li, Hao, et al.
Publicado: (2024)
por: Li, Hao, et al.
Publicado: (2024)
AudCast: Audio-Driven Human Video Generation by Cascaded Diffusion Transformers
por: Guan, Jiazhi, et al.
Publicado: (2025)
por: Guan, Jiazhi, et al.
Publicado: (2025)
TALK-Act: Enhance Textural-Awareness for 2D Speaking Avatar Reenactment with Diffusion Model
por: Guan, Jiazhi, et al.
Publicado: (2024)
por: Guan, Jiazhi, et al.
Publicado: (2024)
GGRt: Towards Pose-free Generalizable 3D Gaussian Splatting in Real-time
por: Li, Hao, et al.
Publicado: (2024)
por: Li, Hao, et al.
Publicado: (2024)
TexRO: Generating Delicate Textures of 3D Models by Recursive Optimization
por: Wu, Jinbo, et al.
Publicado: (2024)
por: Wu, Jinbo, et al.
Publicado: (2024)
GIR: 3D Gaussian Inverse Rendering for Relightable Scene Factorization
por: Shi, Yahao, et al.
Publicado: (2023)
por: Shi, Yahao, et al.
Publicado: (2023)
VDG: Vision-Only Dynamic Gaussian for Driving Simulation
por: Li, Hao, et al.
Publicado: (2024)
por: Li, Hao, et al.
Publicado: (2024)
KD-DETR: Knowledge Distillation for Detection Transformer with Consistent Distillation Points Sampling
por: Wang, Yu, et al.
Publicado: (2022)
por: Wang, Yu, et al.
Publicado: (2022)
Automated Multi-level Preference for MLLMs
por: Zhang, Mengxi, et al.
Publicado: (2024)
por: Zhang, Mengxi, et al.
Publicado: (2024)
SLAM-Former: Putting SLAM into One Transformer
por: Yuan, Yijun, et al.
Publicado: (2025)
por: Yuan, Yijun, et al.
Publicado: (2025)
OpenGaussian: Towards Point-Level 3D Gaussian-based Open Vocabulary Understanding
por: Wu, Yanmin, et al.
Publicado: (2024)
por: Wu, Yanmin, et al.
Publicado: (2024)
LaMI-DETR: Open-Vocabulary Detection with Language Model Instruction
por: Du, Penghui, et al.
Publicado: (2024)
por: Du, Penghui, et al.
Publicado: (2024)
Query-Kontext: An Unified Multimodal Model for Image Generation and Editing
por: Song, Yuxin, et al.
Publicado: (2025)
por: Song, Yuxin, et al.
Publicado: (2025)
OVLW-DETR: Open-Vocabulary Light-Weighted Detection Transformer
por: Wang, Yu, et al.
Publicado: (2024)
por: Wang, Yu, et al.
Publicado: (2024)
FullAnno: A Data Engine for Enhancing Image Comprehension of MLLMs
por: Hao, Jing, et al.
Publicado: (2024)
por: Hao, Jing, et al.
Publicado: (2024)
MGMapNet: Multi-Granularity Representation Learning for End-to-End Vectorized HD Map Construction
por: Yang, Jing, et al.
Publicado: (2024)
por: Yang, Jing, et al.
Publicado: (2024)
iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer
por: Shen, Zhelun, et al.
Publicado: (2025)
por: Shen, Zhelun, et al.
Publicado: (2025)
Skim then Focus: Integrating Contextual and Fine-grained Views for Repetitive Action Counting
por: Zhao, Zhengqi, et al.
Publicado: (2024)
por: Zhao, Zhengqi, et al.
Publicado: (2024)
Dense Connector for MLLMs
por: Yao, Huanjin, et al.
Publicado: (2024)
por: Yao, Huanjin, et al.
Publicado: (2024)
AssetFormer: Modular 3D Assets Generation with Autoregressive Transformer
por: Zhu, Lingting, et al.
Publicado: (2026)
por: Zhu, Lingting, et al.
Publicado: (2026)
CoLoGen: Progressive Learning of Concept-Localization Duality for Unified Image Generation
por: Song, YuXin, et al.
Publicado: (2026)
por: Song, YuXin, et al.
Publicado: (2026)
CODER: Coupled Diversity-Sensitive Momentum Contrastive Learning for Image-Text Retrieval
por: Wang, Haoran, et al.
Publicado: (2022)
por: Wang, Haoran, et al.
Publicado: (2022)
Splatter-360: Generalizable 360$^{\circ}$ Gaussian Splatting for Wide-baseline Panoramic Images
por: Chen, Zheng, et al.
Publicado: (2024)
por: Chen, Zheng, et al.
Publicado: (2024)
ACDiT: Interpolating Autoregressive Conditional Modeling and Diffusion Transformer
por: Hu, Jinyi, et al.
Publicado: (2024)
por: Hu, Jinyi, et al.
Publicado: (2024)
Cosh-DiT: Co-Speech Gesture Video Synthesis via Hybrid Audio-Visual Diffusion Transformers
por: Sun, Yasheng, et al.
Publicado: (2025)
por: Sun, Yasheng, et al.
Publicado: (2025)
OPEN: Object-wise Position Embedding for Multi-view 3D Object Detection
por: Hou, Jinghua, et al.
Publicado: (2024)
por: Hou, Jinghua, et al.
Publicado: (2024)
Guiding Visual Autoregressive Models through Spectrum Weakening
por: Wang, Chaoyang, et al.
Publicado: (2025)
por: Wang, Chaoyang, et al.
Publicado: (2025)
ReSyncer: Rewiring Style-based Generator for Unified Audio-Visually Synced Facial Performer
por: Guan, Jiazhi, et al.
Publicado: (2024)
por: Guan, Jiazhi, et al.
Publicado: (2024)
Interpretable Face Anti-Spoofing: Enhancing Generalization with Multimodal Large Language Models
por: Zhang, Guosheng, et al.
Publicado: (2025)
por: Zhang, Guosheng, et al.
Publicado: (2025)
Image Copy Detection for Diffusion Models
por: Wang, Wenhao, et al.
Publicado: (2024)
por: Wang, Wenhao, et al.
Publicado: (2024)
Gradient-based Sampling for Class Imbalanced Semi-supervised Object Detection
por: Li, Jiaming, et al.
Publicado: (2024)
por: Li, Jiaming, et al.
Publicado: (2024)
Decoupled Pseudo-labeling for Semi-Supervised Monocular 3D Object Detection
por: Zhang, Jiacheng, et al.
Publicado: (2024)
por: Zhang, Jiacheng, et al.
Publicado: (2024)
Uni$^2$Det: Unified and Universal Framework for Prompt-Guided Multi-dataset 3D Detection
por: Wang, Yubin, et al.
Publicado: (2024)
por: Wang, Yubin, et al.
Publicado: (2024)
CAVM: Conditional Autoregressive Vision Model for Contrast-Enhanced Brain Tumor MRI Synthesis
por: Gui, Lujun, et al.
Publicado: (2024)
por: Gui, Lujun, et al.
Publicado: (2024)
ATLAS: Agentic or Latent Visual Reasoning? One Word is Enough for Both
por: Guo, Ziyu, et al.
Publicado: (2026)
por: Guo, Ziyu, et al.
Publicado: (2026)
RefAlign: Representation Alignment for Reference-to-Video Generation
por: Wang, Lei, et al.
Publicado: (2026)
por: Wang, Lei, et al.
Publicado: (2026)
UGen: Unified Autoregressive Multimodal Model with Progressive Vocabulary Learning
por: Tang, Hongxuan, et al.
Publicado: (2025)
por: Tang, Hongxuan, et al.
Publicado: (2025)
Ejemplares similares
-
MS-DETR: Efficient DETR Training with Mixed Supervision
por: Zhao, Chuyang, et al.
Publicado: (2024) -
Re-HOLD: Video Hand Object Interaction Reenactment via adaptive Layout-instructed Diffusion Model
por: Fan, Yingying, et al.
Publicado: (2025) -
GVA: Reconstructing Vivid 3D Gaussian Avatars from Monocular Videos
por: Liu, Xinqi, et al.
Publicado: (2024) -
XLD: A Cross-Lane Dataset for Benchmarking Novel Driving View Synthesis
por: Li, Hao, et al.
Publicado: (2024) -
AudCast: Audio-Driven Human Video Generation by Cascaded Diffusion Transformers
por: Guan, Jiazhi, et al.
Publicado: (2025)