Saved in:
| Main Authors: | Wang, Jiepeng, Wang, Zhaoqing, Pan, Hao, Liu, Yuan, Yu, Dongdong, Wang, Changhu, Wang, Wenping |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2503.20644 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
OneWorld: Taming Scene Generation with 3D Unified Representation Autoencoder
by: Gao, Sensen, et al.
Published: (2026)
by: Gao, Sensen, et al.
Published: (2026)
Taming Camera-Controlled Video Generation with Verifiable Geometry Reward
by: Wang, Zhaoqing, et al.
Published: (2025)
by: Wang, Zhaoqing, et al.
Published: (2025)
TrackGo: A Flexible and Efficient Method for Controllable Video Generation
by: Zhou, Haitao, et al.
Published: (2024)
by: Zhou, Haitao, et al.
Published: (2024)
LaVin-DiT: Large Vision Diffusion Transformer
by: Wang, Zhaoqing, et al.
Published: (2024)
by: Wang, Zhaoqing, et al.
Published: (2024)
PanoSLAM: Panoptic 3D Scene Reconstruction via Gaussian SLAM
by: Chen, Runnan, et al.
Published: (2024)
by: Chen, Runnan, et al.
Published: (2024)
StructRe: Rewriting for Structured Shape Modeling
by: Wang, Jiepeng, et al.
Published: (2023)
by: Wang, Jiepeng, et al.
Published: (2023)
MoDGS: Dynamic Gaussian Splatting from Casually-captured Monocular Videos with Depth Priors
by: Liu, Qingming, et al.
Published: (2024)
by: Liu, Qingming, et al.
Published: (2024)
OVGaussian: Generalizable 3D Gaussian Segmentation with Open Vocabularies
by: Chen, Runnan, et al.
Published: (2024)
by: Chen, Runnan, et al.
Published: (2024)
UniModel: A Visual-Only Framework for Unified Multimodal Understanding and Generation
by: Zhang, Chi, et al.
Published: (2025)
by: Zhang, Chi, et al.
Published: (2025)
MMGenBench: Fully Automatically Evaluating LMMs from the Text-to-Image Generation Perspective
by: Huang, Hailang, et al.
Published: (2024)
by: Huang, Hailang, et al.
Published: (2024)
GausSurf: Geometry-Guided 3D Gaussian Splatting for Surface Reconstruction
by: Wang, Jiepeng, et al.
Published: (2024)
by: Wang, Jiepeng, et al.
Published: (2024)
OneReward: Unified Mask-Guided Image Generation via Multi-Task Human Preference Learning
by: Gong, Yuan, et al.
Published: (2025)
by: Gong, Yuan, et al.
Published: (2025)
Deep Understanding of Soccer Match Videos
by: Xu, Shikun, et al.
Published: (2024)
by: Xu, Shikun, et al.
Published: (2024)
StyleAdapter: A Unified Stylized Image Generation Model
by: Wang, Zhouxia, et al.
Published: (2023)
by: Wang, Zhouxia, et al.
Published: (2023)
ComboStoc: Combinatorial Stochasticity for Diffusion Generative Models
by: Xu, Rui, et al.
Published: (2024)
by: Xu, Rui, et al.
Published: (2024)
Group Editing: Edit Multiple Images in One Go
by: Ma, Yue, et al.
Published: (2026)
by: Ma, Yue, et al.
Published: (2026)
CtrlVDiff: Controllable Video Generation via Unified Multimodal Video Diffusion
by: Xi, Dianbing, et al.
Published: (2025)
by: Xi, Dianbing, et al.
Published: (2025)
Towards Enhanced Image Generation Via Multi-modal Chain of Thought in Unified Generative Models
by: Wang, Yi, et al.
Published: (2025)
by: Wang, Yi, et al.
Published: (2025)
MVBench: A Comprehensive Multi-modal Video Understanding Benchmark
by: Li, Kunchang, et al.
Published: (2023)
by: Li, Kunchang, et al.
Published: (2023)
Unified Reward Model for Multimodal Understanding and Generation
by: Wang, Yibin, et al.
Published: (2025)
by: Wang, Yibin, et al.
Published: (2025)
OmniVDiff: Omni Controllable Video Diffusion for Generation and Understanding
by: Xi, Dianbing, et al.
Published: (2025)
by: Xi, Dianbing, et al.
Published: (2025)
HYDRA: Unifying Multi-modal Generation and Understanding via Representation-Harmonized Tokenization
by: Qiu, Xuerui, et al.
Published: (2026)
by: Qiu, Xuerui, et al.
Published: (2026)
Learning to Generate via Understanding: Understanding-Driven Intrinsic Rewarding for Unified Multimodal Models
by: Pan, Jiadong, et al.
Published: (2026)
by: Pan, Jiadong, et al.
Published: (2026)
MVTokenFlow: High-quality 4D Content Generation using Multiview Token Flow
by: Huang, Hanzhuo, et al.
Published: (2025)
by: Huang, Hanzhuo, et al.
Published: (2025)
CLEAR: Unlocking Generative Potential for Degraded Image Understanding in Unified Multimodal Models
by: Hao, Xiangzhao, et al.
Published: (2026)
by: Hao, Xiangzhao, et al.
Published: (2026)
Uni-Inter: Unifying 3D Human Motion Synthesis Across Diverse Interaction Contexts
by: Liu, Sheng, et al.
Published: (2025)
by: Liu, Sheng, et al.
Published: (2025)
SVGS: Enhancing Gaussian Splatting Using Primitives with Spatially Varying Colors
by: Xu, Rui, et al.
Published: (2024)
by: Xu, Rui, et al.
Published: (2024)
CmFNet: Cross-modal Fusion Network for Weakly-supervised Segmentation of Medical Images
by: Meng, Dongdong, et al.
Published: (2025)
by: Meng, Dongdong, et al.
Published: (2025)
Dynamic Gaussian Scene Reconstruction from Unsynchronized Videos
by: Xu, Zhixin, et al.
Published: (2025)
by: Xu, Zhixin, et al.
Published: (2025)
OTTER: Open-Tagging via Text-Image Representation for Multi-modal Understanding
by: Ouyang, Jieer, et al.
Published: (2025)
by: Ouyang, Jieer, et al.
Published: (2025)
Unified Generative and Discriminative Training for Multi-modal Large Language Models
by: Chow, Wei, et al.
Published: (2024)
by: Chow, Wei, et al.
Published: (2024)
UniRecGen: Unifying Multi-View 3D Reconstruction and Generation
by: Huang, Zhisheng, et al.
Published: (2026)
by: Huang, Zhisheng, et al.
Published: (2026)
CADDreamer: CAD Object Generation from Single-view Images
by: Li, Yuan, et al.
Published: (2025)
by: Li, Yuan, et al.
Published: (2025)
USP: Unified Self-Supervised Pretraining for Image Generation and Understanding
by: Chu, Xiangxiang, et al.
Published: (2025)
by: Chu, Xiangxiang, et al.
Published: (2025)
SolidGS: Consolidating Gaussian Surfel Splatting for Sparse-View Surface Reconstruction
by: Shen, Zhuowen, et al.
Published: (2024)
by: Shen, Zhuowen, et al.
Published: (2024)
OneCAT: Decoder-Only Auto-Regressive Model for Unified Understanding and Generation
by: Li, Han, et al.
Published: (2025)
by: Li, Han, et al.
Published: (2025)
Liquid: Language Models are Scalable and Unified Multi-modal Generators
by: Wu, Junfeng, et al.
Published: (2024)
by: Wu, Junfeng, et al.
Published: (2024)
MambaDFuse: A Mamba-based Dual-phase Model for Multi-modality Image Fusion
by: Li, Zhe, et al.
Published: (2024)
by: Li, Zhe, et al.
Published: (2024)
MTPano: Multi-Task Panoramic Scene Understanding via Label-Free Integration of Dense Prediction Priors
by: Zhang, Jingdong, et al.
Published: (2026)
by: Zhang, Jingdong, et al.
Published: (2026)
UniAlignment: Semantic Alignment for Unified Image Generation, Understanding, Manipulation and Perception
by: Song, Xinyang, et al.
Published: (2025)
by: Song, Xinyang, et al.
Published: (2025)
Similar Items
-
OneWorld: Taming Scene Generation with 3D Unified Representation Autoencoder
by: Gao, Sensen, et al.
Published: (2026) -
Taming Camera-Controlled Video Generation with Verifiable Geometry Reward
by: Wang, Zhaoqing, et al.
Published: (2025) -
TrackGo: A Flexible and Efficient Method for Controllable Video Generation
by: Zhou, Haitao, et al.
Published: (2024) -
LaVin-DiT: Large Vision Diffusion Transformer
by: Wang, Zhaoqing, et al.
Published: (2024) -
PanoSLAM: Panoptic 3D Scene Reconstruction via Gaussian SLAM
by: Chen, Runnan, et al.
Published: (2024)