UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Mao, Weijia, Yang, Zhenheng, Shou, Mike Zheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths
di: Mao, Weijia, et al.
Pubblicazione: (2025)
di: Mao, Weijia, et al.
Pubblicazione: (2025)
Show-o2: Improved Native Unified Multimodal Models
di: Xie, Jinheng, et al.
Pubblicazione: (2025)
di: Xie, Jinheng, et al.
Pubblicazione: (2025)
The Image as Its Own Reward: Reinforcement Learning with Adversarial Reward for Image Generation
di: Mao, Weijia, et al.
Pubblicazione: (2025)
di: Mao, Weijia, et al.
Pubblicazione: (2025)
DoraCycle: Domain-Oriented Adaptation of Unified Generative Model in Multimodal Cycles
di: Zhao, Rui, et al.
Pubblicazione: (2025)
di: Zhao, Rui, et al.
Pubblicazione: (2025)
Show-o: One Single Transformer to Unify Multimodal Understanding and Generation
di: Xie, Jinheng, et al.
Pubblicazione: (2024)
di: Xie, Jinheng, et al.
Pubblicazione: (2024)
Long-Context Autoregressive Video Modeling with Next-Frame Prediction
di: Gu, Yuchao, et al.
Pubblicazione: (2025)
di: Gu, Yuchao, et al.
Pubblicazione: (2025)
UniAPO: Unified Multimodal Automated Prompt Optimization
di: Zhu, Qipeng, et al.
Pubblicazione: (2025)
di: Zhu, Qipeng, et al.
Pubblicazione: (2025)
UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation
di: Chen, Yanzhe, et al.
Pubblicazione: (2025)
di: Chen, Yanzhe, et al.
Pubblicazione: (2025)
UniCorn: Towards Self-Improving Unified Multimodal Models through Self-Generated Supervision
di: Han, Ruiyan, et al.
Pubblicazione: (2026)
di: Han, Ruiyan, et al.
Pubblicazione: (2026)
Automated Movie Generation via Multi-Agent CoT Planning
di: Wu, Weijia, et al.
Pubblicazione: (2025)
di: Wu, Weijia, et al.
Pubblicazione: (2025)
Mitty: Diffusion-based Human-to-Robot Video Generation
di: Song, Yiren, et al.
Pubblicazione: (2025)
di: Song, Yiren, et al.
Pubblicazione: (2025)
Tuning-Free Image Editing with Fidelity and Editability via Unified Latent Diffusion Model
di: Mao, Qi, et al.
Pubblicazione: (2025)
di: Mao, Qi, et al.
Pubblicazione: (2025)
UniWeTok: An Unified Binary Tokenizer with Codebook Size $\mathit{2^{128}}$ for Unified Multimodal Large Language Model
di: Zhuang, Shaobin, et al.
Pubblicazione: (2026)
di: Zhuang, Shaobin, et al.
Pubblicazione: (2026)
Multi-human Interactive Talking Dataset
di: Zhu, Zeyu, et al.
Pubblicazione: (2025)
di: Zhu, Zeyu, et al.
Pubblicazione: (2025)
Skywork UniPic 2.0: Building Kontext Model with Online RL for Unified Multimodal Model
di: Wei, Hongyang, et al.
Pubblicazione: (2025)
di: Wei, Hongyang, et al.
Pubblicazione: (2025)
Reinforcement Learning for Large Model: A Survey
di: Wu, Weijia, et al.
Pubblicazione: (2025)
di: Wu, Weijia, et al.
Pubblicazione: (2025)
D-AR: Diffusion via Autoregressive Models
di: Gao, Ziteng, et al.
Pubblicazione: (2025)
di: Gao, Ziteng, et al.
Pubblicazione: (2025)
Edit Transfer: Learning Image Editing via Vision In-Context Relations
di: Chen, Lan, et al.
Pubblicazione: (2025)
di: Chen, Lan, et al.
Pubblicazione: (2025)
Diffusion-Driven Self-Supervised Learning for Shape Reconstruction and Pose Estimation
di: Sun, Jingtao, et al.
Pubblicazione: (2024)
di: Sun, Jingtao, et al.
Pubblicazione: (2024)
UniMRSeg: Unified Modality-Relax Segmentation via Hierarchical Self-Supervised Compensation
di: Zhao, Xiaoqi, et al.
Pubblicazione: (2025)
di: Zhao, Xiaoqi, et al.
Pubblicazione: (2025)
UniFL: Improve Latent Diffusion Model via Unified Feedback Learning
di: Zhang, Jiacheng, et al.
Pubblicazione: (2024)
di: Zhang, Jiacheng, et al.
Pubblicazione: (2024)
Think or Not? Selective Reasoning via Reinforcement Learning for Vision-Language Models
di: Wang, Jiaqi, et al.
Pubblicazione: (2025)
di: Wang, Jiaqi, et al.
Pubblicazione: (2025)
DiffuMask: Synthesizing Images with Pixel-level Annotations for Semantic Segmentation Using Diffusion Models
di: Wu, Weijia, et al.
Pubblicazione: (2023)
di: Wu, Weijia, et al.
Pubblicazione: (2023)
UniCom: Unified Multimodal Modeling via Compressed Continuous Semantic Representations
di: Zhao, Yaqi, et al.
Pubblicazione: (2026)
di: Zhao, Yaqi, et al.
Pubblicazione: (2026)
Draw-In-Mind: Rebalancing Designer-Painter Roles in Unified Multimodal Models Benefits Image Editing
di: Zeng, Ziyun, et al.
Pubblicazione: (2025)
di: Zeng, Ziyun, et al.
Pubblicazione: (2025)
Uni4D: A Unified Self-Supervised Learning Framework for Point Cloud Videos
di: Zuo, Zhi, et al.
Pubblicazione: (2025)
di: Zuo, Zhi, et al.
Pubblicazione: (2025)
TPDiff: Temporal Pyramid Video Diffusion Model
di: Ran, Lingmin, et al.
Pubblicazione: (2025)
di: Ran, Lingmin, et al.
Pubblicazione: (2025)
Ego-centric Predictive Model Conditioned on Hand Trajectories
di: Zhang, Binjie, et al.
Pubblicazione: (2025)
di: Zhang, Binjie, et al.
Pubblicazione: (2025)
PANDA: Towards Generalist Video Anomaly Detection via Agentic AI Engineer
di: Yang, Zhiwei, et al.
Pubblicazione: (2025)
di: Yang, Zhiwei, et al.
Pubblicazione: (2025)
VISTA: Triplet-Supervised Video Style Transfer with Diffusion Transformers
di: Song, Yiren, et al.
Pubblicazione: (2026)
di: Song, Yiren, et al.
Pubblicazione: (2026)
ParaUni: Enhance Generation in Unified Multimodal Model with Reinforcement-driven Hierarchical Parallel Information Interaction
di: Tan, Jiangtong, et al.
Pubblicazione: (2025)
di: Tan, Jiangtong, et al.
Pubblicazione: (2025)
UniCode: Learning a Unified Codebook for Multimodal Large Language Models
di: Zheng, Sipeng, et al.
Pubblicazione: (2024)
di: Zheng, Sipeng, et al.
Pubblicazione: (2024)
UniT: Unified Geometry Learning with Group Autoregressive Transformer
di: Wang, Haotian, et al.
Pubblicazione: (2026)
di: Wang, Haotian, et al.
Pubblicazione: (2026)
UniModel: A Visual-Only Framework for Unified Multimodal Understanding and Generation
di: Zhang, Chi, et al.
Pubblicazione: (2025)
di: Zhang, Chi, et al.
Pubblicazione: (2025)
AnyFlow: Any-Step Video Diffusion Model with On-Policy Flow Map Distillation
di: Gu, Yuchao, et al.
Pubblicazione: (2026)
di: Gu, Yuchao, et al.
Pubblicazione: (2026)
UniTable: Towards a Unified Framework for Table Recognition via Self-Supervised Pretraining
di: Peng, ShengYun, et al.
Pubblicazione: (2024)
di: Peng, ShengYun, et al.
Pubblicazione: (2024)
VLog: Video-Language Models by Generative Retrieval of Narration Vocabulary
di: Lin, Kevin Qinghong, et al.
Pubblicazione: (2025)
di: Lin, Kevin Qinghong, et al.
Pubblicazione: (2025)
Genixer: Empowering Multimodal Large Language Models as a Powerful Data Generator
di: Zhao, Henry Hengyuan, et al.
Pubblicazione: (2023)
di: Zhao, Henry Hengyuan, et al.
Pubblicazione: (2023)
UniVid: Unifying Vision Tasks with Pre-trained Video Generation Models
di: Chen, Lan, et al.
Pubblicazione: (2025)
di: Chen, Lan, et al.
Pubblicazione: (2025)
Uni-MMMU: A Massive Multi-discipline Multimodal Unified Benchmark
di: Zou, Kai, et al.
Pubblicazione: (2025)
di: Zou, Kai, et al.
Pubblicazione: (2025)
Documenti analoghi
-
UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths
di: Mao, Weijia, et al.
Pubblicazione: (2025) -
Show-o2: Improved Native Unified Multimodal Models
di: Xie, Jinheng, et al.
Pubblicazione: (2025) -
The Image as Its Own Reward: Reinforcement Learning with Adversarial Reward for Image Generation
di: Mao, Weijia, et al.
Pubblicazione: (2025) -
DoraCycle: Domain-Oriented Adaptation of Unified Generative Model in Multimodal Cycles
di: Zhao, Rui, et al.
Pubblicazione: (2025) -
Show-o: One Single Transformer to Unify Multimodal Understanding and Generation
di: Xie, Jinheng, et al.
Pubblicazione: (2024)