Towards Unified Multimodal Interleaved Generation via Group Relative Policy Optimization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Nie, Ming, Wang, Chunwei, Han, Jianhua, Xu, Hang, Zhang, Li |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Reason2Drive: Towards Interpretable and Chain-based Reasoning for Autonomous Driving
par: Nie, Ming, et autres
Publié: (2023)
par: Nie, Ming, et autres
Publié: (2023)
KFFocus: Highlighting Keyframes for Enhanced Video Understanding
par: Nie, Ming, et autres
Publié: (2025)
par: Nie, Ming, et autres
Publié: (2025)
SlowFocus: Enhancing Fine-grained Temporal Understanding in Video LLM
par: Nie, Ming, et autres
Publié: (2026)
par: Nie, Ming, et autres
Publié: (2026)
SemHiTok: A Unified Image Tokenizer via Semantic-Guided Hierarchical Codebook for Multimodal Understanding and Generation
par: Chen, Zisheng, et autres
Publié: (2025)
par: Chen, Zisheng, et autres
Publié: (2025)
UNIT: Unifying Image and Text Recognition in One Vision Encoder
par: Zhu, Yi, et autres
Publié: (2024)
par: Zhu, Yi, et autres
Publié: (2024)
DuoGen: Towards General Purpose Interleaved Multimodal Generation
par: Shi, Min, et autres
Publié: (2026)
par: Shi, Min, et autres
Publié: (2026)
InterCoG: Towards Spatially Precise Image Editing with Interleaved Chain-of-Grounding Reasoning
par: Wan, Yecong, et autres
Publié: (2026)
par: Wan, Yecong, et autres
Publié: (2026)
Brick-Diffusion: Generating Long Videos with Brick-to-Wall Denoising
par: Yuan, Yunlong, et autres
Publié: (2025)
par: Yuan, Yunlong, et autres
Publié: (2025)
Images in Sentences: Scaling Interleaved Instructions for Unified Visual Generation
par: Zhang, Yabo, et autres
Publié: (2026)
par: Zhang, Yabo, et autres
Publié: (2026)
Group Relative Policy Optimization for Image Captioning
par: Liang, Xu
Publié: (2025)
par: Liang, Xu
Publié: (2025)
ILLUME+: Illuminating Unified MLLM with Dual Visual Tokenization and Diffusion Refinement
par: Huang, Runhui, et autres
Publié: (2025)
par: Huang, Runhui, et autres
Publié: (2025)
UniM: A Unified Any-to-Any Interleaved Multimodal Benchmark
par: Li, Yanlin, et autres
Publié: (2026)
par: Li, Yanlin, et autres
Publié: (2026)
ILLUME: Illuminating Your LLMs to See, Draw, and Self-Enhance
par: Wang, Chunwei, et autres
Publié: (2024)
par: Wang, Chunwei, et autres
Publié: (2024)
Breaking Dual Bottlenecks: Evolving Unified Multimodal Models into Self-Adaptive Interleaved Visual Reasoners
par: Liu, Qingyang, et autres
Publié: (2026)
par: Liu, Qingyang, et autres
Publié: (2026)
Robust Object Detection for Autonomous Driving via Curriculum-Guided Group Relative Policy Optimization
par: Jia, Xu
Publié: (2025)
par: Jia, Xu
Publié: (2025)
DetCLIPv3: Towards Versatile Generative Open-vocabulary Object Detection
par: Yao, Lewei, et autres
Publié: (2024)
par: Yao, Lewei, et autres
Publié: (2024)
UniGRPO: Unified Policy Optimization for Reasoning-Driven Visual Generation
par: Liu, Jie, et autres
Publié: (2026)
par: Liu, Jie, et autres
Publié: (2026)
ARMOR: Empowering Multimodal Understanding Model with Interleaved Multimodal Generation Capability
par: Sun, Jianwen, et autres
Publié: (2025)
par: Sun, Jianwen, et autres
Publié: (2025)
OmniMoGen: Unifying Human Motion Generation via Learning from Interleaved Text-Motion Instructions
par: Bu, Wendong, et autres
Publié: (2025)
par: Bu, Wendong, et autres
Publié: (2025)
Towards Generalized Multi-Image Editing for Unified Multimodal Models
par: Xu, Pengcheng, et autres
Publié: (2026)
par: Xu, Pengcheng, et autres
Publié: (2026)
MME-Unify: A Comprehensive Benchmark for Unified Multimodal Understanding and Generation Models
par: Xie, Wulin, et autres
Publié: (2025)
par: Xie, Wulin, et autres
Publié: (2025)
MedGround-R1: Advancing Medical Image Grounding via Spatial-Semantic Rewarded Group Relative Policy Optimization
par: Xu, Huihui, et autres
Publié: (2025)
par: Xu, Huihui, et autres
Publié: (2025)
From Summary to Action: Enhancing Large Language Models for Complex Tasks with Open World APIs
par: Liu, Yulong, et autres
Publié: (2024)
par: Liu, Yulong, et autres
Publié: (2024)
How Long Can Unified Multimodal Models Generate Images Reliably? Taming Long-Horizon Interleaved Image Generation via Context Curation
par: Chen, Haoyu, et autres
Publié: (2026)
par: Chen, Haoyu, et autres
Publié: (2026)
Rethinking Token-Level Policy Optimization for Multimodal Chain-of-Thought
par: Li, Yunheng, et autres
Publié: (2026)
par: Li, Yunheng, et autres
Publié: (2026)
Contextual AD Narration with Interleaved Multimodal Sequence
par: Wang, Hanlin, et autres
Publié: (2024)
par: Wang, Hanlin, et autres
Publié: (2024)
LaneCorrect: Self-supervised Lane Detection
par: Nie, Ming, et autres
Publié: (2024)
par: Nie, Ming, et autres
Publié: (2024)
Towards Harmless Multimodal Assistants with Blind Preference Optimization
par: Li, Yongqi, et autres
Publié: (2025)
par: Li, Yongqi, et autres
Publié: (2025)
HiRes-LLaVA: Restoring Fragmentation Input in High-Resolution Large Vision-Language Models
par: Huang, Runhui, et autres
Publié: (2024)
par: Huang, Runhui, et autres
Publié: (2024)
Think in Strokes, Not Pixels: Process-Driven Image Generation via Interleaved Reasoning
par: Zhang, Lei, et autres
Publié: (2026)
par: Zhang, Lei, et autres
Publié: (2026)
iFlame: Interleaving Full and Linear Attention for Efficient Mesh Generation
par: Wang, Hanxiao, et autres
Publié: (2025)
par: Wang, Hanxiao, et autres
Publié: (2025)
OmniCorpus: A Unified Multimodal Corpus of 10 Billion-Level Images Interleaved with Text
par: Li, Qingyun, et autres
Publié: (2024)
par: Li, Qingyun, et autres
Publié: (2024)
VINO: A Unified Visual Generator with Interleaved OmniModal Context
par: Chen, Junyi, et autres
Publié: (2026)
par: Chen, Junyi, et autres
Publié: (2026)
MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer
par: Tian, Changyao, et autres
Publié: (2024)
par: Tian, Changyao, et autres
Publié: (2024)
M$^{2}$Chat: Empowering VLM for Multimodal LLM Interleaved Text-Image Generation
par: Chi, Xiaowei, et autres
Publié: (2023)
par: Chi, Xiaowei, et autres
Publié: (2023)
Region-Constrained Group Relative Policy Optimization for Flow-Based Image Editing
par: Ouyang, Zhuohan, et autres
Publié: (2026)
par: Ouyang, Zhuohan, et autres
Publié: (2026)
Learning to Generate via Understanding: Understanding-Driven Intrinsic Rewarding for Unified Multimodal Models
par: Pan, Jiadong, et autres
Publié: (2026)
par: Pan, Jiadong, et autres
Publié: (2026)
DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies
par: Song, Wei, et autres
Publié: (2025)
par: Song, Wei, et autres
Publié: (2025)
Group Critical-token Policy Optimization for Autoregressive Image Generation
par: Zhang, Guohui, et autres
Publié: (2025)
par: Zhang, Guohui, et autres
Publié: (2025)
Query-Kontext: An Unified Multimodal Model for Image Generation and Editing
par: Song, Yuxin, et autres
Publié: (2025)
par: Song, Yuxin, et autres
Publié: (2025)
Documents similaires
-
Reason2Drive: Towards Interpretable and Chain-based Reasoning for Autonomous Driving
par: Nie, Ming, et autres
Publié: (2023) -
KFFocus: Highlighting Keyframes for Enhanced Video Understanding
par: Nie, Ming, et autres
Publié: (2025) -
SlowFocus: Enhancing Fine-grained Temporal Understanding in Video LLM
par: Nie, Ming, et autres
Publié: (2026) -
SemHiTok: A Unified Image Tokenizer via Semantic-Guided Hierarchical Codebook for Multimodal Understanding and Generation
par: Chen, Zisheng, et autres
Publié: (2025) -
UNIT: Unifying Image and Text Recognition in One Vision Encoder
par: Zhu, Yi, et autres
Publié: (2024)