MMRPT: MultiModal Reinforcement Pre-Training via Masked Vision-Dependent Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Zheng, Xuhui, An, Kang, Wang, Ziliang, Wang, Yuhang, Qian, Faqiang, Wu, Yichao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark
por: Hao, Yunzhuo, et al.
Publicado: (2025)
por: Hao, Yunzhuo, et al.
Publicado: (2025)
ProM3E: Probabilistic Masked MultiModal Embedding Model for Ecology
por: Sastry, Srikumar, et al.
Publicado: (2025)
por: Sastry, Srikumar, et al.
Publicado: (2025)
MM-R5: MultiModal Reasoning-Enhanced ReRanker via Reinforcement Learning for Document Retrieval
por: Xu, Mingjun, et al.
Publicado: (2025)
por: Xu, Mingjun, et al.
Publicado: (2025)
MultiModal Action Conditioned Video Generation
por: Li, Yichen, et al.
Publicado: (2025)
por: Li, Yichen, et al.
Publicado: (2025)
MultiModal Fine-tuning with Synthetic Captions
por: Enomoto, Shohei, et al.
Publicado: (2026)
por: Enomoto, Shohei, et al.
Publicado: (2026)
CapS-Adapter: Caption-based MultiModal Adapter in Zero-Shot Classification
por: Wang, Qijie, et al.
Publicado: (2024)
por: Wang, Qijie, et al.
Publicado: (2024)
TeamPath: Building MultiModal Pathology Experts with Reasoning AI Copilots
por: Liu, Tianyu, et al.
Publicado: (2025)
por: Liu, Tianyu, et al.
Publicado: (2025)
Multi-Modal Soccer Scene Analysis with Masked Pre-Training
por: Peral, Marc, et al.
Publicado: (2025)
por: Peral, Marc, et al.
Publicado: (2025)
MMA-Diffusion: MultiModal Attack on Diffusion Models
por: Yang, Yijun, et al.
Publicado: (2023)
por: Yang, Yijun, et al.
Publicado: (2023)
M3: 3D-Spatial MultiModal Memory
por: Zou, Xueyan, et al.
Publicado: (2025)
por: Zou, Xueyan, et al.
Publicado: (2025)
ControlEdit: A MultiModal Local Clothing Image Editing Method
por: Cheng, Di, et al.
Publicado: (2024)
por: Cheng, Di, et al.
Publicado: (2024)
M3FAS: An Accurate and Robust MultiModal Mobile Face Anti-Spoofing System
por: Kong, Chenqi, et al.
Publicado: (2023)
por: Kong, Chenqi, et al.
Publicado: (2023)
MMCORE: MultiModal COnnection with Representation Aligned Latent Embeddings
por: Li, Zijie, et al.
Publicado: (2026)
por: Li, Zijie, et al.
Publicado: (2026)
Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation
por: Chen, Yuheng, et al.
Publicado: (2026)
por: Chen, Yuheng, et al.
Publicado: (2026)
Re-M3Dr: Rebalanced MultiModal Mean Deviation Regression
por: Yin, Haojie, et al.
Publicado: (2026)
por: Yin, Haojie, et al.
Publicado: (2026)
An Experimental Study on Exploring Strong Lightweight Vision Transformers via Masked Image Modeling Pre-Training
por: Gao, Jin, et al.
Publicado: (2024)
por: Gao, Jin, et al.
Publicado: (2024)
MM-MoralBench: A MultiModal Moral Evaluation Benchmark for Large Vision-Language Models
por: Yan, Bei, et al.
Publicado: (2024)
por: Yan, Bei, et al.
Publicado: (2024)
Visual-Oriented Fine-Grained Knowledge Editing for MultiModal Large Language Models
por: Zeng, Zhen, et al.
Publicado: (2024)
por: Zeng, Zhen, et al.
Publicado: (2024)
HAMMR: HierArchical MultiModal React agents for generic VQA
por: Castrejon, Lluis, et al.
Publicado: (2024)
por: Castrejon, Lluis, et al.
Publicado: (2024)
LongHalQA: Long-Context Hallucination Evaluation for MultiModal Large Language Models
por: Qiu, Han, et al.
Publicado: (2024)
por: Qiu, Han, et al.
Publicado: (2024)
M$^2$CD: A Unified MultiModal Framework for Optical-SAR Change Detection with Mixture of Experts and Self-Distillation
por: Liu, Ziyuan, et al.
Publicado: (2025)
por: Liu, Ziyuan, et al.
Publicado: (2025)
From Seconds to Hours: Reviewing MultiModal Large Language Models on Comprehensive Long Video Understanding
por: Zou, Heqing, et al.
Publicado: (2024)
por: Zou, Heqing, et al.
Publicado: (2024)
MaskFuser: Masked Fusion of Joint Multi-Modal Tokenization for End-to-End Autonomous Driving
por: Duan, Yiqun, et al.
Publicado: (2024)
por: Duan, Yiqun, et al.
Publicado: (2024)
Asymmetric Masked Distillation for Pre-Training Small Foundation Models
por: Zhao, Zhiyu, et al.
Publicado: (2023)
por: Zhao, Zhiyu, et al.
Publicado: (2023)
ViTCN: Vision Transformer Contrastive Network For Reasoning
por: Song, Bo, et al.
Publicado: (2024)
por: Song, Bo, et al.
Publicado: (2024)
CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder
por: Ma, Lichen, et al.
Publicado: (2024)
por: Ma, Lichen, et al.
Publicado: (2024)
Reliable Multi-Modal Object Re-Identification via Modality-Aware Graph Reasoning
por: Wan, Xixi, et al.
Publicado: (2025)
por: Wan, Xixi, et al.
Publicado: (2025)
Robust Pre-Training of Medical Vision-and-Language Models with Domain-Invariant Multi-Modal Masked Reconstruction
por: Filvantorkaman, Melika, et al.
Publicado: (2026)
por: Filvantorkaman, Melika, et al.
Publicado: (2026)
MiM: Mask in Mask Self-Supervised Pre-Training for 3D Medical Image Analysis
por: Zhuang, Jiaxin, et al.
Publicado: (2024)
por: Zhuang, Jiaxin, et al.
Publicado: (2024)
MMA-DFER: MultiModal Adaptation of unimodal models for Dynamic Facial Expression Recognition in-the-wild
por: Chumachenko, Kateryna, et al.
Publicado: (2024)
por: Chumachenko, Kateryna, et al.
Publicado: (2024)
M3R: Localized Rainfall Nowcasting with Meteorology-Informed MultiModal Attention
por: Panta, Sanjeev, et al.
Publicado: (2026)
por: Panta, Sanjeev, et al.
Publicado: (2026)
Multi-Modal Image Fusion via Intervention-Stable Feature Learning
por: Wang, Xue, et al.
Publicado: (2026)
por: Wang, Xue, et al.
Publicado: (2026)
WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning
por: Yang, Jie, et al.
Publicado: (2025)
por: Yang, Jie, et al.
Publicado: (2025)
A Two-Stage Progressive Pre-training using Multi-Modal Contrastive Masked Autoencoders
por: Jamal, Muhammad Abdullah, et al.
Publicado: (2024)
por: Jamal, Muhammad Abdullah, et al.
Publicado: (2024)
Classification Done Right for Vision-Language Pre-Training
por: Huang, Zilong, et al.
Publicado: (2024)
por: Huang, Zilong, et al.
Publicado: (2024)
Pre-Trained Vision-Language Models as Partial Annotators
por: Wang, Qian-Wei, et al.
Publicado: (2024)
por: Wang, Qian-Wei, et al.
Publicado: (2024)
Muskie: Multi-view Masked Image Modeling for 3D Vision Pre-training
por: Li, Wenyu, et al.
Publicado: (2025)
por: Li, Wenyu, et al.
Publicado: (2025)
Efficient Vision-Language Pre-training by Cluster Masking
por: Wei, Zihao, et al.
Publicado: (2024)
por: Wei, Zihao, et al.
Publicado: (2024)
Think or Not? Selective Reasoning via Reinforcement Learning for Vision-Language Models
por: Wang, Jiaqi, et al.
Publicado: (2025)
por: Wang, Jiaqi, et al.
Publicado: (2025)
Learning to Mask and Permute Visual Tokens for Vision Transformer Pre-Training
por: Baraldi, Lorenzo, et al.
Publicado: (2023)
por: Baraldi, Lorenzo, et al.
Publicado: (2023)
Ejemplares similares
-
Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark
por: Hao, Yunzhuo, et al.
Publicado: (2025) -
ProM3E: Probabilistic Masked MultiModal Embedding Model for Ecology
por: Sastry, Srikumar, et al.
Publicado: (2025) -
MM-R5: MultiModal Reasoning-Enhanced ReRanker via Reinforcement Learning for Document Retrieval
por: Xu, Mingjun, et al.
Publicado: (2025) -
MultiModal Action Conditioned Video Generation
por: Li, Yichen, et al.
Publicado: (2025) -
MultiModal Fine-tuning with Synthetic Captions
por: Enomoto, Shohei, et al.
Publicado: (2026)