MEML-GRPO: Heterogeneous Multi-Expert Mutual Learning for RLVR Advancement
Fuente:
arXiv
Guardado en:
| Autores principales: | Jia, Weitao, Lu, Jinghui, Yu, Haiyang, Wang, Siqi, Tang, Guozhi, Wang, An-Lan, Yin, Weijie, Yang, Dingkang, Nie, Yuxiang, Shan, Bin, Feng, Hao, Li, Irene, Yang, Kun, Wang, Han, Tang, Jingqun, Fu, Teng, Jin, Changhong, Feng, Chao, Lv, Xiaohui, Huang, Can |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ChineseVideoBench: Benchmarking Multi-modal Large Models for Chinese Video Question Answering
por: Nie, Yuxiang, et al.
Publicado: (2025)
por: Nie, Yuxiang, et al.
Publicado: (2025)
Prolonged Reasoning Is Not All You Need: Certainty-Based Adaptive Routing for Efficient LLM/MLLM Reasoning
por: Lu, Jinghui, et al.
Publicado: (2025)
por: Lu, Jinghui, et al.
Publicado: (2025)
Vision as LoRA
por: Wang, Han, et al.
Publicado: (2025)
por: Wang, Han, et al.
Publicado: (2025)
TextPecker: Rewarding Structural Anomaly Quantification for Enhancing Visual Text Rendering
por: Zhu, Hanshen, et al.
Publicado: (2026)
por: Zhu, Hanshen, et al.
Publicado: (2026)
A Bounding Box is Worth One Token: Interleaving Layout and Text in a Large Language Model for Document Understanding
por: Lu, Jinghui, et al.
Publicado: (2024)
por: Lu, Jinghui, et al.
Publicado: (2024)
Advancing Sequential Numerical Prediction in Autoregressive Models
por: Fei, Xiang, et al.
Publicado: (2025)
por: Fei, Xiang, et al.
Publicado: (2025)
MCTBench: Multimodal Cognition towards Text-Rich Visual Scenes Benchmark
por: Shan, Bin, et al.
Publicado: (2024)
por: Shan, Bin, et al.
Publicado: (2024)
Resolving Evidence Sparsity: Agentic Context Engineering for Long-Document Understanding
por: Liu, Keliang, et al.
Publicado: (2025)
por: Liu, Keliang, et al.
Publicado: (2025)
ProFocus: Proactive Perception and Focused Reasoning in Vision-and-Language Navigation
por: Xue, Wei, et al.
Publicado: (2026)
por: Xue, Wei, et al.
Publicado: (2026)
CME-CAD: Heterogeneous Collaborative Multi-Expert Reinforcement Learning for CAD Code Generation
por: Niu, Ke, et al.
Publicado: (2025)
por: Niu, Ke, et al.
Publicado: (2025)
Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning
por: Yu, Haiyang, et al.
Publicado: (2025)
por: Yu, Haiyang, et al.
Publicado: (2025)
EVE: Towards End-to-End Video Subtitle Extraction with Vision-Language Models
por: Yu, Haiyang, et al.
Publicado: (2025)
por: Yu, Haiyang, et al.
Publicado: (2025)
Post-Completion Learning for Language Models
por: Fei, Xiang, et al.
Publicado: (2025)
por: Fei, Xiang, et al.
Publicado: (2025)
Dolphin-v2: Universal Document Parsing via Scalable Anchor Prompting
por: Feng, Hao, et al.
Publicado: (2026)
por: Feng, Hao, et al.
Publicado: (2026)
Dynamic-VLM: Simple Dynamic Visual Token Compression for VideoLLM
por: Wang, Han, et al.
Publicado: (2024)
por: Wang, Han, et al.
Publicado: (2024)
LaF-GRPO: In-Situ Navigation Instruction Generation for the Visually Impaired via GRPO with LLM-as-Follower Reward
por: Zhao, Yi, et al.
Publicado: (2025)
por: Zhao, Yi, et al.
Publicado: (2025)
ParGo: Bridging Vision-Language with Partial and Global Views
por: Wang, An-Lan, et al.
Publicado: (2024)
por: Wang, An-Lan, et al.
Publicado: (2024)
Efficient RLVR Training via Weighted Mutual Information Data Selection
por: Zhou, Xinyu, et al.
Publicado: (2026)
por: Zhou, Xinyu, et al.
Publicado: (2026)
STAGE: Stable and Generalizable GRPO for Autoregressive Image Generation
por: Ma, Xiaoxiao, et al.
Publicado: (2025)
por: Ma, Xiaoxiao, et al.
Publicado: (2025)
Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle
por: Liu, Keliang, et al.
Publicado: (2025)
por: Liu, Keliang, et al.
Publicado: (2025)
Not only where, But when: Temporal Scheduling for RLVR
por: Zhang, Jinghao, et al.
Publicado: (2026)
por: Zhang, Jinghao, et al.
Publicado: (2026)
Beyond Pixel Simulation: Pathology Image Generation via Diagnostic Semantic Tokens and Prototype Control
por: Han, Minghao, et al.
Publicado: (2025)
por: Han, Minghao, et al.
Publicado: (2025)
Exploring Cross-lingual Latent Transplantation: Mutual Opportunities and Open Challenges
por: Ye, Yangfan, et al.
Publicado: (2024)
por: Ye, Yangfan, et al.
Publicado: (2024)
WildDoc: How Far Are We from Achieving Comprehensive and Robust Document Understanding in the Wild?
por: Wang, An-Lan, et al.
Publicado: (2025)
por: Wang, An-Lan, et al.
Publicado: (2025)
Highly Stereoselective Synthesis of Oligosaccharides Motifs From Stichopus herrmanni Fucan Sulfate With Anticoagulant Activities
por: Siqi Li, et al.
Publicado: (2026)
por: Siqi Li, et al.
Publicado: (2026)
DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding
por: Feng, Hao, et al.
Publicado: (2023)
por: Feng, Hao, et al.
Publicado: (2023)
SR-GRPO: Stable Rank as an Intrinsic Geometric Reward for Large Language Model Alignment
por: Tang, Yixuan, et al.
Publicado: (2025)
por: Tang, Yixuan, et al.
Publicado: (2025)
Depth-Breadth Synergy in RLVR: Unlocking LLM Reasoning Gains with Adaptive Exploration
por: Yang, Zhicheng, et al.
Publicado: (2025)
por: Yang, Zhicheng, et al.
Publicado: (2025)
Self-Distilled RLVR
por: Yang, Chenxu, et al.
Publicado: (2026)
por: Yang, Chenxu, et al.
Publicado: (2026)
SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization
por: Chen, Minghan, et al.
Publicado: (2025)
por: Chen, Minghan, et al.
Publicado: (2025)
PlexRL: Cluster-Level Orchestration of Serviceized LLM Execution for RLVR
por: Zhang, Yiqi, et al.
Publicado: (2026)
por: Zhang, Yiqi, et al.
Publicado: (2026)
Multi-Scale Heterogeneity-Aware Hypergraph Representation for Histopathology Whole Slide Images
por: Han, Minghao, et al.
Publicado: (2024)
por: Han, Minghao, et al.
Publicado: (2024)
SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement
por: Yin, Weijie, et al.
Publicado: (2025)
por: Yin, Weijie, et al.
Publicado: (2025)
Therapeutic strategies for aberrant splicing in cancer and genetic disorders
por: Wenhua Shi, et al.
Publicado: (2024)
por: Wenhua Shi, et al.
Publicado: (2024)
Rethinking Entropy Interventions in RLVR: An Entropy Change Perspective
por: Hao, Zhezheng, et al.
Publicado: (2025)
por: Hao, Zhezheng, et al.
Publicado: (2025)
Mutual Learning for Acoustic Matching and Dereverberation via Visual Scene-driven Diffusion
por: Ma, Jian, et al.
Publicado: (2024)
por: Ma, Jian, et al.
Publicado: (2024)
Elysium: Exploring Object-level Perception in Videos via MLLM
por: Wang, Han, et al.
Publicado: (2024)
por: Wang, Han, et al.
Publicado: (2024)
GTPO and GRPO-S: Token and Sequence-Level Reward Shaping with Policy Entropy
por: Tan, Hongze, et al.
Publicado: (2025)
por: Tan, Hongze, et al.
Publicado: (2025)
IntelliAsk: Learning to Ask High-Quality Research Questions via RLVR
por: Sharma, Karun, et al.
Publicado: (2026)
por: Sharma, Karun, et al.
Publicado: (2026)
Flexible Entropy Control in RLVR with a Gradient-Preserving Perspective
por: Chen, Kun, et al.
Publicado: (2026)
por: Chen, Kun, et al.
Publicado: (2026)
Ejemplares similares
-
ChineseVideoBench: Benchmarking Multi-modal Large Models for Chinese Video Question Answering
por: Nie, Yuxiang, et al.
Publicado: (2025) -
Prolonged Reasoning Is Not All You Need: Certainty-Based Adaptive Routing for Efficient LLM/MLLM Reasoning
por: Lu, Jinghui, et al.
Publicado: (2025) -
Vision as LoRA
por: Wang, Han, et al.
Publicado: (2025) -
TextPecker: Rewarding Structural Anomaly Quantification for Enhancing Visual Text Rendering
por: Zhu, Hanshen, et al.
Publicado: (2026) -
A Bounding Box is Worth One Token: Interleaving Layout and Text in a Large Language Model for Document Understanding
por: Lu, Jinghui, et al.
Publicado: (2024)