A Rolling Stone Gathers No Moss: Adaptive Policy Optimization for Stable Self-Evaluation in Large Multimodal Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Wenkai, Guo, Hongcan, Lv, Zheqi, Zhang, Shengyu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Cascaded Self-Evaluation Augmented Training for Lightweight Multimodal LLMs
di: Lv, Zheqi, et al.
Pubblicazione: (2025)
di: Lv, Zheqi, et al.
Pubblicazione: (2025)
ModelGPT: Unleashing LLM's Capabilities for Tailored Model Generation
di: Tang, Zihao, et al.
Pubblicazione: (2024)
di: Tang, Zihao, et al.
Pubblicazione: (2024)
Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding
di: Wang, Wenkai, et al.
Pubblicazione: (2026)
di: Wang, Wenkai, et al.
Pubblicazione: (2026)
Scaling and Transferability of Annealing Strategies in Large Language Model Training
di: Wang, Siqi, et al.
Pubblicazione: (2025)
di: Wang, Siqi, et al.
Pubblicazione: (2025)
MadaKV: Adaptive Modality-Perception KV Cache Eviction for Efficient Multimodal Long-Context Inference
di: Li, Kunxi, et al.
Pubblicazione: (2025)
di: Li, Kunxi, et al.
Pubblicazione: (2025)
Unearthing Gems from Stones: Policy Optimization with Negative Sample Augmentation for LLM Reasoning
di: Yang, Zhaohui, et al.
Pubblicazione: (2025)
di: Yang, Zhaohui, et al.
Pubblicazione: (2025)
Enhancing Large Multimodal Models with Adaptive Sparsity and KV Cache Compression
di: Zhang, Te, et al.
Pubblicazione: (2025)
di: Zhang, Te, et al.
Pubblicazione: (2025)
AGPO: Adaptive Group Policy Optimization with Dual Statistical Feedback
di: Hu, Miaobo, et al.
Pubblicazione: (2026)
di: Hu, Miaobo, et al.
Pubblicazione: (2026)
Trust-Region Adaptive Policy Optimization
di: Su, Mingyu, et al.
Pubblicazione: (2025)
di: Su, Mingyu, et al.
Pubblicazione: (2025)
LEPO: Latent Reasoning Policy Optimization for Large Language Models
di: Zhou, Yuyan, et al.
Pubblicazione: (2026)
di: Zhou, Yuyan, et al.
Pubblicazione: (2026)
Provable and Practical In-Context Policy Optimization for Self-Improvement
di: Yu, Tianrun, et al.
Pubblicazione: (2026)
di: Yu, Tianrun, et al.
Pubblicazione: (2026)
Gradient-Adaptive Policy Optimization: Towards Multi-Objective Alignment of Large Language Models
di: Li, Chengao, et al.
Pubblicazione: (2025)
di: Li, Chengao, et al.
Pubblicazione: (2025)
Unifying Group-Relative and Self-Distillation Policy Optimization via Sample Routing
di: Li, Gengsheng, et al.
Pubblicazione: (2026)
di: Li, Gengsheng, et al.
Pubblicazione: (2026)
Stable On-Policy Distillation through Adaptive Target Reformulation
di: Jang, Ijun, et al.
Pubblicazione: (2026)
di: Jang, Ijun, et al.
Pubblicazione: (2026)
Proximal Policy Optimization with Adaptive Exploration
di: Lixandru, Andrei
Pubblicazione: (2024)
di: Lixandru, Andrei
Pubblicazione: (2024)
Lyapunov-Stable Adaptive Control for Multimodal Concept Drift
di: Pan, Tianyu Bell, et al.
Pubblicazione: (2025)
di: Pan, Tianyu Bell, et al.
Pubblicazione: (2025)
Variational Delayed Policy Optimization
di: Wu, Qingyuan, et al.
Pubblicazione: (2024)
di: Wu, Qingyuan, et al.
Pubblicazione: (2024)
Continual Task Learning through Adaptive Policy Self-Composition
di: Hu, Shengchao, et al.
Pubblicazione: (2024)
di: Hu, Shengchao, et al.
Pubblicazione: (2024)
Adaptive Divergence Regularized Policy Optimization for Fine-tuning Generative Models
di: Fan, Jiajun, et al.
Pubblicazione: (2025)
di: Fan, Jiajun, et al.
Pubblicazione: (2025)
GEPO: Group Expectation Policy Optimization for Stable Heterogeneous Reinforcement Learning
di: Zhang, Han, et al.
Pubblicazione: (2025)
di: Zhang, Han, et al.
Pubblicazione: (2025)
Sequential Policy Gradient for Adaptive Hyperparameter Optimization
di: Li, Zheng, et al.
Pubblicazione: (2025)
di: Li, Zheng, et al.
Pubblicazione: (2025)
Offline Policy Evaluation for Reinforcement Learning with Adaptively Collected Data
di: Madhow, Sunil, et al.
Pubblicazione: (2023)
di: Madhow, Sunil, et al.
Pubblicazione: (2023)
One-Way Policy Optimization for Self-Evolving LLMs
di: Yang, Shuo, et al.
Pubblicazione: (2026)
di: Yang, Shuo, et al.
Pubblicazione: (2026)
GVPO: Group Variance Policy Optimization for Large Language Model Post-Training
di: Zhang, Kaichen, et al.
Pubblicazione: (2025)
di: Zhang, Kaichen, et al.
Pubblicazione: (2025)
Structured Role-Aware Policy Optimization for Multimodal Reasoning
di: Jiang, Bingqing, et al.
Pubblicazione: (2026)
di: Jiang, Bingqing, et al.
Pubblicazione: (2026)
Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training
di: Fakoor, Rasool, et al.
Pubblicazione: (2026)
di: Fakoor, Rasool, et al.
Pubblicazione: (2026)
PULSE: Practical Evaluation Scenarios for Large Multimodal Model Unlearning
di: Kawakami, Tatsuki, et al.
Pubblicazione: (2025)
di: Kawakami, Tatsuki, et al.
Pubblicazione: (2025)
Understanding the Skill Gap in Recurrent Language Models: The Role of the Gather-and-Aggregate Mechanism
di: Bick, Aviv, et al.
Pubblicazione: (2025)
di: Bick, Aviv, et al.
Pubblicazione: (2025)
Adaptive Acquisition Selection for Bayesian Optimization with Large Language Models
di: Ngo, Giang, et al.
Pubblicazione: (2026)
di: Ngo, Giang, et al.
Pubblicazione: (2026)
Bridging Visualization and Optimization: Multimodal Large Language Models on Graph-Structured Combinatorial Optimization
di: Zhao, Jie, et al.
Pubblicazione: (2025)
di: Zhao, Jie, et al.
Pubblicazione: (2025)
AdaReasoner: Adaptive Reasoning Enables More Flexible Thinking in Large Language Models
di: Wang, Xiangqi, et al.
Pubblicazione: (2025)
di: Wang, Xiangqi, et al.
Pubblicazione: (2025)
Adaptive Exploration for Multi-Reward Multi-Policy Evaluation
di: Russo, Alessio, et al.
Pubblicazione: (2025)
di: Russo, Alessio, et al.
Pubblicazione: (2025)
BAPO: Stabilizing Off-Policy Reinforcement Learning for LLMs via Balanced Policy Optimization with Adaptive Clipping
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
Metis: Learning to Jailbreak LLMs via Self-Evolving Metacognitive Policy Optimization
di: Zhou, Huilin, et al.
Pubblicazione: (2026)
di: Zhou, Huilin, et al.
Pubblicazione: (2026)
Soft Adaptive Policy Optimization
di: Gao, Chang, et al.
Pubblicazione: (2025)
di: Gao, Chang, et al.
Pubblicazione: (2025)
HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime
di: Sana, Mohamed, et al.
Pubblicazione: (2026)
di: Sana, Mohamed, et al.
Pubblicazione: (2026)
VESPO: Variational Sequence-Level Soft Policy Optimization for Stable Off-Policy LLM Training
di: Shen, Guobin, et al.
Pubblicazione: (2026)
di: Shen, Guobin, et al.
Pubblicazione: (2026)
Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe
di: Li, Yaxuan, et al.
Pubblicazione: (2026)
di: Li, Yaxuan, et al.
Pubblicazione: (2026)
Adaptive Diffusion Policy Optimization for Robotic Manipulation
di: Jiang, Huiyun, et al.
Pubblicazione: (2025)
di: Jiang, Huiyun, et al.
Pubblicazione: (2025)
DVPO: Distributional Value Modeling-based Policy Optimization for LLM Post-Training
di: Zhu, Dingwei, et al.
Pubblicazione: (2025)
di: Zhu, Dingwei, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Cascaded Self-Evaluation Augmented Training for Lightweight Multimodal LLMs
di: Lv, Zheqi, et al.
Pubblicazione: (2025) -
ModelGPT: Unleashing LLM's Capabilities for Tailored Model Generation
di: Tang, Zihao, et al.
Pubblicazione: (2024) -
Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding
di: Wang, Wenkai, et al.
Pubblicazione: (2026) -
Scaling and Transferability of Annealing Strategies in Large Language Model Training
di: Wang, Siqi, et al.
Pubblicazione: (2025) -
MadaKV: Adaptive Modality-Perception KV Cache Eviction for Efficient Multimodal Long-Context Inference
di: Li, Kunxi, et al.
Pubblicazione: (2025)