Guardado en:
| Autores principales: | Jiang, Zhizheng, Zhao, Kang, Xu, Weikai, Lin, Xinkui, Liu, Wei, Luan, Jian, Shang, Shuo, Han, Peng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2601.19620 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DetermLR: Augmenting LLM-based Logical Reasoning from Indeterminacy to Determinacy
por: Sun, Hongda, et al.
Publicado: (2023)
por: Sun, Hongda, et al.
Publicado: (2023)
Mobile-Bench-v2: A More Realistic and Comprehensive Benchmark for VLM-based Mobile Agents
por: Xu, Weikai, et al.
Publicado: (2025)
por: Xu, Weikai, et al.
Publicado: (2025)
PMSS: Pretrained Matrices Skeleton Selection for LLM Fine-tuning
por: Wang, Qibin, et al.
Publicado: (2024)
por: Wang, Qibin, et al.
Publicado: (2024)
Mobile-Bench: An Evaluation Benchmark for LLM-based Mobile Agents
por: Deng, Shihan, et al.
Publicado: (2024)
por: Deng, Shihan, et al.
Publicado: (2024)
MobileVLM: A Vision-Language Model for Better Intra- and Inter-UI Understanding
por: Wu, Qinzhuo, et al.
Publicado: (2024)
por: Wu, Qinzhuo, et al.
Publicado: (2024)
Freshness-Aware Prioritized Experience Replay for LLM/VLM Reinforcement Learning
por: Ma, Weiyu, et al.
Publicado: (2026)
por: Ma, Weiyu, et al.
Publicado: (2026)
Reinforcement Learning to Rank Using Coarse-grained Rewards
por: Tu, Yiteng, et al.
Publicado: (2022)
por: Tu, Yiteng, et al.
Publicado: (2022)
R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning
por: Zhao, Qingfei, et al.
Publicado: (2025)
por: Zhao, Qingfei, et al.
Publicado: (2025)
EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models
por: Fang, Yiyang, et al.
Publicado: (2026)
por: Fang, Yiyang, et al.
Publicado: (2026)
Rewarded Region Replay (R3) for Policy Learning with Discrete Action Space
por: Li, Bangzheng, et al.
Publicado: (2024)
por: Li, Bangzheng, et al.
Publicado: (2024)
CoME: Empowering Channel-of-Mobile-Experts with Informative Hybrid-Capabilities Reasoning
por: Liu, Yuxuan, et al.
Publicado: (2026)
por: Liu, Yuxuan, et al.
Publicado: (2026)
DyJR: Preserving Diversity in Reinforcement Learning with Verifiable Rewards via Dynamic Jensen-Shannon Replay
por: Li, Long, et al.
Publicado: (2026)
por: Li, Long, et al.
Publicado: (2026)
RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning
por: Zhang, Hongzhi, et al.
Publicado: (2025)
por: Zhang, Hongzhi, et al.
Publicado: (2025)
End-to-End Optimization of LLM-Driven Multi-Agent Search Systems via Heterogeneous-Group-Based Reinforcement Learning
por: Chen, Guanzhong, et al.
Publicado: (2025)
por: Chen, Guanzhong, et al.
Publicado: (2025)
PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning
por: Dong, Daize, et al.
Publicado: (2026)
por: Dong, Daize, et al.
Publicado: (2026)
Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning
por: Surana, Rohan, et al.
Publicado: (2026)
por: Surana, Rohan, et al.
Publicado: (2026)
MobileIPL: Enhancing Mobile Agents Thinking Process via Iterative Preference Learning
por: Huang, Kun, et al.
Publicado: (2025)
por: Huang, Kun, et al.
Publicado: (2025)
Reinforcement Learning with Inverse Rewards for World Model Post-training
por: Ye, Yang, et al.
Publicado: (2025)
por: Ye, Yang, et al.
Publicado: (2025)
R$^3$-SQL: Ranking Reward and Resampling for Text-to-SQL
por: Han, Hojae, et al.
Publicado: (2026)
por: Han, Hojae, et al.
Publicado: (2026)
Revisiting Vulnerability Patch Localization: An Empirical Study and LLM-Based Solution
por: Xu, Haoran, et al.
Publicado: (2025)
por: Xu, Haoran, et al.
Publicado: (2025)
Self-Rewarding Rubric-Based Reinforcement Learning for Open-Ended Reasoning
por: Ye, Zhiling, et al.
Publicado: (2025)
por: Ye, Zhiling, et al.
Publicado: (2025)
Prioritized Trajectory Replay: A Replay Memory for Data-driven Reinforcement Learning
por: Liu, Jinyi, et al.
Publicado: (2023)
por: Liu, Jinyi, et al.
Publicado: (2023)
Higher Replay Ratio Empowers Sample-Efficient Multi-Agent Reinforcement Learning
por: Xu, Linjie, et al.
Publicado: (2024)
por: Xu, Linjie, et al.
Publicado: (2024)
Sample-efficient LLM Optimization with Reset Replay
por: Liu, Zichuan, et al.
Publicado: (2025)
por: Liu, Zichuan, et al.
Publicado: (2025)
Dynamic Reward Adjustment in Multi-Reward Reinforcement Learning for Counselor Reflection Generation
por: Min, Do June, et al.
Publicado: (2024)
por: Min, Do June, et al.
Publicado: (2024)
Rank-R1: Enhancing Reasoning in LLM-based Document Rerankers via Reinforcement Learning
por: Zhuang, Shengyao, et al.
Publicado: (2025)
por: Zhuang, Shengyao, et al.
Publicado: (2025)
TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning
por: Chen, Yuhui, et al.
Publicado: (2025)
por: Chen, Yuhui, et al.
Publicado: (2025)
Latent Reward: LLM-Empowered Credit Assignment in Episodic Reinforcement Learning
por: Qu, Yun, et al.
Publicado: (2024)
por: Qu, Yun, et al.
Publicado: (2024)
Data-Efficient Learning from Human Interventions for Mobile Robots
por: Peng, Zhenghao, et al.
Publicado: (2025)
por: Peng, Zhenghao, et al.
Publicado: (2025)
If an LLM Were a Character, Would It Know Its Own Story? Evaluating Lifelong Learning in LLMs
por: Fan, Siqi, et al.
Publicado: (2025)
por: Fan, Siqi, et al.
Publicado: (2025)
LaSeR: Reinforcement Learning with Last-Token Self-Rewarding
por: Yang, Wenkai, et al.
Publicado: (2025)
por: Yang, Wenkai, et al.
Publicado: (2025)
Enabling Option Learning in Sparse Rewards with Hindsight Experience Replay
por: Romio, Gabriel, et al.
Publicado: (2026)
por: Romio, Gabriel, et al.
Publicado: (2026)
GUI-Shift: Enhancing VLM-Based GUI Agents through Self-supervised Reinforcement Learning
por: Gao, Longxi, et al.
Publicado: (2025)
por: Gao, Longxi, et al.
Publicado: (2025)
Multi-Agent Reinforcement Learning with Submodular Reward
por: Chen, Wenjing, et al.
Publicado: (2026)
por: Chen, Wenjing, et al.
Publicado: (2026)
An Initial Investigation of Neural Replay Simulator for Over-the-Air Adversarial Perturbations to Automatic Speaker Verification
por: Li, Jiaqi, et al.
Publicado: (2023)
por: Li, Jiaqi, et al.
Publicado: (2023)
R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning
por: Zhang, Yi-Fan, et al.
Publicado: (2025)
por: Zhang, Yi-Fan, et al.
Publicado: (2025)
More is not always better? Enhancing Many-Shot In-Context Learning with Differentiated and Reweighting Objectives
por: Zhang, Xiaoqing, et al.
Publicado: (2025)
por: Zhang, Xiaoqing, et al.
Publicado: (2025)
Sample Efficient Experience Replay in Non-stationary Environments
por: Duan, Tianyang, et al.
Publicado: (2025)
por: Duan, Tianyang, et al.
Publicado: (2025)
Distribution-Aware Reward: Reinforcement Learning over Predictive Distributions for LLM Regression
por: Park, Jungsoo, et al.
Publicado: (2026)
por: Park, Jungsoo, et al.
Publicado: (2026)
Perception-R1: Pioneering Perception Policy with Reinforcement Learning
por: Yu, En, et al.
Publicado: (2025)
por: Yu, En, et al.
Publicado: (2025)
Ejemplares similares
-
DetermLR: Augmenting LLM-based Logical Reasoning from Indeterminacy to Determinacy
por: Sun, Hongda, et al.
Publicado: (2023) -
Mobile-Bench-v2: A More Realistic and Comprehensive Benchmark for VLM-based Mobile Agents
por: Xu, Weikai, et al.
Publicado: (2025) -
PMSS: Pretrained Matrices Skeleton Selection for LLM Fine-tuning
por: Wang, Qibin, et al.
Publicado: (2024) -
Mobile-Bench: An Evaluation Benchmark for LLM-based Mobile Agents
por: Deng, Shihan, et al.
Publicado: (2024) -
MobileVLM: A Vision-Language Model for Better Intra- and Inter-UI Understanding
por: Wu, Qinzhuo, et al.
Publicado: (2024)