Salvato in:
| Autori principali: | Zhou, Runlong, Du, Simon S., Li, Beibin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2402.12621 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
The Crucial Role of Samplers in Online Direct Preference Optimization
di: Shi, Ruizhe, et al.
Pubblicazione: (2024)
di: Shi, Ruizhe, et al.
Pubblicazione: (2024)
DuoGuard: A Two-Player RL-Driven Framework for Multilingual LLM Guardrails
di: Deng, Yihe, et al.
Pubblicazione: (2025)
di: Deng, Yihe, et al.
Pubblicazione: (2025)
Offline RL by Reward-Weighted Fine-Tuning for Conversation Optimization
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2025)
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2025)
REA-RL: Reflection-Aware Online Reinforcement Learning for Efficient Reasoning
di: Deng, Hexuan, et al.
Pubblicazione: (2025)
di: Deng, Hexuan, et al.
Pubblicazione: (2025)
Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models
di: Li, Pengyi, et al.
Pubblicazione: (2025)
di: Li, Pengyi, et al.
Pubblicazione: (2025)
Generative Model for Small Molecules with Latent Space RL Fine-Tuning to Protein Targets
di: Sob, Ulrich A. Mbou, et al.
Pubblicazione: (2024)
di: Sob, Ulrich A. Mbou, et al.
Pubblicazione: (2024)
Ignore the KL Penalty! Boosting Exploration on Critical Tokens to Enhance RL Fine-Tuning
di: Vassoyan, Jean, et al.
Pubblicazione: (2025)
di: Vassoyan, Jean, et al.
Pubblicazione: (2025)
Learn Hard Problems During RL with Reference Guided Fine-tuning
di: Wu, Yangzhen, et al.
Pubblicazione: (2026)
di: Wu, Yangzhen, et al.
Pubblicazione: (2026)
Alchemist: Towards the Design of Efficient Online Continual Learning System
di: Huang, Yuyang, et al.
Pubblicazione: (2025)
di: Huang, Yuyang, et al.
Pubblicazione: (2025)
Beyond Markovian: Reflective Exploration via Bayes-Adaptive RL for LLM Reasoning
di: Zhang, Shenao, et al.
Pubblicazione: (2025)
di: Zhang, Shenao, et al.
Pubblicazione: (2025)
Understanding the Performance Gap in Preference Learning: A Dichotomy of RLHF and DPO
di: Shi, Ruizhe, et al.
Pubblicazione: (2025)
di: Shi, Ruizhe, et al.
Pubblicazione: (2025)
CASCADE Your Datasets for Cross-Mode Knowledge Retrieval of Language Models
di: Zhou, Runlong, et al.
Pubblicazione: (2025)
di: Zhou, Runlong, et al.
Pubblicazione: (2025)
RL Grokking Recipe: How Does RL Unlock and Transfer New Algorithms in LLMs?
di: Sun, Yiyou, et al.
Pubblicazione: (2025)
di: Sun, Yiyou, et al.
Pubblicazione: (2025)
On-Policy RL with Optimal Reward Baseline
di: Hao, Yaru, et al.
Pubblicazione: (2025)
di: Hao, Yaru, et al.
Pubblicazione: (2025)
MobileGUI-RL: Advancing Mobile GUI Agent through Reinforcement Learning in Online Environment
di: Shi, Yucheng, et al.
Pubblicazione: (2025)
di: Shi, Yucheng, et al.
Pubblicazione: (2025)
GLIDE-RL: Grounded Language Instruction through DEmonstration in RL
di: Kharyal, Chaitanya, et al.
Pubblicazione: (2024)
di: Kharyal, Chaitanya, et al.
Pubblicazione: (2024)
Hard Prompts Made Interpretable: Sparse Entropy Regularization for Prompt Tuning with RL
di: Choi, Yunseon, et al.
Pubblicazione: (2024)
di: Choi, Yunseon, et al.
Pubblicazione: (2024)
ContextRL: Enhancing MLLM's Knowledge Discovery Efficiency with Context-Augmented RL
di: Lu, Xingyu, et al.
Pubblicazione: (2026)
di: Lu, Xingyu, et al.
Pubblicazione: (2026)
Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone
di: Mark, Max Sobol, et al.
Pubblicazione: (2024)
di: Mark, Max Sobol, et al.
Pubblicazione: (2024)
Diagnosing and Mitigating System Bias in Self-Rewarding RL
di: Tan, Chuyi, et al.
Pubblicazione: (2025)
di: Tan, Chuyi, et al.
Pubblicazione: (2025)
Blockwise Advantage Estimation for Multi-Objective RL with Verifiable Rewards
di: Pavlenko, Kirill, et al.
Pubblicazione: (2026)
di: Pavlenko, Kirill, et al.
Pubblicazione: (2026)
LIMR: Less is More for RL Scaling
di: Li, Xuefeng, et al.
Pubblicazione: (2025)
di: Li, Xuefeng, et al.
Pubblicazione: (2025)
UFO-RL: Uncertainty-Focused Optimization for Efficient Reinforcement Learning Data Selection
di: Zhao, Yang, et al.
Pubblicazione: (2025)
di: Zhao, Yang, et al.
Pubblicazione: (2025)
Large Language Models as Agents in Two-Player Games
di: Liu, Yang, et al.
Pubblicazione: (2024)
di: Liu, Yang, et al.
Pubblicazione: (2024)
Compositional preference models for aligning LMs
di: Go, Dongyoung, et al.
Pubblicazione: (2023)
di: Go, Dongyoung, et al.
Pubblicazione: (2023)
ReflectDiffu:Reflect between Emotion-intent Contagion and Mimicry for Empathetic Response Generation via a RL-Diffusion Framework
di: Yuan, Jiahao, et al.
Pubblicazione: (2024)
di: Yuan, Jiahao, et al.
Pubblicazione: (2024)
DISA: Offline Importance Sampling for Distribution-Matching LLM-RL
di: Wang, Shaobo, et al.
Pubblicazione: (2026)
di: Wang, Shaobo, et al.
Pubblicazione: (2026)
ReLook: Vision-Grounded RL with a Multimodal LLM Critic for Agentic Web Coding
di: Li, Yuhang, et al.
Pubblicazione: (2025)
di: Li, Yuhang, et al.
Pubblicazione: (2025)
TreeRL: LLM Reinforcement Learning with On-Policy Tree Search
di: Hou, Zhenyu, et al.
Pubblicazione: (2025)
di: Hou, Zhenyu, et al.
Pubblicazione: (2025)
Scaling In-Context Online Learning Capability of LLMs via Cross-Episode Meta-RL
di: Lin, Xiaofeng, et al.
Pubblicazione: (2026)
di: Lin, Xiaofeng, et al.
Pubblicazione: (2026)
Small Language Models for Application Interactions: A Case Study
di: Li, Beibin, et al.
Pubblicazione: (2024)
di: Li, Beibin, et al.
Pubblicazione: (2024)
Attention as a Compass: Efficient Exploration for Process-Supervised RL in Reasoning Models
di: Liu, Runze, et al.
Pubblicazione: (2025)
di: Liu, Runze, et al.
Pubblicazione: (2025)
Endless Terminals: Scaling RL Environments for Terminal Agents
di: Gandhi, Kanishk, et al.
Pubblicazione: (2026)
di: Gandhi, Kanishk, et al.
Pubblicazione: (2026)
Enabling Approximate Joint Sampling in Diffusion LMs
di: Bansal, Parikshit, et al.
Pubblicazione: (2025)
di: Bansal, Parikshit, et al.
Pubblicazione: (2025)
SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution
di: Wang, Hanlin, et al.
Pubblicazione: (2025)
di: Wang, Hanlin, et al.
Pubblicazione: (2025)
Prioritized Replay for RL Post-training
di: Fatemi, Mehdi
Pubblicazione: (2026)
di: Fatemi, Mehdi
Pubblicazione: (2026)
Chart-RL: Generalized Chart Comprehension via Reinforcement Learning with Verifiable Rewards
di: Zhang, Xin, et al.
Pubblicazione: (2026)
di: Zhang, Xin, et al.
Pubblicazione: (2026)
When Sharpening Becomes Collapse: Sampling Bias and Semantic Coupling in RL with Verifiable Rewards
di: Fan, Mingyuan, et al.
Pubblicazione: (2026)
di: Fan, Mingyuan, et al.
Pubblicazione: (2026)
Internalizing World Models via Self-Play Finetuning for Agentic RL
di: Chen, Shiqi, et al.
Pubblicazione: (2025)
di: Chen, Shiqi, et al.
Pubblicazione: (2025)
FlowRL: Matching Reward Distributions for LLM Reasoning
di: Zhu, Xuekai, et al.
Pubblicazione: (2025)
di: Zhu, Xuekai, et al.
Pubblicazione: (2025)
Documenti analoghi
-
The Crucial Role of Samplers in Online Direct Preference Optimization
di: Shi, Ruizhe, et al.
Pubblicazione: (2024) -
DuoGuard: A Two-Player RL-Driven Framework for Multilingual LLM Guardrails
di: Deng, Yihe, et al.
Pubblicazione: (2025) -
Offline RL by Reward-Weighted Fine-Tuning for Conversation Optimization
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2025) -
REA-RL: Reflection-Aware Online Reinforcement Learning for Efficient Reasoning
di: Deng, Hexuan, et al.
Pubblicazione: (2025) -
Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models
di: Li, Pengyi, et al.
Pubblicazione: (2025)