Deep Dense Exploration for LLM Reinforcement Learning via Pivot-Driven Resampling
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Guo, Yiran, Qiao, Zhongjian, Xie, Yingqi, Liu, Jie, Ye, Dan, Zhang, Ruiqing, Qiu, Shuang, Xu, Lijie |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Segment Policy Optimization: Effective Segment-Level Credit Assignment in RL for Large Language Models
von: Guo, Yiran, et al.
Veröffentlicht: (2025)
von: Guo, Yiran, et al.
Veröffentlicht: (2025)
CodePivot: Bootstrapping Multilingual Transpilation in LLMs via Reinforcement Learning without Parallel Corpora
von: Li, Shangyu, et al.
Veröffentlicht: (2026)
von: Li, Shangyu, et al.
Veröffentlicht: (2026)
Comments as Natural Logic Pivots: Improve Code Generation via Comment Perspective
von: Chen, Yijie, et al.
Veröffentlicht: (2024)
von: Chen, Yijie, et al.
Veröffentlicht: (2024)
DeepTrans: Deep Reasoning Translation via Reinforcement Learning
von: Wang, Jiaan, et al.
Veröffentlicht: (2025)
von: Wang, Jiaan, et al.
Veröffentlicht: (2025)
Back to Basics: Revisiting Exploration in Reinforcement Learning for LLM Reasoning via Generative Probabilities
von: Li, Pengyi, et al.
Veröffentlicht: (2026)
von: Li, Pengyi, et al.
Veröffentlicht: (2026)
TREX: Automating LLM Fine-tuning via Agent-Driven Tree-based Exploration
von: Ma, Zerun, et al.
Veröffentlicht: (2026)
von: Ma, Zerun, et al.
Veröffentlicht: (2026)
Thought Branches: Interpreting LLM Reasoning Requires Resampling
von: Macar, Uzay, et al.
Veröffentlicht: (2025)
von: Macar, Uzay, et al.
Veröffentlicht: (2025)
PivotAttack: Rethinking the Search Trajectory in Hard-Label Text Attacks via Pivot Words
von: Liang, Yuzhi, et al.
Veröffentlicht: (2026)
von: Liang, Yuzhi, et al.
Veröffentlicht: (2026)
SEER: Facilitating Structured Reasoning and Explanation via Reinforcement Learning
von: Chen, Guoxin, et al.
Veröffentlicht: (2024)
von: Chen, Guoxin, et al.
Veröffentlicht: (2024)
Controllable Generation via Locally Constrained Resampling
von: Ahmed, Kareem, et al.
Veröffentlicht: (2024)
von: Ahmed, Kareem, et al.
Veröffentlicht: (2024)
Co-Evolving LLM Coder and Unit Tester via Reinforcement Learning
von: Wang, Yinjie, et al.
Veröffentlicht: (2025)
von: Wang, Yinjie, et al.
Veröffentlicht: (2025)
Enhancing Nursing and Elderly Care with Large Language Models: An AI-Driven Framework
von: Sun, Qiao, et al.
Veröffentlicht: (2024)
von: Sun, Qiao, et al.
Veröffentlicht: (2024)
ExpWeaver: LLM Agents Learn from Experience via Latent RAG
von: Feng, Tao, et al.
Veröffentlicht: (2026)
von: Feng, Tao, et al.
Veröffentlicht: (2026)
FP8-RL: A Practical and Stable Low-Precision Stack for LLM Reinforcement Learning
von: Qiu, Zhaopeng, et al.
Veröffentlicht: (2026)
von: Qiu, Zhaopeng, et al.
Veröffentlicht: (2026)
Selective Latent Thinking: Adaptive Compression of LLM Reasoning Chains
von: Xie, Hui, et al.
Veröffentlicht: (2026)
von: Xie, Hui, et al.
Veröffentlicht: (2026)
Teaching Language Models to Critique via Reinforcement Learning
von: Xie, Zhihui, et al.
Veröffentlicht: (2025)
von: Xie, Zhihui, et al.
Veröffentlicht: (2025)
Unifying Value Alignment and Assignment in Cross-Domain Offline Reinforcement Learning with Heterogeneous Datasets
von: Qiao, Zhongjian, et al.
Veröffentlicht: (2026)
von: Qiao, Zhongjian, et al.
Veröffentlicht: (2026)
Incentivizing Agentic Reasoning in LLM Judges via Tool-Integrated Reinforcement Learning
von: Xu, Ran, et al.
Veröffentlicht: (2025)
von: Xu, Ran, et al.
Veröffentlicht: (2025)
OverrideFuzz: Semantic-Aware Grammar Fuzzing for Script-Runtime Vulnerabilities
von: Qiu, Yiran
Veröffentlicht: (2026)
von: Qiu, Yiran
Veröffentlicht: (2026)
BroRL: Scaling Reinforcement Learning via Broadened Exploration
von: Hu, Jian, et al.
Veröffentlicht: (2025)
von: Hu, Jian, et al.
Veröffentlicht: (2025)
ExTrans: Multilingual Deep Reasoning Translation via Exemplar-Enhanced Reinforcement Learning
von: Wang, Jiaan, et al.
Veröffentlicht: (2025)
von: Wang, Jiaan, et al.
Veröffentlicht: (2025)
CLASE: A Hybrid Method for Chinese Legalese Stylistic Evaluation
von: Ma, Yiran Rex, et al.
Veröffentlicht: (2026)
von: Ma, Yiran Rex, et al.
Veröffentlicht: (2026)
CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models
von: Dai, Runpeng, et al.
Veröffentlicht: (2025)
von: Dai, Runpeng, et al.
Veröffentlicht: (2025)
SAKE: Structured Agentic Knowledge Extrapolation for Complex LLM Reasoning via Reinforcement Learning
von: He, Jiashu, et al.
Veröffentlicht: (2025)
von: He, Jiashu, et al.
Veröffentlicht: (2025)
ExpGraph: Model-Agnostic Experience Learning with Graph-Structured Memory for LLM Agents
von: Feng, Tao, et al.
Veröffentlicht: (2026)
von: Feng, Tao, et al.
Veröffentlicht: (2026)
LongR: Unleashing Long-Context Reasoning via Reinforcement Learning with Dense Utility Rewards
von: Ping, Bowen, et al.
Veröffentlicht: (2026)
von: Ping, Bowen, et al.
Veröffentlicht: (2026)
Interleaved Reasoning for Large Language Models via Reinforcement Learning
von: Xie, Roy, et al.
Veröffentlicht: (2025)
von: Xie, Roy, et al.
Veröffentlicht: (2025)
Semantic Pivots Enable Cross-Lingual Transfer in Large Language Models
von: He, Kaiyu, et al.
Veröffentlicht: (2025)
von: He, Kaiyu, et al.
Veröffentlicht: (2025)
Token Hidden Reward: Steering Exploration-Exploitation in Group Relative Deep Reinforcement Learning
von: Deng, Wenlong, et al.
Veröffentlicht: (2025)
von: Deng, Wenlong, et al.
Veröffentlicht: (2025)
HarnessLLM: Automatic Testing Harness Generation via Reinforcement Learning
von: Liu, Yujian, et al.
Veröffentlicht: (2025)
von: Liu, Yujian, et al.
Veröffentlicht: (2025)
Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning
von: Ahmadi, Arash, et al.
Veröffentlicht: (2026)
von: Ahmadi, Arash, et al.
Veröffentlicht: (2026)
AUTOCIRCUIT-RL: Reinforcement Learning-Driven LLM for Automated Circuit Topology Generation
von: Vijayaraghavan, Prashanth, et al.
Veröffentlicht: (2025)
von: Vijayaraghavan, Prashanth, et al.
Veröffentlicht: (2025)
ThoughtProbe: Classifier-Guided LLM Thought Space Exploration via Probing Representations
von: Wang, Zijian, et al.
Veröffentlicht: (2025)
von: Wang, Zijian, et al.
Veröffentlicht: (2025)
Reinforced Efficient Reasoning via Semantically Diverse Exploration
von: Zhao, Ziqi, et al.
Veröffentlicht: (2026)
von: Zhao, Ziqi, et al.
Veröffentlicht: (2026)
DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments
von: Zheng, Yuxiang, et al.
Veröffentlicht: (2025)
von: Zheng, Yuxiang, et al.
Veröffentlicht: (2025)
Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning
von: Xie, Tian, et al.
Veröffentlicht: (2025)
von: Xie, Tian, et al.
Veröffentlicht: (2025)
FSMR: A Feature Swapping Multi-modal Reasoning Approach with Joint Textual and Visual Clues
von: Li, Shuang, et al.
Veröffentlicht: (2024)
von: Li, Shuang, et al.
Veröffentlicht: (2024)
Nested Event Extraction upon Pivot Element Recogniton
von: Ren, Weicheng, et al.
Veröffentlicht: (2023)
von: Ren, Weicheng, et al.
Veröffentlicht: (2023)
Unlocking Reasoning Capabilities in LLMs via Reinforcement Learning Exploration
von: Deng, Wenhao, et al.
Veröffentlicht: (2025)
von: Deng, Wenhao, et al.
Veröffentlicht: (2025)
DeepRefine: Agent-Compiled Knowledge Refinement via Reinforcement Learning
von: Huang, Haoyu, et al.
Veröffentlicht: (2026)
von: Huang, Haoyu, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Segment Policy Optimization: Effective Segment-Level Credit Assignment in RL for Large Language Models
von: Guo, Yiran, et al.
Veröffentlicht: (2025) -
CodePivot: Bootstrapping Multilingual Transpilation in LLMs via Reinforcement Learning without Parallel Corpora
von: Li, Shangyu, et al.
Veröffentlicht: (2026) -
Comments as Natural Logic Pivots: Improve Code Generation via Comment Perspective
von: Chen, Yijie, et al.
Veröffentlicht: (2024) -
DeepTrans: Deep Reasoning Translation via Reinforcement Learning
von: Wang, Jiaan, et al.
Veröffentlicht: (2025) -
Back to Basics: Revisiting Exploration in Reinforcement Learning for LLM Reasoning via Generative Probabilities
von: Li, Pengyi, et al.
Veröffentlicht: (2026)