Risk-Sensitive RL for Alleviating Exploration Dilemmas in Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Jiang, Yuhua, Huang, Jiawei, Yuan, Yufeng, Mao, Xin, Yue, Yu, Zhao, Qianchuan, Yan, Lin |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
PAG: Multi-Turn Reinforced LLM Self-Correction with Policy as Generative Verifier
by: Jiang, Yuhua, et al.
Published: (2025)
by: Jiang, Yuhua, et al.
Published: (2025)
DSAC: Distributional Soft Actor-Critic for Risk-Sensitive Reinforcement Learning
by: Ma, Xiaoteng, et al.
Published: (2020)
by: Ma, Xiaoteng, et al.
Published: (2020)
Understanding the Dilemma of Unlearning for Large Language Models
by: Zhang, Qingjie, et al.
Published: (2025)
by: Zhang, Qingjie, et al.
Published: (2025)
Meta-RL Induces Exploration in Language Agents
by: Jiang, Yulun, et al.
Published: (2025)
by: Jiang, Yulun, et al.
Published: (2025)
Exploring the Secondary Risks of Large Language Models
by: Chen, Jiawei, et al.
Published: (2025)
by: Chen, Jiawei, et al.
Published: (2025)
SAFER: Risk-Constrained Sample-then-Filter in Large Language Models
by: Wang, Qingni, et al.
Published: (2025)
by: Wang, Qingni, et al.
Published: (2025)
Alleviating Hallucinations of Large Language Models through Induced Hallucinations
by: Zhang, Yue, et al.
Published: (2023)
by: Zhang, Yue, et al.
Published: (2023)
GlobeDiff: State Diffusion Process for Partial Observability in Multi-Agent Systems
by: Yang, Yiqin, et al.
Published: (2026)
by: Yang, Yiqin, et al.
Published: (2026)
Continuity and Isolation Lead to Doubts or Dilemmas in Large Language Models
by: Pasten, Hector, et al.
Published: (2025)
by: Pasten, Hector, et al.
Published: (2025)
Normative Evaluation of Large Language Models with Everyday Moral Dilemmas
by: Sachdeva, Pratik S., et al.
Published: (2025)
by: Sachdeva, Pratik S., et al.
Published: (2025)
SafeDrive: Knowledge- and Data-Driven Risk-Sensitive Decision-Making for Autonomous Vehicles with Large Language Models
by: Zhou, Zhiyuan, et al.
Published: (2024)
by: Zhou, Zhiyuan, et al.
Published: (2024)
RL for Mitigating Cascading Failures: Targeted Exploration via Sensitivity Factors
by: Dwivedi, Anmol, et al.
Published: (2024)
by: Dwivedi, Anmol, et al.
Published: (2024)
Automating Security Audit Using Large Language Model based Agent: An Exploration Experiment
by: Chin, Jia Hui, et al.
Published: (2025)
by: Chin, Jia Hui, et al.
Published: (2025)
"Pull or Not to Pull?'': Investigating Moral Biases in Leading Large Language Models Across Ethical Dilemmas
by: Ding, Junchen, et al.
Published: (2025)
by: Ding, Junchen, et al.
Published: (2025)
Large Reward Models: Generalizable Online Robot Reward Generation with Vision-Language Models
by: Wu, Yanru, et al.
Published: (2026)
by: Wu, Yanru, et al.
Published: (2026)
Fine-grained Stateful Knowledge Exploration: Effective and Efficient Graph Retrieval with Large Language Models
by: Tao, Dehao, et al.
Published: (2024)
by: Tao, Dehao, et al.
Published: (2024)
GraphScout: Empowering Large Language Models with Intrinsic Exploration Ability for Agentic Graph Reasoning
by: Ying, Yuchen, et al.
Published: (2026)
by: Ying, Yuchen, et al.
Published: (2026)
Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning
by: Tian, Chang, et al.
Published: (2025)
by: Tian, Chang, et al.
Published: (2025)
Model-Based RL for Mean-Field Games is not Statistically Harder than Single-Agent RL
by: Huang, Jiawei, et al.
Published: (2024)
by: Huang, Jiawei, et al.
Published: (2024)
NoiseBoost: Alleviating Hallucination with Noise Perturbation for Multimodal Large Language Models
by: Wu, Kai, et al.
Published: (2024)
by: Wu, Kai, et al.
Published: (2024)
Copyleft for Alleviating AIGC Copyright Dilemma: What-if Analysis, Public Perception and Implications
by: Guo, Xinwei, et al.
Published: (2024)
by: Guo, Xinwei, et al.
Published: (2024)
Spreadsheet-RL: Advancing Large Language Model Agents on Realistic Spreadsheet Tasks via Reinforcement Learning
by: Chi, Banghao, et al.
Published: (2026)
by: Chi, Banghao, et al.
Published: (2026)
An Exploration of Higher Education Course Evaluation by Large Language Models
by: Yuan, Bo, et al.
Published: (2024)
by: Yuan, Bo, et al.
Published: (2024)
GenRES: Rethinking Evaluation for Generative Relation Extraction in the Era of Large Language Models
by: Jiang, Pengcheng, et al.
Published: (2024)
by: Jiang, Pengcheng, et al.
Published: (2024)
AsyncVLA: Asynchronous Flow Matching for Vision-Language-Action Models
by: Jiang, Yuhua, et al.
Published: (2025)
by: Jiang, Yuhua, et al.
Published: (2025)
Efficient Reinforcement Learning for Large Language Models with Intrinsic Exploration
by: Sun, Yan, et al.
Published: (2025)
by: Sun, Yan, et al.
Published: (2025)
Self-Introspective Decoding: Alleviating Hallucinations for Large Vision-Language Models
by: Huo, Fushuo, et al.
Published: (2024)
by: Huo, Fushuo, et al.
Published: (2024)
Solver-Informed RL: Grounding Large Language Models for Authentic Optimization Modeling
by: Chen, Yitian, et al.
Published: (2025)
by: Chen, Yitian, et al.
Published: (2025)
LINKs: Large Language Model Integrated Management for 6G Empowered Digital Twin NetworKs
by: Jiang, Shufan, et al.
Published: (2024)
by: Jiang, Shufan, et al.
Published: (2024)
Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL
by: He, Haoyang, et al.
Published: (2025)
by: He, Haoyang, et al.
Published: (2025)
Prefix Guidance: A Steering Wheel for Large Language Models to Defend Against Jailbreak Attacks
by: Zhao, Jiawei, et al.
Published: (2024)
by: Zhao, Jiawei, et al.
Published: (2024)
Verification-Guided Falsification for Safe RL via Explainable Abstraction and Risk-Aware Exploration
by: Le, Tuan, et al.
Published: (2025)
by: Le, Tuan, et al.
Published: (2025)
TruthX: Alleviating Hallucinations by Editing Large Language Models in Truthful Space
by: Zhang, Shaolei, et al.
Published: (2024)
by: Zhang, Shaolei, et al.
Published: (2024)
On Token's Dilemma: Dynamic MoE with Drift-Aware Token Assignment for Continual Learning of Large Vision Language Models
by: Zhao, Chongyang, et al.
Published: (2026)
by: Zhao, Chongyang, et al.
Published: (2026)
Probing Neural Topology of Large Language Models
by: Zheng, Yu, et al.
Published: (2025)
by: Zheng, Yu, et al.
Published: (2025)
DecisionLLM: Large Language Models for Long Sequence Decision Exploration
by: Lv, Xiaowei, et al.
Published: (2026)
by: Lv, Xiaowei, et al.
Published: (2026)
Digital Gatekeepers: Exploring Large Language Model's Role in Immigration Decisions
by: Mao, Yicheng, et al.
Published: (2025)
by: Mao, Yicheng, et al.
Published: (2025)
Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding
by: Yuan, Liping, et al.
Published: (2025)
by: Yuan, Liping, et al.
Published: (2025)
Dynamics-Predictive Sampling for Active RL Finetuning of Large Reasoning Models
by: Mao, Yixiu, et al.
Published: (2026)
by: Mao, Yixiu, et al.
Published: (2026)
WoVR: World Models as Reliable Simulators for Post-Training VLA Policies with RL
by: Jiang, Zhennan, et al.
Published: (2026)
by: Jiang, Zhennan, et al.
Published: (2026)
Similar Items
-
PAG: Multi-Turn Reinforced LLM Self-Correction with Policy as Generative Verifier
by: Jiang, Yuhua, et al.
Published: (2025) -
DSAC: Distributional Soft Actor-Critic for Risk-Sensitive Reinforcement Learning
by: Ma, Xiaoteng, et al.
Published: (2020) -
Understanding the Dilemma of Unlearning for Large Language Models
by: Zhang, Qingjie, et al.
Published: (2025) -
Meta-RL Induces Exploration in Language Agents
by: Jiang, Yulun, et al.
Published: (2025) -
Exploring the Secondary Risks of Large Language Models
by: Chen, Jiawei, et al.
Published: (2025)