Reinforced Interactive Continual Learning via Real-time Noisy Human Feedback
Fuente:
arXiv
Saved in:
| Main Authors: | Yang, Yutao, Zhou, Jie, Li, Junsong, Pan, Qianjun, Zhan, Bihao, Chen, Qin, Qiu, Xipeng, He, Liang |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Teaching LLMs for Step-Level Automatic Math Correction via Reinforcement Learning
by: Li, Junsong, et al.
Published: (2025)
by: Li, Junsong, et al.
Published: (2025)
Forget What's Sensitive, Remember What Matters: Token-Level Differential Privacy in Memory Sculpting for Continual Learning
by: Zhan, Bihao, et al.
Published: (2025)
by: Zhan, Bihao, et al.
Published: (2025)
LifeAlign: Lifelong Alignment for Large Language Models with Memory-Augmented Focalized Preference Optimization
by: Li, Junsong, et al.
Published: (2025)
by: Li, Junsong, et al.
Published: (2025)
AutoSkill: Experience-Driven Lifelong Learning via Skill Self-Evolution
by: Yang, Yutao, et al.
Published: (2026)
by: Yang, Yutao, et al.
Published: (2026)
Black-box Model Merging for Language-Model-as-a-Service with Massive Model Repositories
by: Chen, Shilian, et al.
Published: (2025)
by: Chen, Shilian, et al.
Published: (2025)
PsychAgent: An Experience-Driven Lifelong Learning Agent for Self-Evolving Psychological Counselor
by: Yang, Yutao, et al.
Published: (2026)
by: Yang, Yutao, et al.
Published: (2026)
A Survey of Slow Thinking-based Reasoning LLMs using Reinforced Learning and Inference-time Scaling Law
by: Pan, Qianjun, et al.
Published: (2025)
by: Pan, Qianjun, et al.
Published: (2025)
Building Self-Evolving Agents via Experience-Driven Lifelong Learning: A Framework and Benchmark
by: Cai, Yuxuan, et al.
Published: (2025)
by: Cai, Yuxuan, et al.
Published: (2025)
PsychEval: A Multi-Session and Multi-Therapy Benchmark for High-Realism AI Psychological Counselor
by: Pan, Qianjun, et al.
Published: (2026)
by: Pan, Qianjun, et al.
Published: (2026)
Task-Core Memory Management and Consolidation for Long-term Continual Learning
by: Huai, Tianyu, et al.
Published: (2025)
by: Huai, Tianyu, et al.
Published: (2025)
Recent Advances of Foundation Language Models-based Continual Learning: A Survey
by: Yang, Yutao, et al.
Published: (2024)
by: Yang, Yutao, et al.
Published: (2024)
From Prediction to Justification: Aligning Sentiment Reasoning with Human Rationale via Reinforcement Learning
by: Zhang, Shihao, et al.
Published: (2026)
by: Zhang, Shihao, et al.
Published: (2026)
CANDERE-COACH: Reinforcement Learning from Noisy Feedback
by: Li, Yuxuan, et al.
Published: (2024)
by: Li, Yuxuan, et al.
Published: (2024)
Pref-GUIDE: Continual Policy Learning from Real-Time Human Feedback via Preference-Based Learning
by: Ji, Zhengran, et al.
Published: (2025)
by: Ji, Zhengran, et al.
Published: (2025)
REARANK: Reasoning Re-ranking Agent via Reinforcement Learning
by: Zhang, Le, et al.
Published: (2025)
by: Zhang, Le, et al.
Published: (2025)
Reinforcing Human Behavior Simulation via Verbal Feedback
by: Sun, Weiwei, et al.
Published: (2026)
by: Sun, Weiwei, et al.
Published: (2026)
Learning Personalized Driving Styles via Reinforcement Learning from Human Feedback
by: Li, Derun, et al.
Published: (2025)
by: Li, Derun, et al.
Published: (2025)
Optimal Refund Mechanism with Consumer Learning
by: Lyu, Qianjun
Published: (2024)
by: Lyu, Qianjun
Published: (2024)
Optimal Refund Mechanism With Consumer Learning
by: Qianjun Lyu
Published: (2026)
by: Qianjun Lyu
Published: (2026)
Interactive Groupwise Comparison for Reinforcement Learning from Human Feedback
by: Kompatscher, Jan, et al.
Published: (2025)
by: Kompatscher, Jan, et al.
Published: (2025)
Interactive Groupwise Comparison for Reinforcement Learning from Human Feedback
by: Jan Kompatscher, et al.
Published: (2025)
by: Jan Kompatscher, et al.
Published: (2025)
GAOKAO-MM: A Chinese Human-Level Benchmark for Multimodal Models Evaluation
by: Zong, Yi, et al.
Published: (2024)
by: Zong, Yi, et al.
Published: (2024)
WebGen-Agent: Enhancing Interactive Website Generation with Multi-Level Feedback and Step-Level Reinforcement Learning
by: Lu, Zimu, et al.
Published: (2025)
by: Lu, Zimu, et al.
Published: (2025)
Deep-Reinforcement-Learning-Based Adaptive State-Feedback Control for Inter-Area Oscillation Damping with Continuous Eigenvalue Configurations
by: Liang, Siyuan, et al.
Published: (2023)
by: Liang, Siyuan, et al.
Published: (2023)
Reinforcement Learning from Human Feedback with Active Queries
by: Ji, Kaixuan, et al.
Published: (2024)
by: Ji, Kaixuan, et al.
Published: (2024)
CMM-Math: A Chinese Multimodal Math Dataset To Evaluate and Enhance the Mathematics Reasoning of Large Multimodal Models
by: Liu, Wentao, et al.
Published: (2024)
by: Liu, Wentao, et al.
Published: (2024)
InteractAnything: Zero-shot Human Object Interaction Synthesis via LLM Feedback and Object Affordance Parsing
by: Zhang, Jinlu, et al.
Published: (2025)
by: Zhang, Jinlu, et al.
Published: (2025)
Boosting Large Language Models with Continual Learning for Aspect-based Sentiment Analysis
by: Ding, Xuanwen, et al.
Published: (2024)
by: Ding, Xuanwen, et al.
Published: (2024)
Learning with Open-world Noisy Data via Class-independent Margin in Dual Representation Space
by: Pan, Linchao, et al.
Published: (2025)
by: Pan, Linchao, et al.
Published: (2025)
Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning
by: Fei, Zhaoye, et al.
Published: (2025)
by: Fei, Zhaoye, et al.
Published: (2025)
ConvSearch-R1: Enhancing Query Reformulation for Conversational Search with Reasoning via Reinforcement Learning
by: Zhu, Changtai, et al.
Published: (2025)
by: Zhu, Changtai, et al.
Published: (2025)
IntrinsicVoice: Empowering LLMs with Intrinsic Real-time Voice Interaction Abilities
by: Zhang, Xin, et al.
Published: (2024)
by: Zhang, Xin, et al.
Published: (2024)
Inference-Time Alignment Control for Diffusion Models with Reinforcement Learning Guidance
by: Jin, Luozhijie, et al.
Published: (2025)
by: Jin, Luozhijie, et al.
Published: (2025)
Reinforcement Learning from Denoising Feedback
by: He, Qi, et al.
Published: (2026)
by: He, Qi, et al.
Published: (2026)
Distributed Zeroth-Order Policy Gradient for Networked Multi-agent Reinforcement Learning from Human Feedback
by: Dai, Pengcheng, et al.
Published: (2026)
by: Dai, Pengcheng, et al.
Published: (2026)
Sample-Efficient Reinforcement Learning from Human Feedback via Information-Directed Sampling
by: Qi, Han, et al.
Published: (2025)
by: Qi, Han, et al.
Published: (2025)
MENTOR: Guiding Hierarchical Reinforcement Learning with Human Feedback and Dynamic Distance Constraint
by: Zhou, Xinglin, et al.
Published: (2024)
by: Zhou, Xinglin, et al.
Published: (2024)
Navigating Noisy Feedback: Enhancing Reinforcement Learning with Error-Prone Language Models
by: Lin, Muhan, et al.
Published: (2024)
by: Lin, Muhan, et al.
Published: (2024)
Efficient Excited-State Calculations for Molecules Based on Contextual Subspace Method and Symmetry Optimizations
by: Yao, Qianjun, et al.
Published: (2025)
by: Yao, Qianjun, et al.
Published: (2025)
A Regularization-based Transfer Learning Method for Information Extraction via Instructed Graph Decoder
by: Chen, Kedi, et al.
Published: (2024)
by: Chen, Kedi, et al.
Published: (2024)
Similar Items
-
Teaching LLMs for Step-Level Automatic Math Correction via Reinforcement Learning
by: Li, Junsong, et al.
Published: (2025) -
Forget What's Sensitive, Remember What Matters: Token-Level Differential Privacy in Memory Sculpting for Continual Learning
by: Zhan, Bihao, et al.
Published: (2025) -
LifeAlign: Lifelong Alignment for Large Language Models with Memory-Augmented Focalized Preference Optimization
by: Li, Junsong, et al.
Published: (2025) -
AutoSkill: Experience-Driven Lifelong Learning via Skill Self-Evolution
by: Yang, Yutao, et al.
Published: (2026) -
Black-box Model Merging for Language-Model-as-a-Service with Massive Model Repositories
by: Chen, Shilian, et al.
Published: (2025)