Mutual Enhancement of Large Language and Reinforcement Learning Models through Bi-Directional Feedback Mechanisms: A Planning Case Study
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Gu, Shangding |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TeaMs-RL: Teaching LLMs to Generate Better Instruction Datasets via Reinforcement Learning
par: Gu, Shangding, et autres
Publié: (2024)
par: Gu, Shangding, et autres
Publié: (2024)
StyleBench: Evaluating thinking styles in Large Language Models
par: Guo, Junyu, et autres
Publié: (2025)
par: Guo, Junyu, et autres
Publié: (2025)
DUAL-REFLECT: Enhancing Large Language Models for Reflective Translation through Dual Learning Feedback Mechanisms
par: Chen, Andong, et autres
Publié: (2024)
par: Chen, Andong, et autres
Publié: (2024)
Enhancing the Traditional Chinese Medicine Capabilities of Large Language Model through Reinforcement Learning from AI Feedback
par: Yu, Song, et autres
Publié: (2024)
par: Yu, Song, et autres
Publié: (2024)
MIRL: Mutual Information-Guided Reinforcement Learning for Vision-Language Models
par: Zhang, Yin, et autres
Publié: (2026)
par: Zhang, Yin, et autres
Publié: (2026)
Experience Sharing in Mutual Reinforcement Learning for Heterogeneous Language Models
par: Liu, Xiaoze, et autres
Publié: (2026)
par: Liu, Xiaoze, et autres
Publié: (2026)
BiTA: Bi-Directional Tuning for Lossless Acceleration in Large Language Models
par: Lin, Feng, et autres
Publié: (2024)
par: Lin, Feng, et autres
Publié: (2024)
Demonstrating Mutual Reinforcement Effect through Information Flow
par: Gan, Chengguang, et autres
Publié: (2024)
par: Gan, Chengguang, et autres
Publié: (2024)
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback
par: van Niekerk, Carel, et autres
Publié: (2025)
par: van Niekerk, Carel, et autres
Publié: (2025)
CHAI for LLMs: Improving Code-Mixed Translation in Large Language Models through Reinforcement Learning with AI Feedback
par: Zhang, Wenbo, et autres
Publié: (2024)
par: Zhang, Wenbo, et autres
Publié: (2024)
FedMKT: Federated Mutual Knowledge Transfer for Large and Small Language Models
par: Fan, Tao, et autres
Publié: (2024)
par: Fan, Tao, et autres
Publié: (2024)
Reinforcement Learning without Human Feedback for Last Mile Fine-Tuning of Large Language Models
par: Solway, Alec
Publié: (2024)
par: Solway, Alec
Publié: (2024)
Direct Preference Knowledge Distillation for Large Language Models
par: Li, Yixing, et autres
Publié: (2024)
par: Li, Yixing, et autres
Publié: (2024)
Fin-R1: A Large Language Model for Financial Reasoning through Reinforcement Learning
par: Liu, Zhaowei, et autres
Publié: (2025)
par: Liu, Zhaowei, et autres
Publié: (2025)
Align-SLM: Textless Spoken Language Models with Reinforcement Learning from AI Feedback
par: Lin, Guan-Ting, et autres
Publié: (2024)
par: Lin, Guan-Ting, et autres
Publié: (2024)
Bootstrapping Exploration with Group-Level Natural Language Feedback in Reinforcement Learning
par: Huang, Lei, et autres
Publié: (2026)
par: Huang, Lei, et autres
Publié: (2026)
RLHFPoison: Reward Poisoning Attack for Reinforcement Learning with Human Feedback in Large Language Models
par: Wang, Jiongxiao, et autres
Publié: (2023)
par: Wang, Jiongxiao, et autres
Publié: (2023)
Enhancing Language Model Rationality with Bi-Directional Deliberation Reasoning
par: Zhang, Yadong, et autres
Publié: (2024)
par: Zhang, Yadong, et autres
Publié: (2024)
Adaptive Reinforcement Learning Planning: Harnessing Large Language Models for Complex Information Extraction
par: Ding, Zepeng, et autres
Publié: (2024)
par: Ding, Zepeng, et autres
Publié: (2024)
Unified Enhancement of the Generalization and Robustness of Language Models via Bi-Stage Optimization
par: Sun, Yudao, et autres
Publié: (2025)
par: Sun, Yudao, et autres
Publié: (2025)
Enhancing the Capability and Robustness of Large Language Models through Reinforcement Learning-Driven Query Refinement
par: Wang, Xiaohua, et autres
Publié: (2024)
par: Wang, Xiaohua, et autres
Publié: (2024)
Reinforcement Learning from Compiler and Language Server Feedback
par: Zhang, Yifan, et autres
Publié: (2025)
par: Zhang, Yifan, et autres
Publié: (2025)
Diver: Large Language Model Decoding with Span-Level Mutual Information Verification
par: Lu, Jinliang, et autres
Publié: (2024)
par: Lu, Jinliang, et autres
Publié: (2024)
MI-PRUN: Optimize Large Language Model Pruning via Mutual Information
par: Zhang, Hao, et autres
Publié: (2026)
par: Zhang, Hao, et autres
Publié: (2026)
Overton Pluralistic Reinforcement Learning for Large Language Models
par: Fu, Yu, et autres
Publié: (2026)
par: Fu, Yu, et autres
Publié: (2026)
Learning Domain Knowledge in Multimodal Large Language Models through Reinforcement Fine-Tuning
par: Cao, Qinglong, et autres
Publié: (2026)
par: Cao, Qinglong, et autres
Publié: (2026)
Explainable Behavior Cloning: Teaching Large Language Model Agents through Learning by Demonstration
par: Guan, Yanchu, et autres
Publié: (2024)
par: Guan, Yanchu, et autres
Publié: (2024)
Educational Personalized Learning Path Planning with Large Language Models
par: Ng, Chee, et autres
Publié: (2024)
par: Ng, Chee, et autres
Publié: (2024)
Sparse Subnetwork Enhancement for Underrepresented Languages in Large Language Models
par: Gurgurov, Daniil, et autres
Publié: (2025)
par: Gurgurov, Daniil, et autres
Publié: (2025)
Kongzi: A Historical Large Language Model with Fact Enhancement
par: Yang, Jiashu, et autres
Publié: (2025)
par: Yang, Jiashu, et autres
Publié: (2025)
Leveraging Conditional Mutual Information to Improve Large Language Model Fine-Tuning For Classification
par: Sivakaran, Thanushon, et autres
Publié: (2025)
par: Sivakaran, Thanushon, et autres
Publié: (2025)
Lens: Rethinking Multilingual Enhancement for Large Language Models
par: Zhao, Weixiang, et autres
Publié: (2024)
par: Zhao, Weixiang, et autres
Publié: (2024)
Interpreting Arithmetic Mechanism in Large Language Models through Comparative Neuron Analysis
par: Yu, Zeping, et autres
Publié: (2024)
par: Yu, Zeping, et autres
Publié: (2024)
Interleaved Reasoning for Large Language Models via Reinforcement Learning
par: Xie, Roy, et autres
Publié: (2025)
par: Xie, Roy, et autres
Publié: (2025)
Revolutionizing Reinforcement Learning Framework for Diffusion Large Language Models
par: Wang, Yinjie, et autres
Publié: (2025)
par: Wang, Yinjie, et autres
Publié: (2025)
Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning
par: Xi, Zhiheng, et autres
Publié: (2024)
par: Xi, Zhiheng, et autres
Publié: (2024)
Learning to Plan for Retrieval-Augmented Large Language Models from Knowledge Graphs
par: Wang, Junjie, et autres
Publié: (2024)
par: Wang, Junjie, et autres
Publié: (2024)
Remembering More, Risking More: Longitudinal Safety Risks in Memory-Equipped LLM Agents
par: Al-Tawaha, Ahmad, et autres
Publié: (2026)
par: Al-Tawaha, Ahmad, et autres
Publié: (2026)
Internal Consistency and Self-Feedback in Large Language Models: A Survey
par: Liang, Xun, et autres
Publié: (2024)
par: Liang, Xun, et autres
Publié: (2024)
A Large Language Model Approach to Educational Survey Feedback Analysis
par: Parker, Michael J., et autres
Publié: (2023)
par: Parker, Michael J., et autres
Publié: (2023)
Documents similaires
-
TeaMs-RL: Teaching LLMs to Generate Better Instruction Datasets via Reinforcement Learning
par: Gu, Shangding, et autres
Publié: (2024) -
StyleBench: Evaluating thinking styles in Large Language Models
par: Guo, Junyu, et autres
Publié: (2025) -
DUAL-REFLECT: Enhancing Large Language Models for Reflective Translation through Dual Learning Feedback Mechanisms
par: Chen, Andong, et autres
Publié: (2024) -
Enhancing the Traditional Chinese Medicine Capabilities of Large Language Model through Reinforcement Learning from AI Feedback
par: Yu, Song, et autres
Publié: (2024) -
MIRL: Mutual Information-Guided Reinforcement Learning for Vision-Language Models
par: Zhang, Yin, et autres
Publié: (2026)