Experience Sharing in Mutual Reinforcement Learning for Heterogeneous Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Xiaoze, Ram, Dhananjay, Zhang, Yuting, Zhang, Zhaoyang, Xia, Wei, Soatto, Stefano |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Learning to Focus: Focal Attention for Selective and Scalable Transformers
por: Ram, Dhananjay, et al.
Publicado: (2025)
por: Ram, Dhananjay, et al.
Publicado: (2025)
Reinforcement-aware Knowledge Distillation for LLM Reasoning
por: Zhang, Zhaoyang, et al.
Publicado: (2026)
por: Zhang, Zhaoyang, et al.
Publicado: (2026)
Meanings and Feelings of Large Language Models: Observability of Latent States in Generative AI
por: Liu, Tian Yu, et al.
Publicado: (2024)
por: Liu, Tian Yu, et al.
Publicado: (2024)
Sequence-level Large Language Model Training with Contrastive Preference Optimization
por: Feng, Zhili, et al.
Publicado: (2025)
por: Feng, Zhili, et al.
Publicado: (2025)
Language Models Can Predict Their Own Behavior
por: Ashok, Dhananjay, et al.
Publicado: (2025)
por: Ashok, Dhananjay, et al.
Publicado: (2025)
Fewer Truncations Improve Language Modeling
por: Ding, Hantian, et al.
Publicado: (2024)
por: Ding, Hantian, et al.
Publicado: (2024)
Evaluating the Factuality of Large Language Models using Large-Scale Knowledge Graphs
por: Liu, Xiaoze, et al.
Publicado: (2024)
por: Liu, Xiaoze, et al.
Publicado: (2024)
PICASO: Permutation-Invariant Context Composition with State Space Models
por: Liu, Tian Yu, et al.
Publicado: (2025)
por: Liu, Tian Yu, et al.
Publicado: (2025)
SUV: Scalable Large Language Model Copyright Compliance with Regularized Selective Unlearning
por: Xu, Tianyang, et al.
Publicado: (2025)
por: Xu, Tianyang, et al.
Publicado: (2025)
Asymmetric Actor-Critic for Multi-turn LLM Agents
por: Jiang, Shuli, et al.
Publicado: (2026)
por: Jiang, Shuli, et al.
Publicado: (2026)
Large Language Models are Biased Reinforcement Learners
por: Hayes, William M., et al.
Publicado: (2024)
por: Hayes, William M., et al.
Publicado: (2024)
Agent World Model: Infinity Synthetic Environments for Agentic Reinforcement Learning
por: Wang, Zhaoyang, et al.
Publicado: (2026)
por: Wang, Zhaoyang, et al.
Publicado: (2026)
Linear Spaces of Meanings: Compositional Structures in Vision-Language Models
por: Trager, Matthew, et al.
Publicado: (2023)
por: Trager, Matthew, et al.
Publicado: (2023)
Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning
por: Xi, Zhiheng, et al.
Publicado: (2024)
por: Xi, Zhiheng, et al.
Publicado: (2024)
The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models
por: Cui, Ganqu, et al.
Publicado: (2025)
por: Cui, Ganqu, et al.
Publicado: (2025)
NOVER: Incentive Training for Language Models via Verifier-Free Reinforcement Learning
por: Liu, Wei, et al.
Publicado: (2025)
por: Liu, Wei, et al.
Publicado: (2025)
Efficient Preference-based Reinforcement Learning via Aligned Experience Estimation
por: Bai, Fengshuo, et al.
Publicado: (2024)
por: Bai, Fengshuo, et al.
Publicado: (2024)
Mutual Reinforcement of LLM Dialogue Synthesis and Summarization Capabilities for Few-Shot Dialogue Summarization
por: Lu, Yen-Ju, et al.
Publicado: (2025)
por: Lu, Yen-Ju, et al.
Publicado: (2025)
Detecting Data Contamination from Reinforcement Learning Post-training for Large Language Models
por: Tao, Yongding, et al.
Publicado: (2025)
por: Tao, Yongding, et al.
Publicado: (2025)
Large Language Models for Cross-lingual Emotion Detection
por: Kadiyala, Ram Mohan Rao
Publicado: (2024)
por: Kadiyala, Ram Mohan Rao
Publicado: (2024)
Revisiting Entropy in Reinforcement Learning for Large Reasoning Models
por: Jin, Renren, et al.
Publicado: (2025)
por: Jin, Renren, et al.
Publicado: (2025)
A Little Human Data Goes A Long Way
por: Ashok, Dhananjay, et al.
Publicado: (2024)
por: Ashok, Dhananjay, et al.
Publicado: (2024)
Mixture of Heterogeneous Grouped Experts for Language Modeling
por: Ma, Zhicheng, et al.
Publicado: (2026)
por: Ma, Zhicheng, et al.
Publicado: (2026)
Training Language Models for Social Deduction with Multi-Agent Reinforcement Learning
por: Sarkar, Bidipta, et al.
Publicado: (2025)
por: Sarkar, Bidipta, et al.
Publicado: (2025)
Knowledgeable Agents by Offline Reinforcement Learning from Large Language Model Rollouts
por: Pang, Jing-Cheng, et al.
Publicado: (2024)
por: Pang, Jing-Cheng, et al.
Publicado: (2024)
Natural Language Reinforcement Learning
por: Feng, Xidong, et al.
Publicado: (2024)
por: Feng, Xidong, et al.
Publicado: (2024)
Doctor Sun: A Bilingual Multimodal Large Language Model for Biomedical AI
por: Xue, Dong, et al.
Publicado: (2025)
por: Xue, Dong, et al.
Publicado: (2025)
Model Assembly Learning with Heterogeneous Layer Weight Merging
por: Zhang, Yi-Kai, et al.
Publicado: (2025)
por: Zhang, Yi-Kai, et al.
Publicado: (2025)
CHAI for LLMs: Improving Code-Mixed Translation in Large Language Models through Reinforcement Learning with AI Feedback
por: Zhang, Wenbo, et al.
Publicado: (2024)
por: Zhang, Wenbo, et al.
Publicado: (2024)
DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language Models
por: Monsefi, Amin Karimi, et al.
Publicado: (2026)
por: Monsefi, Amin Karimi, et al.
Publicado: (2026)
Benefits and Pitfalls of Reinforcement Learning for Language Model Planning: A Theoretical Perspective
por: Wang, Siwei, et al.
Publicado: (2025)
por: Wang, Siwei, et al.
Publicado: (2025)
$\mathbf{(N,K)}$-Puzzle: A Cost-Efficient Testbed for Benchmarking Reinforcement Learning Algorithms in Generative Language Model
por: Zhang, Yufeng, et al.
Publicado: (2024)
por: Zhang, Yufeng, et al.
Publicado: (2024)
CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models
por: Dai, Runpeng, et al.
Publicado: (2025)
por: Dai, Runpeng, et al.
Publicado: (2025)
Teaching Language Models to Critique via Reinforcement Learning
por: Xie, Zhihui, et al.
Publicado: (2025)
por: Xie, Zhihui, et al.
Publicado: (2025)
Self-Hinting Language Models Enhance Reinforcement Learning
por: Liao, Baohao, et al.
Publicado: (2026)
por: Liao, Baohao, et al.
Publicado: (2026)
Language and Experience: A Computational Model of Social Learning in Complex Tasks
por: Colas, Cédric, et al.
Publicado: (2025)
por: Colas, Cédric, et al.
Publicado: (2025)
Thinking About Thinking: SAGE-nano's Inverse Reasoning for Self-Aware Language Models
por: Jha, Basab, et al.
Publicado: (2025)
por: Jha, Basab, et al.
Publicado: (2025)
Learning to Hint for Reinforcement Learning
por: Xia, Yu, et al.
Publicado: (2026)
por: Xia, Yu, et al.
Publicado: (2026)
Heterogeneous Value Alignment Evaluation for Large Language Models
por: Zhang, Zhaowei, et al.
Publicado: (2023)
por: Zhang, Zhaowei, et al.
Publicado: (2023)
Reinforcement Learning for Reasoning in Large Language Models with One Training Example
por: Wang, Yiping, et al.
Publicado: (2025)
por: Wang, Yiping, et al.
Publicado: (2025)
Ejemplares similares
-
Learning to Focus: Focal Attention for Selective and Scalable Transformers
por: Ram, Dhananjay, et al.
Publicado: (2025) -
Reinforcement-aware Knowledge Distillation for LLM Reasoning
por: Zhang, Zhaoyang, et al.
Publicado: (2026) -
Meanings and Feelings of Large Language Models: Observability of Latent States in Generative AI
por: Liu, Tian Yu, et al.
Publicado: (2024) -
Sequence-level Large Language Model Training with Contrastive Preference Optimization
por: Feng, Zhili, et al.
Publicado: (2025) -
Language Models Can Predict Their Own Behavior
por: Ashok, Dhananjay, et al.
Publicado: (2025)