TAMTRL: Teacher-Aligned Reward Reshaping for Multi-Turn Reinforcement Learning in Long-Context Compression
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Li, Wang, Yandong, Yu, Xin, Zhang, Kui, Peng, Tianhao, Wu, Wenjun |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Learning to Adapt SFT Data for Better Reasoning Generalization
par: Sun, Lisong, et autres
Publié: (2026)
par: Sun, Lisong, et autres
Publié: (2026)
LongRLVR: Long-Context Reinforcement Learning Requires Verifiable Context Rewards
par: Chen, Guanzheng, et autres
Publié: (2026)
par: Chen, Guanzheng, et autres
Publié: (2026)
LongR: Unleashing Long-Context Reasoning via Reinforcement Learning with Dense Utility Rewards
par: Ping, Bowen, et autres
Publié: (2026)
par: Ping, Bowen, et autres
Publié: (2026)
Training Long-Context, Multi-Turn Software Engineering Agents with Reinforcement Learning
par: Golubev, Alexander, et autres
Publié: (2025)
par: Golubev, Alexander, et autres
Publié: (2025)
Reinforcement Learning for Long-Horizon Multi-Turn Search Agents
par: Kalyan, Vivek, et autres
Publié: (2025)
par: Kalyan, Vivek, et autres
Publié: (2025)
Rewarding Creativity: A Human-Aligned Generative Reward Model for Reinforcement Learning in Storytelling
par: Li, Zhaoyan, et autres
Publié: (2026)
par: Li, Zhaoyan, et autres
Publié: (2026)
ContextCache: Context-Aware Semantic Cache for Multi-Turn Queries in Large Language Models
par: Yan, Jianxin, et autres
Publié: (2025)
par: Yan, Jianxin, et autres
Publié: (2025)
When Self-Belief Misleads: Active Label Acquisition for Reinforcement Learning with Verifiable Rewards
par: Wang, Li, et autres
Publié: (2026)
par: Wang, Li, et autres
Publié: (2026)
OpenGenAlign: A Preference Dataset and Benchmark for Trustworthy Reward Modeling in Open-Ended, Long-Context Generation
par: Zhang, Hanning, et autres
Publié: (2025)
par: Zhang, Hanning, et autres
Publié: (2025)
MemAgent: Reshaping Long-Context LLM with Multi-Conv RL-based Memory Agent
par: Yu, Hongli, et autres
Publié: (2025)
par: Yu, Hongli, et autres
Publié: (2025)
BRIEF-Pro: Universal Context Compression with Short-to-Long Synthesis for Fast and Accurate Multi-Hop Reasoning
par: Gu, Jia-Chen, et autres
Publié: (2025)
par: Gu, Jia-Chen, et autres
Publié: (2025)
MUSIC: MUlti-Step Instruction Contrast for Multi-Turn Reward Models
par: Li, Wenzhe, et autres
Publié: (2025)
par: Li, Wenzhe, et autres
Publié: (2025)
Dynamic Long Context Reasoning over Compressed Memory via End-to-End Reinforcement Learning
par: Chen, Zhuoen, et autres
Publié: (2026)
par: Chen, Zhuoen, et autres
Publié: (2026)
Reward Is Enough: LLMs Are In-Context Reinforcement Learners
par: Song, Kefan, et autres
Publié: (2025)
par: Song, Kefan, et autres
Publié: (2025)
LongAttnComp: Cross-Family Context Compression for Long-Context Reasoning
par: Ji, Mengmeng, et autres
Publié: (2026)
par: Ji, Mengmeng, et autres
Publié: (2026)
Agentic Reinforcement Learning with Implicit Step Rewards
par: Liu, Xiaoqian, et autres
Publié: (2025)
par: Liu, Xiaoqian, et autres
Publié: (2025)
OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning
par: Hu, Ziyou, et autres
Publié: (2025)
par: Hu, Ziyou, et autres
Publié: (2025)
Evaluating Zero-Shot Long-Context LLM Compression
par: Wang, Chenyu, et autres
Publié: (2024)
par: Wang, Chenyu, et autres
Publié: (2024)
LoongRL: Reinforcement Learning for Advanced Reasoning over Long Contexts
par: Wang, Siyuan, et autres
Publié: (2025)
par: Wang, Siyuan, et autres
Publié: (2025)
Submodular Context Partitioning and Compression for In-Context Learning
par: Zheng, Shaoyi, et autres
Publié: (2025)
par: Zheng, Shaoyi, et autres
Publié: (2025)
Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization
par: Bai, Yang, et autres
Publié: (2026)
par: Bai, Yang, et autres
Publié: (2026)
RLAR: An Agentic Reward System for Multi-task Reinforcement Learning on Large Language Models
par: Feng, Andrew Zhuoer, et autres
Publié: (2026)
par: Feng, Andrew Zhuoer, et autres
Publié: (2026)
CoE-SQL: In-Context Learning for Multi-Turn Text-to-SQL with Chain-of-Editions
par: Zhang, Hanchong, et autres
Publié: (2024)
par: Zhang, Hanchong, et autres
Publié: (2024)
Enhancing Personalized Multi-Turn Dialogue with Curiosity Reward
par: Wan, Yanming, et autres
Publié: (2025)
par: Wan, Yanming, et autres
Publié: (2025)
Learning to Align Multi-Faceted Evaluation: A Unified and Robust Framework
par: Xu, Kaishuai, et autres
Publié: (2025)
par: Xu, Kaishuai, et autres
Publié: (2025)
RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning
par: Wang, Zihan, et autres
Publié: (2025)
par: Wang, Zihan, et autres
Publié: (2025)
GoLongRL: Capability-Oriented Long Context Reinforcement Learning with Multitask Alignment
par: Lv, Minxuan, et autres
Publié: (2026)
par: Lv, Minxuan, et autres
Publié: (2026)
VAGEN: Reinforcing World Model Reasoning for Multi-Turn VLM Agents
par: Wang, Kangrui, et autres
Publié: (2025)
par: Wang, Kangrui, et autres
Publié: (2025)
Stabilizing Long-term Multi-turn Reinforcement Learning with Gated Rewards
par: Sun, Zetian, et autres
Publié: (2025)
par: Sun, Zetian, et autres
Publié: (2025)
LongRM: Revealing and Unlocking the Context Boundary of Reward Modeling
par: Tang, Zecheng, et autres
Publié: (2025)
par: Tang, Zecheng, et autres
Publié: (2025)
LongAlign: A Recipe for Long Context Alignment of Large Language Models
par: Bai, Yushi, et autres
Publié: (2024)
par: Bai, Yushi, et autres
Publié: (2024)
Chart-RL: Generalized Chart Comprehension via Reinforcement Learning with Verifiable Rewards
par: Zhang, Xin, et autres
Publié: (2026)
par: Zhang, Xin, et autres
Publié: (2026)
MMDuet2: Enhancing Proactive Interaction of Video MLLMs with Multi-Turn Reinforcement Learning
par: Wang, Yueqian, et autres
Publié: (2025)
par: Wang, Yueqian, et autres
Publié: (2025)
Rethinking Sample Polarity in Reinforcement Learning with Verifiable Rewards
par: Tang, Xinyu, et autres
Publié: (2025)
par: Tang, Xinyu, et autres
Publié: (2025)
Decoupling Understanding from Reasoning via Problem Space Mapping for Small-Scale Model Reasoning
par: Wang, Li, et autres
Publié: (2025)
par: Wang, Li, et autres
Publié: (2025)
GRKV: Global Regression for Training-Free KV Cache Compression in Long-Context LLMs
par: Peng, Junjie, et autres
Publié: (2026)
par: Peng, Junjie, et autres
Publié: (2026)
KnowMT-Bench: Benchmarking Knowledge-Intensive Long-Form Question Answering in Multi-Turn Dialogues
par: Chen, Junhao, et autres
Publié: (2025)
par: Chen, Junhao, et autres
Publié: (2025)
Breaking Contextual Inertia: Reinforcement Learning with Single-Turn Anchors for Stable Multi-Turn Interaction
par: Chen, Xingwu, et autres
Publié: (2026)
par: Chen, Xingwu, et autres
Publié: (2026)
ZSMerge: Zero-Shot KV Cache Compression for Memory-Efficient Long-Context LLMs
par: Liu, Xin, et autres
Publié: (2025)
par: Liu, Xin, et autres
Publié: (2025)
Outcome Accuracy is Not Enough: Aligning the Reasoning Process of Reward Models
par: Wang, Binghai, et autres
Publié: (2026)
par: Wang, Binghai, et autres
Publié: (2026)
Documents similaires
-
Learning to Adapt SFT Data for Better Reasoning Generalization
par: Sun, Lisong, et autres
Publié: (2026) -
LongRLVR: Long-Context Reinforcement Learning Requires Verifiable Context Rewards
par: Chen, Guanzheng, et autres
Publié: (2026) -
LongR: Unleashing Long-Context Reasoning via Reinforcement Learning with Dense Utility Rewards
par: Ping, Bowen, et autres
Publié: (2026) -
Training Long-Context, Multi-Turn Software Engineering Agents with Reinforcement Learning
par: Golubev, Alexander, et autres
Publié: (2025) -
Reinforcement Learning for Long-Horizon Multi-Turn Search Agents
par: Kalyan, Vivek, et autres
Publié: (2025)