Dynamic Long Context Reasoning over Compressed Memory via End-to-End Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Zhuoen, Li, Dongfang, Zhang, Meishan, Hu, Baotian, Zhang, Min |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LycheeDecode: Accelerating Long-Context LLM Inference via Hybrid-Head Sparse Decoding
par: Lin, Gang, et autres
Publié: (2026)
par: Lin, Gang, et autres
Publié: (2026)
Stabilizing Long-term Multi-turn Reinforcement Learning with Gated Rewards
par: Sun, Zetian, et autres
Publié: (2025)
par: Sun, Zetian, et autres
Publié: (2025)
CMT: A Memory Compression Method for Continual Knowledge Learning of Large Language Models
par: Li, Dongfang, et autres
Publié: (2024)
par: Li, Dongfang, et autres
Publié: (2024)
In-Context Learning State Vector with Inner and Momentum Optimization
par: Li, Dongfang, et autres
Publié: (2024)
par: Li, Dongfang, et autres
Publié: (2024)
LycheeCluster: Efficient Long-Context Inference with Structure-Aware Chunking and Hierarchical KV Indexing
par: Li, Dongfang, et autres
Publié: (2026)
par: Li, Dongfang, et autres
Publié: (2026)
MemSearcher: Training LLMs to Reason, Search and Manage Memory via End-to-End Reinforcement Learning
par: Yuan, Qianhao, et autres
Publié: (2025)
par: Yuan, Qianhao, et autres
Publié: (2025)
Improving Value-based Process Verifier via Low-Cost Variance Reduction
par: Sun, Zetian, et autres
Publié: (2025)
par: Sun, Zetian, et autres
Publié: (2025)
Temporal Knowledge Question Answering via Abstract Reasoning Induction
par: Chen, Ziyang, et autres
Publié: (2023)
par: Chen, Ziyang, et autres
Publié: (2023)
Beyond Chunking: Discourse-Aware Hierarchical Retrieval for Long Document Question Answering
par: Chen, Huiyao, et autres
Publié: (2025)
par: Chen, Huiyao, et autres
Publié: (2025)
Is On-Policy Data always the Best Choice for Direct Preference Optimization-based LM Alignment?
par: Sun, Zetian, et autres
Publié: (2025)
par: Sun, Zetian, et autres
Publié: (2025)
Improving Attributed Text Generation of Large Language Models via Preference Learning
par: Li, Dongfang, et autres
Publié: (2024)
par: Li, Dongfang, et autres
Publié: (2024)
Improving Value-based Process Verifier via Structural Prior Injection
par: Sun, Zetian, et autres
Publié: (2025)
par: Sun, Zetian, et autres
Publié: (2025)
MemReread: Enhancing Agentic Long-Context Reasoning via Memory-Guided Rereading
par: Ji, Baibei, et autres
Publié: (2026)
par: Ji, Baibei, et autres
Publié: (2026)
KG-Reasoner: A Reinforced Model for End-to-End Multi-Hop Knowledge Graph Reasoning
par: Wang, Shuai, et autres
Publié: (2026)
par: Wang, Shuai, et autres
Publié: (2026)
MSA: Memory Sparse Attention for Efficient End-to-End Memory Model Scaling to 100M Tokens
par: Chen, Yu, et autres
Publié: (2026)
par: Chen, Yu, et autres
Publié: (2026)
SelectIT: Selective Instruction Tuning for LLMs via Uncertainty-Aware Self-Reflection
par: Liu, Liangxin, et autres
Publié: (2024)
par: Liu, Liangxin, et autres
Publié: (2024)
Learning to Remember: End-to-End Training of Memory Agents for Long-Context Reasoning
par: Zhang, Kehao, et autres
Publié: (2026)
par: Zhang, Kehao, et autres
Publié: (2026)
CreDes: Causal Reasoning Enhancement and Dual-End Searching for Solving Long-Range Reasoning Problems using LLMs
par: Wang, Kangsheng, et autres
Publié: (2024)
par: Wang, Kangsheng, et autres
Publié: (2024)
EVA: Efficient Reinforcement Learning for End-to-End Video Agent
par: Zhang, Yaolun, et autres
Publié: (2026)
par: Zhang, Yaolun, et autres
Publié: (2026)
Look Back to Reason Forward: Revisitable Memory for Long-Context LLM Agents
par: Shi, Yaorui, et autres
Publié: (2025)
par: Shi, Yaorui, et autres
Publié: (2025)
AutoGraph-R1: End-to-End Reinforcement Learning for Knowledge Graph Construction
par: Tsang, Hong Ting, et autres
Publié: (2025)
par: Tsang, Hong Ting, et autres
Publié: (2025)
Translatotron-V(ison): An End-to-End Model for In-Image Machine Translation
par: Lan, Zhibin, et autres
Publié: (2024)
par: Lan, Zhibin, et autres
Publié: (2024)
End-to-End Long Document Summarization using Gradient Caching
par: Saxena, Rohit, et autres
Publié: (2025)
par: Saxena, Rohit, et autres
Publié: (2025)
Using Large Language Model for End-to-End Chinese ASR and NER
par: Li, Yuang, et autres
Publié: (2024)
par: Li, Yuang, et autres
Publié: (2024)
VideoVista: A Versatile Benchmark for Video Understanding and Reasoning
par: Li, Yunxin, et autres
Publié: (2024)
par: Li, Yunxin, et autres
Publié: (2024)
Incentivizing In-depth Reasoning over Long Contexts with Process Advantage Shaping
par: Peng, Miao, et autres
Publié: (2026)
par: Peng, Miao, et autres
Publié: (2026)
When to Memorize and When to Stop: Gated Recurrent Memory for Long-Context Reasoning
par: Sheng, Leheng, et autres
Publié: (2026)
par: Sheng, Leheng, et autres
Publié: (2026)
End-to-End Agentic RAG System Training for Traceable Diagnostic Reasoning
par: Zheng, Qiaoyu, et autres
Publié: (2025)
par: Zheng, Qiaoyu, et autres
Publié: (2025)
Learning to Extract Rational Evidence via Reinforcement Learning for Retrieval-Augmented Generation
par: Zhao, Xinping, et autres
Publié: (2025)
par: Zhao, Xinping, et autres
Publié: (2025)
TSUBASA: Improving Long-Horizon Personalization via Evolving Memory and Self-Learning with Context Distillation
par: Zhang, Xinliang Frederick, et autres
Publié: (2026)
par: Zhang, Xinliang Frederick, et autres
Publié: (2026)
QUITO: Accelerating Long-Context Reasoning through Query-Guided Context Compression
par: Wang, Wenshan, et autres
Publié: (2024)
par: Wang, Wenshan, et autres
Publié: (2024)
RIG: Synergizing Reasoning and Imagination in End-to-End Generalist Policy
par: Zhao, Zhonghan, et autres
Publié: (2025)
par: Zhao, Zhonghan, et autres
Publié: (2025)
ToolOmni: Enabling Open-World Tool Use via Agentic learning with Proactive Retrieval and Grounded Execution
par: Huang, Shouzheng, et autres
Publié: (2026)
par: Huang, Shouzheng, et autres
Publié: (2026)
Distilling an End-to-End Voice Assistant Without Instruction Training Data
par: Held, William, et autres
Publié: (2024)
par: Held, William, et autres
Publié: (2024)
Long Context Compression with Activation Beacon
par: Zhang, Peitian, et autres
Publié: (2024)
par: Zhang, Peitian, et autres
Publié: (2024)
VisionGraph: Leveraging Large Multimodal Models for Graph Theory Problems in Visual Context
par: Li, Yunxin, et autres
Publié: (2024)
par: Li, Yunxin, et autres
Publié: (2024)
GSQA: An End-to-End Model for Generative Spoken Question Answering
par: Shih, Min-Han, et autres
Publié: (2023)
par: Shih, Min-Han, et autres
Publié: (2023)
PRELUDE: A Benchmark Designed to Require Global Comprehension and Reasoning over Long Contexts
par: Yu, Mo, et autres
Publié: (2025)
par: Yu, Mo, et autres
Publié: (2025)
Chain-of-Agents: End-to-End Agent Foundation Models via Multi-Agent Distillation and Agentic RL
par: Li, Weizhen, et autres
Publié: (2025)
par: Li, Weizhen, et autres
Publié: (2025)
Hit-RAG: Learning to Reason with Long Contexts via Preference Alignment
par: Liu, Junming, et autres
Publié: (2026)
par: Liu, Junming, et autres
Publié: (2026)
Documents similaires
-
LycheeDecode: Accelerating Long-Context LLM Inference via Hybrid-Head Sparse Decoding
par: Lin, Gang, et autres
Publié: (2026) -
Stabilizing Long-term Multi-turn Reinforcement Learning with Gated Rewards
par: Sun, Zetian, et autres
Publié: (2025) -
CMT: A Memory Compression Method for Continual Knowledge Learning of Large Language Models
par: Li, Dongfang, et autres
Publié: (2024) -
In-Context Learning State Vector with Inner and Momentum Optimization
par: Li, Dongfang, et autres
Publié: (2024) -
LycheeCluster: Efficient Long-Context Inference with Structure-Aware Chunking and Hierarchical KV Indexing
par: Li, Dongfang, et autres
Publié: (2026)