ReMiT: RL-Guided Mid-Training for Iterative LLM Evolution
Fuente:
arXiv
Salvato in:
| Autori principali: | Huang, Junjie, Qin, Jiarui, Yin, Di, Liu, Weiwen, Yu, Yong, Sun, Xing, Zhang, Weinan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
APTBench: Benchmarking Agentic Potential of Base LLMs During Pre-Training
di: Qin, Jiarui, et al.
Pubblicazione: (2025)
di: Qin, Jiarui, et al.
Pubblicazione: (2025)
LoopTool: Closing the Data-Training Loop for Robust LLM Tool Calls
di: Zhang, Kangning, et al.
Pubblicazione: (2025)
di: Zhang, Kangning, et al.
Pubblicazione: (2025)
Position: The Real Barrier to LLM Agent Usability is Agentic ROI
di: Liu, Weiwen, et al.
Pubblicazione: (2025)
di: Liu, Weiwen, et al.
Pubblicazione: (2025)
SkillMAS: Skill Co-Evolution with LLM-based Multi-Agent System
di: Pan, Shuai, et al.
Pubblicazione: (2026)
di: Pan, Shuai, et al.
Pubblicazione: (2026)
Beyond Graph Convolution: Multimodal Recommendation with Topology-aware MLPs
di: Huang, Junjie, et al.
Pubblicazione: (2024)
di: Huang, Junjie, et al.
Pubblicazione: (2024)
D2K: Turning Historical Data into Retrievable Knowledge for Recommender Systems
di: Qin, Jiarui, et al.
Pubblicazione: (2024)
di: Qin, Jiarui, et al.
Pubblicazione: (2024)
On the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Models
di: Zhang, Charlie, et al.
Pubblicazione: (2025)
di: Zhang, Charlie, et al.
Pubblicazione: (2025)
CATArena: Evaluating Evolutionary Capabilities of Code Agents via Iterative Tournaments
di: Fu, Lingyue, et al.
Pubblicazione: (2025)
di: Fu, Lingyue, et al.
Pubblicazione: (2025)
Learning to Reason as Action Abstractions with Scalable Mid-Training RL
di: Zhang, Shenao, et al.
Pubblicazione: (2025)
di: Zhang, Shenao, et al.
Pubblicazione: (2025)
A Survey on LLM Mid-Training
di: Tu, Chengying, et al.
Pubblicazione: (2025)
di: Tu, Chengying, et al.
Pubblicazione: (2025)
CoLD: Counterfactually-Guided Length Debiasing for Process Reward Models in Mathematical Reasoning
di: Zheng, Congmin, et al.
Pubblicazione: (2025)
di: Zheng, Congmin, et al.
Pubblicazione: (2025)
TL-GRPO: Turn-Level RL for Reasoning-Guided Iterative Optimization
di: Li, Peiji, et al.
Pubblicazione: (2026)
di: Li, Peiji, et al.
Pubblicazione: (2026)
Automatically Benchmarking LLM Code Agents through Agent-Driven Annotation and Evaluation
di: Fu, Lingyue, et al.
Pubblicazione: (2025)
di: Fu, Lingyue, et al.
Pubblicazione: (2025)
Skills on the Fly: Test-Time Adaptive Skill Synthesis for LLM Agents
di: Wang, Jingxing, et al.
Pubblicazione: (2026)
di: Wang, Jingxing, et al.
Pubblicazione: (2026)
PoLi-RL: A Point-to-List Reinforcement Learning Framework for Conditional Semantic Textual Similarity
di: Song, Zixin, et al.
Pubblicazione: (2025)
di: Song, Zixin, et al.
Pubblicazione: (2025)
A Survey of LLM-based Deep Search Agents: Paradigm, Optimization, Evaluation, and Challenges
di: Xi, Yunjia, et al.
Pubblicazione: (2025)
di: Xi, Yunjia, et al.
Pubblicazione: (2025)
MemAgent: Reshaping Long-Context LLM with Multi-Conv RL-based Memory Agent
di: Yu, Hongli, et al.
Pubblicazione: (2025)
di: Yu, Hongli, et al.
Pubblicazione: (2025)
FP8-RL: A Practical and Stable Low-Precision Stack for LLM Reinforcement Learning
di: Qiu, Zhaopeng, et al.
Pubblicazione: (2026)
di: Qiu, Zhaopeng, et al.
Pubblicazione: (2026)
LogitsCoder: Towards Efficient Chain-of-Thought Path Search via Logits Preference Decoding for Code Generation
di: Chen, Jizheng, et al.
Pubblicazione: (2026)
di: Chen, Jizheng, et al.
Pubblicazione: (2026)
Fast, Slow, and Tool-augmented Thinking for LLMs: A Review
di: Jia, Xinda, et al.
Pubblicazione: (2025)
di: Jia, Xinda, et al.
Pubblicazione: (2025)
WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning
di: Qi, Zehan, et al.
Pubblicazione: (2024)
di: Qi, Zehan, et al.
Pubblicazione: (2024)
ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search
di: Zhang, Dan, et al.
Pubblicazione: (2024)
di: Zhang, Dan, et al.
Pubblicazione: (2024)
Evolutionary Perspectives on the Evaluation of LLM-Based AI Agents: A Comprehensive Survey
di: Zhu, Jiachen, et al.
Pubblicazione: (2025)
di: Zhu, Jiachen, et al.
Pubblicazione: (2025)
CoEvolve: Training LLM Agents via Agent-Data Mutual Evolution
di: Yang, Shidong, et al.
Pubblicazione: (2026)
di: Yang, Shidong, et al.
Pubblicazione: (2026)
ReLook: Vision-Grounded RL with a Multimodal LLM Critic for Agentic Web Coding
di: Li, Yuhang, et al.
Pubblicazione: (2025)
di: Li, Yuhang, et al.
Pubblicazione: (2025)
ToReMi: Topic-Aware Data Reweighting for Dynamic Pre-Training Data Selection
di: Zhu, Xiaoxuan, et al.
Pubblicazione: (2025)
di: Zhu, Xiaoxuan, et al.
Pubblicazione: (2025)
Guided Profile Generation Improves Personalization with LLMs
di: Zhang, Jiarui
Pubblicazione: (2024)
di: Zhang, Jiarui
Pubblicazione: (2024)
APT: Improving Specialist LLM Performance with Weakness Case Acquisition and Iterative Preference Training
di: Rao, Jun, et al.
Pubblicazione: (2025)
di: Rao, Jun, et al.
Pubblicazione: (2025)
NL-Debugging: Exploiting Natural Language as an Intermediate Representation for Code Debugging
di: Zhang, Weiming, et al.
Pubblicazione: (2025)
di: Zhang, Weiming, et al.
Pubblicazione: (2025)
ToolACE-R: Model-aware Iterative Training and Adaptive Refinement for Tool Learning
di: Zeng, Xingshan, et al.
Pubblicazione: (2025)
di: Zeng, Xingshan, et al.
Pubblicazione: (2025)
Unleashing the Potential of Multi-Channel Fusion in Retrieval for Personalized Recommendations
di: Huang, Junjie, et al.
Pubblicazione: (2024)
di: Huang, Junjie, et al.
Pubblicazione: (2024)
ReDit: Reward Dithering for Improved LLM Policy Optimization
di: Wei, Chenxing, et al.
Pubblicazione: (2025)
di: Wei, Chenxing, et al.
Pubblicazione: (2025)
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
Table-LLM-Specialist: Language Model Specialists for Tables using Iterative Generator-Validator Fine-tuning
di: Xing, Junjie, et al.
Pubblicazione: (2024)
di: Xing, Junjie, et al.
Pubblicazione: (2024)
ColorBench: Benchmarking Mobile Agents with Graph-Structured Framework for Complex Long-Horizon Tasks
di: Song, Yuanyi, et al.
Pubblicazione: (2025)
di: Song, Yuanyi, et al.
Pubblicazione: (2025)
PilotRL: Training Language Model Agents via Global Planning-Guided Progressive Reinforcement Learning
di: Lu, Keer, et al.
Pubblicazione: (2025)
di: Lu, Keer, et al.
Pubblicazione: (2025)
Quick on the Uptake: Eliciting Implicit Intents from Human Demonstrations for Personalized Mobile-Use Agents
di: Wu, Zheng, et al.
Pubblicazione: (2025)
di: Wu, Zheng, et al.
Pubblicazione: (2025)
How Does Personalized Memory Shape LLM Behavior? Benchmarking Rational Preference Utilization in Personalized Assistants
di: Feng, Xueyang, et al.
Pubblicazione: (2026)
di: Feng, Xueyang, et al.
Pubblicazione: (2026)
MiCRo: Mixture Modeling and Context-aware Routing for Personalized Preference Learning
di: Shen, Jingyan, et al.
Pubblicazione: (2025)
di: Shen, Jingyan, et al.
Pubblicazione: (2025)
Agent-Dice: Disentangling Knowledge Updates via Geometric Consensus for Agent Continual Learning
di: Wu, Zheng, et al.
Pubblicazione: (2026)
di: Wu, Zheng, et al.
Pubblicazione: (2026)
Documenti analoghi
-
APTBench: Benchmarking Agentic Potential of Base LLMs During Pre-Training
di: Qin, Jiarui, et al.
Pubblicazione: (2025) -
LoopTool: Closing the Data-Training Loop for Robust LLM Tool Calls
di: Zhang, Kangning, et al.
Pubblicazione: (2025) -
Position: The Real Barrier to LLM Agent Usability is Agentic ROI
di: Liu, Weiwen, et al.
Pubblicazione: (2025) -
SkillMAS: Skill Co-Evolution with LLM-based Multi-Agent System
di: Pan, Shuai, et al.
Pubblicazione: (2026) -
Beyond Graph Convolution: Multimodal Recommendation with Topology-aware MLPs
di: Huang, Junjie, et al.
Pubblicazione: (2024)