Behavior Knowledge Merge in Reinforced Agentic Models
Fuente:
arXiv
Saved in:
| Main Authors: | Yuan, Xiangchi, Shi, Dachuan, Zhang, Chunhui, Liu, Zheyuan, Yao, Shenglong, Vosoughi, Soroush, Lee, Wenke |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Superficial Self-Improved Reasoners Benefit from Model Merging
by: Yuan, Xiangchi, et al.
Published: (2025)
by: Yuan, Xiangchi, et al.
Published: (2025)
What Makes a Good Curriculum? Disentangling the Effects of Data Ordering on LLM Mathematical Reasoning
by: Jia, Yaning, et al.
Published: (2025)
by: Jia, Yaning, et al.
Published: (2025)
MetaState: Persistent Working Memory Enhances Reasoning in Discrete Diffusion Language Models
by: Xia, Kejing, et al.
Published: (2026)
by: Xia, Kejing, et al.
Published: (2026)
Pretrained Image-Text Models are Secretly Video Captioners
by: Zhang, Chunhui, et al.
Published: (2025)
by: Zhang, Chunhui, et al.
Published: (2025)
Scaled Supervision is an Implicit Lipschitz Regularizer
by: Ouyang, Zhongyu, et al.
Published: (2025)
by: Ouyang, Zhongyu, et al.
Published: (2025)
Towards Interpretable Deep Reinforcement Learning Models via Inverse Reinforcement Learning
by: Xie, Sean, et al.
Published: (2022)
by: Xie, Sean, et al.
Published: (2022)
Growing Through Experience: Scaling Episodic Grounding in Language Models
by: Zhang, Chunhui, et al.
Published: (2025)
by: Zhang, Chunhui, et al.
Published: (2025)
What Makes LLMs Effective Sequential Recommenders? A Study on Preference Intensity and Temporal Context
by: Ouyang, Zhongyu, et al.
Published: (2025)
by: Ouyang, Zhongyu, et al.
Published: (2025)
Achieving Domain-Independent Certified Robustness via Knowledge Continuity
by: Sun, Alan, et al.
Published: (2024)
by: Sun, Alan, et al.
Published: (2024)
CopT: Contrastive On-Policy Thinking with Continuous Spaces for General and Agentic Reasoning
by: Shi, Dachuan, et al.
Published: (2026)
by: Shi, Dachuan, et al.
Published: (2026)
Bridging Unsupervised and Semi-Supervised Anomaly Detection: A Theoretically-Grounded and Practical Framework with Synthetic Anomalies
by: Lau, Matthew, et al.
Published: (2025)
by: Lau, Matthew, et al.
Published: (2025)
Knowledge from Large-Scale Protein Contact Prediction Models Can Be Transferred to the Data-Scarce RNA Contact Prediction Task
by: Jian, Yiren, et al.
Published: (2023)
by: Jian, Yiren, et al.
Published: (2023)
AmoebaLLM: Constructing Any-Shape Large Language Models for Efficient and Instant Deployment
by: Fu, Yonggan, et al.
Published: (2024)
by: Fu, Yonggan, et al.
Published: (2024)
NushuRescue: Revitalization of the Endangered Nushu Language with AI
by: Yang, Ivory, et al.
Published: (2024)
by: Yang, Ivory, et al.
Published: (2024)
Mitigating Forgetting Between Supervised and Reinforcement Learning Yields Stronger Reasoners
by: Yuan, Xiangchi, et al.
Published: (2025)
by: Yuan, Xiangchi, et al.
Published: (2025)
LaCache: Ladder-Shaped KV Caching for Efficient Long-Context Modeling of Large Language Models
by: Shi, Dachuan, et al.
Published: (2025)
by: Shi, Dachuan, et al.
Published: (2025)
Semantic Compositions Enhance Vision-Language Contrastive Learning
by: Aladago, Maxwell, et al.
Published: (2024)
by: Aladago, Maxwell, et al.
Published: (2024)
Merge and Guide: Unifying Model Merging and Guided Decoding for Controllable Multi-Objective Generation
by: Xie, Guofu, et al.
Published: (2025)
by: Xie, Guofu, et al.
Published: (2025)
KCES: Training-Free Defense for Robust Graph Neural Networks via Kernel Complexity
by: Jia, Yaning, et al.
Published: (2025)
by: Jia, Yaning, et al.
Published: (2025)
Forecasting at Full Spectrum: Holistic Multi-Granular Traffic Modeling under High-Throughput Inference Regimes
by: Wang, Zhaoyan, et al.
Published: (2025)
by: Wang, Zhaoyan, et al.
Published: (2025)
Orthogonal Model Merging
by: Yang, Sihan, et al.
Published: (2026)
by: Yang, Sihan, et al.
Published: (2026)
Elastic Spectral State Space Models for Budgeted Inference
by: Song, Dachuan, et al.
Published: (2026)
by: Song, Dachuan, et al.
Published: (2026)
SwiReasoning: Switch-Thinking in Latent and Explicit for Pareto-Superior Reasoning LLMs
by: Shi, Dachuan, et al.
Published: (2025)
by: Shi, Dachuan, et al.
Published: (2025)
Personalized Student Knowledge Modeling for Future Learning Resource Prediction
by: Hashemifar, Soroush, et al.
Published: (2025)
by: Hashemifar, Soroush, et al.
Published: (2025)
Model Merging with Functional Dual Anchors
by: Shi, Kexuan, et al.
Published: (2025)
by: Shi, Kexuan, et al.
Published: (2025)
Model Merging for Knowledge Editing
by: Fu, Zichuan, et al.
Published: (2025)
by: Fu, Zichuan, et al.
Published: (2025)
Modality-Aware Neuron Pruning for Unlearning in Multimodal Large Language Models
by: Liu, Zheyuan, et al.
Published: (2025)
by: Liu, Zheyuan, et al.
Published: (2025)
Pushing Forward Pareto Frontiers of Proactive Agents with Behavioral Agentic Optimization
by: Yao, Yihang, et al.
Published: (2026)
by: Yao, Yihang, et al.
Published: (2026)
BadMerging: Backdoor Attacks Against Model Merging
by: Zhang, Jinghuai, et al.
Published: (2024)
by: Zhang, Jinghuai, et al.
Published: (2024)
Merging Methods for Multilingual Knowledge Editing for Large Language Models: An Empirical Odyssey
by: Lee, Kunil, et al.
Published: (2026)
by: Lee, Kunil, et al.
Published: (2026)
SPABA: A Single-Loop and Probabilistic Stochastic Bilevel Algorithm Achieving Optimal Sample Complexity
by: Chu, Tianshu, et al.
Published: (2024)
by: Chu, Tianshu, et al.
Published: (2024)
Breaking the Trilemma of Privacy, Utility, Efficiency via Controllable Machine Unlearning
by: Liu, Zheyuan, et al.
Published: (2023)
by: Liu, Zheyuan, et al.
Published: (2023)
MergeMoE: Efficient Compression of MoE Models via Expert Output Merging
by: Miao, Ruijie, et al.
Published: (2025)
by: Miao, Ruijie, et al.
Published: (2025)
Behavior Injection: Preparing Language Models for Reinforcement Learning
by: Cen, Zhepeng, et al.
Published: (2025)
by: Cen, Zhepeng, et al.
Published: (2025)
A Combinatorial Approach to Neural Emergent Communication
by: Zhang, Zheyuan
Published: (2024)
by: Zhang, Zheyuan
Published: (2024)
Agent World Model: Infinity Synthetic Environments for Agentic Reinforcement Learning
by: Wang, Zhaoyang, et al.
Published: (2026)
by: Wang, Zhaoyang, et al.
Published: (2026)
The Hidden Signal of Verifier Strictness: Controlling and Improving Step-Wise Verification via Selective Latent Steering
by: Zhou, Yefan, et al.
Published: (2026)
by: Zhou, Yefan, et al.
Published: (2026)
FedMerge: Federated Personalization via Model Merging
by: Chen, Shutong, et al.
Published: (2025)
by: Chen, Shutong, et al.
Published: (2025)
Merging Smarter, Generalizing Better: Enhancing Model Merging on OOD Data
by: Zhang, Bingjie, et al.
Published: (2025)
by: Zhang, Bingjie, et al.
Published: (2025)
EARL: Efficient Agentic Reinforcement Learning Systems for Large Language Models
by: Tan, Zheyue, et al.
Published: (2025)
by: Tan, Zheyue, et al.
Published: (2025)
Similar Items
-
Superficial Self-Improved Reasoners Benefit from Model Merging
by: Yuan, Xiangchi, et al.
Published: (2025) -
What Makes a Good Curriculum? Disentangling the Effects of Data Ordering on LLM Mathematical Reasoning
by: Jia, Yaning, et al.
Published: (2025) -
MetaState: Persistent Working Memory Enhances Reasoning in Discrete Diffusion Language Models
by: Xia, Kejing, et al.
Published: (2026) -
Pretrained Image-Text Models are Secretly Video Captioners
by: Zhang, Chunhui, et al.
Published: (2025) -
Scaled Supervision is an Implicit Lipschitz Regularizer
by: Ouyang, Zhongyu, et al.
Published: (2025)