Free(): Learning to Forget in Malloc-Only Reasoning Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zheng, Yilun, Ma, Dongyang, Liang, Tian, Xu, Jiahao, Huang, Xinting, Chen, Lihui, Mi, Haitao, Wang, Yan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
The End of Manual Decoding: Towards Truly End-to-End Language Models
von: Wang, Zhichao, et al.
Veröffentlicht: (2025)
von: Wang, Zhichao, et al.
Veröffentlicht: (2025)
DeepCompress: A Dual Reward Strategy for Dynamically Exploring and Compressing Reasoning Chains
von: Liang, Tian, et al.
Veröffentlicht: (2025)
von: Liang, Tian, et al.
Veröffentlicht: (2025)
Less is More: Denoising Knowledge Graphs For Retrieval Augmented Generation
von: Zheng, Yilun, et al.
Veröffentlicht: (2025)
von: Zheng, Yilun, et al.
Veröffentlicht: (2025)
DeepTheorem: Advancing LLM Reasoning for Theorem Proving Through Natural Language and Reinforcement Learning
von: Zhang, Ziyin, et al.
Veröffentlicht: (2025)
von: Zhang, Ziyin, et al.
Veröffentlicht: (2025)
Mitigating Catastrophic Forgetting in Large Language Models with Self-Synthesized Rehearsal
von: Huang, Jianheng, et al.
Veröffentlicht: (2024)
von: Huang, Jianheng, et al.
Veröffentlicht: (2024)
Trust, But Verify: A Self-Verification Approach to Reinforcement Learning with Verifiable Rewards
von: Liu, Xiaoyuan, et al.
Veröffentlicht: (2025)
von: Liu, Xiaoyuan, et al.
Veröffentlicht: (2025)
Graph-O1 : Monte Carlo Tree Search with Reinforcement Learning for Text-Attributed Graph Reasoning
von: Liu, Lihui
Veröffentlicht: (2025)
von: Liu, Lihui
Veröffentlicht: (2025)
WebDevJudge: Evaluating (M)LLMs as Critiques for Web Development Quality
von: Li, Chunyang, et al.
Veröffentlicht: (2025)
von: Li, Chunyang, et al.
Veröffentlicht: (2025)
Group Distributionally Robust Optimization-Driven Reinforcement Learning for LLM Reasoning
von: Panaganti, Kishan, et al.
Veröffentlicht: (2026)
von: Panaganti, Kishan, et al.
Veröffentlicht: (2026)
Block-Attention for Efficient Prefilling
von: Ma, Dongyang, et al.
Veröffentlicht: (2024)
von: Ma, Dongyang, et al.
Veröffentlicht: (2024)
DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning
von: He, Zhiwei, et al.
Veröffentlicht: (2025)
von: He, Zhiwei, et al.
Veröffentlicht: (2025)
Decomposing Representation Space into Interpretable Subspaces with Unsupervised Learning
von: Huang, Xinting, et al.
Veröffentlicht: (2025)
von: Huang, Xinting, et al.
Veröffentlicht: (2025)
The Pensieve Paradigm: Stateful Language Models Mastering Their Own Context
von: Liu, Xiaoyuan, et al.
Veröffentlicht: (2026)
von: Liu, Xiaoyuan, et al.
Veröffentlicht: (2026)
Offline Learning and Forgetting for Reasoning with Large Language Models
von: Ni, Tianwei, et al.
Veröffentlicht: (2025)
von: Ni, Tianwei, et al.
Veröffentlicht: (2025)
EconProver: Towards More Economical Test-Time Scaling for Automated Theorem Proving
von: Li, Mukai, et al.
Veröffentlicht: (2025)
von: Li, Mukai, et al.
Veröffentlicht: (2025)
DOTS: Learning to Reason Dynamically in LLMs via Optimal Reasoning Trajectories Search
von: Yue, Murong, et al.
Veröffentlicht: (2024)
von: Yue, Murong, et al.
Veröffentlicht: (2024)
Self-Consistency Boosts Calibration for Math Reasoning
von: Wang, Ante, et al.
Veröffentlicht: (2024)
von: Wang, Ante, et al.
Veröffentlicht: (2024)
LLM Unlearning via Loss Adjustment with Only Forget Data
von: Wang, Yaxuan, et al.
Veröffentlicht: (2024)
von: Wang, Yaxuan, et al.
Veröffentlicht: (2024)
Fine-Grained Self-Endorsement Improves Factuality and Reasoning
von: Wang, Ante, et al.
Veröffentlicht: (2024)
von: Wang, Ante, et al.
Veröffentlicht: (2024)
Dual-Uncertainty Guided Policy Learning for Multimodal Reasoning
von: Liu, Rui, et al.
Veröffentlicht: (2025)
von: Liu, Rui, et al.
Veröffentlicht: (2025)
Expediting and Elevating Large Language Model Reasoning via Hidden Chain-of-Thought Decoding
von: Liu, Tianqiao, et al.
Veröffentlicht: (2024)
von: Liu, Tianqiao, et al.
Veröffentlicht: (2024)
Routing-Free Mixture-of-Experts
von: Liu, Yilun, et al.
Veröffentlicht: (2026)
von: Liu, Yilun, et al.
Veröffentlicht: (2026)
Safety Recovery in Reasoning Models Is Only a Few Early Steering Steps Away
von: Ghosal, Soumya Suvra, et al.
Veröffentlicht: (2026)
von: Ghosal, Soumya Suvra, et al.
Veröffentlicht: (2026)
PRISM-MCTS: Learning from Reasoning Trajectories with Metacognitive Reflection
von: Cheng, Siyuan, et al.
Veröffentlicht: (2026)
von: Cheng, Siyuan, et al.
Veröffentlicht: (2026)
Assessing Logical Reasoning Capabilities of Encoder-Only Transformer Models
von: Pirozelli, Paulo, et al.
Veröffentlicht: (2023)
von: Pirozelli, Paulo, et al.
Veröffentlicht: (2023)
Revisiting Catastrophic Forgetting in Large Language Model Tuning
von: Li, Hongyu, et al.
Veröffentlicht: (2024)
von: Li, Hongyu, et al.
Veröffentlicht: (2024)
FanChuan: A Multilingual and Graph-Structured Benchmark For Parody Detection and Analysis
von: Zheng, Yilun, et al.
Veröffentlicht: (2025)
von: Zheng, Yilun, et al.
Veröffentlicht: (2025)
HDFlow: Enhancing LLM Complex Problem-Solving with Hybrid Thinking and Dynamic Workflows
von: Yao, Wenlin, et al.
Veröffentlicht: (2024)
von: Yao, Wenlin, et al.
Veröffentlicht: (2024)
Dual-Head Reasoning Distillation: Improving Classifier Accuracy with Train-Time-Only Reasoning
von: Xu, Jillian, et al.
Veröffentlicht: (2025)
von: Xu, Jillian, et al.
Veröffentlicht: (2025)
Reasoning with Sampling: Your Base Model is Smarter Than You Think
von: Karan, Aayush, et al.
Veröffentlicht: (2025)
von: Karan, Aayush, et al.
Veröffentlicht: (2025)
Training LLM Agents for Spontaneous, Reward-Free Self-Evolution via World Knowledge Exploration
von: Zhang, Qifan, et al.
Veröffentlicht: (2026)
von: Zhang, Qifan, et al.
Veröffentlicht: (2026)
Advancing Mathematical Reasoning in Language Models: The Impact of Problem-Solving Data, Data Synthesis Methods, and Training Stages
von: Chen, Zui, et al.
Veröffentlicht: (2025)
von: Chen, Zui, et al.
Veröffentlicht: (2025)
Contrastive Reasoning Alignment: Reinforcement Learning from Hidden Representations
von: Luo, Haozheng, et al.
Veröffentlicht: (2026)
von: Luo, Haozheng, et al.
Veröffentlicht: (2026)
ReasoningGuard: Safeguarding Large Reasoning Models with Inference-time Safety Aha Moments
von: Wang, Yuquan, et al.
Veröffentlicht: (2025)
von: Wang, Yuquan, et al.
Veröffentlicht: (2025)
Draft Model Knows When to Stop: Self-Verification Speculative Decoding for Long-Form Generation
von: Zhang, Ziyin, et al.
Veröffentlicht: (2024)
von: Zhang, Ziyin, et al.
Veröffentlicht: (2024)
Entropy-Adaptive Fine-Tuning: Resolving Confident Conflicts to Mitigate Forgetting
von: Diao, Muxi, et al.
Veröffentlicht: (2026)
von: Diao, Muxi, et al.
Veröffentlicht: (2026)
SUCEA: Reasoning-Intensive Retrieval for Adversarial Fact-checking through Claim Decomposition and Editing
von: Liu, Hongjun, et al.
Veröffentlicht: (2025)
von: Liu, Hongjun, et al.
Veröffentlicht: (2025)
SciAgent: A Unified Multi-Agent System for Generalistic Scientific Reasoning
von: Li, Xuchen, et al.
Veröffentlicht: (2025)
von: Li, Xuchen, et al.
Veröffentlicht: (2025)
Atomic Skills are the Prerequisite: When Reinforcement Learning Synthesizes Compositional Reasoning, and When It Only Amplifies
von: Cheng, Sitao, et al.
Veröffentlicht: (2025)
von: Cheng, Sitao, et al.
Veröffentlicht: (2025)
Wings: Learning Multimodal LLMs without Text-only Forgetting
von: Zhang, Yi-Kai, et al.
Veröffentlicht: (2024)
von: Zhang, Yi-Kai, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
The End of Manual Decoding: Towards Truly End-to-End Language Models
von: Wang, Zhichao, et al.
Veröffentlicht: (2025) -
DeepCompress: A Dual Reward Strategy for Dynamically Exploring and Compressing Reasoning Chains
von: Liang, Tian, et al.
Veröffentlicht: (2025) -
Less is More: Denoising Knowledge Graphs For Retrieval Augmented Generation
von: Zheng, Yilun, et al.
Veröffentlicht: (2025) -
DeepTheorem: Advancing LLM Reasoning for Theorem Proving Through Natural Language and Reinforcement Learning
von: Zhang, Ziyin, et al.
Veröffentlicht: (2025) -
Mitigating Catastrophic Forgetting in Large Language Models with Self-Synthesized Rehearsal
von: Huang, Jianheng, et al.
Veröffentlicht: (2024)