SuRe: Surprise-Driven Prioritised Replay for Continual LLM Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Hazard, Hugo, Fountas, Zafeirios, Benfeghoul, Martin A., Oomerjee, Adnan, Wang, Jun, Bou-Ammar, Haitham |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Untangling Component Imbalance in Hybrid Linear Attention Conversion Methods
di: Benfeghoul, Martin, et al.
Pubblicazione: (2025)
di: Benfeghoul, Martin, et al.
Pubblicazione: (2025)
Human-inspired Episodic Memory for Infinite Context LLMs
di: Fountas, Zafeirios, et al.
Pubblicazione: (2024)
di: Fountas, Zafeirios, et al.
Pubblicazione: (2024)
Bottlenecked Transformers: Periodic KV Cache Consolidation for Generalised Reasoning
di: Oomerjee, Adnan, et al.
Pubblicazione: (2025)
di: Oomerjee, Adnan, et al.
Pubblicazione: (2025)
Subjective Depth and Timescale Transformers: Learning Where and When to Compute
di: Wieser, Frederico, et al.
Pubblicazione: (2025)
di: Wieser, Frederico, et al.
Pubblicazione: (2025)
Why the Brain Consolidates: Predictive Forgetting for Optimal Generalisation
di: Fountas, Zafeirios, et al.
Pubblicazione: (2026)
di: Fountas, Zafeirios, et al.
Pubblicazione: (2026)
When in Doubt, Think Slow: Iterative Reasoning with Latent Imagination
di: Benfeghoul, Martin, et al.
Pubblicazione: (2024)
di: Benfeghoul, Martin, et al.
Pubblicazione: (2024)
Emergent Bayesian Behaviour and Optimal Cue Combination in LLMs
di: Ma, Julian, et al.
Pubblicazione: (2025)
di: Ma, Julian, et al.
Pubblicazione: (2025)
SuRe: Summarizing Retrievals using Answer Candidates for Open-domain QA of LLMs
di: Kim, Jaehyung, et al.
Pubblicazione: (2024)
di: Kim, Jaehyung, et al.
Pubblicazione: (2024)
A Brain-like Synergistic Core in LLMs Drives Behaviour and Learning
di: Urbina-Rodriguez, Pedro, et al.
Pubblicazione: (2026)
di: Urbina-Rodriguez, Pedro, et al.
Pubblicazione: (2026)
SparsePO: Controlling Preference Alignment of LLMs via Sparse Token Masks
di: Christopoulou, Fenia, et al.
Pubblicazione: (2024)
di: Christopoulou, Fenia, et al.
Pubblicazione: (2024)
Mixture of Attentions For Speculative Decoding
di: Zimmer, Matthieu, et al.
Pubblicazione: (2024)
di: Zimmer, Matthieu, et al.
Pubblicazione: (2024)
GeRe: Towards Efficient Anti-Forgetting in Continual Learning of LLM via General Samples Replay
di: Zhang, Yunan, et al.
Pubblicazione: (2025)
di: Zhang, Yunan, et al.
Pubblicazione: (2025)
Risk-Controlled Lean-as-Judge for Natural-Language Mathematical Reasoning
di: Bourigault, Pauline, et al.
Pubblicazione: (2026)
di: Bourigault, Pauline, et al.
Pubblicazione: (2026)
A Pragmatist Robot: Learning to Plan Tasks by Experiencing the Real World
di: Qu, Kaixian, et al.
Pubblicazione: (2025)
di: Qu, Kaixian, et al.
Pubblicazione: (2025)
Multi-Task GRPO: Reliable LLM Reasoning Across Tasks
di: Ramesh, Shyam Sundhar, et al.
Pubblicazione: (2026)
di: Ramesh, Shyam Sundhar, et al.
Pubblicazione: (2026)
Surprisal Driven $k$-NN for Robust and Interpretable Nonparametric Learning
di: Banerjee, Amartya, et al.
Pubblicazione: (2023)
di: Banerjee, Amartya, et al.
Pubblicazione: (2023)
Sample as You Infer: Predictive Coding With Langevin Dynamics
di: Zahid, Umais, et al.
Pubblicazione: (2023)
di: Zahid, Umais, et al.
Pubblicazione: (2023)
MSSR: Memory-Aware Adaptive Replay for Continual LLM Fine-Tuning
di: Lu, Yiyang, et al.
Pubblicazione: (2026)
di: Lu, Yiyang, et al.
Pubblicazione: (2026)
RePO: Replay-Enhanced Policy Optimization
di: Li, Siheng, et al.
Pubblicazione: (2025)
di: Li, Siheng, et al.
Pubblicazione: (2025)
Decoding as Optimisation on the Probability Simplex: From Top-K to Top-P (Nucleus) to Best-of-K Samplers
di: Ji, Xiaotong, et al.
Pubblicazione: (2026)
di: Ji, Xiaotong, et al.
Pubblicazione: (2026)
Scalable Power Sampling: Unlocking Efficient, Training-Free Reasoning for LLMs via Distribution Sharpening
di: Ji, Xiaotong, et al.
Pubblicazione: (2026)
di: Ji, Xiaotong, et al.
Pubblicazione: (2026)
Rethinking Large Language Model Distillation: A Constrained Markov Decision Process Perspective
di: Zimmer, Matthieu, et al.
Pubblicazione: (2025)
di: Zimmer, Matthieu, et al.
Pubblicazione: (2025)
Model-Based and Sample-Efficient AI-Assisted Math Discovery in Sphere Packing
di: Tutunov, Rasul, et al.
Pubblicazione: (2025)
di: Tutunov, Rasul, et al.
Pubblicazione: (2025)
AgentHER: Hindsight Experience Replay for LLM Agent Trajectory Relabeling
di: Ding, Liang
Pubblicazione: (2026)
di: Ding, Liang
Pubblicazione: (2026)
FOREVER: Forgetting Curve-Inspired Memory Replay for Language Model Continual Learning
di: Feng, Yujie, et al.
Pubblicazione: (2026)
di: Feng, Yujie, et al.
Pubblicazione: (2026)
Learning by Surprise: Surplexity for Mitigating Model Collapse in Generative AI
di: Gambetta, Daniele, et al.
Pubblicazione: (2024)
di: Gambetta, Daniele, et al.
Pubblicazione: (2024)
Self-generated Replay Memories for Continual Neural Machine Translation
di: Resta, Michele, et al.
Pubblicazione: (2024)
di: Resta, Michele, et al.
Pubblicazione: (2024)
Bourbaki: Self-Generated and Goal-Conditioned MDPs for Theorem Proving
di: Zimmer, Matthieu, et al.
Pubblicazione: (2025)
di: Zimmer, Matthieu, et al.
Pubblicazione: (2025)
Internalizing LLM Reasoning via Discovery and Replay of Latent Actions
di: Shi, Zhenning, et al.
Pubblicazione: (2026)
di: Shi, Zhenning, et al.
Pubblicazione: (2026)
The Model Knows, the Decoder Finds: Future Value Guided Particle Power Sampling
di: Nguyen, Tu, et al.
Pubblicazione: (2026)
di: Nguyen, Tu, et al.
Pubblicazione: (2026)
The $\mathbf{Y}$-Combinator for LLMs: Solving Long-Context Rot with $λ$-Calculus
di: Roy, Amartya, et al.
Pubblicazione: (2026)
di: Roy, Amartya, et al.
Pubblicazione: (2026)
Revisiting Replay and Gradient Alignment for Continual Pre-Training of Large Language Models
di: Abbes, Istabrak, et al.
Pubblicazione: (2025)
di: Abbes, Istabrak, et al.
Pubblicazione: (2025)
Confabulation: The Surprising Value of Large Language Model Hallucinations
di: Sui, Peiqi, et al.
Pubblicazione: (2024)
di: Sui, Peiqi, et al.
Pubblicazione: (2024)
The Surprising Effectiveness of Test-Time Training for Few-Shot Learning
di: Akyürek, Ekin, et al.
Pubblicazione: (2024)
di: Akyürek, Ekin, et al.
Pubblicazione: (2024)
Does Knowledge Localization Hold True? Surprising Differences Between Entity and Relation Perspectives in Language Models
di: Wei, Yifan, et al.
Pubblicazione: (2024)
di: Wei, Yifan, et al.
Pubblicazione: (2024)
Many of Your DPOs are Secretly One: Attempting Unification Through Mutual Information
di: Tutnov, Rasul, et al.
Pubblicazione: (2025)
di: Tutnov, Rasul, et al.
Pubblicazione: (2025)
Trust Region Inverse Reinforcement Learning: Explicit Dual Ascent using Local Policy Updates
di: Diwan, Anish, et al.
Pubblicazione: (2026)
di: Diwan, Anish, et al.
Pubblicazione: (2026)
LURE: Live-Usage Replay Evaluations for Reducing Evaluation Awareness
di: Ivanov, Igor, et al.
Pubblicazione: (2026)
di: Ivanov, Igor, et al.
Pubblicazione: (2026)
Replay Failures as Successes: Sample-Efficient Reinforcement Learning for Instruction Following
di: Zhang, Kongcheng, et al.
Pubblicazione: (2025)
di: Zhang, Kongcheng, et al.
Pubblicazione: (2025)
GenQuest: An LLM-based Text Adventure Game for Language Learners
di: Wang, Qiao, et al.
Pubblicazione: (2025)
di: Wang, Qiao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Untangling Component Imbalance in Hybrid Linear Attention Conversion Methods
di: Benfeghoul, Martin, et al.
Pubblicazione: (2025) -
Human-inspired Episodic Memory for Infinite Context LLMs
di: Fountas, Zafeirios, et al.
Pubblicazione: (2024) -
Bottlenecked Transformers: Periodic KV Cache Consolidation for Generalised Reasoning
di: Oomerjee, Adnan, et al.
Pubblicazione: (2025) -
Subjective Depth and Timescale Transformers: Learning Where and When to Compute
di: Wieser, Frederico, et al.
Pubblicazione: (2025) -
Why the Brain Consolidates: Predictive Forgetting for Optimal Generalisation
di: Fountas, Zafeirios, et al.
Pubblicazione: (2026)