Let Me Grok for You: Accelerating Grokking via Embedding Transfer from a Weaker Model
Fuente:
arXiv
Salvato in:
| Autori principali: | Xu, Zhiwei, Ni, Zhiyu, Wang, Yixin, Hu, Wei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
To Grok Grokking: Provable Grokking in Ridge Regression
di: Xu, Mingyue, et al.
Pubblicazione: (2026)
di: Xu, Mingyue, et al.
Pubblicazione: (2026)
GrokAlign: Geometric Characterisation and Acceleration of Grokking
di: Walker, Thomas, et al.
Pubblicazione: (2025)
di: Walker, Thomas, et al.
Pubblicazione: (2025)
NeuralGrok: Accelerate Grokking by Neural Gradient Transformation
di: Zhou, Xinyu, et al.
Pubblicazione: (2025)
di: Zhou, Xinyu, et al.
Pubblicazione: (2025)
Why Do You Grok? A Theoretical Analysis of Grokking Modular Addition
di: Mohamadi, Mohamad Amin, et al.
Pubblicazione: (2024)
di: Mohamadi, Mohamad Amin, et al.
Pubblicazione: (2024)
Grokking in Linear Estimators -- A Solvable Model that Groks without Understanding
di: Levi, Noam, et al.
Pubblicazione: (2023)
di: Levi, Noam, et al.
Pubblicazione: (2023)
Mechanistic Insights into Grokking from the Embedding Layer
di: AlquBoj, H. V., et al.
Pubblicazione: (2025)
di: AlquBoj, H. V., et al.
Pubblicazione: (2025)
Muon Optimizer Accelerates Grokking
di: Tveit, Amund, et al.
Pubblicazione: (2025)
di: Tveit, Amund, et al.
Pubblicazione: (2025)
Language Models "Grok" to Copy
di: Lv, Ang, et al.
Pubblicazione: (2024)
di: Lv, Ang, et al.
Pubblicazione: (2024)
Grokfast: Accelerated Grokking by Amplifying Slow Gradients
di: Lee, Jaerin, et al.
Pubblicazione: (2024)
di: Lee, Jaerin, et al.
Pubblicazione: (2024)
Acceleration of Grokking in Learning Arithmetic Operations via Kolmogorov-Arnold Representation
di: Park, Yeachan, et al.
Pubblicazione: (2024)
di: Park, Yeachan, et al.
Pubblicazione: (2024)
Egalitarian Gradient Descent: A Simple Approach to Accelerated Grokking
di: Pasand, Ali Saheb, et al.
Pubblicazione: (2025)
di: Pasand, Ali Saheb, et al.
Pubblicazione: (2025)
Adaptive Variance Reduction for Stochastic Optimization under Weaker Assumptions
di: Jiang, Wei, et al.
Pubblicazione: (2024)
di: Jiang, Wei, et al.
Pubblicazione: (2024)
Tracing the Path to Grokking: Embeddings, Dropout, and Network Activation
di: Salah, Ahmed, et al.
Pubblicazione: (2025)
di: Salah, Ahmed, et al.
Pubblicazione: (2025)
Grokked Models are Better Unlearners
di: Liang, Yuanbang, et al.
Pubblicazione: (2025)
di: Liang, Yuanbang, et al.
Pubblicazione: (2025)
Latency-Response Theory Model: Evaluating Large Language Models via Response Accuracy and Chain-of-Thought Length
di: Xu, Zhiyu, et al.
Pubblicazione: (2025)
di: Xu, Zhiyu, et al.
Pubblicazione: (2025)
Exploring Grokking: Experimental and Mechanistic Investigations
di: Qiye, Hu, et al.
Pubblicazione: (2024)
di: Qiye, Hu, et al.
Pubblicazione: (2024)
Bridging Lottery Ticket and Grokking: Understanding Grokking from Inner Structure of Networks
di: Minegishi, Gouki, et al.
Pubblicazione: (2023)
di: Minegishi, Gouki, et al.
Pubblicazione: (2023)
Early-Warning Signals of Grokking via Loss-Landscape Geometry
di: Xu, Yongzhong
Pubblicazione: (2026)
di: Xu, Yongzhong
Pubblicazione: (2026)
The Complexity Dynamics of Grokking
di: DeMoss, Branton, et al.
Pubblicazione: (2024)
di: DeMoss, Branton, et al.
Pubblicazione: (2024)
Measuring Sharpness in Grokking
di: Miller, Jack, et al.
Pubblicazione: (2024)
di: Miller, Jack, et al.
Pubblicazione: (2024)
Topological Signatures of Grokking
di: Tang, Yifan, et al.
Pubblicazione: (2026)
di: Tang, Yifan, et al.
Pubblicazione: (2026)
Towards Weaker Variance Assumptions for Stochastic Optimization
di: Alacaoglu, Ahmet, et al.
Pubblicazione: (2025)
di: Alacaoglu, Ahmet, et al.
Pubblicazione: (2025)
Unified View of Grokking, Double Descent and Emergent Abilities: A Perspective from Circuits Competition
di: Huang, Yufei, et al.
Pubblicazione: (2024)
di: Huang, Yufei, et al.
Pubblicazione: (2024)
Beyond Progress Measures: Theoretical Insights into the Mechanism of Grokking
di: Gu, Zihan, et al.
Pubblicazione: (2025)
di: Gu, Zihan, et al.
Pubblicazione: (2025)
Grokking in Linear Models for Logistic Regression
di: Das, Nataraj, et al.
Pubblicazione: (2026)
di: Das, Nataraj, et al.
Pubblicazione: (2026)
Scalable Text-Embedding-informed Cognitive Diagnosis of Large Language Models
di: Liu, Jia, et al.
Pubblicazione: (2026)
di: Liu, Jia, et al.
Pubblicazione: (2026)
Distributional Spectral Diagnostics for Localizing Grokking Transitions
di: Wang, Ziyue, et al.
Pubblicazione: (2026)
di: Wang, Ziyue, et al.
Pubblicazione: (2026)
Grokking of Diffusion Models: Case Study on Modular Addition
di: Kim, Joon Hyeok, et al.
Pubblicazione: (2026)
di: Kim, Joon Hyeok, et al.
Pubblicazione: (2026)
Flatness is Necessary, Neural Collapse is Not: Rethinking Generalization via Grokking
di: Han, Ting, et al.
Pubblicazione: (2025)
di: Han, Ting, et al.
Pubblicazione: (2025)
Let Go of Your Labels with Unsupervised Transfer
di: Gadetsky, Artyom, et al.
Pubblicazione: (2024)
di: Gadetsky, Artyom, et al.
Pubblicazione: (2024)
Low-Dimensional and Transversely Curved Optimization Dynamics in Grokking
di: Xu, Yongzhong
Pubblicazione: (2026)
di: Xu, Yongzhong
Pubblicazione: (2026)
GrokFormer: Graph Fourier Kolmogorov-Arnold Transformers
di: Ai, Guoguo, et al.
Pubblicazione: (2024)
di: Ai, Guoguo, et al.
Pubblicazione: (2024)
ILDR: Geometric Early Detection of Grokking
di: Golwala, Shreel
Pubblicazione: (2026)
di: Golwala, Shreel
Pubblicazione: (2026)
Grokking Beyond Neural Networks: An Empirical Exploration with Model Complexity
di: Miller, Jack, et al.
Pubblicazione: (2023)
di: Miller, Jack, et al.
Pubblicazione: (2023)
A Basin-Selection Perspective on Grokking via Singular Learning Theory
di: Cullen, Ben, et al.
Pubblicazione: (2026)
di: Cullen, Ben, et al.
Pubblicazione: (2026)
Let Models Speak Ciphers: Multiagent Debate through Embeddings
di: Pham, Chau, et al.
Pubblicazione: (2023)
di: Pham, Chau, et al.
Pubblicazione: (2023)
RL Grokking Recipe: How Does RL Unlock and Transfer New Algorithms in LLMs?
di: Sun, Yiyou, et al.
Pubblicazione: (2025)
di: Sun, Yiyou, et al.
Pubblicazione: (2025)
A Polynomial-time Algorithm for Online Sparse Linear Regression with Improved Regret Bound under Weaker Conditions
di: Li, Junfan, et al.
Pubblicazione: (2025)
di: Li, Junfan, et al.
Pubblicazione: (2025)
Arbitrary Time Information Modeling via Polynomial Approximation for Temporal Knowledge Graph Embedding
di: Fang, Zhiyu, et al.
Pubblicazione: (2024)
di: Fang, Zhiyu, et al.
Pubblicazione: (2024)
Dichotomy of Early and Late Phase Implicit Biases Can Provably Induce Grokking
di: Lyu, Kaifeng, et al.
Pubblicazione: (2023)
di: Lyu, Kaifeng, et al.
Pubblicazione: (2023)
Documenti analoghi
-
To Grok Grokking: Provable Grokking in Ridge Regression
di: Xu, Mingyue, et al.
Pubblicazione: (2026) -
GrokAlign: Geometric Characterisation and Acceleration of Grokking
di: Walker, Thomas, et al.
Pubblicazione: (2025) -
NeuralGrok: Accelerate Grokking by Neural Gradient Transformation
di: Zhou, Xinyu, et al.
Pubblicazione: (2025) -
Why Do You Grok? A Theoretical Analysis of Grokking Modular Addition
di: Mohamadi, Mohamad Amin, et al.
Pubblicazione: (2024) -
Grokking in Linear Estimators -- A Solvable Model that Groks without Understanding
di: Levi, Noam, et al.
Pubblicazione: (2023)