Crown, Frame, Reverse: Layer-Wise Scaling Variants for LLM Pre-Training
Fuente:
arXiv
Salvato in:
| Autori principali: | Baroian, Andrei, Notebomer, Kasper |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Supervised Fine-Tuning or In-Context Learning? Evaluating LLMs for Clinical NER
di: Baroian, Andrei
Pubblicazione: (2025)
di: Baroian, Andrei
Pubblicazione: (2025)
Towards Transparency: Exploring LLM Trainings Datasets through Visual Topic Modeling and Semantic Frame
di: de Dampierre, Charles, et al.
Pubblicazione: (2024)
di: de Dampierre, Charles, et al.
Pubblicazione: (2024)
Adaptive Layer Selection for Layer-Wise Token Pruning in LLM Inference
di: Taniguchi, Rei, et al.
Pubblicazione: (2026)
di: Taniguchi, Rei, et al.
Pubblicazione: (2026)
How to Alleviate Catastrophic Forgetting in LLMs Finetuning? Hierarchical Layer-Wise and Element-Wise Regularization
di: Song, Shezheng, et al.
Pubblicazione: (2025)
di: Song, Shezheng, et al.
Pubblicazione: (2025)
Scaling LLM Pre-training with Vocabulary Curriculum
di: Yu, Fangyuan
Pubblicazione: (2025)
di: Yu, Fangyuan
Pubblicazione: (2025)
Beyond Public Access in LLM Pre-Training Data
di: Rosenblat, Sruly, et al.
Pubblicazione: (2025)
di: Rosenblat, Sruly, et al.
Pubblicazione: (2025)
Prompt replay: speeding up grpo with on-policy reuse of high-signal prompts
di: Baroian, Andrei, et al.
Pubblicazione: (2026)
di: Baroian, Andrei, et al.
Pubblicazione: (2026)
Reverse Training to Nurse the Reversal Curse
di: Golovneva, Olga, et al.
Pubblicazione: (2024)
di: Golovneva, Olga, et al.
Pubblicazione: (2024)
LLMCache: Layer-Wise Caching Strategies for Accelerated Reuse in Transformer Inference
di: Bansal, Harsh Vardhan
Pubblicazione: (2025)
di: Bansal, Harsh Vardhan
Pubblicazione: (2025)
Layer-Wise Perturbations via Sparse Autoencoders for Adversarial Text Generation
di: Shu, Huizhen, et al.
Pubblicazione: (2025)
di: Shu, Huizhen, et al.
Pubblicazione: (2025)
WilKE: Wise-Layer Knowledge Editor for Lifelong Knowledge Editing
di: Hu, Chenhui, et al.
Pubblicazione: (2024)
di: Hu, Chenhui, et al.
Pubblicazione: (2024)
A Study on Hidden Layer Distillation for Large Language Model Pre-Training
di: Guigon, Maxime, et al.
Pubblicazione: (2026)
di: Guigon, Maxime, et al.
Pubblicazione: (2026)
Investigating Cost-Efficiency of LLM-Generated Training Data for Conversational Semantic Frame Analysis
di: Matta, Shiho, et al.
Pubblicazione: (2024)
di: Matta, Shiho, et al.
Pubblicazione: (2024)
Layer-Wise Evolution of Representations in Fine-Tuned Transformers: Insights from Sparse AutoEncoders
di: Nadipalli, Suneel
Pubblicazione: (2025)
di: Nadipalli, Suneel
Pubblicazione: (2025)
Khayyam Challenge (PersianMMLU): Is Your LLM Truly Wise to The Persian Language?
di: Ghahroodi, Omid, et al.
Pubblicazione: (2024)
di: Ghahroodi, Omid, et al.
Pubblicazione: (2024)
LPCD: Unified Framework from Layer-Wise to Submodule Quantization
di: Ichikawa, Yuma, et al.
Pubblicazione: (2025)
di: Ichikawa, Yuma, et al.
Pubblicazione: (2025)
AutoScale: Scale-Aware Data Mixing for Pre-Training LLMs
di: Kang, Feiyang, et al.
Pubblicazione: (2024)
di: Kang, Feiyang, et al.
Pubblicazione: (2024)
Continual Pre-Training for Cross-Lingual LLM Adaptation: Enhancing Japanese Language Capabilities
di: Fujii, Kazuki, et al.
Pubblicazione: (2024)
di: Fujii, Kazuki, et al.
Pubblicazione: (2024)
KVTuner: Sensitivity-Aware Layer-Wise Mixed-Precision KV Cache Quantization for Efficient and Nearly Lossless LLM Inference
di: Li, Xing, et al.
Pubblicazione: (2025)
di: Li, Xing, et al.
Pubblicazione: (2025)
LESA: Learnable LLM Layer Scaling-Up
di: Yang, Yifei, et al.
Pubblicazione: (2025)
di: Yang, Yifei, et al.
Pubblicazione: (2025)
Beyond Scaling: Measuring and Predicting the Upper Bound of Knowledge Retention in Language Model Pre-Training
di: Jiang, Changhao, et al.
Pubblicazione: (2025)
di: Jiang, Changhao, et al.
Pubblicazione: (2025)
Stacking Your Transformers: A Closer Look at Model Growth for Efficient LLM Pre-Training
di: Du, Wenyu, et al.
Pubblicazione: (2024)
di: Du, Wenyu, et al.
Pubblicazione: (2024)
Rethinking Reflection in Pre-Training
di: AI, Essential, et al.
Pubblicazione: (2025)
di: AI, Essential, et al.
Pubblicazione: (2025)
Adaptive Layer-skipping in Pre-trained LLMs
di: Luo, Xuan, et al.
Pubblicazione: (2025)
di: Luo, Xuan, et al.
Pubblicazione: (2025)
LLM-BIP: Structured Pruning for Large Language Models with Block-Wise Forward Importance Propagation
di: Wu, Haihang
Pubblicazione: (2024)
di: Wu, Haihang
Pubblicazione: (2024)
Evaluating Expert Contributions in a MoE LLM for Quiz-Based Tasks
di: Chernov, Andrei
Pubblicazione: (2025)
di: Chernov, Andrei
Pubblicazione: (2025)
Memory Layers at Scale
di: Berges, Vincent-Pierre, et al.
Pubblicazione: (2024)
di: Berges, Vincent-Pierre, et al.
Pubblicazione: (2024)
Bridging Linguistic Gaps: Cross-Lingual Mapping in Pre-Training and Dataset for Enhanced Multilingual LLM Performance
di: Zheng, Weihua, et al.
Pubblicazione: (2026)
di: Zheng, Weihua, et al.
Pubblicazione: (2026)
DataFrame QA: A Universal LLM Framework on DataFrame Question Answering Without Data Exposure
di: Ye, Junyi, et al.
Pubblicazione: (2024)
di: Ye, Junyi, et al.
Pubblicazione: (2024)
Geometry-Lite: Interpretable Safety Probing via Layer-Wise Margin Geometry
di: Sim, Woo Seob, et al.
Pubblicazione: (2026)
di: Sim, Woo Seob, et al.
Pubblicazione: (2026)
KVSharer: Efficient Inference via Layer-Wise Dissimilar KV Cache Sharing
di: Yang, Yifei, et al.
Pubblicazione: (2024)
di: Yang, Yifei, et al.
Pubblicazione: (2024)
Hidden Heroes and Gradient Bloats: Layer-Wise Redundancy Inverts Attribution in Transformers
di: Ye, Donald
Pubblicazione: (2026)
di: Ye, Donald
Pubblicazione: (2026)
Unraveling Emotions with Pre-Trained Models
di: Pajón-Sanmartín, Alejandro, et al.
Pubblicazione: (2025)
di: Pajón-Sanmartín, Alejandro, et al.
Pubblicazione: (2025)
When Wording Steers the Evaluation: Framing Bias in LLM judges
di: Hwang, Yerin, et al.
Pubblicazione: (2026)
di: Hwang, Yerin, et al.
Pubblicazione: (2026)
SafeMERGE: Preserving Safety Alignment in Fine-Tuned Large Language Models via Selective Layer-Wise Model Merging
di: Djuhera, Aladin, et al.
Pubblicazione: (2025)
di: Djuhera, Aladin, et al.
Pubblicazione: (2025)
NCV: A Node-Wise Consistency Verification Approach for Low-Cost Structured Error Localization in LLM Reasoning
di: Zhang, Yulong, et al.
Pubblicazione: (2025)
di: Zhang, Yulong, et al.
Pubblicazione: (2025)
ProtLLM: An Interleaved Protein-Language LLM with Protein-as-Word Pre-Training
di: Zhuo, Le, et al.
Pubblicazione: (2024)
di: Zhuo, Le, et al.
Pubblicazione: (2024)
Less is More: Pre-Training Cross-Lingual Small-Scale Language Models with Cognitively-Plausible Curriculum Learning Strategies
di: Salhan, Suchir, et al.
Pubblicazione: (2024)
di: Salhan, Suchir, et al.
Pubblicazione: (2024)
Evolution of Concepts in Language Model Pre-Training
di: Ge, Xuyang, et al.
Pubblicazione: (2025)
di: Ge, Xuyang, et al.
Pubblicazione: (2025)
Reversing Large Language Models for Efficient Training and Fine-Tuning
di: Gal, Eshed, et al.
Pubblicazione: (2025)
di: Gal, Eshed, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Supervised Fine-Tuning or In-Context Learning? Evaluating LLMs for Clinical NER
di: Baroian, Andrei
Pubblicazione: (2025) -
Towards Transparency: Exploring LLM Trainings Datasets through Visual Topic Modeling and Semantic Frame
di: de Dampierre, Charles, et al.
Pubblicazione: (2024) -
Adaptive Layer Selection for Layer-Wise Token Pruning in LLM Inference
di: Taniguchi, Rei, et al.
Pubblicazione: (2026) -
How to Alleviate Catastrophic Forgetting in LLMs Finetuning? Hierarchical Layer-Wise and Element-Wise Regularization
di: Song, Shezheng, et al.
Pubblicazione: (2025) -
Scaling LLM Pre-training with Vocabulary Curriculum
di: Yu, Fangyuan
Pubblicazione: (2025)