Guardado en:
| Autores principales: | Guigon, Maxime, Dixon, Lucas, Sander, Michaël E. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2605.11513 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Patchscopes: A Unifying Framework for Inspecting Hidden Representations of Language Models
por: Ghandeharioun, Asma, et al.
Publicado: (2024)
por: Ghandeharioun, Asma, et al.
Publicado: (2024)
Pre-training Distillation for Large Language Models: A Design Space Exploration
por: Peng, Hao, et al.
Publicado: (2024)
por: Peng, Hao, et al.
Publicado: (2024)
Layer by Layer: Uncovering Hidden Representations in Language Models
por: Skean, Oscar, et al.
Publicado: (2025)
por: Skean, Oscar, et al.
Publicado: (2025)
Legal Documents Drafting with Fine-Tuned Pre-Trained Large Language Model
por: Lin, Chun-Hsien, et al.
Publicado: (2024)
por: Lin, Chun-Hsien, et al.
Publicado: (2024)
Embedding-to-Prefix: Parameter-Efficient Personalization for Pre-Trained Large Language Models
por: Huber, Bernd, et al.
Publicado: (2025)
por: Huber, Bernd, et al.
Publicado: (2025)
Bounded Hyperbolic Tangent: A Stable and Efficient Alternative to Pre-Layer Normalization in Large Language Models
por: Byun, Hoyoon, et al.
Publicado: (2025)
por: Byun, Hoyoon, et al.
Publicado: (2025)
Evolution of Concepts in Language Model Pre-Training
por: Ge, Xuyang, et al.
Publicado: (2025)
por: Ge, Xuyang, et al.
Publicado: (2025)
Learning Dynamics in Continual Pre-Training for Large Language Models
por: Wang, Xingjin, et al.
Publicado: (2025)
por: Wang, Xingjin, et al.
Publicado: (2025)
Construction of Hyper-Relational Knowledge Graphs Using Pre-Trained Large Language Models
por: Datta, Preetha, et al.
Publicado: (2024)
por: Datta, Preetha, et al.
Publicado: (2024)
Date Fragments: A Hidden Bottleneck of Tokenization for Temporal Reasoning
por: Bhatia, Gagan, et al.
Publicado: (2025)
por: Bhatia, Gagan, et al.
Publicado: (2025)
Pre-Trained Language Models for Keyphrase Prediction: A Review
por: Umair, Muhammad, et al.
Publicado: (2024)
por: Umair, Muhammad, et al.
Publicado: (2024)
Revealing the Inherent Instructability of Pre-Trained Language Models
por: An, Seokhyun, et al.
Publicado: (2024)
por: An, Seokhyun, et al.
Publicado: (2024)
Amuro and Char: Analyzing the Relationship between Pre-Training and Fine-Tuning of Large Language Models
por: Sun, Kaiser, et al.
Publicado: (2024)
por: Sun, Kaiser, et al.
Publicado: (2024)
EasyDistill: A Comprehensive Toolkit for Effective Knowledge Distillation of Large Language Models
por: Wang, Chengyu, et al.
Publicado: (2025)
por: Wang, Chengyu, et al.
Publicado: (2025)
Group-SAE: Efficient Training of Sparse Autoencoders for Large Language Models via Layer Groups
por: Ghilardi, Davide, et al.
Publicado: (2024)
por: Ghilardi, Davide, et al.
Publicado: (2024)
Pre-Training Curriculum for Multi-Token Prediction in Language Models
por: Aynetdinov, Ansar, et al.
Publicado: (2025)
por: Aynetdinov, Ansar, et al.
Publicado: (2025)
Revisiting Replay and Gradient Alignment for Continual Pre-Training of Large Language Models
por: Abbes, Istabrak, et al.
Publicado: (2025)
por: Abbes, Istabrak, et al.
Publicado: (2025)
Dual-Space Knowledge Distillation for Large Language Models
por: Zhang, Songming, et al.
Publicado: (2024)
por: Zhang, Songming, et al.
Publicado: (2024)
MiniLLM: On-Policy Distillation of Large Language Models
por: Gu, Yuxian, et al.
Publicado: (2023)
por: Gu, Yuxian, et al.
Publicado: (2023)
Black-Box On-Policy Distillation of Large Language Models
por: Ye, Tianzhu, et al.
Publicado: (2025)
por: Ye, Tianzhu, et al.
Publicado: (2025)
LLM Comparator: Visual Analytics for Side-by-Side Evaluation of Large Language Models
por: Kahng, Minsuk, et al.
Publicado: (2024)
por: Kahng, Minsuk, et al.
Publicado: (2024)
Crown, Frame, Reverse: Layer-Wise Scaling Variants for LLM Pre-Training
por: Baroian, Andrei, et al.
Publicado: (2025)
por: Baroian, Andrei, et al.
Publicado: (2025)
Outlier-Safe Pre-Training for Robust 4-Bit Quantization of Large Language Models
por: Park, Jungwoo, et al.
Publicado: (2025)
por: Park, Jungwoo, et al.
Publicado: (2025)
MLLM-Microscope: Unlocking Hidden Structure Within Multimodal Large Language Models
por: Mussabayev, Ravil, et al.
Publicado: (2026)
por: Mussabayev, Ravil, et al.
Publicado: (2026)
Gecko: Versatile Text Embeddings Distilled from Large Language Models
por: Lee, Jinhyuk, et al.
Publicado: (2024)
por: Lee, Jinhyuk, et al.
Publicado: (2024)
Mitigating Hidden Confounding by Progressive Confounder Imputation via Large Language Models
por: Yang, Hao, et al.
Publicado: (2025)
por: Yang, Hao, et al.
Publicado: (2025)
Dual-objective Language Models: Training Efficiency Without Overfitting
por: Samuel, David, et al.
Publicado: (2025)
por: Samuel, David, et al.
Publicado: (2025)
CORE: A Conceptual Reasoning Layer for Large Language Models
por: Hegde, Vishwas, et al.
Publicado: (2025)
por: Hegde, Vishwas, et al.
Publicado: (2025)
Cross-Modal Knowledge Distillation for Speech Large Language Models
por: Wang, Enzhi, et al.
Publicado: (2025)
por: Wang, Enzhi, et al.
Publicado: (2025)
ELAD: Explanation-Guided Large Language Models Active Distillation
por: Zhang, Yifei, et al.
Publicado: (2024)
por: Zhang, Yifei, et al.
Publicado: (2024)
Distilling Event Sequence Knowledge From Large Language Models
por: Wadhwa, Somin, et al.
Publicado: (2024)
por: Wadhwa, Somin, et al.
Publicado: (2024)
Knowledge-Driven Agentic Scientific Corpus Distillation Framework for Biomedical Large Language Models Training
por: Xiao, Meng, et al.
Publicado: (2025)
por: Xiao, Meng, et al.
Publicado: (2025)
Large Language Models, scientific knowledge and factuality: A framework to streamline human expert evaluation
por: Wysocka, Magdalena, et al.
Publicado: (2023)
por: Wysocka, Magdalena, et al.
Publicado: (2023)
Layer Swapping for Zero-Shot Cross-Lingual Transfer in Large Language Models
por: Bandarkar, Lucas, et al.
Publicado: (2024)
por: Bandarkar, Lucas, et al.
Publicado: (2024)
Unraveling Emotions with Pre-Trained Models
por: Pajón-Sanmartín, Alejandro, et al.
Publicado: (2025)
por: Pajón-Sanmartín, Alejandro, et al.
Publicado: (2025)
"According to ...": Prompting Language Models Improves Quoting from Pre-Training Data
por: Weller, Orion, et al.
Publicado: (2023)
por: Weller, Orion, et al.
Publicado: (2023)
PLaD: Preference-based Large Language Model Distillation with Pseudo-Preference Pairs
por: Zhang, Rongzhi, et al.
Publicado: (2024)
por: Zhang, Rongzhi, et al.
Publicado: (2024)
Pre-trained Large Language Models for Financial Sentiment Analysis
por: Luo, Wei, et al.
Publicado: (2024)
por: Luo, Wei, et al.
Publicado: (2024)
Spike No More: Stabilizing the Pre-training of Large Language Models
por: Takase, Sho, et al.
Publicado: (2023)
por: Takase, Sho, et al.
Publicado: (2023)
Federated Learning with Layer Skipping: Efficient Training of Large Language Models for Healthcare NLP
por: Zhang, Lihong, et al.
Publicado: (2025)
por: Zhang, Lihong, et al.
Publicado: (2025)
Ejemplares similares
-
Patchscopes: A Unifying Framework for Inspecting Hidden Representations of Language Models
por: Ghandeharioun, Asma, et al.
Publicado: (2024) -
Pre-training Distillation for Large Language Models: A Design Space Exploration
por: Peng, Hao, et al.
Publicado: (2024) -
Layer by Layer: Uncovering Hidden Representations in Language Models
por: Skean, Oscar, et al.
Publicado: (2025) -
Legal Documents Drafting with Fine-Tuned Pre-Trained Large Language Model
por: Lin, Chun-Hsien, et al.
Publicado: (2024) -
Embedding-to-Prefix: Parameter-Efficient Personalization for Pre-Trained Large Language Models
por: Huber, Bernd, et al.
Publicado: (2025)