Salvato in:
| Autori principali: | Tapaninaho, Joonas, Oussala, Mourad |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2508.00544 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DiPaCo: Distributed Path Composition
di: Douillard, Arthur, et al.
Pubblicazione: (2024)
di: Douillard, Arthur, et al.
Pubblicazione: (2024)
Model Merging in Pre-training of Large Language Models
di: Li, Yunshui, et al.
Pubblicazione: (2025)
di: Li, Yunshui, et al.
Pubblicazione: (2025)
DEPT: Decoupled Embeddings for Pre-training Language Models
di: Iacob, Alex, et al.
Pubblicazione: (2024)
di: Iacob, Alex, et al.
Pubblicazione: (2024)
Parallel Structures in Pre-training Data Yield In-Context Learning
di: Chen, Yanda, et al.
Pubblicazione: (2024)
di: Chen, Yanda, et al.
Pubblicazione: (2024)
Exploiting Vocabulary Frequency Imbalance in Language Model Pre-training
di: Chung, Woojin, et al.
Pubblicazione: (2025)
di: Chung, Woojin, et al.
Pubblicazione: (2025)
Making Pre-trained Language Models Great on Tabular Prediction
di: Yan, Jiahuan, et al.
Pubblicazione: (2024)
di: Yan, Jiahuan, et al.
Pubblicazione: (2024)
Learn or Recall? Revisiting Incremental Learning with Pre-trained Language Models
di: Zheng, Junhao, et al.
Pubblicazione: (2023)
di: Zheng, Junhao, et al.
Pubblicazione: (2023)
MediSwift: Efficient Sparse Pre-trained Biomedical Language Models
di: Thangarasa, Vithursan, et al.
Pubblicazione: (2024)
di: Thangarasa, Vithursan, et al.
Pubblicazione: (2024)
Investigating Data Contamination for Pre-training Language Models
di: Jiang, Minhao, et al.
Pubblicazione: (2024)
di: Jiang, Minhao, et al.
Pubblicazione: (2024)
Aligning Pre-trained Models for Spoken Language Translation
di: Sedláček, Šimon, et al.
Pubblicazione: (2024)
di: Sedláček, Šimon, et al.
Pubblicazione: (2024)
Sequence-to-Sequence Spanish Pre-trained Language Models
di: Araujo, Vladimir, et al.
Pubblicazione: (2023)
di: Araujo, Vladimir, et al.
Pubblicazione: (2023)
Efficient Knowledge Probing of Large Language Models by Adapting Pre-trained Embeddings
di: Sharma, Kartik, et al.
Pubblicazione: (2025)
di: Sharma, Kartik, et al.
Pubblicazione: (2025)
Fine-Tuning Pre-trained Language Models to Detect In-Game Trash Talks
di: Fesalbon, Daniel, et al.
Pubblicazione: (2024)
di: Fesalbon, Daniel, et al.
Pubblicazione: (2024)
Pre-trained Large Language Models Use Fourier Features to Compute Addition
di: Zhou, Tianyi, et al.
Pubblicazione: (2024)
di: Zhou, Tianyi, et al.
Pubblicazione: (2024)
HLAT: High-quality Large Language Model Pre-trained on AWS Trainium
di: Fan, Haozheng, et al.
Pubblicazione: (2024)
di: Fan, Haozheng, et al.
Pubblicazione: (2024)
Structural Pruning of Pre-trained Language Models via Neural Architecture Search
di: Klein, Aaron, et al.
Pubblicazione: (2024)
di: Klein, Aaron, et al.
Pubblicazione: (2024)
MLKD-BERT: Multi-level Knowledge Distillation for Pre-trained Language Models
di: Zhang, Ying, et al.
Pubblicazione: (2024)
di: Zhang, Ying, et al.
Pubblicazione: (2024)
Lory: Fully Differentiable Mixture-of-Experts for Autoregressive Language Model Pre-training
di: Zhong, Zexuan, et al.
Pubblicazione: (2024)
di: Zhong, Zexuan, et al.
Pubblicazione: (2024)
Integrating Pre-trained Language Model into Neural Machine Translation
di: Hwang, Soon-Jae, et al.
Pubblicazione: (2023)
di: Hwang, Soon-Jae, et al.
Pubblicazione: (2023)
Evaluating the Effectiveness of Pre-trained Language Models in Predicting the Helpfulness of Online Product Reviews
di: Boluki, Ali, et al.
Pubblicazione: (2023)
di: Boluki, Ali, et al.
Pubblicazione: (2023)
A Context-Aware Approach for Enhancing Data Imputation with Pre-trained Language Models
di: Hayat, Ahatsham, et al.
Pubblicazione: (2024)
di: Hayat, Ahatsham, et al.
Pubblicazione: (2024)
Efficient Continual Pre-training of LLMs for Low-resource Languages
di: Nag, Arijit, et al.
Pubblicazione: (2024)
di: Nag, Arijit, et al.
Pubblicazione: (2024)
The Dark Side of the Language: Pre-trained Transformers in the DarkNet
di: Ranaldi, Leonardo, et al.
Pubblicazione: (2022)
di: Ranaldi, Leonardo, et al.
Pubblicazione: (2022)
Pre-trained Language Models Learn Remarkably Accurate Representations of Numbers
di: Kadlčík, Marek, et al.
Pubblicazione: (2025)
di: Kadlčík, Marek, et al.
Pubblicazione: (2025)
Thinking Augmented Pre-training
di: Wang, Liang, et al.
Pubblicazione: (2025)
di: Wang, Liang, et al.
Pubblicazione: (2025)
CMR Scaling Law: Predicting Critical Mixture Ratios for Continual Pre-training of Language Models
di: Gu, Jiawei, et al.
Pubblicazione: (2024)
di: Gu, Jiawei, et al.
Pubblicazione: (2024)
Hadamard Adapter: An Extreme Parameter-Efficient Adapter Tuning Method for Pre-trained Language Models
di: Chen, Yuyan, et al.
Pubblicazione: (2024)
di: Chen, Yuyan, et al.
Pubblicazione: (2024)
Pre-training Limited Memory Language Models with Internal and External Knowledge
di: Zhao, Linxi, et al.
Pubblicazione: (2025)
di: Zhao, Linxi, et al.
Pubblicazione: (2025)
Simple and Scalable Strategies to Continually Pre-train Large Language Models
di: Ibrahim, Adam, et al.
Pubblicazione: (2024)
di: Ibrahim, Adam, et al.
Pubblicazione: (2024)
Sparse is Enough in Fine-tuning Pre-trained Large Language Models
di: Song, Weixi, et al.
Pubblicazione: (2023)
di: Song, Weixi, et al.
Pubblicazione: (2023)
SpikeGPT: Generative Pre-trained Language Model with Spiking Neural Networks
di: Zhu, Rui-Jie, et al.
Pubblicazione: (2023)
di: Zhu, Rui-Jie, et al.
Pubblicazione: (2023)
Machine Unlearning of Pre-trained Large Language Models
di: Yao, Jin, et al.
Pubblicazione: (2024)
di: Yao, Jin, et al.
Pubblicazione: (2024)
Unmasking Backdoors: An Explainable Defense via Gradient-Attention Anomaly Scoring for Pre-trained Language Models
di: Das, Anindya Sundar, et al.
Pubblicazione: (2025)
di: Das, Anindya Sundar, et al.
Pubblicazione: (2025)
Enhancing One-shot Pruned Pre-trained Language Models through Sparse-Dense-Sparse Mechanism
di: Li, Guanchen, et al.
Pubblicazione: (2024)
di: Li, Guanchen, et al.
Pubblicazione: (2024)
Scaling Smart: Accelerating Large Language Model Pre-training with Small Model Initialization
di: Samragh, Mohammad, et al.
Pubblicazione: (2024)
di: Samragh, Mohammad, et al.
Pubblicazione: (2024)
MIA-Tuner: Adapting Large Language Models as Pre-training Text Detector
di: Fu, Wenjie, et al.
Pubblicazione: (2024)
di: Fu, Wenjie, et al.
Pubblicazione: (2024)
HiFloat4 Format for Language Model Pre-training on Ascend NPUs
di: Taghian, Mehran, et al.
Pubblicazione: (2026)
di: Taghian, Mehran, et al.
Pubblicazione: (2026)
CDGP: Automatic Cloze Distractor Generation based on Pre-trained Language Model
di: Chiang, Shang-Hsuan, et al.
Pubblicazione: (2024)
di: Chiang, Shang-Hsuan, et al.
Pubblicazione: (2024)
Parallel Scaling Law for Language Models
di: Chen, Mouxiang, et al.
Pubblicazione: (2025)
di: Chen, Mouxiang, et al.
Pubblicazione: (2025)
Parallel Token Prediction for Language Models
di: Draxler, Felix, et al.
Pubblicazione: (2025)
di: Draxler, Felix, et al.
Pubblicazione: (2025)
Documenti analoghi
-
DiPaCo: Distributed Path Composition
di: Douillard, Arthur, et al.
Pubblicazione: (2024) -
Model Merging in Pre-training of Large Language Models
di: Li, Yunshui, et al.
Pubblicazione: (2025) -
DEPT: Decoupled Embeddings for Pre-training Language Models
di: Iacob, Alex, et al.
Pubblicazione: (2024) -
Parallel Structures in Pre-training Data Yield In-Context Learning
di: Chen, Yanda, et al.
Pubblicazione: (2024) -
Exploiting Vocabulary Frequency Imbalance in Language Model Pre-training
di: Chung, Woojin, et al.
Pubblicazione: (2025)