PaPaformer: Language Model from Pre-trained Parallel Paths
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tapaninaho, Joonas, Oussala, Mourad |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DiPaCo: Distributed Path Composition
par: Douillard, Arthur, et autres
Publié: (2024)
par: Douillard, Arthur, et autres
Publié: (2024)
Model Merging in Pre-training of Large Language Models
par: Li, Yunshui, et autres
Publié: (2025)
par: Li, Yunshui, et autres
Publié: (2025)
DEPT: Decoupled Embeddings for Pre-training Language Models
par: Iacob, Alex, et autres
Publié: (2024)
par: Iacob, Alex, et autres
Publié: (2024)
Exploiting Vocabulary Frequency Imbalance in Language Model Pre-training
par: Chung, Woojin, et autres
Publié: (2025)
par: Chung, Woojin, et autres
Publié: (2025)
Making Pre-trained Language Models Great on Tabular Prediction
par: Yan, Jiahuan, et autres
Publié: (2024)
par: Yan, Jiahuan, et autres
Publié: (2024)
Parallel Structures in Pre-training Data Yield In-Context Learning
par: Chen, Yanda, et autres
Publié: (2024)
par: Chen, Yanda, et autres
Publié: (2024)
Learn or Recall? Revisiting Incremental Learning with Pre-trained Language Models
par: Zheng, Junhao, et autres
Publié: (2023)
par: Zheng, Junhao, et autres
Publié: (2023)
MediSwift: Efficient Sparse Pre-trained Biomedical Language Models
par: Thangarasa, Vithursan, et autres
Publié: (2024)
par: Thangarasa, Vithursan, et autres
Publié: (2024)
Efficient Knowledge Probing of Large Language Models by Adapting Pre-trained Embeddings
par: Sharma, Kartik, et autres
Publié: (2025)
par: Sharma, Kartik, et autres
Publié: (2025)
Fine-Tuning Pre-trained Language Models to Detect In-Game Trash Talks
par: Fesalbon, Daniel, et autres
Publié: (2024)
par: Fesalbon, Daniel, et autres
Publié: (2024)
Pre-trained Large Language Models Use Fourier Features to Compute Addition
par: Zhou, Tianyi, et autres
Publié: (2024)
par: Zhou, Tianyi, et autres
Publié: (2024)
HLAT: High-quality Large Language Model Pre-trained on AWS Trainium
par: Fan, Haozheng, et autres
Publié: (2024)
par: Fan, Haozheng, et autres
Publié: (2024)
Structural Pruning of Pre-trained Language Models via Neural Architecture Search
par: Klein, Aaron, et autres
Publié: (2024)
par: Klein, Aaron, et autres
Publié: (2024)
MLKD-BERT: Multi-level Knowledge Distillation for Pre-trained Language Models
par: Zhang, Ying, et autres
Publié: (2024)
par: Zhang, Ying, et autres
Publié: (2024)
Lory: Fully Differentiable Mixture-of-Experts for Autoregressive Language Model Pre-training
par: Zhong, Zexuan, et autres
Publié: (2024)
par: Zhong, Zexuan, et autres
Publié: (2024)
Investigating Data Contamination for Pre-training Language Models
par: Jiang, Minhao, et autres
Publié: (2024)
par: Jiang, Minhao, et autres
Publié: (2024)
Aligning Pre-trained Models for Spoken Language Translation
par: Sedláček, Šimon, et autres
Publié: (2024)
par: Sedláček, Šimon, et autres
Publié: (2024)
Sequence-to-Sequence Spanish Pre-trained Language Models
par: Araujo, Vladimir, et autres
Publié: (2023)
par: Araujo, Vladimir, et autres
Publié: (2023)
Evaluating the Effectiveness of Pre-trained Language Models in Predicting the Helpfulness of Online Product Reviews
par: Boluki, Ali, et autres
Publié: (2023)
par: Boluki, Ali, et autres
Publié: (2023)
A Context-Aware Approach for Enhancing Data Imputation with Pre-trained Language Models
par: Hayat, Ahatsham, et autres
Publié: (2024)
par: Hayat, Ahatsham, et autres
Publié: (2024)
Efficient Continual Pre-training of LLMs for Low-resource Languages
par: Nag, Arijit, et autres
Publié: (2024)
par: Nag, Arijit, et autres
Publié: (2024)
The Dark Side of the Language: Pre-trained Transformers in the DarkNet
par: Ranaldi, Leonardo, et autres
Publié: (2022)
par: Ranaldi, Leonardo, et autres
Publié: (2022)
Integrating Pre-trained Language Model into Neural Machine Translation
par: Hwang, Soon-Jae, et autres
Publié: (2023)
par: Hwang, Soon-Jae, et autres
Publié: (2023)
CMR Scaling Law: Predicting Critical Mixture Ratios for Continual Pre-training of Language Models
par: Gu, Jiawei, et autres
Publié: (2024)
par: Gu, Jiawei, et autres
Publié: (2024)
Hadamard Adapter: An Extreme Parameter-Efficient Adapter Tuning Method for Pre-trained Language Models
par: Chen, Yuyan, et autres
Publié: (2024)
par: Chen, Yuyan, et autres
Publié: (2024)
Pre-trained Language Models Learn Remarkably Accurate Representations of Numbers
par: Kadlčík, Marek, et autres
Publié: (2025)
par: Kadlčík, Marek, et autres
Publié: (2025)
Thinking Augmented Pre-training
par: Wang, Liang, et autres
Publié: (2025)
par: Wang, Liang, et autres
Publié: (2025)
Unmasking Backdoors: An Explainable Defense via Gradient-Attention Anomaly Scoring for Pre-trained Language Models
par: Das, Anindya Sundar, et autres
Publié: (2025)
par: Das, Anindya Sundar, et autres
Publié: (2025)
Enhancing One-shot Pruned Pre-trained Language Models through Sparse-Dense-Sparse Mechanism
par: Li, Guanchen, et autres
Publié: (2024)
par: Li, Guanchen, et autres
Publié: (2024)
Pre-training Limited Memory Language Models with Internal and External Knowledge
par: Zhao, Linxi, et autres
Publié: (2025)
par: Zhao, Linxi, et autres
Publié: (2025)
Simple and Scalable Strategies to Continually Pre-train Large Language Models
par: Ibrahim, Adam, et autres
Publié: (2024)
par: Ibrahim, Adam, et autres
Publié: (2024)
Sparse is Enough in Fine-tuning Pre-trained Large Language Models
par: Song, Weixi, et autres
Publié: (2023)
par: Song, Weixi, et autres
Publié: (2023)
SpikeGPT: Generative Pre-trained Language Model with Spiking Neural Networks
par: Zhu, Rui-Jie, et autres
Publié: (2023)
par: Zhu, Rui-Jie, et autres
Publié: (2023)
Parallel Scaling Law for Language Models
par: Chen, Mouxiang, et autres
Publié: (2025)
par: Chen, Mouxiang, et autres
Publié: (2025)
Parallel Token Prediction for Language Models
par: Draxler, Felix, et autres
Publié: (2025)
par: Draxler, Felix, et autres
Publié: (2025)
Scaling Smart: Accelerating Large Language Model Pre-training with Small Model Initialization
par: Samragh, Mohammad, et autres
Publié: (2024)
par: Samragh, Mohammad, et autres
Publié: (2024)
MIA-Tuner: Adapting Large Language Models as Pre-training Text Detector
par: Fu, Wenjie, et autres
Publié: (2024)
par: Fu, Wenjie, et autres
Publié: (2024)
HiFloat4 Format for Language Model Pre-training on Ascend NPUs
par: Taghian, Mehran, et autres
Publié: (2026)
par: Taghian, Mehran, et autres
Publié: (2026)
CDGP: Automatic Cloze Distractor Generation based on Pre-trained Language Model
par: Chiang, Shang-Hsuan, et autres
Publié: (2024)
par: Chiang, Shang-Hsuan, et autres
Publié: (2024)
Machine Unlearning of Pre-trained Large Language Models
par: Yao, Jin, et autres
Publié: (2024)
par: Yao, Jin, et autres
Publié: (2024)
Documents similaires
-
DiPaCo: Distributed Path Composition
par: Douillard, Arthur, et autres
Publié: (2024) -
Model Merging in Pre-training of Large Language Models
par: Li, Yunshui, et autres
Publié: (2025) -
DEPT: Decoupled Embeddings for Pre-training Language Models
par: Iacob, Alex, et autres
Publié: (2024) -
Exploiting Vocabulary Frequency Imbalance in Language Model Pre-training
par: Chung, Woojin, et autres
Publié: (2025) -
Making Pre-trained Language Models Great on Tabular Prediction
par: Yan, Jiahuan, et autres
Publié: (2024)