HLAT: High-quality Large Language Model Pre-trained on AWS Trainium
Fuente:
arXiv
Guardado en:
| Autores principales: | Fan, Haozheng, Zhou, Hao, Huang, Guangtai, Raman, Parameswaran, Fu, Xinwei, Gupta, Gaurav, Ram, Dhananjay, Wang, Yida, Huan, Jun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
NeuronMLP: Efficient LLM Inference via Singular Value Decomposition Compression and Tiling on AWS Trainium
por: Song, Dinghong, et al.
Publicado: (2025)
por: Song, Dinghong, et al.
Publicado: (2025)
NinjaLLM: Fast, Scalable and Cost-effective RAG using Amazon SageMaker and AWS Trainium and Inferentia2
por: Xue, Tengfei, et al.
Publicado: (2024)
por: Xue, Tengfei, et al.
Publicado: (2024)
Variance-reduced Zeroth-Order Methods for Fine-Tuning Language Models
por: Gautam, Tanmay, et al.
Publicado: (2024)
por: Gautam, Tanmay, et al.
Publicado: (2024)
Pre-trained Large Language Models Use Fourier Features to Compute Addition
por: Zhou, Tianyi, et al.
Publicado: (2024)
por: Zhou, Tianyi, et al.
Publicado: (2024)
CoderEval: A Benchmark of Pragmatic Code Generation with Generative Pre-trained Models
por: Yu, Hao, et al.
Publicado: (2023)
por: Yu, Hao, et al.
Publicado: (2023)
Model Merging in Pre-training of Large Language Models
por: Li, Yunshui, et al.
Publicado: (2025)
por: Li, Yunshui, et al.
Publicado: (2025)
Spike No More: Stabilizing the Pre-training of Large Language Models
por: Takase, Sho, et al.
Publicado: (2023)
por: Takase, Sho, et al.
Publicado: (2023)
Utilizing Pre-trained and Large Language Models for 10-K Items Segmentation
por: Lu, Hsin-Min, et al.
Publicado: (2025)
por: Lu, Hsin-Min, et al.
Publicado: (2025)
STEP: Staged Parameter-Efficient Pre-training for Large Language Models
por: Yano, Kazuki, et al.
Publicado: (2025)
por: Yano, Kazuki, et al.
Publicado: (2025)
Distributed Specialization: Rare-Token Neurons in Large Language Models
por: Liu, Jing, et al.
Publicado: (2025)
por: Liu, Jing, et al.
Publicado: (2025)
Adaptive Batch Sizes Using Non-Euclidean Gradient Noise Scales for Stochastic Sign and Spectral Descent
por: Naganuma, Hiroki, et al.
Publicado: (2026)
por: Naganuma, Hiroki, et al.
Publicado: (2026)
Simple and Scalable Strategies to Continually Pre-train Large Language Models
por: Ibrahim, Adam, et al.
Publicado: (2024)
por: Ibrahim, Adam, et al.
Publicado: (2024)
Sequence-level Large Language Model Training with Contrastive Preference Optimization
por: Feng, Zhili, et al.
Publicado: (2025)
por: Feng, Zhili, et al.
Publicado: (2025)
Cross-layer Attention Sharing for Pre-trained Large Language Models
por: Mu, Yongyu, et al.
Publicado: (2024)
por: Mu, Yongyu, et al.
Publicado: (2024)
Smoothing DiLoCo with Primal Averaging for Faster Training of LLMs
por: Defazio, Aaron, et al.
Publicado: (2025)
por: Defazio, Aaron, et al.
Publicado: (2025)
CRAFT: Fine-Grained Cost-Aware Expert Replication For Efficient Mixture-of-Experts Serving
por: Zhao, Adrian, et al.
Publicado: (2026)
por: Zhao, Adrian, et al.
Publicado: (2026)
Adaptation of augmented reality technologies to the educational process of training graphic designers
por: Li, Yida
Publicado: (2025)
por: Li, Yida
Publicado: (2025)
MIA-Tuner: Adapting Large Language Models as Pre-training Text Detector
por: Fu, Wenjie, et al.
Publicado: (2024)
por: Fu, Wenjie, et al.
Publicado: (2024)
Learning to Focus: Focal Attention for Selective and Scalable Transformers
por: Ram, Dhananjay, et al.
Publicado: (2025)
por: Ram, Dhananjay, et al.
Publicado: (2025)
Pre-training Differentially Private Models with Limited Public Data
por: Bu, Zhiqi, et al.
Publicado: (2024)
por: Bu, Zhiqi, et al.
Publicado: (2024)
Towards Efficient Pre-training: Exploring FP4 Precision in Large Language Models
por: Zhou, Jiecheng, et al.
Publicado: (2025)
por: Zhou, Jiecheng, et al.
Publicado: (2025)
Towards Effective and Efficient Continual Pre-training of Large Language Models
por: Chen, Jie, et al.
Publicado: (2024)
por: Chen, Jie, et al.
Publicado: (2024)
Multivariate Wireless Link Quality Prediction Based on Pre-trained Large Language Models
por: Yan, Zhuangzhuang, et al.
Publicado: (2025)
por: Yan, Zhuangzhuang, et al.
Publicado: (2025)
Pre-training Distillation for Large Language Models: A Design Space Exploration
por: Peng, Hao, et al.
Publicado: (2024)
por: Peng, Hao, et al.
Publicado: (2024)
A General Framework for Load Forecasting based on Pre-trained Large Language Model
por: Gao, Mingyang, et al.
Publicado: (2024)
por: Gao, Mingyang, et al.
Publicado: (2024)
Machine Unlearning of Pre-trained Large Language Models
por: Yao, Jin, et al.
Publicado: (2024)
por: Yao, Jin, et al.
Publicado: (2024)
The Future of Large Language Model Pre-training is Federated
por: Sani, Lorenzo, et al.
Publicado: (2024)
por: Sani, Lorenzo, et al.
Publicado: (2024)
PipeFill: Using GPUs During Bubbles in Pipeline-parallel LLM Training
por: Arfeen, Daiyaan, et al.
Publicado: (2024)
por: Arfeen, Daiyaan, et al.
Publicado: (2024)
Unsupervised Domain Adaption Harnessing Vision-Language Pre-training
por: Zhou, Wenlve, et al.
Publicado: (2024)
por: Zhou, Wenlve, et al.
Publicado: (2024)
Chain-of-Action: Faithful and Multimodal Question Answering through Large Language Models
por: Pan, Zhenyu, et al.
Publicado: (2024)
por: Pan, Zhenyu, et al.
Publicado: (2024)
PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines
por: Vir, Reya, et al.
Publicado: (2025)
por: Vir, Reya, et al.
Publicado: (2025)
Efficient Temporal Tokenization for Mobility Prediction with Large Language Models
por: He, Haoyu, et al.
Publicado: (2025)
por: He, Haoyu, et al.
Publicado: (2025)
Bayesian Network Fusion of Large Language Models for Sentiment Analysis
por: Amirzadeh, Rasoul, et al.
Publicado: (2025)
por: Amirzadeh, Rasoul, et al.
Publicado: (2025)
Revisiting Large Language Model Pruning using Neuron Semantic Attribution
por: Ding, Yizhuo, et al.
Publicado: (2025)
por: Ding, Yizhuo, et al.
Publicado: (2025)
Pre-trained Large Language Models for Financial Sentiment Analysis
por: Luo, Wei, et al.
Publicado: (2024)
por: Luo, Wei, et al.
Publicado: (2024)
PEAC: Unsupervised Pre-training for Cross-Embodiment Reinforcement Learning
por: Ying, Chengyang, et al.
Publicado: (2024)
por: Ying, Chengyang, et al.
Publicado: (2024)
Non-Hermitian effect to the ballistic transport and quantized Hall conductivity in 2H-MoS$_{2}$
por: Wu, Chen-Huan, et al.
Publicado: (2023)
por: Wu, Chen-Huan, et al.
Publicado: (2023)
Pre-train and Fine-tune: Recommenders as Large Models
por: Jiang, Zhenhao, et al.
Publicado: (2025)
por: Jiang, Zhenhao, et al.
Publicado: (2025)
Query Expansion in the Age of Pre-trained and Large Language Models: A Comprehensive Survey
por: Li, Minghan, et al.
Publicado: (2025)
por: Li, Minghan, et al.
Publicado: (2025)
Efficient Data Learning for Open Information Extraction with Pre-trained Language Models
por: Fan, Zhiyuan, et al.
Publicado: (2023)
por: Fan, Zhiyuan, et al.
Publicado: (2023)
Ejemplares similares
-
NeuronMLP: Efficient LLM Inference via Singular Value Decomposition Compression and Tiling on AWS Trainium
por: Song, Dinghong, et al.
Publicado: (2025) -
NinjaLLM: Fast, Scalable and Cost-effective RAG using Amazon SageMaker and AWS Trainium and Inferentia2
por: Xue, Tengfei, et al.
Publicado: (2024) -
Variance-reduced Zeroth-Order Methods for Fine-Tuning Language Models
por: Gautam, Tanmay, et al.
Publicado: (2024) -
Pre-trained Large Language Models Use Fourier Features to Compute Addition
por: Zhou, Tianyi, et al.
Publicado: (2024) -
CoderEval: A Benchmark of Pragmatic Code Generation with Generative Pre-trained Models
por: Yu, Hao, et al.
Publicado: (2023)