Enregistré dans:
| Auteur principal: | Rao, Praveen |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2602.02632 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Is Training Data Quality or Quantity More Impactful to Small Language Model Performance?
par: Sajith, Aryan, et autres
Publié: (2024)
par: Sajith, Aryan, et autres
Publié: (2024)
Adjusting Pretrained Backbones for Performativity
par: Demirel, Berker, et autres
Publié: (2024)
par: Demirel, Berker, et autres
Publié: (2024)
Reasoning Language Model Inference Serving Unveiled: An Empirical Study
par: Li, Qi, et autres
Publié: (2025)
par: Li, Qi, et autres
Publié: (2025)
Pretraining a Foundation Model for Small-Molecule Natural Products
par: Ding, Yuheng, et autres
Publié: (2025)
par: Ding, Yuheng, et autres
Publié: (2025)
LLM-Inspired Pretrain-Then-Finetune for Small-Data, Large-Scale Optimization
par: Zhang, Zishi, et autres
Publié: (2026)
par: Zhang, Zishi, et autres
Publié: (2026)
Finetune-Informed Pretraining Boosts Downstream Performance
par: Faysal, Atik, et autres
Publié: (2026)
par: Faysal, Atik, et autres
Publié: (2026)
Small Vocabularies, Big Gains: Pretraining and Tokenization in Time Series Models
par: Roger, Alexis, et autres
Publié: (2025)
par: Roger, Alexis, et autres
Publié: (2025)
Learning Transferable Sensor Models via Language-Informed Pretraining
par: Chen, Yuliang, et autres
Publié: (2026)
par: Chen, Yuliang, et autres
Publié: (2026)
How Does Controllability Emerge In Language Models During Pretraining?
par: She, Jianshu, et autres
Publié: (2025)
par: She, Jianshu, et autres
Publié: (2025)
Probing the Limits of Compressive Memory: A Study of Infini-Attention in Small-Scale Pretraining
par: Huang, Ruizhe, et autres
Publié: (2025)
par: Huang, Ruizhe, et autres
Publié: (2025)
On Training Large Language Models for Long-Horizon Tasks: An Empirical Study of Horizon Length
par: Kim, Sunghwan, et autres
Publié: (2026)
par: Kim, Sunghwan, et autres
Publié: (2026)
Why Representation Engineering Works: A Theoretical and Empirical Study in Vision-Language Models
par: Tian, Bowei, et autres
Publié: (2025)
par: Tian, Bowei, et autres
Publié: (2025)
A Step Toward Federated Pretraining of Multimodal Large Language Models
par: Xiong, Baochen, et autres
Publié: (2026)
par: Xiong, Baochen, et autres
Publié: (2026)
Modeling and Performance Analysis for Semantic Communications Based on Empirical Results
par: Ma, Shuai, et autres
Publié: (2025)
par: Ma, Shuai, et autres
Publié: (2025)
Pretraining Large Language Models with NVFP4
par: NVIDIA, et autres
Publié: (2025)
par: NVIDIA, et autres
Publié: (2025)
Patent Language Model Pretraining with ModernBERT
par: Yousefiramandi, Amirhossein, et autres
Publié: (2025)
par: Yousefiramandi, Amirhossein, et autres
Publié: (2025)
What Makes Quantization for Large Language Models Hard? An Empirical Study from the Lens of Perturbation
par: Gong, Zhuocheng, et autres
Publié: (2024)
par: Gong, Zhuocheng, et autres
Publié: (2024)
Enhancing Microgrid Performance Prediction with Attention-based Deep Learning Models
par: Maddineni, Vinod Kumar, et autres
Publié: (2024)
par: Maddineni, Vinod Kumar, et autres
Publié: (2024)
Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining
par: Sow, Daouda, et autres
Publié: (2025)
par: Sow, Daouda, et autres
Publié: (2025)
Predicting LLM Reasoning Performance with Small Proxy Model
par: Koh, Woosung, et autres
Publié: (2025)
par: Koh, Woosung, et autres
Publié: (2025)
In-context Pretraining: Language Modeling Beyond Document Boundaries
par: Shi, Weijia, et autres
Publié: (2023)
par: Shi, Weijia, et autres
Publié: (2023)
Revisiting Multilingual Data Mixtures in Language Model Pretraining
par: Foroutan, Negar, et autres
Publié: (2025)
par: Foroutan, Negar, et autres
Publié: (2025)
Discovering Knowledge-Critical Subnetworks in Pretrained Language Models
par: Bayazit, Deniz, et autres
Publié: (2023)
par: Bayazit, Deniz, et autres
Publié: (2023)
Deep Ensembles Secretly Perform Empirical Bayes
par: Loaiza-Ganem, Gabriel, et autres
Publié: (2025)
par: Loaiza-Ganem, Gabriel, et autres
Publié: (2025)
Small Language Models for Application Interactions: A Case Study
par: Li, Beibin, et autres
Publié: (2024)
par: Li, Beibin, et autres
Publié: (2024)
Learnware of Language Models: Specialized Small Language Models Can Do Big
par: Tan, Zhi-Hao, et autres
Publié: (2025)
par: Tan, Zhi-Hao, et autres
Publié: (2025)
Caching Techniques for Reducing the Communication Cost of Federated Learning in IoT Environments
par: Alhonainy, Ahmad, et autres
Publié: (2025)
par: Alhonainy, Ahmad, et autres
Publié: (2025)
Robust Uncertainty Quantification for Self-Evolving Large Language Models via Continual Domain Pretraining
par: Zhou, Xiaofan, et autres
Publié: (2025)
par: Zhou, Xiaofan, et autres
Publié: (2025)
Retrieval Capabilities of Large Language Models Scale with Pretraining FLOPs
par: Portes, Jacob, et autres
Publié: (2025)
par: Portes, Jacob, et autres
Publié: (2025)
Teaching Pretrained Language Models to Think Deeper with Retrofitted Recurrence
par: McLeish, Sean, et autres
Publié: (2025)
par: McLeish, Sean, et autres
Publié: (2025)
Pretrained Vision-Language-Action Models are Surprisingly Resistant to Forgetting in Continual Learning
par: Liu, Huihan, et autres
Publié: (2026)
par: Liu, Huihan, et autres
Publié: (2026)
Multiple Physics Pretraining for Physical Surrogate Models
par: McCabe, Michael, et autres
Publié: (2023)
par: McCabe, Michael, et autres
Publié: (2023)
An Empirical Study of Realized GNN Expressiveness
par: Wang, Yanbo, et autres
Publié: (2023)
par: Wang, Yanbo, et autres
Publié: (2023)
Unlock the Potential of Large Language Models for Predictive Tabular Tasks in Data Science with Table-Specific Pretraining
par: Yang, Yazheng, et autres
Publié: (2024)
par: Yang, Yazheng, et autres
Publié: (2024)
Enhancing Two-Player Performance Through Single-Player Knowledge Transfer: An Empirical Study on Atari 2600 Games
par: Saadat, Kimiya, et autres
Publié: (2024)
par: Saadat, Kimiya, et autres
Publié: (2024)
Generalizable and Stable Finetuning of Pretrained Language Models on Low-Resource Texts
par: Somayajula, Sai Ashish, et autres
Publié: (2024)
par: Somayajula, Sai Ashish, et autres
Publié: (2024)
Cite Pretrain: Retrieval-Free Knowledge Attribution for Large Language Models
par: Huang, Yukun, et autres
Publié: (2025)
par: Huang, Yukun, et autres
Publié: (2025)
Improved Large Language Model Jailbreak Detection via Pretrained Embeddings
par: Galinkin, Erick, et autres
Publié: (2024)
par: Galinkin, Erick, et autres
Publié: (2024)
Tracing the Representation Geometry of Language Models from Pretraining to Post-training
par: Li, Melody Zixuan, et autres
Publié: (2025)
par: Li, Melody Zixuan, et autres
Publié: (2025)
FedNano: Toward Lightweight Federated Tuning for Pretrained Multimodal Large Language Models
par: Zhang, Yao, et autres
Publié: (2025)
par: Zhang, Yao, et autres
Publié: (2025)
Documents similaires
-
Is Training Data Quality or Quantity More Impactful to Small Language Model Performance?
par: Sajith, Aryan, et autres
Publié: (2024) -
Adjusting Pretrained Backbones for Performativity
par: Demirel, Berker, et autres
Publié: (2024) -
Reasoning Language Model Inference Serving Unveiled: An Empirical Study
par: Li, Qi, et autres
Publié: (2025) -
Pretraining a Foundation Model for Small-Molecule Natural Products
par: Ding, Yuheng, et autres
Publié: (2025) -
LLM-Inspired Pretrain-Then-Finetune for Small-Data, Large-Scale Optimization
par: Zhang, Zishi, et autres
Publié: (2026)