What Happens When Small Is Made Smaller? Exploring the Impact of Compression on Small Data Pretrained Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Awobade, Busayo, Oduwole, Mardiyyah, Kolawole, Steven |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
From Scarcity to Efficiency: Investigating the Effects of Data Augmentation on African Machine Translation
von: Oduwole, Mardiyyah, et al.
Veröffentlicht: (2025)
von: Oduwole, Mardiyyah, et al.
Veröffentlicht: (2025)
DataDecide: How to Predict Best Pretraining Data with Small Experiments
von: Magnusson, Ian, et al.
Veröffentlicht: (2025)
von: Magnusson, Ian, et al.
Veröffentlicht: (2025)
Language Models Improve When Pretraining Data Matches Target Tasks
von: Mizrahi, David, et al.
Veröffentlicht: (2025)
von: Mizrahi, David, et al.
Veröffentlicht: (2025)
AfriVox-v2: A Domain-Verticalized Benchmark for In-the-Wild African Speech Recognition
von: Awobade, Busayo, et al.
Veröffentlicht: (2026)
von: Awobade, Busayo, et al.
Veröffentlicht: (2026)
Task-Specific Efficiency Analysis: When Small Language Models Outperform Large Language Models
von: Cao, Jinghan, et al.
Veröffentlicht: (2026)
von: Cao, Jinghan, et al.
Veröffentlicht: (2026)
Probing the Limits of Compressive Memory: A Study of Infini-Attention in Small-Scale Pretraining
von: Huang, Ruizhe, et al.
Veröffentlicht: (2025)
von: Huang, Ruizhe, et al.
Veröffentlicht: (2025)
Is Training Data Quality or Quantity More Impactful to Small Language Model Performance?
von: Sajith, Aryan, et al.
Veröffentlicht: (2024)
von: Sajith, Aryan, et al.
Veröffentlicht: (2024)
Small Vocabularies, Big Gains: Pretraining and Tokenization in Time Series Models
von: Roger, Alexis, et al.
Veröffentlicht: (2025)
von: Roger, Alexis, et al.
Veröffentlicht: (2025)
When Correct Isn't Usable: Improving Structured Output Reliability in Small Language Models
von: Galeone, Cosimo, et al.
Veröffentlicht: (2026)
von: Galeone, Cosimo, et al.
Veröffentlicht: (2026)
Reinforcement Learning for Reasoning in Small LLMs: What Works and What Doesn't
von: Dang, Quy-Anh, et al.
Veröffentlicht: (2025)
von: Dang, Quy-Anh, et al.
Veröffentlicht: (2025)
From Unstructured Data to In-Context Learning: Exploring What Tasks Can Be Learned and When
von: Wibisono, Kevin Christian, et al.
Veröffentlicht: (2024)
von: Wibisono, Kevin Christian, et al.
Veröffentlicht: (2024)
On Importance of Layer Pruning for Smaller BERT Models and Low Resource Languages
von: Shirke, Mayur, et al.
Veröffentlicht: (2025)
von: Shirke, Mayur, et al.
Veröffentlicht: (2025)
Facts in Stats: Impacts of Pretraining Diversity on Language Model Generalization
von: Behnia, Tina, et al.
Veröffentlicht: (2025)
von: Behnia, Tina, et al.
Veröffentlicht: (2025)
Small Language Models Improve Giants by Rewriting Their Outputs
von: Vernikos, Giorgos, et al.
Veröffentlicht: (2023)
von: Vernikos, Giorgos, et al.
Veröffentlicht: (2023)
Self-Taught Self-Correction for Small Language Models
von: Moskvoretskii, Viktor, et al.
Veröffentlicht: (2025)
von: Moskvoretskii, Viktor, et al.
Veröffentlicht: (2025)
An Analysis for Reasoning Bias of Language Models with Small Initialization
von: Yao, Junjie, et al.
Veröffentlicht: (2025)
von: Yao, Junjie, et al.
Veröffentlicht: (2025)
Smaller Language Models are Better Black-box Machine-Generated Text Detectors
von: Mireshghallah, Niloofar, et al.
Veröffentlicht: (2023)
von: Mireshghallah, Niloofar, et al.
Veröffentlicht: (2023)
When Attention Collapses: How Degenerate Layers in LLMs Enable Smaller, Stronger Models
von: Sanyal, Sunny, et al.
Veröffentlicht: (2024)
von: Sanyal, Sunny, et al.
Veröffentlicht: (2024)
Procedural Pretraining: Warming Up Language Models with Abstract Data
von: Jiang, Liangze, et al.
Veröffentlicht: (2026)
von: Jiang, Liangze, et al.
Veröffentlicht: (2026)
Analyzing Similarity Metrics for Data Selection for Language Model Pretraining
von: Sam, Dylan, et al.
Veröffentlicht: (2025)
von: Sam, Dylan, et al.
Veröffentlicht: (2025)
Need a Small Specialized Language Model? Plan Early!
von: Grangier, David, et al.
Veröffentlicht: (2024)
von: Grangier, David, et al.
Veröffentlicht: (2024)
From Small to Large Language Models: Revisiting the Federalist Papers
von: Jeong, So Won, et al.
Veröffentlicht: (2025)
von: Jeong, So Won, et al.
Veröffentlicht: (2025)
Domain-Adaptive Continued Pre-Training of Small Language Models
von: Faroz, Salman
Veröffentlicht: (2025)
von: Faroz, Salman
Veröffentlicht: (2025)
SmallToLarge (S2L): Scalable Data Selection for Fine-tuning Large Language Models by Summarizing Training Trajectories of Small Models
von: Yang, Yu, et al.
Veröffentlicht: (2024)
von: Yang, Yu, et al.
Veröffentlicht: (2024)
Stacking Small Language Models for Generalizability
von: Liang, Laurence
Veröffentlicht: (2024)
von: Liang, Laurence
Veröffentlicht: (2024)
All Language Models Large and Small
von: Chen, Zhixun, et al.
Veröffentlicht: (2024)
von: Chen, Zhixun, et al.
Veröffentlicht: (2024)
Data Mixing for Large Language Models Pretraining: A Survey and Outlook
von: Chen, Zhuo, et al.
Veröffentlicht: (2026)
von: Chen, Zhuo, et al.
Veröffentlicht: (2026)
Temporal Entailment Pretraining for Clinical Language Models over EHR Data
von: Tanaka, Tatsunori, et al.
Veröffentlicht: (2025)
von: Tanaka, Tatsunori, et al.
Veröffentlicht: (2025)
Perplexed by Perplexity: Perplexity-Based Data Pruning With Small Reference Models
von: Ankner, Zachary, et al.
Veröffentlicht: (2024)
von: Ankner, Zachary, et al.
Veröffentlicht: (2024)
Can Small Language Models Learn, Unlearn, and Retain Noise Patterns?
von: Scaria, Nicy, et al.
Veröffentlicht: (2024)
von: Scaria, Nicy, et al.
Veröffentlicht: (2024)
Domain-Adaptive Small Language Models for Structured Tax Code Prediction
von: Nath, Souvik, et al.
Veröffentlicht: (2025)
von: Nath, Souvik, et al.
Veröffentlicht: (2025)
Architectural Trade-offs in Small Language Models Under Compute Constraints
von: Bhatti, Shivraj Singh
Veröffentlicht: (2025)
von: Bhatti, Shivraj Singh
Veröffentlicht: (2025)
Small Models Are (Still) Effective Cross-Domain Argument Extractors
von: Gantt, William, et al.
Veröffentlicht: (2024)
von: Gantt, William, et al.
Veröffentlicht: (2024)
Training-free Ultra Small Model for Universal Sparse Reconstruction in Compressed Sensing
von: Tang, Chaoqing, et al.
Veröffentlicht: (2025)
von: Tang, Chaoqing, et al.
Veröffentlicht: (2025)
Small Language Models: Survey, Measurements, and Insights
von: Lu, Zhenyan, et al.
Veröffentlicht: (2024)
von: Lu, Zhenyan, et al.
Veröffentlicht: (2024)
Squat: Quant Small Language Models on the Edge
von: Shen, Xuan, et al.
Veröffentlicht: (2024)
von: Shen, Xuan, et al.
Veröffentlicht: (2024)
Towards Reasoning Ability of Small Language Models
von: Srivastava, Gaurav, et al.
Veröffentlicht: (2025)
von: Srivastava, Gaurav, et al.
Veröffentlicht: (2025)
Chameleon: A Flexible Data-mixing Framework for Language Model Pretraining and Finetuning
von: Xie, Wanyun, et al.
Veröffentlicht: (2025)
von: Xie, Wanyun, et al.
Veröffentlicht: (2025)
Layer by Layer: Uncovering Where Multi-Task Learning Happens in Instruction-Tuned Large Language Models
von: Zhao, Zheng, et al.
Veröffentlicht: (2024)
von: Zhao, Zheng, et al.
Veröffentlicht: (2024)
MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies
von: Hu, Shengding, et al.
Veröffentlicht: (2024)
von: Hu, Shengding, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
From Scarcity to Efficiency: Investigating the Effects of Data Augmentation on African Machine Translation
von: Oduwole, Mardiyyah, et al.
Veröffentlicht: (2025) -
DataDecide: How to Predict Best Pretraining Data with Small Experiments
von: Magnusson, Ian, et al.
Veröffentlicht: (2025) -
Language Models Improve When Pretraining Data Matches Target Tasks
von: Mizrahi, David, et al.
Veröffentlicht: (2025) -
AfriVox-v2: A Domain-Verticalized Benchmark for In-the-Wild African Speech Recognition
von: Awobade, Busayo, et al.
Veröffentlicht: (2026) -
Task-Specific Efficiency Analysis: When Small Language Models Outperform Large Language Models
von: Cao, Jinghan, et al.
Veröffentlicht: (2026)