FLOP-Efficient Training: Early Stopping Based on Test-Time Compute Awareness
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Amer, Hossam, Dialameh, Maryam, Rajabzadeh, Hossein, Ahmed, Walid, Zhang, Weiwei, Liu, Yang |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Bayesian Mixture of Experts For Large Language Models
par: Dialameh, Maryam, et autres
Publié: (2025)
par: Dialameh, Maryam, et autres
Publié: (2025)
ECHO-LLaMA: Efficient Caching for High-Performance LLaMA Training
par: Dialameh, Maryam, et autres
Publié: (2025)
par: Dialameh, Maryam, et autres
Publié: (2025)
EPAS: Efficient Training with Progressive Activation Sharing
par: Karim, Rezaul, et autres
Publié: (2026)
par: Karim, Rezaul, et autres
Publié: (2026)
Continuous Self-Improvement of Large Language Models by Test-time Training with Verifier-Driven Sample Selection
par: Moradi, Mohammad Mahdi, et autres
Publié: (2025)
par: Moradi, Mohammad Mahdi, et autres
Publié: (2025)
LoRA-Drop: Temporal LoRA Decoding for Efficient LLM Inference
par: Rajabzadeh, Hossein, et autres
Publié: (2026)
par: Rajabzadeh, Hossein, et autres
Publié: (2026)
Sparse-IFT: Sparse Iso-FLOP Transformations for Maximizing Training Efficiency
par: Thangarasa, Vithursan, et autres
Publié: (2023)
par: Thangarasa, Vithursan, et autres
Publié: (2023)
Training Acceleration of Low-Rank Decomposed Networks using Sequential Freezing and Rank Quantization
par: Hajimolahoseini, Habib, et autres
Publié: (2023)
par: Hajimolahoseini, Habib, et autres
Publié: (2023)
Problems with Chinchilla Approach 2: Systematic Biases in IsoFLOP Parabola Fits
par: Czech, Eric, et autres
Publié: (2026)
par: Czech, Eric, et autres
Publié: (2026)
Just on Time: Token-Level Early Stopping for Diffusion Language Models
par: Kohut, Zahar, et autres
Publié: (2026)
par: Kohut, Zahar, et autres
Publié: (2026)
Distributed Hybrid Parallelism for Large Language Models: Comparative Study and System Design Guide
par: Amer, Hossam, et autres
Publié: (2026)
par: Amer, Hossam, et autres
Publié: (2026)
ArzEn-LLM: Code-Switched Egyptian Arabic-English Translation and Speech Recognition Using LLMs
par: Heakl, Ahmed, et autres
Publié: (2024)
par: Heakl, Ahmed, et autres
Publié: (2024)
Latency and Token-Aware Test-Time Compute
par: Huang, Jenny Y., et autres
Publié: (2025)
par: Huang, Jenny Y., et autres
Publié: (2025)
EchoAtt: Attend, Copy, then Adjust for More Efficient Large Language Models
par: Rajabzadeh, Hossein, et autres
Publié: (2024)
par: Rajabzadeh, Hossein, et autres
Publié: (2024)
Every FLOP Counts: Scaling a 300B Mixture-of-Experts LING LLM without Premium GPUs
par: Ling Team, et autres
Publié: (2025)
par: Ling Team, et autres
Publié: (2025)
QDyLoRA: Quantized Dynamic Low-Rank Adaptation for Efficient Large Language Model Tuning
par: Rajabzadeh, Hossein, et autres
Publié: (2024)
par: Rajabzadeh, Hossein, et autres
Publié: (2024)
Accelerating the Low-Rank Decomposed Models
par: Hajimolahoseini, Habib, et autres
Publié: (2024)
par: Hajimolahoseini, Habib, et autres
Publié: (2024)
MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention
par: MiniMax, et autres
Publié: (2025)
par: MiniMax, et autres
Publié: (2025)
SR-TTT: Surprisal-Aware Residual Test-Time Training
par: P, Swamynathan V
Publié: (2026)
par: P, Swamynathan V
Publié: (2026)
When to Ponder: Adaptive Compute Allocation for Code Generation via Test-Time Training
par: Sim, Gihyeon
Publié: (2025)
par: Sim, Gihyeon
Publié: (2025)
FALCON: FLOP-Aware Combinatorial Optimization for Neural Network Pruning
par: Meng, Xiang, et autres
Publié: (2024)
par: Meng, Xiang, et autres
Publié: (2024)
In-Place Test-Time Training
par: Feng, Guhao, et autres
Publié: (2026)
par: Feng, Guhao, et autres
Publié: (2026)
Precision Aquaculture: An Integrated Computer Vision and IoT Approach for Optimized Tilapia Feeding
par: Hossam, Rania, et autres
Publié: (2024)
par: Hossam, Rania, et autres
Publié: (2024)
Stopping Computation for Converged Tokens in Masked Diffusion-LM Decoding
par: Oba, Daisuke, et autres
Publié: (2026)
par: Oba, Daisuke, et autres
Publié: (2026)
TrimR: Verifier-based Training-Free Thinking Compression for Efficient Test-Time Scaling
par: Lin, Weizhe, et autres
Publié: (2025)
par: Lin, Weizhe, et autres
Publié: (2025)
Efficient Agent Training for Computer Use
par: He, Yanheng, et autres
Publié: (2025)
par: He, Yanheng, et autres
Publié: (2025)
FEval-TTC: Fair Evaluation Protocol for Test-Time Compute
par: Rumiantsev, Pavel, et autres
Publié: (2025)
par: Rumiantsev, Pavel, et autres
Publié: (2025)
Test-Time Training Done Right
par: Zhang, Tianyuan, et autres
Publié: (2025)
par: Zhang, Tianyuan, et autres
Publié: (2025)
Optimal Stopping vs Best-of-$N$ for Inference Time Optimization
par: Kalayci, Yusuf, et autres
Publié: (2025)
par: Kalayci, Yusuf, et autres
Publié: (2025)
Early Stopping for Large Reasoning Models via Confidence Dynamics
par: Hosseini, Parsa, et autres
Publié: (2026)
par: Hosseini, Parsa, et autres
Publié: (2026)
DELTA: Dynamic Layer-Aware Token Attention for Efficient Long-Context Reasoning
par: Zarch, Hossein Entezari, et autres
Publié: (2025)
par: Zarch, Hossein Entezari, et autres
Publié: (2025)
DEL: Context-Aware Dynamic Exit Layer for Efficient Self-Speculative Decoding
par: Zarch, Hossein Entezari, et autres
Publié: (2025)
par: Zarch, Hossein Entezari, et autres
Publié: (2025)
Test-Time Scaling Makes Overtraining Compute-Optimal
par: Roberts, Nicholas, et autres
Publié: (2026)
par: Roberts, Nicholas, et autres
Publié: (2026)
Early Transformers: A study on Efficient Training of Transformer Models through Early-Bird Lottery Tickets
par: Cheekati, Shravan
Publié: (2024)
par: Cheekati, Shravan
Publié: (2024)
Mixed Sparsity Training: Achieving 4$\times$ FLOP Reduction for Transformer Pretraining
par: Hu, Pihe, et autres
Publié: (2024)
par: Hu, Pihe, et autres
Publié: (2024)
Test-Time Training on Nearest Neighbors for Large Language Models
par: Hardt, Moritz, et autres
Publié: (2023)
par: Hardt, Moritz, et autres
Publié: (2023)
e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs
par: Setlur, Amrith, et autres
Publié: (2025)
par: Setlur, Amrith, et autres
Publié: (2025)
FinGPT-HPC: Efficient Pretraining and Finetuning Large Language Models for Financial Applications with High-Performance Computing
par: Liu, Xiao-Yang, et autres
Publié: (2024)
par: Liu, Xiao-Yang, et autres
Publié: (2024)
Improving Resnet-9 Generalization Trained on Small Datasets
par: Awad, Omar Mohamed, et autres
Publié: (2023)
par: Awad, Omar Mohamed, et autres
Publié: (2023)
Scaling Law for Quantization-Aware Training
par: Chen, Mengzhao, et autres
Publié: (2025)
par: Chen, Mengzhao, et autres
Publié: (2025)
Scaling Test-Time Compute Without Verification or RL is Suboptimal
par: Setlur, Amrith, et autres
Publié: (2025)
par: Setlur, Amrith, et autres
Publié: (2025)
Documents similaires
-
Bayesian Mixture of Experts For Large Language Models
par: Dialameh, Maryam, et autres
Publié: (2025) -
ECHO-LLaMA: Efficient Caching for High-Performance LLaMA Training
par: Dialameh, Maryam, et autres
Publié: (2025) -
EPAS: Efficient Training with Progressive Activation Sharing
par: Karim, Rezaul, et autres
Publié: (2026) -
Continuous Self-Improvement of Large Language Models by Test-time Training with Verifier-Driven Sample Selection
par: Moradi, Mohammad Mahdi, et autres
Publié: (2025) -
LoRA-Drop: Temporal LoRA Decoding for Efficient LLM Inference
par: Rajabzadeh, Hossein, et autres
Publié: (2026)