Cascade-Aware Training of Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Congchao, Augenstein, Sean, Rush, Keith, Jitkrittum, Wittawat, Narasimhan, Harikrishna, Rawat, Ankit Singh, Menon, Aditya Krishna, Go, Alec |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Language Model Cascades: Token-level uncertainty and beyond
by: Gupta, Neha, et al.
Published: (2024)
by: Gupta, Neha, et al.
Published: (2024)
Faster Cascades via Speculative Decoding
by: Narasimhan, Harikrishna, et al.
Published: (2024)
by: Narasimhan, Harikrishna, et al.
Published: (2024)
When Does Confidence-Based Cascade Deferral Suffice?
by: Jitkrittum, Wittawat, et al.
Published: (2023)
by: Jitkrittum, Wittawat, et al.
Published: (2023)
Universal Model Routing for Efficient LLM Inference
by: Jitkrittum, Wittawat, et al.
Published: (2025)
by: Jitkrittum, Wittawat, et al.
Published: (2025)
Gatekeeper: Improving Model Cascades Through Confidence Tuning
by: Rabanser, Stephan, et al.
Published: (2025)
by: Rabanser, Stephan, et al.
Published: (2025)
Think before you speak: Training Language Models With Pause Tokens
by: Goyal, Sachin, et al.
Published: (2023)
by: Goyal, Sachin, et al.
Published: (2023)
A Little Help Goes a Long Way: Efficient LLM Training by Leveraging Small LMs
by: Rawat, Ankit Singh, et al.
Published: (2024)
by: Rawat, Ankit Singh, et al.
Published: (2024)
Bipartite Ranking From Multiple Labels: On Loss Versus Label Aggregation
by: Lukasik, Michal, et al.
Published: (2025)
by: Lukasik, Michal, et al.
Published: (2025)
DistillSpec: Improving Speculative Decoding via Knowledge Distillation
by: Zhou, Yongchao, et al.
Published: (2023)
by: Zhou, Yongchao, et al.
Published: (2023)
A Statistical Framework for Data-dependent Retrieval-Augmented Models
by: Basu, Soumya, et al.
Published: (2024)
by: Basu, Soumya, et al.
Published: (2024)
Regression-aware Inference with LLMs
by: Lukasik, Michal, et al.
Published: (2024)
by: Lukasik, Michal, et al.
Published: (2024)
Privacy-preserved LLM Cascade via CoT-enhanced Policy Learning
by: Zhang, Kai, et al.
Published: (2024)
by: Zhang, Kai, et al.
Published: (2024)
Cost-Aware Routing for Efficient Text-To-Image Generation
by: Li, Qinchan, et al.
Published: (2025)
by: Li, Qinchan, et al.
Published: (2025)
DrJAX: Scalable and Differentiable MapReduce Primitives in JAX
by: Rush, Keith, et al.
Published: (2024)
by: Rush, Keith, et al.
Published: (2024)
Fine-grained Analysis of In-context Linear Estimation: Data, Architecture, and Beyond
by: Li, Yingcong, et al.
Published: (2024)
by: Li, Yingcong, et al.
Published: (2024)
Crossing Language Borders: A Pipeline for Indonesian Manhwa Translation
by: Narasimhan, Nithyasri, et al.
Published: (2025)
by: Narasimhan, Nithyasri, et al.
Published: (2025)
From Self-Attention to Markov Models: Unveiling the Dynamics of Generative Transformers
by: Ildiz, M. Emrullah, et al.
Published: (2024)
by: Ildiz, M. Emrullah, et al.
Published: (2024)
Reinforcement Learning without Human Feedback for Last Mile Fine-Tuning of Large Language Models
by: Solway, Alec
Published: (2024)
by: Solway, Alec
Published: (2024)
Communication-Efficient Language Model Training Scales Reliably and Robustly: Scaling Laws for DiLoCo
by: Charles, Zachary, et al.
Published: (2025)
by: Charles, Zachary, et al.
Published: (2025)
Investigating the Impact of Model Instability on Explanations and Uncertainty
by: Marjanović, Sara Vera, et al.
Published: (2024)
by: Marjanović, Sara Vera, et al.
Published: (2024)
Development of Pre-Trained Transformer-based Models for the Nepali Language
by: Thapa, Prajwal, et al.
Published: (2024)
by: Thapa, Prajwal, et al.
Published: (2024)
Towards Linguistically-Aware and Language-Independent Tokenization for Large Language Models (LLMs)
by: Rahman, Abrar, et al.
Published: (2024)
by: Rahman, Abrar, et al.
Published: (2024)
Fine-Tuning Large Language Models with User-Level Differential Privacy
by: Charles, Zachary, et al.
Published: (2024)
by: Charles, Zachary, et al.
Published: (2024)
Noise-Aware Training of Layout-Aware Language Models
by: Sarkhel, Ritesh, et al.
Published: (2024)
by: Sarkhel, Ritesh, et al.
Published: (2024)
UPLME: Uncertainty-Aware Probabilistic Language Modelling for Robust Empathy Regression
by: Hasan, Md Rakibul, et al.
Published: (2025)
by: Hasan, Md Rakibul, et al.
Published: (2025)
Never Train from Scratch: Fair Comparison of Long-Sequence Models Requires Data-Driven Priors
by: Amos, Ido, et al.
Published: (2023)
by: Amos, Ido, et al.
Published: (2023)
SynDARin: Synthesising Datasets for Automated Reasoning in Low-Resource Languages
by: Ghazaryan, Gayane, et al.
Published: (2024)
by: Ghazaryan, Gayane, et al.
Published: (2024)
LoSA: Locality Aware Sparse Attention for Block-Wise Diffusion Language Models
by: Xi, Haocheng, et al.
Published: (2026)
by: Xi, Haocheng, et al.
Published: (2026)
Revealing Fine-Grained Values and Opinions in Large Language Models
by: Wright, Dustin, et al.
Published: (2024)
by: Wright, Dustin, et al.
Published: (2024)
Is Training Data Quality or Quantity More Impactful to Small Language Model Performance?
by: Sajith, Aryan, et al.
Published: (2024)
by: Sajith, Aryan, et al.
Published: (2024)
Gating is Weighting: Understanding Gated Linear Attention through In-context Learning
by: Li, Yingcong, et al.
Published: (2025)
by: Li, Yingcong, et al.
Published: (2025)
Mechanics of Next Token Prediction with Self-Attention
by: Li, Yingcong, et al.
Published: (2024)
by: Li, Yingcong, et al.
Published: (2024)
Language-Guided World Models: A Model-Based Approach to AI Control
by: Zhang, Alex, et al.
Published: (2024)
by: Zhang, Alex, et al.
Published: (2024)
When Should a Language Model Trust Itself? Same-Model Self-Verification as a Conditional Confidence Signal
by: Phalod, Aditya Ajay
Published: (2026)
by: Phalod, Aditya Ajay
Published: (2026)
Semantic Sensitivities and Inconsistent Predictions: Measuring the Fragility of NLI Models
by: Arakelyan, Erik, et al.
Published: (2024)
by: Arakelyan, Erik, et al.
Published: (2024)
CAST: Continuous and Differentiable Semi-Structured Sparsity-Aware Training for Large Language Models
by: Huang, Weiyu, et al.
Published: (2025)
by: Huang, Weiyu, et al.
Published: (2025)
DISCERN: Decoding Systematic Errors in Natural Language for Text Classifiers
by: Menon, Rakesh R., et al.
Published: (2024)
by: Menon, Rakesh R., et al.
Published: (2024)
Radio: Rate-Distortion Optimization for Large Language Model Compression
by: Young, Sean I.
Published: (2025)
by: Young, Sean I.
Published: (2025)
Sequence-level Large Language Model Training with Contrastive Preference Optimization
by: Feng, Zhili, et al.
Published: (2025)
by: Feng, Zhili, et al.
Published: (2025)
Foundations of Large Language Model Compression -- Part 1: Weight Quantization
by: Young, Sean I.
Published: (2024)
by: Young, Sean I.
Published: (2024)
Similar Items
-
Language Model Cascades: Token-level uncertainty and beyond
by: Gupta, Neha, et al.
Published: (2024) -
Faster Cascades via Speculative Decoding
by: Narasimhan, Harikrishna, et al.
Published: (2024) -
When Does Confidence-Based Cascade Deferral Suffice?
by: Jitkrittum, Wittawat, et al.
Published: (2023) -
Universal Model Routing for Efficient LLM Inference
by: Jitkrittum, Wittawat, et al.
Published: (2025) -
Gatekeeper: Improving Model Cascades Through Confidence Tuning
by: Rabanser, Stephan, et al.
Published: (2025)