Language Model Cascades: Token-level uncertainty and beyond
Fuente:
arXiv
Salvato in:
| Autori principali: | Gupta, Neha, Narasimhan, Harikrishna, Jitkrittum, Wittawat, Rawat, Ankit Singh, Menon, Aditya Krishna, Kumar, Sanjiv |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Faster Cascades via Speculative Decoding
di: Narasimhan, Harikrishna, et al.
Pubblicazione: (2024)
di: Narasimhan, Harikrishna, et al.
Pubblicazione: (2024)
When Does Confidence-Based Cascade Deferral Suffice?
di: Jitkrittum, Wittawat, et al.
Pubblicazione: (2023)
di: Jitkrittum, Wittawat, et al.
Pubblicazione: (2023)
Cascade-Aware Training of Language Models
di: Wang, Congchao, et al.
Pubblicazione: (2024)
di: Wang, Congchao, et al.
Pubblicazione: (2024)
Think before you speak: Training Language Models With Pause Tokens
di: Goyal, Sachin, et al.
Pubblicazione: (2023)
di: Goyal, Sachin, et al.
Pubblicazione: (2023)
Regression-aware Inference with LLMs
di: Lukasik, Michal, et al.
Pubblicazione: (2024)
di: Lukasik, Michal, et al.
Pubblicazione: (2024)
Universal Model Routing for Efficient LLM Inference
di: Jitkrittum, Wittawat, et al.
Pubblicazione: (2025)
di: Jitkrittum, Wittawat, et al.
Pubblicazione: (2025)
Bipartite Ranking From Multiple Labels: On Loss Versus Label Aggregation
di: Lukasik, Michal, et al.
Pubblicazione: (2025)
di: Lukasik, Michal, et al.
Pubblicazione: (2025)
DistillSpec: Improving Speculative Decoding via Knowledge Distillation
di: Zhou, Yongchao, et al.
Pubblicazione: (2023)
di: Zhou, Yongchao, et al.
Pubblicazione: (2023)
A Statistical Framework for Data-dependent Retrieval-Augmented Models
di: Basu, Soumya, et al.
Pubblicazione: (2024)
di: Basu, Soumya, et al.
Pubblicazione: (2024)
A Little Help Goes a Long Way: Efficient LLM Training by Leveraging Small LMs
di: Rawat, Ankit Singh, et al.
Pubblicazione: (2024)
di: Rawat, Ankit Singh, et al.
Pubblicazione: (2024)
Mechanics of Next Token Prediction with Self-Attention
di: Li, Yingcong, et al.
Pubblicazione: (2024)
di: Li, Yingcong, et al.
Pubblicazione: (2024)
Efficient Document Ranking with Learnable Late Interactions
di: Ji, Ziwei, et al.
Pubblicazione: (2024)
di: Ji, Ziwei, et al.
Pubblicazione: (2024)
On student-teacher deviations in distillation: does it pay to disobey?
di: Nagarajan, Vaishnavh, et al.
Pubblicazione: (2023)
di: Nagarajan, Vaishnavh, et al.
Pubblicazione: (2023)
Fine-grained Analysis of In-context Linear Estimation: Data, Architecture, and Beyond
di: Li, Yingcong, et al.
Pubblicazione: (2024)
di: Li, Yingcong, et al.
Pubblicazione: (2024)
From Self-Attention to Markov Models: Unveiling the Dynamics of Generative Transformers
di: Ildiz, M. Emrullah, et al.
Pubblicazione: (2024)
di: Ildiz, M. Emrullah, et al.
Pubblicazione: (2024)
Short-Context Dominance: How Much Local Context Natural Language Actually Needs?
di: Vakilian, Vala, et al.
Pubblicazione: (2025)
di: Vakilian, Vala, et al.
Pubblicazione: (2025)
Enabling Autoregressive Models to Fill In Masked Tokens
di: Israel, Daniel, et al.
Pubblicazione: (2025)
di: Israel, Daniel, et al.
Pubblicazione: (2025)
G-Loss: Graph-Guided Fine-Tuning of Language Models
di: Sharma, Aditya, et al.
Pubblicazione: (2026)
di: Sharma, Aditya, et al.
Pubblicazione: (2026)
Language-Guided World Models: A Model-Based Approach to AI Control
di: Zhang, Alex, et al.
Pubblicazione: (2024)
di: Zhang, Alex, et al.
Pubblicazione: (2024)
Gating is Weighting: Understanding Gated Linear Attention through In-context Learning
di: Li, Yingcong, et al.
Pubblicazione: (2025)
di: Li, Yingcong, et al.
Pubblicazione: (2025)
Deep sequence models tend to memorize geometrically; it is unclear why
di: Noroozizadeh, Shahriar, et al.
Pubblicazione: (2025)
di: Noroozizadeh, Shahriar, et al.
Pubblicazione: (2025)
Beyond Next-Token Prediction: A Performance Characterization of Diffusion versus Autoregressive Language Models
di: Kim, Minseo, et al.
Pubblicazione: (2025)
di: Kim, Minseo, et al.
Pubblicazione: (2025)
Tokenization Matters: Navigating Data-Scarce Tokenization for Gender Inclusive Language Technologies
di: Ovalle, Anaelia, et al.
Pubblicazione: (2023)
di: Ovalle, Anaelia, et al.
Pubblicazione: (2023)
MrT5: Dynamic Token Merging for Efficient Byte-level Language Models
di: Kallini, Julie, et al.
Pubblicazione: (2024)
di: Kallini, Julie, et al.
Pubblicazione: (2024)
Recent Advances in Generative AI and Large Language Models: Current Status, Challenges, and Perspectives
di: Hagos, Desta Haileselassie, et al.
Pubblicazione: (2024)
di: Hagos, Desta Haileselassie, et al.
Pubblicazione: (2024)
Remember This Event That Year? Assessing Temporal Information and Reasoning in Large Language Models
di: Beniwal, Himanshu, et al.
Pubblicazione: (2024)
di: Beniwal, Himanshu, et al.
Pubblicazione: (2024)
Length-MAX Tokenizer for Language Models
di: Dong, Dong, et al.
Pubblicazione: (2025)
di: Dong, Dong, et al.
Pubblicazione: (2025)
Are language models aware of the road not taken? Token-level uncertainty and hidden state dynamics
di: Zur, Amir, et al.
Pubblicazione: (2025)
di: Zur, Amir, et al.
Pubblicazione: (2025)
LoRA on the Go: Instance-level Dynamic LoRA Selection and Merging
di: Lee, Seungeon, et al.
Pubblicazione: (2025)
di: Lee, Seungeon, et al.
Pubblicazione: (2025)
Sequence-level Large Language Model Training with Contrastive Preference Optimization
di: Feng, Zhili, et al.
Pubblicazione: (2025)
di: Feng, Zhili, et al.
Pubblicazione: (2025)
Understanding and Mitigating Tokenization Bias in Language Models
di: Phan, Buu, et al.
Pubblicazione: (2024)
di: Phan, Buu, et al.
Pubblicazione: (2024)
Guiding Language Model Reasoning with Planning Tokens
di: Wang, Xinyi, et al.
Pubblicazione: (2023)
di: Wang, Xinyi, et al.
Pubblicazione: (2023)
Adapting Language Models via Token Translation
di: Feng, Zhili, et al.
Pubblicazione: (2024)
di: Feng, Zhili, et al.
Pubblicazione: (2024)
Counterfactual Token Generation in Large Language Models
di: Chatzi, Ivi, et al.
Pubblicazione: (2024)
di: Chatzi, Ivi, et al.
Pubblicazione: (2024)
Large Language Models aren't all that you need
di: Holla, Kiran Voderhobli, et al.
Pubblicazione: (2024)
di: Holla, Kiran Voderhobli, et al.
Pubblicazione: (2024)
FLeX: Fourier-based Low-rank EXpansion for multilingual transfer
di: Narasimhan, Gaurav
Pubblicazione: (2026)
di: Narasimhan, Gaurav
Pubblicazione: (2026)
Reasoning with Latent Thoughts: On the Power of Looped Transformers
di: Saunshi, Nikunj, et al.
Pubblicazione: (2025)
di: Saunshi, Nikunj, et al.
Pubblicazione: (2025)
Revisiting Graph-Tokenizing Large Language Models: A Systematic Evaluation of Graph Token Understanding
di: Zhang, Zhongjian, et al.
Pubblicazione: (2026)
di: Zhang, Zhongjian, et al.
Pubblicazione: (2026)
Compositional Steering of Large Language Models with Steering Tokens
di: Radevski, Gorjan, et al.
Pubblicazione: (2026)
di: Radevski, Gorjan, et al.
Pubblicazione: (2026)
Probabilistic Token Alignment for Large Language Model Fusion
di: Zeng, Runjia, et al.
Pubblicazione: (2025)
di: Zeng, Runjia, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Faster Cascades via Speculative Decoding
di: Narasimhan, Harikrishna, et al.
Pubblicazione: (2024) -
When Does Confidence-Based Cascade Deferral Suffice?
di: Jitkrittum, Wittawat, et al.
Pubblicazione: (2023) -
Cascade-Aware Training of Language Models
di: Wang, Congchao, et al.
Pubblicazione: (2024) -
Think before you speak: Training Language Models With Pause Tokens
di: Goyal, Sachin, et al.
Pubblicazione: (2023) -
Regression-aware Inference with LLMs
di: Lukasik, Michal, et al.
Pubblicazione: (2024)