Cut Your Losses in Large-Vocabulary Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Wijmans, Erik, Huval, Brody, Hertzberg, Alexander, Koltun, Vladlen, Krähenbühl, Philipp |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Does Spatial Cognition Emerge in Frontier Models?
by: Ramakrishnan, Santhosh Kumar, et al.
Published: (2024)
by: Ramakrishnan, Santhosh Kumar, et al.
Published: (2024)
Robust Autonomy Emerges from Self-Play
by: Cusumano-Towner, Marco, et al.
Published: (2025)
by: Cusumano-Towner, Marco, et al.
Published: (2025)
Reinforcement Learning for Long-Horizon Interactive LLM Agents
by: Chen, Kevin, et al.
Published: (2025)
by: Chen, Kevin, et al.
Published: (2025)
Do multimodal models imagine electric sheep?
by: Ramakrishnan, Santhosh Kumar, et al.
Published: (2026)
by: Ramakrishnan, Santhosh Kumar, et al.
Published: (2026)
Cut Your Losses! Learning to Prune Paths Early for Efficient Parallel Reasoning
by: Bi, Jiaxi, et al.
Published: (2026)
by: Bi, Jiaxi, et al.
Published: (2026)
Conformation Generation using Transformer Flows
by: Shah, Sohil Atul, et al.
Published: (2024)
by: Shah, Sohil Atul, et al.
Published: (2024)
DynaSpec: Context-aware Dynamic Speculative Sampling for Large-Vocabulary Language Models
by: Zhang, Jinbin, et al.
Published: (2025)
by: Zhang, Jinbin, et al.
Published: (2025)
Entropy-Preserving Reinforcement Learning
by: Petrenko, Aleksei, et al.
Published: (2026)
by: Petrenko, Aleksei, et al.
Published: (2026)
An Empirical Comparison of Vocabulary Expansion and Initialization Approaches for Language Models
by: Mundra, Nandini, et al.
Published: (2024)
by: Mundra, Nandini, et al.
Published: (2024)
Exploiting Vocabulary Frequency Imbalance in Language Model Pre-training
by: Chung, Woojin, et al.
Published: (2025)
by: Chung, Woojin, et al.
Published: (2025)
Merging Language and Domain Specific Models: The Impact on Technical Vocabulary Acquisition
by: Rousset, Thibault, et al.
Published: (2025)
by: Rousset, Thibault, et al.
Published: (2025)
Output Embedding Centering for Stable LLM Pretraining
by: Stollenwerk, Felix, et al.
Published: (2026)
by: Stollenwerk, Felix, et al.
Published: (2026)
Power-Law Decay Loss for Large Language Model Finetuning: A Theory Perspective
by: Shao, Jintian
Published: (2025)
by: Shao, Jintian
Published: (2025)
CoMotion: Concurrent Multi-person 3D Motion
by: Newell, Alejandro, et al.
Published: (2025)
by: Newell, Alejandro, et al.
Published: (2025)
Fast Vocabulary Transfer for Language Model Compression
by: Gee, Leonidas, et al.
Published: (2024)
by: Gee, Leonidas, et al.
Published: (2024)
LAS: Loss-less ANN-SNN Conversion for Fully Spike-Driven Large Language Models
by: Chen, Long, et al.
Published: (2025)
by: Chen, Long, et al.
Published: (2025)
Should You Use Your Large Language Model to Explore or Exploit?
by: Harris, Keegan, et al.
Published: (2025)
by: Harris, Keegan, et al.
Published: (2025)
Sanitize Your Responses: Mitigating Privacy Leakage in Large Language Models
by: Fu, Wenjie, et al.
Published: (2025)
by: Fu, Wenjie, et al.
Published: (2025)
Calibrated Large Language Models for Binary Question Answering
by: Giovannotti, Patrizio, et al.
Published: (2024)
by: Giovannotti, Patrizio, et al.
Published: (2024)
FR-Spec: Accelerating Large-Vocabulary Language Models via Frequency-Ranked Speculative Sampling
by: Zhao, Weilin, et al.
Published: (2025)
by: Zhao, Weilin, et al.
Published: (2025)
CELL your Model: Contrastive Explanations for Large Language Models
by: Luss, Ronny, et al.
Published: (2024)
by: Luss, Ronny, et al.
Published: (2024)
Lossless Vocabulary Reduction for Auto-Regressive Language Models
by: Chijiwa, Daiki, et al.
Published: (2025)
by: Chijiwa, Daiki, et al.
Published: (2025)
CASCADE Your Datasets for Cross-Mode Knowledge Retrieval of Language Models
by: Zhou, Runlong, et al.
Published: (2025)
by: Zhou, Runlong, et al.
Published: (2025)
Backward Lens: Projecting Language Model Gradients into the Vocabulary Space
by: Katz, Shahar, et al.
Published: (2024)
by: Katz, Shahar, et al.
Published: (2024)
Your Finetuned Large Language Model is Already a Powerful Out-of-distribution Detector
by: Zhang, Andi, et al.
Published: (2024)
by: Zhang, Andi, et al.
Published: (2024)
Quantization of Large Language Models with an Overdetermined Basis
by: Merkulov, Daniil, et al.
Published: (2024)
by: Merkulov, Daniil, et al.
Published: (2024)
Investigating Automatic Scoring and Feedback using Large Language Models
by: Katuka, Gloria Ashiya, et al.
Published: (2024)
by: Katuka, Gloria Ashiya, et al.
Published: (2024)
Language-Image Models with 3D Understanding
by: Cho, Jang Hyun, et al.
Published: (2024)
by: Cho, Jang Hyun, et al.
Published: (2024)
AutoElicit: Using Large Language Models for Expert Prior Elicitation in Predictive Modelling
by: Capstick, Alexander, et al.
Published: (2024)
by: Capstick, Alexander, et al.
Published: (2024)
How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence
by: Choi, Hyeong Kyu, et al.
Published: (2025)
by: Choi, Hyeong Kyu, et al.
Published: (2025)
Improving Diversity in Language Models: When Temperature Fails, Change the Loss
by: Verine, Alexandre, et al.
Published: (2025)
by: Verine, Alexandre, et al.
Published: (2025)
Scaling Laws for Post Training Quantized Large Language Models
by: Xu, Zifei, et al.
Published: (2024)
by: Xu, Zifei, et al.
Published: (2024)
Large Language Models Reflect the Ideology of their Creators
by: Buyl, Maarten, et al.
Published: (2024)
by: Buyl, Maarten, et al.
Published: (2024)
Feedback Loops With Language Models Drive In-Context Reward Hacking
by: Pan, Alexander, et al.
Published: (2024)
by: Pan, Alexander, et al.
Published: (2024)
Watch Out for Your Guidance on Generation! Exploring Conditional Backdoor Attacks against Large Language Models
by: He, Jiaming, et al.
Published: (2024)
by: He, Jiaming, et al.
Published: (2024)
The Depth Ceiling: On the Limits of Large Language Models in Discovering Latent Planning
by: Xu, Yi, et al.
Published: (2026)
by: Xu, Yi, et al.
Published: (2026)
VocabTailor: Dynamic Vocabulary Selection for Downstream Tasks in Small Language Models
by: Zhang, Hanling, et al.
Published: (2025)
by: Zhang, Hanling, et al.
Published: (2025)
Self-Verified Distillation: Your Language Model Is Secretly Its Own Synthetic Data Pipeline
by: Lee, Tony, et al.
Published: (2026)
by: Lee, Tony, et al.
Published: (2026)
A Multimodal Approach to Device-Directed Speech Detection with Large Language Models
by: Wagner, Dominik, et al.
Published: (2024)
by: Wagner, Dominik, et al.
Published: (2024)
On the Thinking-Language Modeling Gap in Large Language Models
by: Liu, Chenxi, et al.
Published: (2025)
by: Liu, Chenxi, et al.
Published: (2025)
Similar Items
-
Does Spatial Cognition Emerge in Frontier Models?
by: Ramakrishnan, Santhosh Kumar, et al.
Published: (2024) -
Robust Autonomy Emerges from Self-Play
by: Cusumano-Towner, Marco, et al.
Published: (2025) -
Reinforcement Learning for Long-Horizon Interactive LLM Agents
by: Chen, Kevin, et al.
Published: (2025) -
Do multimodal models imagine electric sheep?
by: Ramakrishnan, Santhosh Kumar, et al.
Published: (2026) -
Cut Your Losses! Learning to Prune Paths Early for Efficient Parallel Reasoning
by: Bi, Jiaxi, et al.
Published: (2026)