Parallel Token Prediction for Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Draxler, Felix, Will, Justus, Sofian, Farrin Marouf, Karaletsos, Theofanis, Singh, Sameer, Mandt, Stephan |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Variational Control for Guidance in Diffusion Models
by: Pandey, Kushagra, et al.
Published: (2025)
by: Pandey, Kushagra, et al.
Published: (2025)
Hierarchical Variational Policies for Reward-Guided Diffusion
by: Pandey, Kushagra, et al.
Published: (2026)
by: Pandey, Kushagra, et al.
Published: (2026)
Control-Augmented Autoregressive Diffusion for Data Assimilation
by: Srivastava, Prakhar, et al.
Published: (2025)
by: Srivastava, Prakhar, et al.
Published: (2025)
Calibrated Test-Time Guidance for Bayesian Inference
by: Geyfman, Daniel, et al.
Published: (2026)
by: Geyfman, Daniel, et al.
Published: (2026)
How Well Do LLMs Understand Drug Mechanisms? A Knowledge + Reasoning Evaluation Dataset
by: Mohan, Sunil, et al.
Published: (2025)
by: Mohan, Sunil, et al.
Published: (2025)
Modelling Cellular Perturbations with the Sparse Additive Mechanism Shift Variational Autoencoder
by: Bereket, Michael, et al.
Published: (2023)
by: Bereket, Michael, et al.
Published: (2023)
Progressive Compression with Universally Quantized Diffusion Models
by: Yang, Yibo, et al.
Published: (2024)
by: Yang, Yibo, et al.
Published: (2024)
Channel Vision Transformers: An Image Is Worth 1 x 16 x 16 Words
by: Bao, Yujia, et al.
Published: (2023)
by: Bao, Yujia, et al.
Published: (2023)
Stop-Think-AutoRegress: Language Modeling with Latent Diffusion Planning
by: Lovelace, Justin, et al.
Published: (2026)
by: Lovelace, Justin, et al.
Published: (2026)
TIDE: Textual Identity Detection for Evaluating and Augmenting Classification and Language Models
by: Klu, Emmanuel, et al.
Published: (2023)
by: Klu, Emmanuel, et al.
Published: (2023)
Entropy-Aligned Decoding of LMs for Better Writing and Reasoning
by: Ahmed, Kareem, et al.
Published: (2026)
by: Ahmed, Kareem, et al.
Published: (2026)
Toward Identifiable Sparse Autoencoders
by: Nelson, Walter, et al.
Published: (2026)
by: Nelson, Walter, et al.
Published: (2026)
Training Large Language Models To Reason In Parallel With Global Forking Tokens
by: Jia, Sheng, et al.
Published: (2025)
by: Jia, Sheng, et al.
Published: (2025)
From Token to Token Pair: Efficient Prompt Compression for Large Language Models in Clinical Prediction
by: Zhu, Mingcheng, et al.
Published: (2026)
by: Zhu, Mingcheng, et al.
Published: (2026)
Efficient Temporal Tokenization for Mobility Prediction with Large Language Models
by: He, Haoyu, et al.
Published: (2025)
by: He, Haoyu, et al.
Published: (2025)
Rethinking Token Prediction: Tree-Structured Diffusion Language Model
by: Wu, Zihao, et al.
Published: (2026)
by: Wu, Zihao, et al.
Published: (2026)
Compositional Deep Probabilistic Models of DNA Encoded Libraries
by: Chen, Benson, et al.
Published: (2023)
by: Chen, Benson, et al.
Published: (2023)
MorphGen: Controllable and Morphologically Plausible Generative Cell-Imaging
by: Demirel, Berker, et al.
Published: (2025)
by: Demirel, Berker, et al.
Published: (2025)
Skill Set Optimization: Reinforcing Language Model Behavior via Transferable Skills
by: Nottingham, Kolby, et al.
Published: (2024)
by: Nottingham, Kolby, et al.
Published: (2024)
Lossless Compression of Large Language Model-Generated Text via Next-Token Prediction
by: Mao, Yu, et al.
Published: (2025)
by: Mao, Yu, et al.
Published: (2025)
Perceptions of Linguistic Uncertainty by Language Models and Humans
by: Belem, Catarina G, et al.
Published: (2024)
by: Belem, Catarina G, et al.
Published: (2024)
Parallel Scaling Law for Language Models
by: Chen, Mouxiang, et al.
Published: (2025)
by: Chen, Mouxiang, et al.
Published: (2025)
Language Modeling with Learned Meta-Tokens
by: Shah, Alok N., et al.
Published: (2025)
by: Shah, Alok N., et al.
Published: (2025)
A Law of Next-Token Prediction in Large Language Models
by: He, Hangfeng, et al.
Published: (2024)
by: He, Hangfeng, et al.
Published: (2024)
Differentially Private Next-Token Prediction of Large Language Models
by: Flemings, James, et al.
Published: (2024)
by: Flemings, James, et al.
Published: (2024)
Can Perplexity Predict Fine-tuning Performance? An Investigation of Tokenization Effects on Sequential Language Models for Nepali
by: Luitel, Nishant, et al.
Published: (2024)
by: Luitel, Nishant, et al.
Published: (2024)
Language Model Cascades: Token-level uncertainty and beyond
by: Gupta, Neha, et al.
Published: (2024)
by: Gupta, Neha, et al.
Published: (2024)
DeCAL Tokenwise Compression
by: Panwar, Sameer
Published: (2025)
by: Panwar, Sameer
Published: (2025)
ProPD: Dynamic Token Tree Pruning and Generation for LLM Parallel Decoding
by: Zhong, Shuzhang, et al.
Published: (2024)
by: Zhong, Shuzhang, et al.
Published: (2024)
Unraveling Token Prediction Refinement and Identifying Essential Layers in Language Models
by: Kongmanee, Jaturong
Published: (2025)
by: Kongmanee, Jaturong
Published: (2025)
Implicit Optimization Bias of Next-Token Prediction in Linear Models
by: Thrampoulidis, Christos
Published: (2024)
by: Thrampoulidis, Christos
Published: (2024)
Statistical and structural identifiability in representation learning
by: Nelson, Walter, et al.
Published: (2026)
by: Nelson, Walter, et al.
Published: (2026)
The Geometry of Tokens in Internal Representations of Large Language Models
by: Viswanathan, Karthik, et al.
Published: (2025)
by: Viswanathan, Karthik, et al.
Published: (2025)
Beyond Next Token Prediction: Patch-Level Training for Large Language Models
by: Shao, Chenze, et al.
Published: (2024)
by: Shao, Chenze, et al.
Published: (2024)
Temporal Tokenization Strategies for Event Sequence Modeling with Large Language Models
by: Liu, Zefang, et al.
Published: (2025)
by: Liu, Zefang, et al.
Published: (2025)
Towards Linguistically-Aware and Language-Independent Tokenization for Large Language Models (LLMs)
by: Rahman, Abrar, et al.
Published: (2024)
by: Rahman, Abrar, et al.
Published: (2024)
Think before you speak: Training Language Models With Pause Tokens
by: Goyal, Sachin, et al.
Published: (2023)
by: Goyal, Sachin, et al.
Published: (2023)
Cross-Tokenizer Likelihood Scoring Algorithms for Language Model Distillation
by: Phan, Buu, et al.
Published: (2025)
by: Phan, Buu, et al.
Published: (2025)
Smaller Language Models are Better Black-box Machine-Generated Text Detectors
by: Mireshghallah, Niloofar, et al.
Published: (2023)
by: Mireshghallah, Niloofar, et al.
Published: (2023)
Efficient Parallel Samplers for Recurrent-Depth Models and Their Connection to Diffusion Language Models
by: Geiping, Jonas, et al.
Published: (2025)
by: Geiping, Jonas, et al.
Published: (2025)
Similar Items
-
Variational Control for Guidance in Diffusion Models
by: Pandey, Kushagra, et al.
Published: (2025) -
Hierarchical Variational Policies for Reward-Guided Diffusion
by: Pandey, Kushagra, et al.
Published: (2026) -
Control-Augmented Autoregressive Diffusion for Data Assimilation
by: Srivastava, Prakhar, et al.
Published: (2025) -
Calibrated Test-Time Guidance for Bayesian Inference
by: Geyfman, Daniel, et al.
Published: (2026) -
How Well Do LLMs Understand Drug Mechanisms? A Knowledge + Reasoning Evaluation Dataset
by: Mohan, Sunil, et al.
Published: (2025)