Faster LLM Inference via Sequential Monte Carlo
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Emara, Yahya, da Costa, Mauricio Barba, Chang, Chi-Chih, Freer, Cameron, Vieira, Tim, Cotterell, Ryan, Abdelfattah, Mohamed S. |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Syntactic and Semantic Control of Large Language Models via Sequential Monte Carlo
par: Loula, João, et autres
Publié: (2025)
par: Loula, João, et autres
Publié: (2025)
Ensembling Language Models with Sequential Monte Carlo
par: Chan, Robin Shing Moon, et autres
Publié: (2026)
par: Chan, Robin Shing Moon, et autres
Publié: (2026)
NITRO: LLM Inference on Intel Laptop NPUs
par: Fei, Anthony, et autres
Publié: (2024)
par: Fei, Anthony, et autres
Publié: (2024)
Syntactic Control of Language Models by Posterior Inference
par: Xefteri, Vicky, et autres
Publié: (2025)
par: Xefteri, Vicky, et autres
Publié: (2025)
Better Estimation of the Kullback--Leibler Divergence Between Language Models
par: Amini, Afra, et autres
Publié: (2025)
par: Amini, Afra, et autres
Publié: (2025)
Direct Preference Optimization with an Offset
par: Amini, Afra, et autres
Publié: (2024)
par: Amini, Afra, et autres
Publié: (2024)
Automating the Analysis of Parsing Algorithms (and other Dynamic Programs)
par: Vieira, Tim, et autres
Publié: (2025)
par: Vieira, Tim, et autres
Publié: (2025)
Language Models over Canonical Byte-Pair Encodings
par: Vieira, Tim, et autres
Publié: (2025)
par: Vieira, Tim, et autres
Publié: (2025)
On the Proper Treatment of Units in Surprisal Theory
par: Kiegeland, Samuel, et autres
Publié: (2026)
par: Kiegeland, Samuel, et autres
Publié: (2026)
Probabilistic Inference in Language Models via Twisted Sequential Monte Carlo
par: Zhao, Stephen, et autres
Publié: (2024)
par: Zhao, Stephen, et autres
Publié: (2024)
Variational Best-of-N Alignment
par: Amini, Afra, et autres
Publié: (2024)
par: Amini, Afra, et autres
Publié: (2024)
Speculate Deep and Accurate: Lossless and Training-Free Acceleration for Offloaded LLMs via Substitute Speculative Decoding
par: Wang, Pei-Shuo, et autres
Publié: (2025)
par: Wang, Pei-Shuo, et autres
Publié: (2025)
Algorithms for Weighted Pushdown Automata
par: Butoi, Alexandra, et autres
Publié: (2022)
par: Butoi, Alexandra, et autres
Publié: (2022)
SplitReason: Learning To Offload Reasoning
par: Akhauri, Yash, et autres
Publié: (2025)
par: Akhauri, Yash, et autres
Publié: (2025)
Transducing Language Models
par: Snæbjarnarson, Vésteinn, et autres
Publié: (2026)
par: Snæbjarnarson, Vésteinn, et autres
Publié: (2026)
Prefix Parsing is Just Parsing
par: Pasti, Clemente, et autres
Publié: (2026)
par: Pasti, Clemente, et autres
Publié: (2026)
Principled Gradient-based Markov Chain Monte Carlo for Text Generation
par: Du, Li, et autres
Publié: (2023)
par: Du, Li, et autres
Publié: (2023)
Cascade Speculative Drafting for Even Faster LLM Inference
par: Chen, Ziyi, et autres
Publié: (2023)
par: Chen, Ziyi, et autres
Publié: (2023)
Characterizing the Expressivity of Local Attention in Transformers
par: Li, Jiaoda, et autres
Publié: (2026)
par: Li, Jiaoda, et autres
Publié: (2026)
Exact Hard Monotonic Attention for Character-Level Transduction
par: Wu, Shijie, et autres
Publié: (2019)
par: Wu, Shijie, et autres
Publié: (2019)
Low-Resource Named Entity Recognition with Cross-Lingual, Character-Level Neural Conditional Random Fields
par: Cotterell, Ryan, et autres
Publié: (2024)
par: Cotterell, Ryan, et autres
Publié: (2024)
Cross-lingual, Character-Level Neural Morphological Tagging
par: Cotterell, Ryan, et autres
Publié: (2017)
par: Cotterell, Ryan, et autres
Publié: (2017)
Characterizing the Expressivity of Fixed-Precision Transformer Language Models
par: Li, Jiaoda, et autres
Publié: (2025)
par: Li, Jiaoda, et autres
Publié: (2025)
Quamba2: A Robust and Scalable Post-training Quantization Framework for Selective State Space Models
par: Chiang, Hung-Yueh, et autres
Publié: (2025)
par: Chiang, Hung-Yueh, et autres
Publié: (2025)
Transformers Can Represent $n$-gram Language Models
par: Svete, Anej, et autres
Publié: (2024)
par: Svete, Anej, et autres
Publié: (2024)
A Close Analysis of the Subset Construction
par: Baburin, Ivan, et autres
Publié: (2024)
par: Baburin, Ivan, et autres
Publié: (2024)
Towards Explainability in Legal Outcome Prediction Models
par: Valvoda, Josef, et autres
Publié: (2024)
par: Valvoda, Josef, et autres
Publié: (2024)
Compute Where it Counts: Self Optimizing Language Models
par: Akhauri, Yash, et autres
Publié: (2026)
par: Akhauri, Yash, et autres
Publié: (2026)
On the Proper Treatment of Tokenization in Psycholinguistics
par: Giulianelli, Mario, et autres
Publié: (2024)
par: Giulianelli, Mario, et autres
Publié: (2024)
Inference-Time Alignment of Diffusion Models via Trust-Region Iterative Twisted Sequential Monte Carlo
par: Wang, Weixin, et autres
Publié: (2026)
par: Wang, Weixin, et autres
Publié: (2026)
Lower Bounds on the Expressivity of Recurrent Neural Language Models
par: Svete, Anej, et autres
Publié: (2024)
par: Svete, Anej, et autres
Publié: (2024)
Bearing Syntactic Fruit with Stack-Augmented Neural Networks
par: DuSell, Brian, et autres
Publié: (2025)
par: DuSell, Brian, et autres
Publié: (2025)
Exploring the Linear Subspace Hypothesis in Gender Bias Mitigation
par: Vargas, Francisco, et autres
Publié: (2020)
par: Vargas, Francisco, et autres
Publié: (2020)
TokenButler: Token Importance is Predictable
par: Akhauri, Yash, et autres
Publié: (2025)
par: Akhauri, Yash, et autres
Publié: (2025)
FLRC: Fine-grained Low-Rank Compressor for Efficient LLM Inference
par: Lu, Yu-Chen, et autres
Publié: (2025)
par: Lu, Yu-Chen, et autres
Publié: (2025)
Speculative Decoding via Early-exiting for Faster LLM Inference with Thompson Sampling Control Mechanism
par: Liu, Jiahao, et autres
Publié: (2024)
par: Liu, Jiahao, et autres
Publié: (2024)
A Fast Algorithm for Computing Prefix Probabilities
par: Nowak, Franz, et autres
Publié: (2023)
par: Nowak, Franz, et autres
Publié: (2023)
An Algebraic View of the Expressivity of Recurrent Language Models
par: Nowak, Franz, et autres
Publié: (2026)
par: Nowak, Franz, et autres
Publié: (2026)
FlashDLM: Accelerating Diffusion Language Model Inference via Efficient KV Caching and Guided Diffusion
par: Hu, Zhanqiu, et autres
Publié: (2025)
par: Hu, Zhanqiu, et autres
Publié: (2025)
A Simple Joint Model for Improved Contextual Neural Lemmatization
par: Malaviya, Chaitanya, et autres
Publié: (2019)
par: Malaviya, Chaitanya, et autres
Publié: (2019)
Documents similaires
-
Syntactic and Semantic Control of Large Language Models via Sequential Monte Carlo
par: Loula, João, et autres
Publié: (2025) -
Ensembling Language Models with Sequential Monte Carlo
par: Chan, Robin Shing Moon, et autres
Publié: (2026) -
NITRO: LLM Inference on Intel Laptop NPUs
par: Fei, Anthony, et autres
Publié: (2024) -
Syntactic Control of Language Models by Posterior Inference
par: Xefteri, Vicky, et autres
Publié: (2025) -
Better Estimation of the Kullback--Leibler Divergence Between Language Models
par: Amini, Afra, et autres
Publié: (2025)