Efficient and Asymptotically Unbiased Constrained Decoding for Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Ye, Haotian, Jain, Himanshu, You, Chong, Suresh, Ananda Theertha, Lin, Haowei, Zou, James, Yu, Felix |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SpecTr: Fast Speculative Decoding via Optimal Transport
di: Sun, Ziteng, et al.
Pubblicazione: (2023)
di: Sun, Ziteng, et al.
Pubblicazione: (2023)
Coupling without Communication and Drafter-Invariant Speculative Decoding
di: Daliri, Majid, et al.
Pubblicazione: (2024)
di: Daliri, Majid, et al.
Pubblicazione: (2024)
Hierarchical Retrieval: The Geometry and a Pretrain-Finetune Recipe
di: You, Chong, et al.
Pubblicazione: (2025)
di: You, Chong, et al.
Pubblicazione: (2025)
Exploring and Improving Drafts in Blockwise Parallel Decoding
di: Kim, Taehyeon, et al.
Pubblicazione: (2024)
di: Kim, Taehyeon, et al.
Pubblicazione: (2024)
Block Verification Accelerates Speculative Decoding
di: Sun, Ziteng, et al.
Pubblicazione: (2024)
di: Sun, Ziteng, et al.
Pubblicazione: (2024)
Generative Evaluation of Complex Reasoning in Large Language Models
di: Lin, Haowei, et al.
Pubblicazione: (2025)
di: Lin, Haowei, et al.
Pubblicazione: (2025)
Selecting Large Language Model to Fine-tune via Rectified Scaling Law
di: Lin, Haowei, et al.
Pubblicazione: (2024)
di: Lin, Haowei, et al.
Pubblicazione: (2024)
Asymptotics of Language Model Alignment
di: Yang, Joy Qiping, et al.
Pubblicazione: (2024)
di: Yang, Joy Qiping, et al.
Pubblicazione: (2024)
CoDistill-GRPO: A Co-Distillation Recipe for Efficient Group Relative Policy Optimization
di: Kwon, Soo Min, et al.
Pubblicazione: (2026)
di: Kwon, Soo Min, et al.
Pubblicazione: (2026)
Improved Unbiased Watermark for Large Language Models
di: Chen, Ruibo, et al.
Pubblicazione: (2025)
di: Chen, Ruibo, et al.
Pubblicazione: (2025)
Efficient Language Model Architectures for Differentially Private Federated Learning
di: Ro, Jae Hun, et al.
Pubblicazione: (2024)
di: Ro, Jae Hun, et al.
Pubblicazione: (2024)
DSCD: Large Language Model Detoxification with Self-Constrained Decoding
di: Dong, Ming, et al.
Pubblicazione: (2025)
di: Dong, Ming, et al.
Pubblicazione: (2025)
Conceptual and Unbiased Reasoning in Language Models
di: Zhou, Ben, et al.
Pubblicazione: (2024)
di: Zhou, Ben, et al.
Pubblicazione: (2024)
BiMark: Unbiased Multilayer Watermarking for Large Language Models
di: Feng, Xiaoyan, et al.
Pubblicazione: (2025)
di: Feng, Xiaoyan, et al.
Pubblicazione: (2025)
Theoretical guarantees on the best-of-n alignment policy
di: Beirami, Ahmad, et al.
Pubblicazione: (2024)
di: Beirami, Ahmad, et al.
Pubblicazione: (2024)
Measuring Implicit Bias in Explicitly Unbiased Large Language Models
di: Bai, Xuechunzi, et al.
Pubblicazione: (2024)
di: Bai, Xuechunzi, et al.
Pubblicazione: (2024)
Can Language Models Discover Scaling Laws?
di: Lin, Haowei, et al.
Pubblicazione: (2025)
di: Lin, Haowei, et al.
Pubblicazione: (2025)
CSV-Decode: Certifiable Sub-Vocabulary Decoding for Efficient Large Language Model Inference
di: Liu, Dong, et al.
Pubblicazione: (2025)
di: Liu, Dong, et al.
Pubblicazione: (2025)
Latent Distance Guided Alignment Training for Large Language Models
di: Luo, Haotian
Pubblicazione: (2024)
di: Luo, Haotian
Pubblicazione: (2024)
When Linear Attention Meets Autoregressive Decoding: Towards More Effective and Efficient Linearized Large Language Models
di: You, Haoran, et al.
Pubblicazione: (2024)
di: You, Haoran, et al.
Pubblicazione: (2024)
Recurrent Drafter for Fast Speculative Decoding in Large Language Models
di: Cheng, Yunfei, et al.
Pubblicazione: (2024)
di: Cheng, Yunfei, et al.
Pubblicazione: (2024)
FAEDKV: Infinite-Window Fourier Transform for Unbiased KV Cache Compression
di: Li, Runchao, et al.
Pubblicazione: (2025)
di: Li, Runchao, et al.
Pubblicazione: (2025)
Sketch-Guided Constrained Decoding for Boosting Blackbox Large Language Models without Logit Access
di: Geng, Saibo, et al.
Pubblicazione: (2024)
di: Geng, Saibo, et al.
Pubblicazione: (2024)
Thinking Before Constraining: A Unified Decoding Framework for Large Language Models
di: Nguyen, Ngoc Trinh Hung, et al.
Pubblicazione: (2026)
di: Nguyen, Ngoc Trinh Hung, et al.
Pubblicazione: (2026)
AdaSpec: Adaptive Speculative Decoding for Fast, SLO-Aware Large Language Model Serving
di: Huang, Kaiyu, et al.
Pubblicazione: (2025)
di: Huang, Kaiyu, et al.
Pubblicazione: (2025)
Breaking Block Boundaries: Anchor-based History-stable Decoding for Diffusion Large Language Models
di: Zou, Shun, et al.
Pubblicazione: (2026)
di: Zou, Shun, et al.
Pubblicazione: (2026)
Watermarking Low-entropy Generation for Large Language Models: An Unbiased and Low-risk Method
di: Mao, Minjia, et al.
Pubblicazione: (2024)
di: Mao, Minjia, et al.
Pubblicazione: (2024)
Unlocking Anticipatory Text Generation: A Constrained Approach for Large Language Models Decoding
di: Tu, Lifu, et al.
Pubblicazione: (2023)
di: Tu, Lifu, et al.
Pubblicazione: (2023)
Flexible and Efficient Grammar-Constrained Decoding
di: Park, Kanghee, et al.
Pubblicazione: (2025)
di: Park, Kanghee, et al.
Pubblicazione: (2025)
Sparse Reward Subsystem in Large Language Models
di: Xu, Guowei, et al.
Pubblicazione: (2026)
di: Xu, Guowei, et al.
Pubblicazione: (2026)
Plato: Plan to Efficiently Decode for Large Language Model Inference
di: Jin, Shuowei, et al.
Pubblicazione: (2024)
di: Jin, Shuowei, et al.
Pubblicazione: (2024)
Adaptive Draft-Verification for Efficient Large Language Model Decoding
di: Liu, Xukun, et al.
Pubblicazione: (2024)
di: Liu, Xukun, et al.
Pubblicazione: (2024)
Efficient Beam Search for Large Language Models Using Trie-Based Decoding
di: Chan, Brian J, et al.
Pubblicazione: (2025)
di: Chan, Brian J, et al.
Pubblicazione: (2025)
ART: Attention Run-time Termination for Efficient Large Language Model Decoding
di: Qiu, Chen, et al.
Pubblicazione: (2026)
di: Qiu, Chen, et al.
Pubblicazione: (2026)
MemeArena: Automating Context-Aware Unbiased Evaluation of Harmfulness Understanding for Multimodal Large Language Models
di: Chen, Zixin, et al.
Pubblicazione: (2025)
di: Chen, Zixin, et al.
Pubblicazione: (2025)
Encoder-Decoder or Decoder-Only? Revisiting Encoder-Decoder Large Language Model
di: Zhang, Biao, et al.
Pubblicazione: (2025)
di: Zhang, Biao, et al.
Pubblicazione: (2025)
Comparison of Scoring Rationales Between Large Language Models and Human Raters
di: Hua, Haowei, et al.
Pubblicazione: (2025)
di: Hua, Haowei, et al.
Pubblicazione: (2025)
CreditDecoding: Accelerating Parallel Decoding in Diffusion Large Language Models with Trace Credit
di: Wang, Kangyu, et al.
Pubblicazione: (2025)
di: Wang, Kangyu, et al.
Pubblicazione: (2025)
Constrained Reasoning Chains for Enhancing Theory-of-Mind in Large Language Models
di: Lin, Zizheng, et al.
Pubblicazione: (2024)
di: Lin, Zizheng, et al.
Pubblicazione: (2024)
EMS-SD: Efficient Multi-sample Speculative Decoding for Accelerating Large Language Models
di: Ni, Yunsheng, et al.
Pubblicazione: (2024)
di: Ni, Yunsheng, et al.
Pubblicazione: (2024)
Documenti analoghi
-
SpecTr: Fast Speculative Decoding via Optimal Transport
di: Sun, Ziteng, et al.
Pubblicazione: (2023) -
Coupling without Communication and Drafter-Invariant Speculative Decoding
di: Daliri, Majid, et al.
Pubblicazione: (2024) -
Hierarchical Retrieval: The Geometry and a Pretrain-Finetune Recipe
di: You, Chong, et al.
Pubblicazione: (2025) -
Exploring and Improving Drafts in Blockwise Parallel Decoding
di: Kim, Taehyeon, et al.
Pubblicazione: (2024) -
Block Verification Accelerates Speculative Decoding
di: Sun, Ziteng, et al.
Pubblicazione: (2024)