Draft-Conditioned Constrained Decoding for Structured Generation in LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Reddy, Avinash, Walker, Thayne T., Ide, James S., Bedi, Amrit Singh |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Multi-LLM QA with Embodied Exploration
par: Patel, Bhrij, et autres
Publié: (2024)
par: Patel, Bhrij, et autres
Publié: (2024)
Training Domain Draft Models for Speculative Decoding: Best Practices and Insights
par: Hong, Fenglu, et autres
Publié: (2025)
par: Hong, Fenglu, et autres
Publié: (2025)
Code Comprehension then Auditing for Unsupervised LLM Evaluation
par: Patel, Bhrij, et autres
Publié: (2024)
par: Patel, Bhrij, et autres
Publié: (2024)
HiSpec: Hierarchical Speculative Decoding for LLMs
par: Kumar, Avinash, et autres
Publié: (2025)
par: Kumar, Avinash, et autres
Publié: (2025)
Direct Alignment of Draft Model for Speculative Decoding with Chat-Fine-Tuned LLMs
par: Goel, Raghavv, et autres
Publié: (2024)
par: Goel, Raghavv, et autres
Publié: (2024)
POSS: Position Specialist Generates Better Draft for Speculative Decoding
par: Huang, Langlin, et autres
Publié: (2025)
par: Huang, Langlin, et autres
Publié: (2025)
Bounded Rationality for LLMs: Satisficing Alignment at Inference-Time
par: Chehade, Mohamad, et autres
Publié: (2025)
par: Chehade, Mohamad, et autres
Publié: (2025)
Exploring and Improving Drafts in Blockwise Parallel Decoding
par: Kim, Taehyeon, et autres
Publié: (2024)
par: Kim, Taehyeon, et autres
Publié: (2024)
Balancing Coverage and Draft Latency in Vocabulary Trimming for Faster Speculative Decoding
par: Shoham, Ofir Ben
Publié: (2026)
par: Shoham, Ofir Ben
Publié: (2026)
ML-SpecQD: Multi-Level Speculative Decoding with Quantized Drafts
par: Georganas, Evangelos, et autres
Publié: (2025)
par: Georganas, Evangelos, et autres
Publié: (2025)
Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration
par: Wen, Zhuofan, et autres
Publié: (2024)
par: Wen, Zhuofan, et autres
Publié: (2024)
LongSpec: Long-Context Lossless Speculative Decoding with Efficient Drafting and Verification
par: Yang, Penghui, et autres
Publié: (2025)
par: Yang, Penghui, et autres
Publié: (2025)
Align-Pro: A Principled Approach to Prompt Optimization for LLM Alignment
par: Trivedi, Prashant, et autres
Publié: (2025)
par: Trivedi, Prashant, et autres
Publié: (2025)
Grammar-Constrained Decoding for Structured NLP Tasks without Finetuning
par: Geng, Saibo, et autres
Publié: (2023)
par: Geng, Saibo, et autres
Publié: (2023)
MaxMin-RLHF: Alignment with Diverse Human Preferences
par: Chakraborty, Souradip, et autres
Publié: (2024)
par: Chakraborty, Souradip, et autres
Publié: (2024)
Achieving Zero Constraint Violation for Constrained Reinforcement Learning via Conservative Natural Policy Gradient Primal-Dual Algorithm
par: Bai, Qinbo, et autres
Publié: (2022)
par: Bai, Qinbo, et autres
Publié: (2022)
Nudging: Inference-time Alignment of LLMs via Guided Decoding
par: Fei, Yu, et autres
Publié: (2024)
par: Fei, Yu, et autres
Publié: (2024)
SAIL: Self-Improving Efficient Online Alignment of Large Language Models
par: Ding, Mucong, et autres
Publié: (2024)
par: Ding, Mucong, et autres
Publié: (2024)
One Jump Is All You Need: Short-Cutting Transformers for Early Exit Prediction with One Jump to Fit All Exit Levels
par: Seshadri, Amrit Diggavi
Publié: (2025)
par: Seshadri, Amrit Diggavi
Publié: (2025)
Minimal and Mechanistic Conditions for Behavioral Self-Awareness in LLMs
par: Bozoukov, Matthew, et autres
Publié: (2025)
par: Bozoukov, Matthew, et autres
Publié: (2025)
MineDraft: A Framework for Batch Parallel Speculative Decoding
par: Tang, Zhenwei, et autres
Publié: (2026)
par: Tang, Zhenwei, et autres
Publié: (2026)
Agreement-Constrained Probabilistic Minimum Bayes Risk Decoding
par: Natsumi, Koki, et autres
Publié: (2025)
par: Natsumi, Koki, et autres
Publié: (2025)
Token-Driven GammaTune: Adaptive Calibration for Enhanced Speculative Decoding
par: Gautam, Aayush, et autres
Publié: (2025)
par: Gautam, Aayush, et autres
Publié: (2025)
Distillation Contrastive Decoding: Improving LLMs Reasoning with Contrastive Decoding and Distillation
par: Phan, Phuc, et autres
Publié: (2024)
par: Phan, Phuc, et autres
Publié: (2024)
Make Every Draft Count: Hidden State based Speculative Decoding
par: Chen, Yuetao, et autres
Publié: (2026)
par: Chen, Yuetao, et autres
Publié: (2026)
Enhancing Domain-Specific Retrieval-Augmented Generation: Synthetic Data Generation and Evaluation using Reasoning Models
par: Jadon, Aryan, et autres
Publié: (2025)
par: Jadon, Aryan, et autres
Publié: (2025)
Evaluating Reasoning LLMs for Suicide Screening with the Columbia-Suicide Severity Rating Scale
par: Patil, Avinash, et autres
Publié: (2025)
par: Patil, Avinash, et autres
Publié: (2025)
Dialogue Ontology Relation Extraction via Constrained Chain-of-Thought Decoding
par: Vukovic, Renato, et autres
Publié: (2024)
par: Vukovic, Renato, et autres
Publié: (2024)
Dialogue Without Limits: Constant-Sized KV Caches for Extended Responses in LLMs
par: Ghadia, Ravi, et autres
Publié: (2025)
par: Ghadia, Ravi, et autres
Publié: (2025)
Weak-to-Strong Elicitation via Mismatched Wrong Drafts
par: Deng, Wei
Publié: (2026)
par: Deng, Wei
Publié: (2026)
Evolutionary Guided Decoding: Iterative Value Refinement for LLMs
par: Liu, Zhenhua, et autres
Publié: (2025)
par: Liu, Zhenhua, et autres
Publié: (2025)
PRISM: Parametrically Refactoring Inference for Speculative Sampling Draft Models
par: Wang, Xuliang, et autres
Publié: (2026)
par: Wang, Xuliang, et autres
Publié: (2026)
SafeR-CLIP: Mitigating NSFW Content in Vision-Language Models While Preserving Pre-Trained Knowledge
par: Yousaf, Adeel, et autres
Publié: (2025)
par: Yousaf, Adeel, et autres
Publié: (2025)
Does Thinking More always Help? Mirage of Test-Time Scaling in Reasoning Models
par: Ghosal, Soumya Suvra, et autres
Publié: (2025)
par: Ghosal, Soumya Suvra, et autres
Publié: (2025)
$\texttt{SPECS}$: Faster Test-Time Scaling through Speculative Drafts
par: Cemri, Mert, et autres
Publié: (2025)
par: Cemri, Mert, et autres
Publié: (2025)
Modality Collapse as Mismatched Decoding: Information-Theoretic Limits of Multimodal LLMs
par: Billa, Jayadev
Publié: (2026)
par: Billa, Jayadev
Publié: (2026)
On the Global Optimality of Policy Gradient Methods in General Utility Reinforcement Learning
par: Barakat, Anas, et autres
Publié: (2024)
par: Barakat, Anas, et autres
Publié: (2024)
Interpreting the Effects of Quantization on LLMs
par: Singh, Manpreet, et autres
Publié: (2025)
par: Singh, Manpreet, et autres
Publié: (2025)
Earley-Driven Dynamic Pruning for Efficient Structured Decoding
par: Sun, Xintong, et autres
Publié: (2025)
par: Sun, Xintong, et autres
Publié: (2025)
Adaptive Inference-Time Compute: LLMs Can Predict if They Can Do Better, Even Mid-Generation
par: Manvi, Rohin, et autres
Publié: (2024)
par: Manvi, Rohin, et autres
Publié: (2024)
Documents similaires
-
Multi-LLM QA with Embodied Exploration
par: Patel, Bhrij, et autres
Publié: (2024) -
Training Domain Draft Models for Speculative Decoding: Best Practices and Insights
par: Hong, Fenglu, et autres
Publié: (2025) -
Code Comprehension then Auditing for Unsupervised LLM Evaluation
par: Patel, Bhrij, et autres
Publié: (2024) -
HiSpec: Hierarchical Speculative Decoding for LLMs
par: Kumar, Avinash, et autres
Publié: (2025) -
Direct Alignment of Draft Model for Speculative Decoding with Chat-Fine-Tuned LLMs
par: Goel, Raghavv, et autres
Publié: (2024)