Revisiting Judge Decoding from First Principles via Training-Free Distributional Divergence
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sun, Shengyin, Li, Yiming, Liu, Renxi, Lin, Weizhe, Zhen, Hui-Ling, Yu, Xianzhi, Yuan, Mingxuan, Ma, Chen |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PSD: Pushing the Pareto Frontier of Diffusion LLMs via Parallel Speculative Decoding
par: Sun, Shengyin, et autres
Publié: (2026)
par: Sun, Shengyin, et autres
Publié: (2026)
Scaling Up, Speeding Up: A Benchmark of Speculative Decoding for Efficient LLM Test-Time Scaling
par: Sun, Shengyin, et autres
Publié: (2025)
par: Sun, Shengyin, et autres
Publié: (2025)
TrimR: Verifier-based Training-Free Thinking Compression for Efficient Test-Time Scaling
par: Lin, Weizhe, et autres
Publié: (2025)
par: Lin, Weizhe, et autres
Publié: (2025)
MemDLM: Memory-Enhanced DLM Training
par: Pei, Zehua, et autres
Publié: (2026)
par: Pei, Zehua, et autres
Publié: (2026)
SwiftMem: Fast Agentic Memory via Query-aware Indexing
par: Tian, Anxin, et autres
Publié: (2026)
par: Tian, Anxin, et autres
Publié: (2026)
From Pruning to Grafting: Dynamic Knowledge Redistribution via Learnable Layer Fusion
par: Pei, Zehua, et autres
Publié: (2024)
par: Pei, Zehua, et autres
Publié: (2024)
FocuSFT: Bilevel Optimization for Dilution-Aware Long-Context Fine-Tuning
par: Pei, Zehua, et autres
Publié: (2026)
par: Pei, Zehua, et autres
Publié: (2026)
Towards Efficient Agents: A Co-Design of Inference Architecture and System
par: Lin, Weizhe, et autres
Publié: (2025)
par: Lin, Weizhe, et autres
Publié: (2025)
What Matters For Safety Alignment?
par: Li, Xing, et autres
Publié: (2026)
par: Li, Xing, et autres
Publié: (2026)
SVDq: 1.25-bit and 410x Key Cache Compression for LLM Attention
par: Yankun, Hong, et autres
Publié: (2025)
par: Yankun, Hong, et autres
Publié: (2025)
DLLM Agent: See Farther, Run Faster
par: Zhen, Huiling, et autres
Publié: (2026)
par: Zhen, Huiling, et autres
Publié: (2026)
PASER: Post-Training Data Selection for Efficient Pruned Large Language Model Recovery
par: He, Bowei, et autres
Publié: (2025)
par: He, Bowei, et autres
Publié: (2025)
Behavioral Fingerprinting of Large Language Models
par: Pei, Zehua, et autres
Publié: (2025)
par: Pei, Zehua, et autres
Publié: (2025)
Unleashing Low-Bit Inference on Ascend NPUs: A Comprehensive Evaluation of HiFloat Formats
par: Zhao, Pengxiang, et autres
Publié: (2026)
par: Zhao, Pengxiang, et autres
Publié: (2026)
Benchmarking Post-Training Quantization of Large Language Models under Microscaling Floating Point Formats
par: Zhang, Manyi, et autres
Publié: (2026)
par: Zhang, Manyi, et autres
Publié: (2026)
BetterV: Controlled Verilog Generation with Discriminative Guidance
par: Pei, Zehua, et autres
Publié: (2024)
par: Pei, Zehua, et autres
Publié: (2024)
AgentCollab: A Self-Evaluation-Driven Collaboration Paradigm for Efficient LLM Agents
par: Gao, Wenbo, et autres
Publié: (2026)
par: Gao, Wenbo, et autres
Publié: (2026)
Verilog-Evolve: Feedback-Driven and Skill-Evolving Verilog Generation
par: Pei, Zehua, et autres
Publié: (2026)
par: Pei, Zehua, et autres
Publié: (2026)
Large Language Models as Topological Structure Enhancers for Text-Attributed Graphs
par: Sun, Shengyin, et autres
Publié: (2023)
par: Sun, Shengyin, et autres
Publié: (2023)
Direct Preference Optimization for Neural Machine Translation with Minimum Bayes Risk Decoding
par: Yang, Guangyu, et autres
Publié: (2023)
par: Yang, Guangyu, et autres
Publié: (2023)
DiLA: Enhancing LLM Tool Learning with Differential Logic Layer
par: Zhang, Yu, et autres
Publié: (2024)
par: Zhang, Yu, et autres
Publié: (2024)
Beyond Speedup -- Utilizing KV Cache for Sampling and Reasoning
par: Xing, Zeyu, et autres
Publié: (2026)
par: Xing, Zeyu, et autres
Publié: (2026)
SelfJudge: Faster Speculative Decoding via Self-Supervised Judge Verification
par: Yoon, Kanghoon, et autres
Publié: (2025)
par: Yoon, Kanghoon, et autres
Publié: (2025)
Factorization-Error-Free Discrete Diffusion Language Model via Speculative Decoding
par: Fang, Xun, et autres
Publié: (2026)
par: Fang, Xun, et autres
Publié: (2026)
StepWiser: Stepwise Generative Judges for Wiser Reasoning
par: Xiong, Wei, et autres
Publié: (2025)
par: Xiong, Wei, et autres
Publié: (2025)
Encoder-Decoder or Decoder-Only? Revisiting Encoder-Decoder Large Language Model
par: Zhang, Biao, et autres
Publié: (2025)
par: Zhang, Biao, et autres
Publié: (2025)
Divergence Decoding: Inference-Time Unlearning via Auxiliary Models
par: Merchant, Humzah, et autres
Publié: (2026)
par: Merchant, Humzah, et autres
Publié: (2026)
MOSS: Efficient and Accurate FP8 LLM Training with Microscaling and Automatic Scaling
par: Zhang, Yu, et autres
Publié: (2025)
par: Zhang, Yu, et autres
Publié: (2025)
AutoJudge: Judge Decoding Without Manual Annotation
par: Garipov, Roman, et autres
Publié: (2025)
par: Garipov, Roman, et autres
Publié: (2025)
First Activations Matter: Training-Free Methods for Dynamic Activation in Large Language Models
par: Ma, Chi, et autres
Publié: (2024)
par: Ma, Chi, et autres
Publié: (2024)
Control-DAG: Constrained Decoding for Non-Autoregressive Directed Acyclic T5 using Weighted Finite State Automata
par: Chen, Jinghong, et autres
Publié: (2024)
par: Chen, Jinghong, et autres
Publié: (2024)
KVTuner: Sensitivity-Aware Layer-Wise Mixed-Precision KV Cache Quantization for Efficient and Nearly Lossless LLM Inference
par: Li, Xing, et autres
Publié: (2025)
par: Li, Xing, et autres
Publié: (2025)
Judging the Judges: A Systematic Study of Position Bias in LLM-as-a-Judge
par: Shi, Lin, et autres
Publié: (2024)
par: Shi, Lin, et autres
Publié: (2024)
EAQuant: Enhancing Post-Training Quantization for MoE Models via Expert-Aware Optimization
par: Fu, Zhongqian, et autres
Publié: (2025)
par: Fu, Zhongqian, et autres
Publié: (2025)
S2D2: Fast Decoding for Diffusion LLMs via Training-Free Self-Speculation
par: Han, Ligong, et autres
Publié: (2026)
par: Han, Ligong, et autres
Publié: (2026)
Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge
par: Wu, Tianhao, et autres
Publié: (2024)
par: Wu, Tianhao, et autres
Publié: (2024)
On-the-fly Preference Alignment via Principle-Guided Decoding
par: Zhu, Mingye, et autres
Publié: (2025)
par: Zhu, Mingye, et autres
Publié: (2025)
Speculate Deep and Accurate: Lossless and Training-Free Acceleration for Offloaded LLMs via Substitute Speculative Decoding
par: Wang, Pei-Shuo, et autres
Publié: (2025)
par: Wang, Pei-Shuo, et autres
Publié: (2025)
Multi-Turn Context Jailbreak Attack on Large Language Models From First Principles
par: Sun, Xiongtao, et autres
Publié: (2024)
par: Sun, Xiongtao, et autres
Publié: (2024)
(G)I-DLE: Generative Inference via Distribution-preserving Logit Exclusion with KL Divergence Minimization for Constrained Decoding
par: Lee, Hanwool
Publié: (2025)
par: Lee, Hanwool
Publié: (2025)
Documents similaires
-
PSD: Pushing the Pareto Frontier of Diffusion LLMs via Parallel Speculative Decoding
par: Sun, Shengyin, et autres
Publié: (2026) -
Scaling Up, Speeding Up: A Benchmark of Speculative Decoding for Efficient LLM Test-Time Scaling
par: Sun, Shengyin, et autres
Publié: (2025) -
TrimR: Verifier-based Training-Free Thinking Compression for Efficient Test-Time Scaling
par: Lin, Weizhe, et autres
Publié: (2025) -
MemDLM: Memory-Enhanced DLM Training
par: Pei, Zehua, et autres
Publié: (2026) -
SwiftMem: Fast Agentic Memory via Query-aware Indexing
par: Tian, Anxin, et autres
Publié: (2026)