Think Before You Accept: Semantic Reflective Verification for Faster Speculative Decoding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Yixuan, Liu, Yijun, ji, Shiyu, Xu, Yuzhuang, Xu, Yang, Zhu, Qingfu, Che, Wanxiang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CRVQ: Channel-Relaxed Vector Quantization for Extreme Compression of LLMs
par: Xu, Yuzhuang, et autres
Publié: (2024)
par: Xu, Yuzhuang, et autres
Publié: (2024)
CAMERA: Multi-Matrix Joint Compression for MoE Models via Micro-Expert Redundancy Analysis
par: Xu, Yuzhuang, et autres
Publié: (2025)
par: Xu, Yuzhuang, et autres
Publié: (2025)
Lookahead Q-Cache: Achieving More Consistent KV Cache Eviction via Pseudo Query
par: Wang, Yixuan, et autres
Publié: (2025)
par: Wang, Yixuan, et autres
Publié: (2025)
Judge Q: Trainable Queries for Optimized Information Retention in KV Cache Eviction
par: Liu, Yijun, et autres
Publié: (2025)
par: Liu, Yijun, et autres
Publié: (2025)
Make Some Noise: Unlocking Language Model Parallel Inference Capability through Noisy Training
par: Wang, Yixuan, et autres
Publié: (2024)
par: Wang, Yixuan, et autres
Publié: (2024)
CommonKV: Compressing KV Cache with Cross-layer Parameter Sharing
par: Wang, Yixuan, et autres
Publié: (2025)
par: Wang, Yixuan, et autres
Publié: (2025)
Seer Self-Consistency: Advance Budget Estimation for Adaptive Test-Time Scaling
par: Ji, Shiyu, et autres
Publié: (2025)
par: Ji, Shiyu, et autres
Publié: (2025)
EchoKV: Efficient KV Cache Compression via Similarity-Based Reconstruction
par: Ji, Shiyu, et autres
Publié: (2026)
par: Ji, Shiyu, et autres
Publié: (2026)
Greedy Multi-Path Block Verification for Faster Decoding in Speculative Sampling
par: Thomas, Rahul, et autres
Publié: (2026)
par: Thomas, Rahul, et autres
Publié: (2026)
Multi-Layer Attention is the Amplifier of Demonstration Effectiveness
par: Wang, Dingzirui, et autres
Publié: (2025)
par: Wang, Dingzirui, et autres
Publié: (2025)
ProxyAttn: Guided Sparse Attention via Representative Heads
par: Wang, Yixuan, et autres
Publié: (2025)
par: Wang, Yixuan, et autres
Publié: (2025)
Think Before You Prune: Self-Reflective Structured Pruning for Reasoning Language Models
par: Wang, Ziyan, et autres
Publié: (2025)
par: Wang, Ziyan, et autres
Publié: (2025)
Faster Cascades via Speculative Decoding
par: Narasimhan, Harikrishna, et autres
Publié: (2024)
par: Narasimhan, Harikrishna, et autres
Publié: (2024)
Semantic-Guided Generative Image Augmentation Method with Diffusion Models for Image Classification
par: Li, Bohan, et autres
Publié: (2023)
par: Li, Bohan, et autres
Publié: (2023)
Self-Speculative Biased Decoding for Faster Re-Translation
par: Zeng, Linxiao, et autres
Publié: (2025)
par: Zeng, Linxiao, et autres
Publié: (2025)
Traversal Verification for Speculative Tree Decoding
par: Weng, Yepeng, et autres
Publié: (2025)
par: Weng, Yepeng, et autres
Publié: (2025)
MARS: Unleashing the Power of Speculative Decoding via Margin-Aware Verification
par: Song, Jingwei, et autres
Publié: (2026)
par: Song, Jingwei, et autres
Publié: (2026)
DySpec: Faster Speculative Decoding with Dynamic Token Tree Structure
par: Xiong, Yunfan, et autres
Publié: (2024)
par: Xiong, Yunfan, et autres
Publié: (2024)
TriSpec: Ternary Speculative Decoding via Lightweight Proxy Verification
par: Jiang, Haoyun, et autres
Publié: (2026)
par: Jiang, Haoyun, et autres
Publié: (2026)
Think Twice Before You Act: Improving Inverse Problem Solving With MCMC
par: Zhu, Yaxuan, et autres
Publié: (2024)
par: Zhu, Yaxuan, et autres
Publié: (2024)
HUOZIIME: An On-Device LLM-enhanced Input Method for Deep Personalization
par: Shan, Baocai, et autres
Publié: (2026)
par: Shan, Baocai, et autres
Publié: (2026)
Speculative Speculative Decoding
par: Kumar, Tanishq, et autres
Publié: (2026)
par: Kumar, Tanishq, et autres
Publié: (2026)
Block Verification Accelerates Speculative Decoding
par: Sun, Ziteng, et autres
Publié: (2024)
par: Sun, Ziteng, et autres
Publié: (2024)
OneBit: Towards Extremely Low-bit Large Language Models
par: Xu, Yuzhuang, et autres
Publié: (2024)
par: Xu, Yuzhuang, et autres
Publié: (2024)
Speculative Safety-Aware Decoding
par: Wang, Xuekang, et autres
Publié: (2025)
par: Wang, Xuekang, et autres
Publié: (2025)
Judge Decoding: Faster Speculative Sampling Requires Going Beyond Model Alignment
par: Bachmann, Gregor, et autres
Publié: (2025)
par: Bachmann, Gregor, et autres
Publié: (2025)
Speeding up Speculative Decoding via Sequential Approximate Verification
par: Zhong, Meiyu, et autres
Publié: (2025)
par: Zhong, Meiyu, et autres
Publié: (2025)
Think Before You Act: Decision Transformers with Working Memory
par: Kang, Jikun, et autres
Publié: (2023)
par: Kang, Jikun, et autres
Publié: (2023)
Balancing Coverage and Draft Latency in Vocabulary Trimming for Faster Speculative Decoding
par: Shoham, Ofir Ben
Publié: (2026)
par: Shoham, Ofir Ben
Publié: (2026)
Annealed Relaxation of Speculative Decoding for Faster Autoregressive Image Generation
par: Li, Xingyao, et autres
Publié: (2026)
par: Li, Xingyao, et autres
Publié: (2026)
Improving Grammatical Error Correction via Contextual Data Augmentation
par: Wang, Yixuan, et autres
Publié: (2024)
par: Wang, Yixuan, et autres
Publié: (2024)
Speculative Decoding for Verilog: Speed and Quality, All in One
par: Xu, Changran, et autres
Publié: (2025)
par: Xu, Changran, et autres
Publié: (2025)
LongSpec: Long-Context Lossless Speculative Decoding with Efficient Drafting and Verification
par: Yang, Penghui, et autres
Publié: (2025)
par: Yang, Penghui, et autres
Publié: (2025)
Speculative Decoding Meets Quantization: Compatibility Evaluation and Hierarchical Framework Design
par: Zhang, Yudi, et autres
Publié: (2025)
par: Zhang, Yudi, et autres
Publié: (2025)
Decoding Speculative Decoding
par: Yan, Minghao, et autres
Publié: (2024)
par: Yan, Minghao, et autres
Publié: (2024)
Think Before You Lie: How Reasoning Leads to Honesty
par: Yuan, Ann, et autres
Publié: (2026)
par: Yuan, Ann, et autres
Publié: (2026)
Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts
par: Li, Cheng, et autres
Publié: (2025)
par: Li, Cheng, et autres
Publié: (2025)
Advancing Tool-Augmented Large Language Models via Meta-Verification and Reflection Learning
par: Ma, Zhiyuan, et autres
Publié: (2025)
par: Ma, Zhiyuan, et autres
Publié: (2025)
ArcLight: A Lightweight LLM Inference Architecture for Many-Core CPUs
par: Xu, Yuzhuang, et autres
Publié: (2026)
par: Xu, Yuzhuang, et autres
Publié: (2026)
SpecPV: Improving Self-Speculative Decoding for Long-Context Generation via Partial Verification
par: Tan, Zhendong, et autres
Publié: (2025)
par: Tan, Zhendong, et autres
Publié: (2025)
Documents similaires
-
CRVQ: Channel-Relaxed Vector Quantization for Extreme Compression of LLMs
par: Xu, Yuzhuang, et autres
Publié: (2024) -
CAMERA: Multi-Matrix Joint Compression for MoE Models via Micro-Expert Redundancy Analysis
par: Xu, Yuzhuang, et autres
Publié: (2025) -
Lookahead Q-Cache: Achieving More Consistent KV Cache Eviction via Pseudo Query
par: Wang, Yixuan, et autres
Publié: (2025) -
Judge Q: Trainable Queries for Optimized Information Retention in KV Cache Eviction
par: Liu, Yijun, et autres
Publié: (2025) -
Make Some Noise: Unlocking Language Model Parallel Inference Capability through Noisy Training
par: Wang, Yixuan, et autres
Publié: (2024)