KNN-SSD: Enabling Dynamic Self-Speculative Decoding via Nearest Neighbor Layer Set Optimization
Fuente:
arXiv
Guardado en:
| Autores principales: | Song, Mingbo, Xia, Heming, Zhang, Jun, Leong, Chak Tou, Xu, Qiancheng, Li, Wenjie, Li, Sujian |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ToolSpec: Accelerating Tool Calling via Schema-Aware and Retrieval-Augmented Speculative Decoding
por: Xia, Heming, et al.
Publicado: (2026)
por: Xia, Heming, et al.
Publicado: (2026)
Merlin's Whisper: Enabling Efficient Reasoning in Large Language Models via Black-box Persuasive Prompting
por: Xia, Heming, et al.
Publicado: (2025)
por: Xia, Heming, et al.
Publicado: (2025)
TokenSkip: Controllable Chain-of-Thought Compression in LLMs
por: Xia, Heming, et al.
Publicado: (2025)
por: Xia, Heming, et al.
Publicado: (2025)
SWIFT: On-the-Fly Self-Speculative Decoding for LLM Inference Acceleration
por: Xia, Heming, et al.
Publicado: (2024)
por: Xia, Heming, et al.
Publicado: (2024)
Finding RELIEF: Shaping Reasoning Behavior without Reasoning Supervision via Belief Engineering
por: Leong, Chak Tou, et al.
Publicado: (2026)
por: Leong, Chak Tou, et al.
Publicado: (2026)
Nearest Neighbor Speculative Decoding for LLM Generation and Attribution
por: Li, Minghan, et al.
Publicado: (2024)
por: Li, Minghan, et al.
Publicado: (2024)
Seeing Isn't Believing: Mitigating Belief Inertia via Active Intervention in Embodied Agents
por: Wang, Hanlin, et al.
Publicado: (2026)
por: Wang, Hanlin, et al.
Publicado: (2026)
Tutorial Proposal: Speculative Decoding for Efficient LLM Inference
por: Xia, Heming, et al.
Publicado: (2025)
por: Xia, Heming, et al.
Publicado: (2025)
Bayes-Decisive Linear KNN with Adaptive Nearest Neighbors
por: Jin Zhang, et al.
Publicado: (2024)
por: Jin Zhang, et al.
Publicado: (2024)
Enhancing Tool Retrieval with Iterative Feedback from Large Language Models
por: Xu, Qiancheng, et al.
Publicado: (2024)
por: Xu, Qiancheng, et al.
Publicado: (2024)
STeCa: Step-level Trajectory Calibration for LLM Agent Learning
por: Wang, Hanlin, et al.
Publicado: (2025)
por: Wang, Hanlin, et al.
Publicado: (2025)
Why Safeguarded Ships Run Aground? Aligned Large Language Models' Safety Mechanisms Tend to Be Anchored in The Template Region
por: Leong, Chak Tou, et al.
Publicado: (2025)
por: Leong, Chak Tou, et al.
Publicado: (2025)
E2CL: Exploration-based Error Correction Learning for Embodied Agents
por: Wang, Hanlin, et al.
Publicado: (2024)
por: Wang, Hanlin, et al.
Publicado: (2024)
SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution
por: Wang, Hanlin, et al.
Publicado: (2025)
por: Wang, Hanlin, et al.
Publicado: (2025)
Scaling over Scaling: Exploring Test-Time Scaling Plateau in Large Reasoning Models
por: Wang, Jian, et al.
Publicado: (2025)
por: Wang, Jian, et al.
Publicado: (2025)
Mitigating Unhelpfulness in Emotional Support Conversations with Multifaceted AI Feedback
por: Wang, Jiashuo, et al.
Publicado: (2024)
por: Wang, Jiashuo, et al.
Publicado: (2024)
SpecVLM: Enhancing Speculative Decoding of Video LLMs via Verifier-Guided Token Pruning
por: Ji, Yicheng, et al.
Publicado: (2025)
por: Ji, Yicheng, et al.
Publicado: (2025)
PEToolLLM: Towards Personalized Tool Learning in Large Language Models
por: Xu, Qiancheng, et al.
Publicado: (2025)
por: Xu, Qiancheng, et al.
Publicado: (2025)
Unlocking Efficiency in Large Language Model Inference: A Comprehensive Survey of Speculative Decoding
por: Xia, Heming, et al.
Publicado: (2024)
por: Xia, Heming, et al.
Publicado: (2024)
No Two Devils Alike: Unveiling Distinct Mechanisms of Fine-tuning Attacks
por: Leong, Chak Tou, et al.
Publicado: (2024)
por: Leong, Chak Tou, et al.
Publicado: (2024)
KNN-Defense: Defense against 3D Adversarial Point Clouds using Nearest-Neighbor Search
por: Jamali, Nima, et al.
Publicado: (2025)
por: Jamali, Nima, et al.
Publicado: (2025)
Subtle Errors in Reasoning: Preference Learning via Error-injected Self-editing
por: Xu, Kaishuai, et al.
Publicado: (2024)
por: Xu, Kaishuai, et al.
Publicado: (2024)
LayerSkip: Enabling Early Exit Inference and Self-Speculative Decoding
por: Elhoushi, Mostafa, et al.
Publicado: (2024)
por: Elhoushi, Mostafa, et al.
Publicado: (2024)
Vectorized Generalized Nearest Neighbor Decoding for In-block Memory Channel
por: Liu, Yuhao, et al.
Publicado: (2026)
por: Liu, Yuhao, et al.
Publicado: (2026)
Instruct Once, Chat Consistently in Multiple Rounds: An Efficient Tuning Framework for Dialogue
por: Wang, Jian, et al.
Publicado: (2024)
por: Wang, Jian, et al.
Publicado: (2024)
Learning to Draft: Adaptive Speculative Decoding with Reinforcement Learning
por: Zhang, Jiebin, et al.
Publicado: (2026)
por: Zhang, Jiebin, et al.
Publicado: (2026)
DFlare: Scaling Up Draft Capacity for Block Diffusion Speculative Decoding
por: Zhang, Jiebin, et al.
Publicado: (2026)
por: Zhang, Jiebin, et al.
Publicado: (2026)
Efficient Nearest Neighbor Search Using Dynamic Programming
por: Wang, Pengfei, et al.
Publicado: (2024)
por: Wang, Pengfei, et al.
Publicado: (2024)
DEL: Context-Aware Dynamic Exit Layer for Efficient Self-Speculative Decoding
por: Zarch, Hossein Entezari, et al.
Publicado: (2025)
por: Zarch, Hossein Entezari, et al.
Publicado: (2025)
One-Layer Transformer Provably Learns One-Nearest Neighbor In Context
por: Li, Zihao, et al.
Publicado: (2024)
por: Li, Zihao, et al.
Publicado: (2024)
Differentiable Folding for Nearest Neighbor Model Optimization
por: Krueger, Ryan K., et al.
Publicado: (2025)
por: Krueger, Ryan K., et al.
Publicado: (2025)
A Versatile Framework for Attributed Network Clustering via K-Nearest Neighbor Augmentation
por: Li, Yiran, et al.
Publicado: (2024)
por: Li, Yiran, et al.
Publicado: (2024)
CLaSp: In-Context Layer Skip for Self-Speculative Decoding
por: Chen, Longze, et al.
Publicado: (2025)
por: Chen, Longze, et al.
Publicado: (2025)
ConfLayers: Adaptive Confidence-based Layer Skipping for Self-Speculative Decoding
por: Amer, Walaa, et al.
Publicado: (2026)
por: Amer, Walaa, et al.
Publicado: (2026)
Graph-based Nearest Neighbors with Dynamic Updates via Random Walks
por: Mishra, Nina, et al.
Publicado: (2025)
por: Mishra, Nina, et al.
Publicado: (2025)
Induction Head Toxicity Mechanistically Explains Repetition Curse in Large Language Models
por: Wang, Shuxun, et al.
Publicado: (2025)
por: Wang, Shuxun, et al.
Publicado: (2025)
Efficient Sketching and Nearest Neighbor Search Algorithms for Sparse Vector Sets
por: Bruch, Sebastian, et al.
Publicado: (2025)
por: Bruch, Sebastian, et al.
Publicado: (2025)
Varentropy Estimation via Nearest Neighbor Graphs
por: Leonenko, Nikolai, et al.
Publicado: (2024)
por: Leonenko, Nikolai, et al.
Publicado: (2024)
VSAG: An Optimized Search Framework for Graph-based Approximate Nearest Neighbor Search
por: Zhong, Xiaoyao, et al.
Publicado: (2025)
por: Zhong, Xiaoyao, et al.
Publicado: (2025)
A Framework for Uncertainty Quantification Based on Nearest Neighbors Across Layers
por: Font, Miguel N., et al.
Publicado: (2025)
por: Font, Miguel N., et al.
Publicado: (2025)
Ejemplares similares
-
ToolSpec: Accelerating Tool Calling via Schema-Aware and Retrieval-Augmented Speculative Decoding
por: Xia, Heming, et al.
Publicado: (2026) -
Merlin's Whisper: Enabling Efficient Reasoning in Large Language Models via Black-box Persuasive Prompting
por: Xia, Heming, et al.
Publicado: (2025) -
TokenSkip: Controllable Chain-of-Thought Compression in LLMs
por: Xia, Heming, et al.
Publicado: (2025) -
SWIFT: On-the-Fly Self-Speculative Decoding for LLM Inference Acceleration
por: Xia, Heming, et al.
Publicado: (2024) -
Finding RELIEF: Shaping Reasoning Behavior without Reasoning Supervision via Belief Engineering
por: Leong, Chak Tou, et al.
Publicado: (2026)