Salvato in:
| Autori principali: | Song, Mingbo, Xia, Heming, Zhang, Jun, Leong, Chak Tou, Xu, Qiancheng, Li, Wenjie, Li, Sujian |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2505.16162 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ToolSpec: Accelerating Tool Calling via Schema-Aware and Retrieval-Augmented Speculative Decoding
di: Xia, Heming, et al.
Pubblicazione: (2026)
di: Xia, Heming, et al.
Pubblicazione: (2026)
Merlin's Whisper: Enabling Efficient Reasoning in Large Language Models via Black-box Persuasive Prompting
di: Xia, Heming, et al.
Pubblicazione: (2025)
di: Xia, Heming, et al.
Pubblicazione: (2025)
TokenSkip: Controllable Chain-of-Thought Compression in LLMs
di: Xia, Heming, et al.
Pubblicazione: (2025)
di: Xia, Heming, et al.
Pubblicazione: (2025)
SWIFT: On-the-Fly Self-Speculative Decoding for LLM Inference Acceleration
di: Xia, Heming, et al.
Pubblicazione: (2024)
di: Xia, Heming, et al.
Pubblicazione: (2024)
Finding RELIEF: Shaping Reasoning Behavior without Reasoning Supervision via Belief Engineering
di: Leong, Chak Tou, et al.
Pubblicazione: (2026)
di: Leong, Chak Tou, et al.
Pubblicazione: (2026)
Seeing Isn't Believing: Mitigating Belief Inertia via Active Intervention in Embodied Agents
di: Wang, Hanlin, et al.
Pubblicazione: (2026)
di: Wang, Hanlin, et al.
Pubblicazione: (2026)
Nearest Neighbor Speculative Decoding for LLM Generation and Attribution
di: Li, Minghan, et al.
Pubblicazione: (2024)
di: Li, Minghan, et al.
Pubblicazione: (2024)
Tutorial Proposal: Speculative Decoding for Efficient LLM Inference
di: Xia, Heming, et al.
Pubblicazione: (2025)
di: Xia, Heming, et al.
Pubblicazione: (2025)
Enhancing Tool Retrieval with Iterative Feedback from Large Language Models
di: Xu, Qiancheng, et al.
Pubblicazione: (2024)
di: Xu, Qiancheng, et al.
Pubblicazione: (2024)
STeCa: Step-level Trajectory Calibration for LLM Agent Learning
di: Wang, Hanlin, et al.
Pubblicazione: (2025)
di: Wang, Hanlin, et al.
Pubblicazione: (2025)
Why Safeguarded Ships Run Aground? Aligned Large Language Models' Safety Mechanisms Tend to Be Anchored in The Template Region
di: Leong, Chak Tou, et al.
Pubblicazione: (2025)
di: Leong, Chak Tou, et al.
Pubblicazione: (2025)
E2CL: Exploration-based Error Correction Learning for Embodied Agents
di: Wang, Hanlin, et al.
Pubblicazione: (2024)
di: Wang, Hanlin, et al.
Pubblicazione: (2024)
Bayes-Decisive Linear KNN with Adaptive Nearest Neighbors
di: Jin Zhang, et al.
Pubblicazione: (2024)
di: Jin Zhang, et al.
Pubblicazione: (2024)
SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution
di: Wang, Hanlin, et al.
Pubblicazione: (2025)
di: Wang, Hanlin, et al.
Pubblicazione: (2025)
Scaling over Scaling: Exploring Test-Time Scaling Plateau in Large Reasoning Models
di: Wang, Jian, et al.
Pubblicazione: (2025)
di: Wang, Jian, et al.
Pubblicazione: (2025)
Mitigating Unhelpfulness in Emotional Support Conversations with Multifaceted AI Feedback
di: Wang, Jiashuo, et al.
Pubblicazione: (2024)
di: Wang, Jiashuo, et al.
Pubblicazione: (2024)
PEToolLLM: Towards Personalized Tool Learning in Large Language Models
di: Xu, Qiancheng, et al.
Pubblicazione: (2025)
di: Xu, Qiancheng, et al.
Pubblicazione: (2025)
No Two Devils Alike: Unveiling Distinct Mechanisms of Fine-tuning Attacks
di: Leong, Chak Tou, et al.
Pubblicazione: (2024)
di: Leong, Chak Tou, et al.
Pubblicazione: (2024)
SpecVLM: Enhancing Speculative Decoding of Video LLMs via Verifier-Guided Token Pruning
di: Ji, Yicheng, et al.
Pubblicazione: (2025)
di: Ji, Yicheng, et al.
Pubblicazione: (2025)
Subtle Errors in Reasoning: Preference Learning via Error-injected Self-editing
di: Xu, Kaishuai, et al.
Pubblicazione: (2024)
di: Xu, Kaishuai, et al.
Pubblicazione: (2024)
Unlocking Efficiency in Large Language Model Inference: A Comprehensive Survey of Speculative Decoding
di: Xia, Heming, et al.
Pubblicazione: (2024)
di: Xia, Heming, et al.
Pubblicazione: (2024)
Instruct Once, Chat Consistently in Multiple Rounds: An Efficient Tuning Framework for Dialogue
di: Wang, Jian, et al.
Pubblicazione: (2024)
di: Wang, Jian, et al.
Pubblicazione: (2024)
KNN-Defense: Defense against 3D Adversarial Point Clouds using Nearest-Neighbor Search
di: Jamali, Nima, et al.
Pubblicazione: (2025)
di: Jamali, Nima, et al.
Pubblicazione: (2025)
Learning to Draft: Adaptive Speculative Decoding with Reinforcement Learning
di: Zhang, Jiebin, et al.
Pubblicazione: (2026)
di: Zhang, Jiebin, et al.
Pubblicazione: (2026)
Vectorized Generalized Nearest Neighbor Decoding for In-block Memory Channel
di: Liu, Yuhao, et al.
Pubblicazione: (2026)
di: Liu, Yuhao, et al.
Pubblicazione: (2026)
LayerSkip: Enabling Early Exit Inference and Self-Speculative Decoding
di: Elhoushi, Mostafa, et al.
Pubblicazione: (2024)
di: Elhoushi, Mostafa, et al.
Pubblicazione: (2024)
DFlare: Scaling Up Draft Capacity for Block Diffusion Speculative Decoding
di: Zhang, Jiebin, et al.
Pubblicazione: (2026)
di: Zhang, Jiebin, et al.
Pubblicazione: (2026)
Induction Head Toxicity Mechanistically Explains Repetition Curse in Large Language Models
di: Wang, Shuxun, et al.
Pubblicazione: (2025)
di: Wang, Shuxun, et al.
Pubblicazione: (2025)
Efficient Nearest Neighbor Search Using Dynamic Programming
di: Wang, Pengfei, et al.
Pubblicazione: (2024)
di: Wang, Pengfei, et al.
Pubblicazione: (2024)
One-Layer Transformer Provably Learns One-Nearest Neighbor In Context
di: Li, Zihao, et al.
Pubblicazione: (2024)
di: Li, Zihao, et al.
Pubblicazione: (2024)
Constrain Alignment with Sparse Autoencoders
di: Yin, Qingyu, et al.
Pubblicazione: (2024)
di: Yin, Qingyu, et al.
Pubblicazione: (2024)
DEL: Context-Aware Dynamic Exit Layer for Efficient Self-Speculative Decoding
di: Zarch, Hossein Entezari, et al.
Pubblicazione: (2025)
di: Zarch, Hossein Entezari, et al.
Pubblicazione: (2025)
AutoPal: Autonomous Adaptation to Users for Personal AI Companionship
di: Cheng, Yi, et al.
Pubblicazione: (2024)
di: Cheng, Yi, et al.
Pubblicazione: (2024)
Protein as a Second Language for LLMs
di: Chen, Xinhui, et al.
Pubblicazione: (2025)
di: Chen, Xinhui, et al.
Pubblicazione: (2025)
Differentiable Folding for Nearest Neighbor Model Optimization
di: Krueger, Ryan K., et al.
Pubblicazione: (2025)
di: Krueger, Ryan K., et al.
Pubblicazione: (2025)
Expanding before Inferring: Enhancing Factuality in Large Language Models through Premature Layers Interpolation
di: Chen, Dingwei, et al.
Pubblicazione: (2025)
di: Chen, Dingwei, et al.
Pubblicazione: (2025)
A Versatile Framework for Attributed Network Clustering via K-Nearest Neighbor Augmentation
di: Li, Yiran, et al.
Pubblicazione: (2024)
di: Li, Yiran, et al.
Pubblicazione: (2024)
Probing Cultural Awareness in LLMs: A Case Study of Cross-Culture Aesthetic Stylistics
di: Wang, Jiashuo, et al.
Pubblicazione: (2026)
di: Wang, Jiashuo, et al.
Pubblicazione: (2026)
CLaSp: In-Context Layer Skip for Self-Speculative Decoding
di: Chen, Longze, et al.
Pubblicazione: (2025)
di: Chen, Longze, et al.
Pubblicazione: (2025)
Graph-based Nearest Neighbors with Dynamic Updates via Random Walks
di: Mishra, Nina, et al.
Pubblicazione: (2025)
di: Mishra, Nina, et al.
Pubblicazione: (2025)
Documenti analoghi
-
ToolSpec: Accelerating Tool Calling via Schema-Aware and Retrieval-Augmented Speculative Decoding
di: Xia, Heming, et al.
Pubblicazione: (2026) -
Merlin's Whisper: Enabling Efficient Reasoning in Large Language Models via Black-box Persuasive Prompting
di: Xia, Heming, et al.
Pubblicazione: (2025) -
TokenSkip: Controllable Chain-of-Thought Compression in LLMs
di: Xia, Heming, et al.
Pubblicazione: (2025) -
SWIFT: On-the-Fly Self-Speculative Decoding for LLM Inference Acceleration
di: Xia, Heming, et al.
Pubblicazione: (2024) -
Finding RELIEF: Shaping Reasoning Behavior without Reasoning Supervision via Belief Engineering
di: Leong, Chak Tou, et al.
Pubblicazione: (2026)