CoDec: Prefix-Shared Decoding Kernel for LLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Zhibin, Ning, Rui, Fang, Chao, Zhang, Zhonghui, Lin, Xi, Ma, Shaobo, Zhou, Mo, Li, Xue, Wang, Zhongfeng, Huan, Chengying, Gu, Rong, Yang, Kun, Chen, Guihai, Zhong, Sheng, Tian, Chen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Accelerating Mixture-of-Experts Inference by Hiding Offloading Latency with Speculative Decoding
di: Wang, Zhibin, et al.
Pubblicazione: (2025)
di: Wang, Zhibin, et al.
Pubblicazione: (2025)
STAR: Decode-Phase Rescheduling for LLM Inference
di: Wang, Zhibin, et al.
Pubblicazione: (2025)
di: Wang, Zhibin, et al.
Pubblicazione: (2025)
Echo: Efficient Co-Scheduling of Hybrid Online-Offline Tasks for Large Language Model Serving
di: Wang, Zhibin, et al.
Pubblicazione: (2025)
di: Wang, Zhibin, et al.
Pubblicazione: (2025)
Revisiting Service Level Objectives and System Level Metrics in Large Language Model Serving
di: Wang, Zhibin, et al.
Pubblicazione: (2024)
di: Wang, Zhibin, et al.
Pubblicazione: (2024)
Bifurcated Attention: Accelerating Massively Parallel Decoding with Shared Prefixes in LLMs
di: Athiwaratkun, Ben, et al.
Pubblicazione: (2024)
di: Athiwaratkun, Ben, et al.
Pubblicazione: (2024)
OrchANN: A Unified I/O Orchestration Framework for Skewed Out-of-Core Vector Search
di: Huan, Chengying, et al.
Pubblicazione: (2025)
di: Huan, Chengying, et al.
Pubblicazione: (2025)
Chordless Structure: A Pathway to Simple and Expressive GNNs
di: Pan, Hongxu, et al.
Pubblicazione: (2025)
di: Pan, Hongxu, et al.
Pubblicazione: (2025)
Bingo: Radix-based Bias Factorization for Random Walk on Dynamic Graphs
di: Wang, Pinhuan, et al.
Pubblicazione: (2025)
di: Wang, Pinhuan, et al.
Pubblicazione: (2025)
Tree Training: Accelerating Agentic LLMs Training via Shared Prefix Reuse
di: Wang, Jinghui, et al.
Pubblicazione: (2025)
di: Wang, Jinghui, et al.
Pubblicazione: (2025)
Prefix Grouper: Efficient GRPO Training through Shared-Prefix Forward
di: Liu, Zikang, et al.
Pubblicazione: (2025)
di: Liu, Zikang, et al.
Pubblicazione: (2025)
DART: Diffusion-Inspired Speculative Decoding for Fast LLM Inference
di: Liu, Fuliang, et al.
Pubblicazione: (2026)
di: Liu, Fuliang, et al.
Pubblicazione: (2026)
Co-Designing Binarized Transformer and Hardware Accelerator for Efficient End-to-End Edge Deployment
di: Ji, Yuhao, et al.
Pubblicazione: (2024)
di: Ji, Yuhao, et al.
Pubblicazione: (2024)
FastMamba: A High-Speed and Efficient Mamba Accelerator on FPGA with Accurate Quantization
di: Wang, Aotao, et al.
Pubblicazione: (2025)
di: Wang, Aotao, et al.
Pubblicazione: (2025)
APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration
di: Ma, Shaobo, et al.
Pubblicazione: (2025)
di: Ma, Shaobo, et al.
Pubblicazione: (2025)
Efficient Arbitrary Precision Acceleration for Large Language Models on GPU Tensor Cores
di: Ma, Shaobo, et al.
Pubblicazione: (2024)
di: Ma, Shaobo, et al.
Pubblicazione: (2024)
SSV: Sparse Speculative Verification for Efficient LLM Inference
di: Wang, Zhibin, et al.
Pubblicazione: (2026)
di: Wang, Zhibin, et al.
Pubblicazione: (2026)
TyphoonMLA: A Mixed Naive-Absorb MLA Kernel For Shared Prefix
di: Yüzügüler, Ahmet Caner, et al.
Pubblicazione: (2025)
di: Yüzügüler, Ahmet Caner, et al.
Pubblicazione: (2025)
Accelerating Direct Preference Optimization with Prefix Sharing
di: Wang, Franklin, et al.
Pubblicazione: (2024)
di: Wang, Franklin, et al.
Pubblicazione: (2024)
Mechanism and Communication Co-Design for Differentially Private Energy Sharing
di: Gu, Yingshuo, et al.
Pubblicazione: (2026)
di: Gu, Yingshuo, et al.
Pubblicazione: (2026)
TAPS: Target-Aware Prefix Tree Selection for Diffusion-Drafted Speculative Decoding
di: Wang, Zhuoyu, et al.
Pubblicazione: (2026)
di: Wang, Zhuoyu, et al.
Pubblicazione: (2026)
Schedule-Level Shared-Prefix Reuse for LLM RL Training
di: Li, Pengbo, et al.
Pubblicazione: (2026)
di: Li, Pengbo, et al.
Pubblicazione: (2026)
PAT: Accelerating LLM Decoding via Prefix-Aware Attention with Resource Efficient Multi-Tile Kernel
di: Yi, Jinjun, et al.
Pubblicazione: (2025)
di: Yi, Jinjun, et al.
Pubblicazione: (2025)
Accelerating Suffix Jailbreak attacks with Prefix-Shared KV-cache
di: Wang, Xinhai, et al.
Pubblicazione: (2026)
di: Wang, Xinhai, et al.
Pubblicazione: (2026)
An FPGA-Based Accelerator Enabling Efficient Support for CNNs with Arbitrary Kernel Sizes
di: Wang, Miaoxin, et al.
Pubblicazione: (2024)
di: Wang, Miaoxin, et al.
Pubblicazione: (2024)
CoFi-Dec: Hallucination-Resistant Decoding via Coarse-to-Fine Generative Feedback in Large Vision-Language Models
di: Cao, Zongsheng, et al.
Pubblicazione: (2025)
di: Cao, Zongsheng, et al.
Pubblicazione: (2025)
Super-FEC Codes for 40/100 Gbps Networking
di: Wang, Zhongfeng
Pubblicazione: (2012)
di: Wang, Zhongfeng
Pubblicazione: (2012)
PrefixMemory-Tuning: Modernizing Prefix-Tuning by Decoupling the Prefix from Attention
di: Wang, Haonan, et al.
Pubblicazione: (2025)
di: Wang, Haonan, et al.
Pubblicazione: (2025)
PrefixWall: Mitigating Prefix Caching Side Channels in Shared LLM Systems
di: Pennas, Panagiotis Georgios, et al.
Pubblicazione: (2026)
di: Pennas, Panagiotis Georgios, et al.
Pubblicazione: (2026)
Scaling Graph Chain-of-Thought Reasoning: A Multi-Agent Framework with Efficient LLM Serving
di: Huan, Chengying, et al.
Pubblicazione: (2025)
di: Huan, Chengying, et al.
Pubblicazione: (2025)
Marconi: Prefix Caching for the Era of Hybrid LLMs
di: Pan, Rui, et al.
Pubblicazione: (2024)
di: Pan, Rui, et al.
Pubblicazione: (2024)
How Trustworthy are Open-Source LLMs? An Assessment under Malicious Demonstrations Shows their Vulnerabilities
di: Mo, Lingbo, et al.
Pubblicazione: (2023)
di: Mo, Lingbo, et al.
Pubblicazione: (2023)
The fragility of "cultural tendencies" in LLMs
di: Sun, Kun, et al.
Pubblicazione: (2025)
di: Sun, Kun, et al.
Pubblicazione: (2025)
MobileKernelBench: Can LLMs Write Efficient Kernels for Mobile Devices?
di: Zou, Xingze, et al.
Pubblicazione: (2026)
di: Zou, Xingze, et al.
Pubblicazione: (2026)
PrefixQuant: Eliminating Outliers by Prefixed Tokens for Large Language Models Quantization
di: Chen, Mengzhao, et al.
Pubblicazione: (2024)
di: Chen, Mengzhao, et al.
Pubblicazione: (2024)
Rooted Absorbed Prefix Trajectory Balance with Submodular Replay for GFlowNet Training
di: Wang, Xi, et al.
Pubblicazione: (2026)
di: Wang, Xi, et al.
Pubblicazione: (2026)
SpecDec++: Boosting Speculative Decoding via Adaptive Candidate Lengths
di: Huang, Kaixuan, et al.
Pubblicazione: (2024)
di: Huang, Kaixuan, et al.
Pubblicazione: (2024)
Fast Chain-of-Thought: A Glance of Future from Parallel Decoding Leads to Answers Faster
di: Zhang, Hongxuan, et al.
Pubblicazione: (2023)
di: Zhang, Hongxuan, et al.
Pubblicazione: (2023)
Optimizing Feature Extraction for On-device Model Inference with User Behavior Sequences
di: Gong, Chen, et al.
Pubblicazione: (2026)
di: Gong, Chen, et al.
Pubblicazione: (2026)
MagicDec: Breaking the Latency-Throughput Tradeoff for Long Context Generation with Speculative Decoding
di: Sadhukhan, Ranajoy, et al.
Pubblicazione: (2024)
di: Sadhukhan, Ranajoy, et al.
Pubblicazione: (2024)
SnipSnap: A Joint Compression Format and Dataflow Co-Optimization Framework for Efficient Sparse LLM Accelerator Design
di: Wu, Junyi, et al.
Pubblicazione: (2025)
di: Wu, Junyi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Accelerating Mixture-of-Experts Inference by Hiding Offloading Latency with Speculative Decoding
di: Wang, Zhibin, et al.
Pubblicazione: (2025) -
STAR: Decode-Phase Rescheduling for LLM Inference
di: Wang, Zhibin, et al.
Pubblicazione: (2025) -
Echo: Efficient Co-Scheduling of Hybrid Online-Offline Tasks for Large Language Model Serving
di: Wang, Zhibin, et al.
Pubblicazione: (2025) -
Revisiting Service Level Objectives and System Level Metrics in Large Language Model Serving
di: Wang, Zhibin, et al.
Pubblicazione: (2024) -
Bifurcated Attention: Accelerating Massively Parallel Decoding with Shared Prefixes in LLMs
di: Athiwaratkun, Ben, et al.
Pubblicazione: (2024)