Bifurcated Attention: Accelerating Massively Parallel Decoding with Shared Prefixes in LLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Athiwaratkun, Ben, Gonugondla, Sujan Kumar, Gouda, Sanjay Krishna, Qian, Haifeng, Ding, Hantian, Sun, Qing, Wang, Jun, Guo, Jiacheng, Chen, Liangfu, Bhatia, Parminder, Nallapati, Ramesh, Sengupta, Sudipta, Xiang, Bing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
BASS: Batched Attention-optimized Speculative Sampling
di: Qian, Haifeng, et al.
Pubblicazione: (2024)
di: Qian, Haifeng, et al.
Pubblicazione: (2024)
Token Alignment via Character Matching for Subword Completion
di: Athiwaratkun, Ben, et al.
Pubblicazione: (2024)
di: Athiwaratkun, Ben, et al.
Pubblicazione: (2024)
Constrained Decoding for Fill-in-the-Middle Code Language Models via Efficient Left and Right Quotienting of Context-Sensitive Grammars
di: Melcer, Daniel, et al.
Pubblicazione: (2024)
di: Melcer, Daniel, et al.
Pubblicazione: (2024)
The N-Grammys: Accelerating Autoregressive Inference with Learning-Free Batched Speculation
di: Stewart, Lawrence, et al.
Pubblicazione: (2024)
di: Stewart, Lawrence, et al.
Pubblicazione: (2024)
Code Representation Learning At Scale
di: Zhang, Dejiao, et al.
Pubblicazione: (2024)
di: Zhang, Dejiao, et al.
Pubblicazione: (2024)
Approximately Aligned Decoding
di: Melcer, Daniel, et al.
Pubblicazione: (2024)
di: Melcer, Daniel, et al.
Pubblicazione: (2024)
Massive Feynman integrals at high energies: recent analytic results
di: Zhang, Hantian
Pubblicazione: (2025)
di: Zhang, Hantian
Pubblicazione: (2025)
Massive two-loop four-point Feynman integrals at high energies with AsyInt
di: Zhang, Hantian
Pubblicazione: (2024)
di: Zhang, Hantian
Pubblicazione: (2024)
Accelerating Direct Preference Optimization with Prefix Sharing
di: Wang, Franklin, et al.
Pubblicazione: (2024)
di: Wang, Franklin, et al.
Pubblicazione: (2024)
CoDec: Prefix-Shared Decoding Kernel for LLMs
di: Wang, Zhibin, et al.
Pubblicazione: (2025)
di: Wang, Zhibin, et al.
Pubblicazione: (2025)
PAT: Accelerating LLM Decoding via Prefix-Aware Attention with Resource Efficient Multi-Tile Kernel
di: Yi, Jinjun, et al.
Pubblicazione: (2025)
di: Yi, Jinjun, et al.
Pubblicazione: (2025)
Accelerating Suffix Jailbreak attacks with Prefix-Shared KV-cache
di: Wang, Xinhai, et al.
Pubblicazione: (2026)
di: Wang, Xinhai, et al.
Pubblicazione: (2026)
Transforming Decoder-Only Transformers for Accurate WiFi-Telemetry Based Indoor Localization
di: Bhatia, Nayan Sanjay, et al.
Pubblicazione: (2025)
di: Bhatia, Nayan Sanjay, et al.
Pubblicazione: (2025)
Tree Training: Accelerating Agentic LLMs Training via Shared Prefix Reuse
di: Wang, Jinghui, et al.
Pubblicazione: (2025)
di: Wang, Jinghui, et al.
Pubblicazione: (2025)
PrefixMemory-Tuning: Modernizing Prefix-Tuning by Decoupling the Prefix from Attention
di: Wang, Haonan, et al.
Pubblicazione: (2025)
di: Wang, Haonan, et al.
Pubblicazione: (2025)
Prefix Grouper: Efficient GRPO Training through Shared-Prefix Forward
di: Liu, Zikang, et al.
Pubblicazione: (2025)
di: Liu, Zikang, et al.
Pubblicazione: (2025)
PrefixLLM: LLM-aided Prefix Circuit Design
di: Xiao, Weihua, et al.
Pubblicazione: (2024)
di: Xiao, Weihua, et al.
Pubblicazione: (2024)
Parallel Prefix Verification for Speculative Generation
di: Yao, Yuncheng, et al.
Pubblicazione: (2026)
di: Yao, Yuncheng, et al.
Pubblicazione: (2026)
Over-the-Air Beamforming Design for Full-Duplex Cell-Free Massive MIMO Systems
di: Gouda, Bikshapathi, et al.
Pubblicazione: (2026)
di: Gouda, Bikshapathi, et al.
Pubblicazione: (2026)
QCD and electroweak corrections for single and double Higgs boson production at the LHC
di: Zhang, Hantian
Pubblicazione: (2024)
di: Zhang, Hantian
Pubblicazione: (2024)
PrefixWall: Mitigating Prefix Caching Side Channels in Shared LLM Systems
di: Pennas, Panagiotis Georgios, et al.
Pubblicazione: (2026)
di: Pennas, Panagiotis Georgios, et al.
Pubblicazione: (2026)
Sequential-Parallel Duality in Prefix Scannable Models
di: Yau, Morris, et al.
Pubblicazione: (2025)
di: Yau, Morris, et al.
Pubblicazione: (2025)
Dynamic Graph Attention Networks for Travel Time Distribution Prediction in Urban Arterial Roads
di: Yousefzadeh, Nooshin, et al.
Pubblicazione: (2024)
di: Yousefzadeh, Nooshin, et al.
Pubblicazione: (2024)
AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism
di: Wei, Zhepei, et al.
Pubblicazione: (2025)
di: Wei, Zhepei, et al.
Pubblicazione: (2025)
Focus on What Matters: Enhancing Medical Vision-Language Models with Automatic Attention Alignment Tuning
di: Chang, Aofei, et al.
Pubblicazione: (2025)
di: Chang, Aofei, et al.
Pubblicazione: (2025)
VLPPLAs: Variable Latency Parallel Prefix Ling Adders
di: Yongqiang Zhang, et al.
Pubblicazione: (2025)
di: Yongqiang Zhang, et al.
Pubblicazione: (2025)
Uplink Transmit Power Optimization for Distributed Massive MIMO Systems with 1-Bit ADCs
di: Gouda, Bikshapathi, et al.
Pubblicazione: (2024)
di: Gouda, Bikshapathi, et al.
Pubblicazione: (2024)
Hydragen: High-Throughput LLM Inference with Shared Prefixes
di: Juravsky, Jordan, et al.
Pubblicazione: (2024)
di: Juravsky, Jordan, et al.
Pubblicazione: (2024)
Pilot-Aided Distributed Multi-Group Multicast Precoding Design for Cell-Free Massive MIMO
di: Gouda, Bikshapathi, et al.
Pubblicazione: (2022)
di: Gouda, Bikshapathi, et al.
Pubblicazione: (2022)
Accelerating Transformer Inference for Translation via Parallel Decoding
di: Santilli, Andrea, et al.
Pubblicazione: (2023)
di: Santilli, Andrea, et al.
Pubblicazione: (2023)
Accelerating Diffusion LLMs via Adaptive Parallel Decoding
di: Israel, Daniel, et al.
Pubblicazione: (2025)
di: Israel, Daniel, et al.
Pubblicazione: (2025)
On The Performance of Prefix-Sum Parallel Kalman Filters and Smoothers on GPUs
di: Särkkä, Simo, et al.
Pubblicazione: (2025)
di: Särkkä, Simo, et al.
Pubblicazione: (2025)
Breaking the Code: Security Assessment of AI Code Agents Through Systematic Jailbreaking Attacks
di: Saha, Shoumik, et al.
Pubblicazione: (2025)
di: Saha, Shoumik, et al.
Pubblicazione: (2025)
Hyper Hawkes Processes: Interpretable Models of Marked Temporal Point Processes
di: Boyd, Alex, et al.
Pubblicazione: (2025)
di: Boyd, Alex, et al.
Pubblicazione: (2025)
MammoDINO: Anatomically Aware Self-Supervision for Mammographic Images
di: Zhou, Sicheng, et al.
Pubblicazione: (2025)
di: Zhou, Sicheng, et al.
Pubblicazione: (2025)
RETRACTED: Overexpression of SEZ6L2 and Immune Infiltration in Cancer Based on Gene Image Diagnosis
di: Liangfu Ding, et al.
Pubblicazione: (2024)
di: Liangfu Ding, et al.
Pubblicazione: (2024)
Schedule-Level Shared-Prefix Reuse for LLM RL Training
di: Li, Pengbo, et al.
Pubblicazione: (2026)
di: Li, Pengbo, et al.
Pubblicazione: (2026)
GRAND Massive Parallel Decoding Framework for Low Latency in Beyond 5G
di: Gligoroski, Danilo, et al.
Pubblicazione: (2024)
di: Gligoroski, Danilo, et al.
Pubblicazione: (2024)
CodeFort: Robust Training for Code Generation Models
di: Zhang, Yuhao, et al.
Pubblicazione: (2024)
di: Zhang, Yuhao, et al.
Pubblicazione: (2024)
Learning to Parallel: Accelerating Diffusion Large Language Models via Learnable Parallel Decoding
di: Bao, Wenrui, et al.
Pubblicazione: (2025)
di: Bao, Wenrui, et al.
Pubblicazione: (2025)
Documenti analoghi
-
BASS: Batched Attention-optimized Speculative Sampling
di: Qian, Haifeng, et al.
Pubblicazione: (2024) -
Token Alignment via Character Matching for Subword Completion
di: Athiwaratkun, Ben, et al.
Pubblicazione: (2024) -
Constrained Decoding for Fill-in-the-Middle Code Language Models via Efficient Left and Right Quotienting of Context-Sensitive Grammars
di: Melcer, Daniel, et al.
Pubblicazione: (2024) -
The N-Grammys: Accelerating Autoregressive Inference with Learning-Free Batched Speculation
di: Stewart, Lawrence, et al.
Pubblicazione: (2024) -
Code Representation Learning At Scale
di: Zhang, Dejiao, et al.
Pubblicazione: (2024)