FlashPrefill: Instantaneous Pattern Discovery and Thresholding for Ultra-Fast Long-Context Prefilling
Fuente:
arXiv
Salvato in:
| Autori principali: | Fan, Qihang, Huang, Huaibo, Wu, Zhiying, Wang, Juqiu, Wang, Bingning, He, Ran |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
UniPrefill: Universal Long-Context Prefill Acceleration via Block-wise Dynamic Sparsification
di: Fan, Qihang, et al.
Pubblicazione: (2026)
di: Fan, Qihang, et al.
Pubblicazione: (2026)
Accelerating Prefilling for Long-Context LLMs via Sparse Pattern Sharing
di: Peng, Dan, et al.
Pubblicazione: (2025)
di: Peng, Dan, et al.
Pubblicazione: (2025)
Block-Attention for Efficient Prefilling
di: Ma, Dongyang, et al.
Pubblicazione: (2024)
di: Ma, Dongyang, et al.
Pubblicazione: (2024)
CritiPrefill: A Segment-wise Criticality-based Approach for Prefilling Acceleration in LLMs
di: Lv, Junlin, et al.
Pubblicazione: (2024)
di: Lv, Junlin, et al.
Pubblicazione: (2024)
SwiftKV: Fast Prefill-Optimized Inference with Knowledge-Preserving Model Transformation
di: Qiao, Aurick, et al.
Pubblicazione: (2024)
di: Qiao, Aurick, et al.
Pubblicazione: (2024)
POP: Prefill-Only Pruning for Efficient Large Model Inference
di: He, Junhui, et al.
Pubblicazione: (2026)
di: He, Junhui, et al.
Pubblicazione: (2026)
PDTrim: Targeted Pruning for Prefill-Decode Disaggregation in Inference
di: Zhang, Hao, et al.
Pubblicazione: (2025)
di: Zhang, Hao, et al.
Pubblicazione: (2025)
Copy-as-Decode: Grammar-Constrained Parallel Prefill for LLM Editing
di: Liu, Ziyang
Pubblicazione: (2026)
di: Liu, Ziyang
Pubblicazione: (2026)
Prepacking: A Simple Method for Fast Prefilling and Increased Throughput in Large Language Models
di: Zhao, Siyan, et al.
Pubblicazione: (2024)
di: Zhao, Siyan, et al.
Pubblicazione: (2024)
Stability Implies Redundancy: Delta Attention Selective Halting for Efficient Long-Context Prefilling
di: Chen, Yujie, et al.
Pubblicazione: (2026)
di: Chen, Yujie, et al.
Pubblicazione: (2026)
PreFT: Prefill-only finetuning for efficient inference
di: Lanpouthakoun, Andrew, et al.
Pubblicazione: (2026)
di: Lanpouthakoun, Andrew, et al.
Pubblicazione: (2026)
Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation
di: Liu, Jingyu, et al.
Pubblicazione: (2025)
di: Liu, Jingyu, et al.
Pubblicazione: (2025)
Prefill-Guided Thinking for zero-shot detection of AI-generated images
di: Kachwala, Zoher, et al.
Pubblicazione: (2025)
di: Kachwala, Zoher, et al.
Pubblicazione: (2025)
Exposing the Systematic Vulnerability of Open-Weight Models to Prefill Attacks
di: Struppek, Lukas, et al.
Pubblicazione: (2026)
di: Struppek, Lukas, et al.
Pubblicazione: (2026)
IntroLM: Introspective Language Models via Prefilling-Time Self-Evaluation
di: Kasnavieh, Hossein Hosseini, et al.
Pubblicazione: (2026)
di: Kasnavieh, Hossein Hosseini, et al.
Pubblicazione: (2026)
VSPrefill: Vertical-Slash Sparse Attention with Lightweight Indexing for Long-Context Prefilling
di: Guanzhong, Chen
Pubblicazione: (2026)
di: Guanzhong, Chen
Pubblicazione: (2026)
Let's Put Ourselves in Sally's Shoes: Shoes-of-Others Prefilling Improves Theory of Mind in Large Language Models
di: Shinoda, Kazutoshi, et al.
Pubblicazione: (2025)
di: Shinoda, Kazutoshi, et al.
Pubblicazione: (2025)
Fast Forward: Accelerating LLM Prefill with Predictive FFN Sparsity
di: Gautam, Aayush, et al.
Pubblicazione: (2026)
di: Gautam, Aayush, et al.
Pubblicazione: (2026)
No Free Lunch for Defending Against Prefilling Attack by In-Context Learning
di: Xue, Zhiyu, et al.
Pubblicazione: (2024)
di: Xue, Zhiyu, et al.
Pubblicazione: (2024)
Shallow Prefill, Deep Decoding: Efficient Long-Context Inference via Layer-Asymmetric KV Visibility
di: Oh, Jungsuk, et al.
Pubblicazione: (2026)
di: Oh, Jungsuk, et al.
Pubblicazione: (2026)
Prefill-level Jailbreak: A Black-Box Risk Analysis of Large Language Models
di: Li, Yakai, et al.
Pubblicazione: (2025)
di: Li, Yakai, et al.
Pubblicazione: (2025)
LLM Serving Optimization with Variable Prefill and Decode Lengths
di: Wang, Meixuan, et al.
Pubblicazione: (2025)
di: Wang, Meixuan, et al.
Pubblicazione: (2025)
FlowPrefill: Decoupling Preemption from Prefill Scheduling Granularity to Mitigate Head-of-Line Blocking in LLM Serving
di: Hsieh, Chia-chi, et al.
Pubblicazione: (2026)
di: Hsieh, Chia-chi, et al.
Pubblicazione: (2026)
Cross-Family Speculative Prefill: Training-Free Long-Context Compression with Small Draft Models
di: Upasani, Shubhangi, et al.
Pubblicazione: (2026)
di: Upasani, Shubhangi, et al.
Pubblicazione: (2026)
Stream2LLM: Overlap Context Streaming and Prefill for Reduced Time-to-First-Token (TTFT)
di: Bachkaniwala, Rajveer, et al.
Pubblicazione: (2026)
di: Bachkaniwala, Rajveer, et al.
Pubblicazione: (2026)
SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling
di: Ji, Xiaodong, et al.
Pubblicazione: (2025)
di: Ji, Xiaodong, et al.
Pubblicazione: (2025)
LAPS: A Length-Aware-Prefill LLM Serving System
di: She, Jianshu, et al.
Pubblicazione: (2026)
di: She, Jianshu, et al.
Pubblicazione: (2026)
QUOKA: Query-Oriented KV Selection For Efficient LLM Prefill
di: Jones, Dalton, et al.
Pubblicazione: (2026)
di: Jones, Dalton, et al.
Pubblicazione: (2026)
TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference
di: Tang, Xiaojuan, et al.
Pubblicazione: (2025)
di: Tang, Xiaojuan, et al.
Pubblicazione: (2025)
Flash-Searcher: Fast and Effective Web Agents via DAG-Based Parallel Execution
di: Qin, Tianrui, et al.
Pubblicazione: (2025)
di: Qin, Tianrui, et al.
Pubblicazione: (2025)
FastKV: Decoupling of Context Reduction and KV Cache Compression for Prefill-Decoding Acceleration
di: Jo, Dongwon, et al.
Pubblicazione: (2025)
di: Jo, Dongwon, et al.
Pubblicazione: (2025)
QUITO: Accelerating Long-Context Reasoning through Query-Guided Context Compression
di: Wang, Wenshan, et al.
Pubblicazione: (2024)
di: Wang, Wenshan, et al.
Pubblicazione: (2024)
FlashSampling: Fast and Memory-Efficient Exact Sampling
di: Ruiz, Tomas, et al.
Pubblicazione: (2026)
di: Ruiz, Tomas, et al.
Pubblicazione: (2026)
Tree-OPO: Off-policy Monte Carlo Tree-Guided Advantage Optimization for Multistep Reasoning
di: Huang, Bingning, et al.
Pubblicazione: (2025)
di: Huang, Bingning, et al.
Pubblicazione: (2025)
FAST-Prefill: FPGA Accelerated Sparse Attention for Long Context LLM Prefill
di: Jayanth, Rakshith, et al.
Pubblicazione: (2026)
di: Jayanth, Rakshith, et al.
Pubblicazione: (2026)
Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN
di: Xu, Yao, et al.
Pubblicazione: (2025)
di: Xu, Yao, et al.
Pubblicazione: (2025)
FlashBlock: Attention Caching for Efficient Long-Context Block Diffusion
di: Chen, Zhuokun, et al.
Pubblicazione: (2026)
di: Chen, Zhuokun, et al.
Pubblicazione: (2026)
Towards Efficient Key-Value Cache Management for Prefix Prefilling in LLM Inference
di: Zhu, Yue, et al.
Pubblicazione: (2025)
di: Zhu, Yue, et al.
Pubblicazione: (2025)
Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models
di: An, Tai, et al.
Pubblicazione: (2025)
di: An, Tai, et al.
Pubblicazione: (2025)
Prefill-Time Intervention for Mitigating Hallucination in Large Vision-Language Models
di: Zhang, Chengsheng, et al.
Pubblicazione: (2026)
di: Zhang, Chengsheng, et al.
Pubblicazione: (2026)
Documenti analoghi
-
UniPrefill: Universal Long-Context Prefill Acceleration via Block-wise Dynamic Sparsification
di: Fan, Qihang, et al.
Pubblicazione: (2026) -
Accelerating Prefilling for Long-Context LLMs via Sparse Pattern Sharing
di: Peng, Dan, et al.
Pubblicazione: (2025) -
Block-Attention for Efficient Prefilling
di: Ma, Dongyang, et al.
Pubblicazione: (2024) -
CritiPrefill: A Segment-wise Criticality-based Approach for Prefilling Acceleration in LLMs
di: Lv, Junlin, et al.
Pubblicazione: (2024) -
SwiftKV: Fast Prefill-Optimized Inference with Knowledge-Preserving Model Transformation
di: Qiao, Aurick, et al.
Pubblicazione: (2024)