BlockBatch: Multi-Scale Consensus Decoding for Efficient Diffusion Language Model Inference
Fuente:
arXiv
Guardado en:
| Autores principales: | Wu, Xiaoyou, Shih, Cheng-Jhih, Ji, Binfei, Liu, Yong, Lin, Yingyan Celine |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
$R^2$-dLLM: Accelerating Diffusion Large Language Models via Spatio-Temporal Redundancy Reduction
por: Du, Zhenbang, et al.
Publicado: (2026)
por: Du, Zhenbang, et al.
Publicado: (2026)
When Linear Attention Meets Autoregressive Decoding: Towards More Effective and Efficient Linearized Large Language Models
por: You, Haoran, et al.
Publicado: (2024)
por: You, Haoran, et al.
Publicado: (2024)
DepCap: Adaptive Block-Wise Parallel Decoding for Efficient Diffusion LM Inference
por: Xia, Xiang, et al.
Publicado: (2026)
por: Xia, Xiang, et al.
Publicado: (2026)
Encoder-Decoder Diffusion Language Models for Efficient Training and Inference
por: Arriola, Marianne, et al.
Publicado: (2025)
por: Arriola, Marianne, et al.
Publicado: (2025)
Efficient-DLM: From Autoregressive to Diffusion Language Models, and Beyond in Speed
por: Fu, Yonggan, et al.
Publicado: (2025)
por: Fu, Yonggan, et al.
Publicado: (2025)
ShiftAddViT: Mixture of Multiplication Primitives Towards Efficient Vision Transformer
por: You, Haoran, et al.
Publicado: (2023)
por: You, Haoran, et al.
Publicado: (2023)
SERE: Similarity-based Expert Re-routing for Efficient Batch Decoding in MoE Models
por: Wu, Juntong, et al.
Publicado: (2026)
por: Wu, Juntong, et al.
Publicado: (2026)
MG-Verilog: Multi-grained Dataset Towards Enhanced LLM-assisted Verilog Generation
por: Zhang, Yongan, et al.
Publicado: (2024)
por: Zhang, Yongan, et al.
Publicado: (2024)
Plato: Plan to Efficiently Decode for Large Language Model Inference
por: Jin, Shuowei, et al.
Publicado: (2024)
por: Jin, Shuowei, et al.
Publicado: (2024)
EffGen: Enabling Small Language Models as Capable Autonomous Agents
por: Srivastava, Gaurav, et al.
Publicado: (2026)
por: Srivastava, Gaurav, et al.
Publicado: (2026)
A*-Decoding: Token-Efficient Inference Scaling
por: Chatziveroglou, Giannis
Publicado: (2025)
por: Chatziveroglou, Giannis
Publicado: (2025)
CSV-Decode: Certifiable Sub-Vocabulary Decoding for Efficient Large Language Model Inference
por: Liu, Dong, et al.
Publicado: (2025)
por: Liu, Dong, et al.
Publicado: (2025)
SynerDiff: Synergetic Continuous Batching for Fast and Parallel Diffusion Model Inference
por: Zhou, Ziqi, et al.
Publicado: (2026)
por: Zhou, Ziqi, et al.
Publicado: (2026)
ShiftAddNAS: Hardware-Inspired Search for More Accurate and Efficient Neural Networks
por: You, Haoran, et al.
Publicado: (2022)
por: You, Haoran, et al.
Publicado: (2022)
AmoebaLLM: Constructing Any-Shape Large Language Models for Efficient and Instant Deployment
por: Fu, Yonggan, et al.
Publicado: (2024)
por: Fu, Yonggan, et al.
Publicado: (2024)
Efficient Large Language Model Inference with Neural Block Linearization
por: Erdogan, Mete, et al.
Publicado: (2025)
por: Erdogan, Mete, et al.
Publicado: (2025)
FairBatching: Fairness-Aware Batch Formation for LLM Inference
por: Lyu, Hongtao, et al.
Publicado: (2025)
por: Lyu, Hongtao, et al.
Publicado: (2025)
Small Language Models are the Future of Agentic AI
por: Belcak, Peter, et al.
Publicado: (2025)
por: Belcak, Peter, et al.
Publicado: (2025)
Reversible Diffusion Decoding for Diffusion Language Models
por: Wang, Xinyun, et al.
Publicado: (2026)
por: Wang, Xinyun, et al.
Publicado: (2026)
Scaling Inference-Efficient Language Models
por: Bian, Song, et al.
Publicado: (2025)
por: Bian, Song, et al.
Publicado: (2025)
CreditDecoding: Accelerating Parallel Decoding in Diffusion Large Language Models with Trace Credit
por: Wang, Kangyu, et al.
Publicado: (2025)
por: Wang, Kangyu, et al.
Publicado: (2025)
Restoring Heterogeneity in LLM-based Social Simulation: An Audience Segmentation Approach
por: Qin, Xiaoyou, et al.
Publicado: (2026)
por: Qin, Xiaoyou, et al.
Publicado: (2026)
Batch Speculative Decoding Done Right
por: Zhang, Ranran Haoran, et al.
Publicado: (2025)
por: Zhang, Ranran Haoran, et al.
Publicado: (2025)
MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators
por: Wan, Cheng, et al.
Publicado: (2025)
por: Wan, Cheng, et al.
Publicado: (2025)
GauRast: Enhancing GPU Triangle Rasterizers to Accelerate 3D Gaussian Splatting
por: Li, Sixu, et al.
Publicado: (2025)
por: Li, Sixu, et al.
Publicado: (2025)
dInfer: An Efficient Inference Framework for Diffusion Language Models
por: Ma, Yuxin, et al.
Publicado: (2025)
por: Ma, Yuxin, et al.
Publicado: (2025)
Edge Intelligence Optimization for Large Language Model Inference with Batching and Quantization
por: Zhang, Xinyuan, et al.
Publicado: (2024)
por: Zhang, Xinyuan, et al.
Publicado: (2024)
BatchLLM: Optimizing Large Batched LLM Inference with Global Prefix Sharing and Throughput-oriented Token Batching
por: Zheng, Zhen, et al.
Publicado: (2024)
por: Zheng, Zhen, et al.
Publicado: (2024)
Systematic Analysis for Pretrained Language Model Priming for Parameter-Efficient Fine-tuning
por: Huang, Shih-Cheng, et al.
Publicado: (2022)
por: Huang, Shih-Cheng, et al.
Publicado: (2022)
Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline
por: Fang, Zhiyuan, et al.
Publicado: (2025)
por: Fang, Zhiyuan, et al.
Publicado: (2025)
SDAR-VL: Stable and Efficient Block-wise Diffusion for Vision-Language Understanding
por: Cheng, Shuang, et al.
Publicado: (2025)
por: Cheng, Shuang, et al.
Publicado: (2025)
Speculative Decoding for Multi-Sample Inference
por: Li, Yiwei, et al.
Publicado: (2025)
por: Li, Yiwei, et al.
Publicado: (2025)
Heterogeneous Consensus-Progressive Reasoning for Efficient Multi-Agent Debate
por: Liu, Yiqing, et al.
Publicado: (2026)
por: Liu, Yiqing, et al.
Publicado: (2026)
Confidence-Based Decoding is Provably Efficient for Diffusion Language Models
por: Cai, Changxiao, et al.
Publicado: (2026)
por: Cai, Changxiao, et al.
Publicado: (2026)
Threshold-Based Exclusive Batching for LLM Inference
por: Zhang, Weifang, et al.
Publicado: (2026)
por: Zhang, Weifang, et al.
Publicado: (2026)
Speculative Decoding Reimagined for Multimodal Large Language Models
por: Lin, Luxi, et al.
Publicado: (2025)
por: Lin, Luxi, et al.
Publicado: (2025)
InstructFLIP: Exploring Unified Vision-Language Model for Face Anti-spoofing
por: Lin, Kun-Hsiang, et al.
Publicado: (2025)
por: Lin, Kun-Hsiang, et al.
Publicado: (2025)
CITER: Collaborative Inference for Efficient Large Language Model Decoding with Token-Level Routing
por: Zheng, Wenhao, et al.
Publicado: (2025)
por: Zheng, Wenhao, et al.
Publicado: (2025)
Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers
por: You, Haoran, et al.
Publicado: (2024)
por: You, Haoran, et al.
Publicado: (2024)
DARE: Diffusion Language Model Activation Reuse for Efficient Inference
por: Frumkin, Natalia, et al.
Publicado: (2026)
por: Frumkin, Natalia, et al.
Publicado: (2026)
Ejemplares similares
-
$R^2$-dLLM: Accelerating Diffusion Large Language Models via Spatio-Temporal Redundancy Reduction
por: Du, Zhenbang, et al.
Publicado: (2026) -
When Linear Attention Meets Autoregressive Decoding: Towards More Effective and Efficient Linearized Large Language Models
por: You, Haoran, et al.
Publicado: (2024) -
DepCap: Adaptive Block-Wise Parallel Decoding for Efficient Diffusion LM Inference
por: Xia, Xiang, et al.
Publicado: (2026) -
Encoder-Decoder Diffusion Language Models for Efficient Training and Inference
por: Arriola, Marianne, et al.
Publicado: (2025) -
Efficient-DLM: From Autoregressive to Diffusion Language Models, and Beyond in Speed
por: Fu, Yonggan, et al.
Publicado: (2025)