Accelerating Inference of Discrete Autoregressive Normalizing Flows by Selective Jacobi Decoding
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Jiaru, Lu, Juanwu, Wu, Xiaoyu, Wang, Ziran, Zhang, Ruqi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
On Variance Reduction in Learning Mean Flows
por: Lu, Juanwu, et al.
Publicado: (2026)
por: Lu, Juanwu, et al.
Publicado: (2026)
Analytical Correction for Subsampling Bias in Drifting Models
por: Zhang, Jiaru, et al.
Publicado: (2026)
por: Zhang, Jiaru, et al.
Publicado: (2026)
One-Step Diffusion Samplers via Self-Distillation and Deterministic Flow
por: Jutras-Dube, Pascal, et al.
Publicado: (2025)
por: Jutras-Dube, Pascal, et al.
Publicado: (2025)
Latent Bayesian Optimization via Autoregressive Normalizing Flows
por: Lee, Seunghun, et al.
Publicado: (2025)
por: Lee, Seunghun, et al.
Publicado: (2025)
Leveraging Model Guidance to Extract Training Data from Personalized Diffusion Models
por: Wu, Xiaoyu, et al.
Publicado: (2024)
por: Wu, Xiaoyu, et al.
Publicado: (2024)
CAS-Spec: Cascade Adaptive Self-Speculative Decoding for On-the-Fly Lossless Inference Acceleration of LLMs
por: Ning, Zhiyuan, et al.
Publicado: (2025)
por: Ning, Zhiyuan, et al.
Publicado: (2025)
FedMomentum: Preserving LoRA Training Momentum in Federated Fine-Tuning
por: Yan, Peishen, et al.
Publicado: (2026)
por: Yan, Peishen, et al.
Publicado: (2026)
Model Merging on Loss Landscape: A Geometry Perspective
por: Lu, Juanwu, et al.
Publicado: (2026)
por: Lu, Juanwu, et al.
Publicado: (2026)
Distilling Autoregressive Models to Obtain High-Performance Non-Autoregressive Solvers for Vehicle Routing Problems with Faster Inference Speed
por: Xiao, Yubin, et al.
Publicado: (2023)
por: Xiao, Yubin, et al.
Publicado: (2023)
DIVERSED: Relaxed Speculative Decoding via Dynamic Ensemble Verification
por: Wang, Ziyi, et al.
Publicado: (2026)
por: Wang, Ziyi, et al.
Publicado: (2026)
A Universal and Robust Framework for Multiple Gas Recognition Based-on Spherical Normalization-Coupled Mahalanobis Algorithm
por: Chen, Shuai, et al.
Publicado: (2025)
por: Chen, Shuai, et al.
Publicado: (2025)
Autoregressive Visual Decoding from EEG Signals
por: Dai, Sicheng, et al.
Publicado: (2026)
por: Dai, Sicheng, et al.
Publicado: (2026)
Learning Discrete Autoregressive Priors with Wasserstein Gradient Flow
por: Zheng, Bowen, et al.
Publicado: (2026)
por: Zheng, Bowen, et al.
Publicado: (2026)
Accelerating Large-Scale Reasoning Model Inference with Sparse Self-Speculative Decoding
por: Zhao, Yilong, et al.
Publicado: (2025)
por: Zhao, Yilong, et al.
Publicado: (2025)
Recursive Speculative Decoding: Accelerating LLM Inference via Sampling Without Replacement
por: Jeon, Wonseok, et al.
Publicado: (2024)
por: Jeon, Wonseok, et al.
Publicado: (2024)
Accelerating Transformer Inference for Translation via Parallel Decoding
por: Santilli, Andrea, et al.
Publicado: (2023)
por: Santilli, Andrea, et al.
Publicado: (2023)
PromptIntern: Saving Inference Costs by Internalizing Recurrent Prompt during Large Language Model Fine-tuning
por: Zou, Jiaru, et al.
Publicado: (2024)
por: Zou, Jiaru, et al.
Publicado: (2024)
Latent-DARM: Bridging Discrete Diffusion And Autoregressive Models For Reasoning
por: Berrayana, Lina, et al.
Publicado: (2026)
por: Berrayana, Lina, et al.
Publicado: (2026)
A Theoretical Analysis of Discrete Flow Matching Generative Models
por: Su, Maojiang, et al.
Publicado: (2025)
por: Su, Maojiang, et al.
Publicado: (2025)
Discrete Flow Matching
por: Gat, Itai, et al.
Publicado: (2024)
por: Gat, Itai, et al.
Publicado: (2024)
Accelerating LLM Inference with Lossless Speculative Decoding Algorithms for Heterogeneous Vocabularies
por: Timor, Nadav, et al.
Publicado: (2025)
por: Timor, Nadav, et al.
Publicado: (2025)
Speculative Decoding with CTC-based Draft Model for LLM Inference Acceleration
por: Wen, Zhuofan, et al.
Publicado: (2024)
por: Wen, Zhuofan, et al.
Publicado: (2024)
Context-Aware Assistant Selection for Improved Inference Acceleration with Large Language Models
por: Huang, Jerry, et al.
Publicado: (2024)
por: Huang, Jerry, et al.
Publicado: (2024)
DepCap: Adaptive Block-Wise Parallel Decoding for Efficient Diffusion LM Inference
por: Xia, Xiang, et al.
Publicado: (2026)
por: Xia, Xiang, et al.
Publicado: (2026)
Linear Transformers as VAR Models: Aligning Autoregressive Attention Mechanisms with Autoregressive Forecasting
por: Lu, Jiecheng, et al.
Publicado: (2025)
por: Lu, Jiecheng, et al.
Publicado: (2025)
TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference
por: Tang, Xiaojuan, et al.
Publicado: (2025)
por: Tang, Xiaojuan, et al.
Publicado: (2025)
PAHQ: Accelerating Automated Circuit Discovery through Mixed-Precision Inference Optimization
por: Wang, Xinhai, et al.
Publicado: (2025)
por: Wang, Xinhai, et al.
Publicado: (2025)
Controlled LLM Decoding via Discrete Auto-regressive Biasing
por: Pynadath, Patrick, et al.
Publicado: (2025)
por: Pynadath, Patrick, et al.
Publicado: (2025)
Attention Drift: What Autoregressive Speculative Decoding Models Learn
por: Eldenk, Doğaç, et al.
Publicado: (2026)
por: Eldenk, Doğaç, et al.
Publicado: (2026)
From Values to Tokens: An LLM-Driven Framework for Context-aware Time Series Forecasting via Symbolic Discretization
por: Tao, Xiaoyu, et al.
Publicado: (2025)
por: Tao, Xiaoyu, et al.
Publicado: (2025)
ASTRA: Communication-Efficient Acceleration for Multi-Device Transformer Inference
por: Liu, Xiao, et al.
Publicado: (2025)
por: Liu, Xiao, et al.
Publicado: (2025)
Diffusion LLMs Can Do Faster-Than-AR Inference via Discrete Diffusion Forcing
por: Wang, Xu, et al.
Publicado: (2025)
por: Wang, Xu, et al.
Publicado: (2025)
Efficient Regression-Based Training of Normalizing Flows for Boltzmann Generators
por: Rehman, Danyal, et al.
Publicado: (2025)
por: Rehman, Danyal, et al.
Publicado: (2025)
Exploring Diffusion Models' Corruption Stage in Few-Shot Fine-tuning and Mitigating with Bayesian Neural Networks
por: Wu, Xiaoyu, et al.
Publicado: (2024)
por: Wu, Xiaoyu, et al.
Publicado: (2024)
ReFusion: A Diffusion Large Language Model with Parallel Autoregressive Decoding
por: Li, Jia-Nan, et al.
Publicado: (2025)
por: Li, Jia-Nan, et al.
Publicado: (2025)
Amortized Sampling with Transferable Normalizing Flows
por: Tan, Charlie B., et al.
Publicado: (2025)
por: Tan, Charlie B., et al.
Publicado: (2025)
Knowledge Graph Embedding by Normalizing Flows
por: Xiao, Changyi, et al.
Publicado: (2024)
por: Xiao, Changyi, et al.
Publicado: (2024)
Personalized Federated Learning via Learning Dynamic Graphs
por: Zhou, Ziran, et al.
Publicado: (2025)
por: Zhou, Ziran, et al.
Publicado: (2025)
Annealed Relaxation of Speculative Decoding for Faster Autoregressive Image Generation
por: Li, Xingyao, et al.
Publicado: (2026)
por: Li, Xingyao, et al.
Publicado: (2026)
FlowPG: Action-constrained Policy Gradient with Normalizing Flows
por: Brahmanage, Janaka Chathuranga, et al.
Publicado: (2024)
por: Brahmanage, Janaka Chathuranga, et al.
Publicado: (2024)
Ejemplares similares
-
On Variance Reduction in Learning Mean Flows
por: Lu, Juanwu, et al.
Publicado: (2026) -
Analytical Correction for Subsampling Bias in Drifting Models
por: Zhang, Jiaru, et al.
Publicado: (2026) -
One-Step Diffusion Samplers via Self-Distillation and Deterministic Flow
por: Jutras-Dube, Pascal, et al.
Publicado: (2025) -
Latent Bayesian Optimization via Autoregressive Normalizing Flows
por: Lee, Seunghun, et al.
Publicado: (2025) -
Leveraging Model Guidance to Extract Training Data from Personalized Diffusion Models
por: Wu, Xiaoyu, et al.
Publicado: (2024)