AsyncSpade: Efficient Test-Time Scaling with Asynchronous Sparse Decoding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Luo, Shuqing, Guan, Yilin, Li, Pingzhi, Wang, Hanrui, Chen, Tianlong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Hexa-MoE: Efficient and Heterogeneous-aware Training for Mixture-of-Experts
par: Luo, Shuqing, et autres
Publié: (2024)
par: Luo, Shuqing, et autres
Publié: (2024)
AsyncTLS: Efficient Generative LLM Inference with Asynchronous Two-level Sparse Attention
par: Hu, Yuxuan, et autres
Publié: (2026)
par: Hu, Yuxuan, et autres
Publié: (2026)
AsyncSwitch: Asynchronous Text-Speech Adaptation for Code-Switched ASR
par: Nguyen, Tuan, et autres
Publié: (2025)
par: Nguyen, Tuan, et autres
Publié: (2025)
Occult: Optimizing Collaborative Communication across Experts for Accelerated Parallel MoE Training and Inference
par: Luo, Shuqing, et autres
Publié: (2025)
par: Luo, Shuqing, et autres
Publié: (2025)
ATTS: Asynchronous Test-Time Scaling via Conformal Prediction
par: Xiong, Jing, et autres
Publié: (2025)
par: Xiong, Jing, et autres
Publié: (2025)
ORAL: Prompting Your Large-Scale LoRAs via Conditional Recurrent Diffusion
par: Khan, Rana Muhammad Shahroz, et autres
Publié: (2025)
par: Khan, Rana Muhammad Shahroz, et autres
Publié: (2025)
Scaling Up, Speeding Up: A Benchmark of Speculative Decoding for Efficient LLM Test-Time Scaling
par: Sun, Shengyin, et autres
Publié: (2025)
par: Sun, Shengyin, et autres
Publié: (2025)
SpAtten: Efficient Sparse Attention Architecture with Cascade Token and Head Pruning
par: Wang, Hanrui, et autres
Publié: (2020)
par: Wang, Hanrui, et autres
Publié: (2020)
AsyncSparse: Accelerating Sparse Matrix-Matrix Multiplication on Asynchronous GPU Architectures
par: Liu, Jie, et autres
Publié: (2026)
par: Liu, Jie, et autres
Publié: (2026)
Can GRPO Help LLMs Transcend Their Pretraining Origin?
par: Ni, Kangqi, et autres
Publié: (2025)
par: Ni, Kangqi, et autres
Publié: (2025)
QuantMoE-Bench: Examining Post-Training Quantization for Mixture-of-Experts
par: Li, Pingzhi, et autres
Publié: (2024)
par: Li, Pingzhi, et autres
Publié: (2024)
Sampling-Efficient Test-Time Scaling: Self-Estimating the Best-of-N Sampling in Early Decoding
par: Wang, Yiming, et autres
Publié: (2025)
par: Wang, Yiming, et autres
Publié: (2025)
Advancing MoE Efficiency: A Collaboration-Constrained Routing (C2R) Strategy for Better Expert Parallelism Design
par: Zhang, Mohan, et autres
Publié: (2025)
par: Zhang, Mohan, et autres
Publié: (2025)
Parallel Loop Transformer for Efficient Test-Time Computation Scaling
par: Wu, Bohong, et autres
Publié: (2025)
par: Wu, Bohong, et autres
Publié: (2025)
Q-Newton: Hybrid Quantum-Classical Scheduling for Accelerating Neural Network Training with Newton's Gradient Descent
par: Li, Pingzhi, et autres
Publié: (2024)
par: Li, Pingzhi, et autres
Publié: (2024)
Merge, Then Compress: Demystify Efficient SMoE with Hints from Its Routing Policy
par: Li, Pingzhi, et autres
Publié: (2023)
par: Li, Pingzhi, et autres
Publié: (2023)
AdaFuse: Adaptive Ensemble Decoding with Test-Time Scaling for LLMs
par: Cui, Chengming, et autres
Publié: (2026)
par: Cui, Chengming, et autres
Publié: (2026)
DOGe: Defensive Output Generation for LLM Protection Against Knowledge Distillation
par: Li, Pingzhi, et autres
Publié: (2025)
par: Li, Pingzhi, et autres
Publié: (2025)
AsyncDiff: Parallelizing Diffusion Models by Asynchronous Denoising
par: Chen, Zigeng, et autres
Publié: (2024)
par: Chen, Zigeng, et autres
Publié: (2024)
Learning to Keep a Promise: Scaling Language Model Decoding Parallelism with Learned Asynchronous Decoding
par: Jin, Tian, et autres
Publié: (2025)
par: Jin, Tian, et autres
Publié: (2025)
Optimal Aggregation of LLM and PRM Signals for Efficient Test-Time Scaling
par: Kuang, Peng, et autres
Publié: (2025)
par: Kuang, Peng, et autres
Publié: (2025)
Efficient Many-Shot In-Context Learning with Dynamic Block-Sparse Attention
par: Xiao, Emily, et autres
Publié: (2025)
par: Xiao, Emily, et autres
Publié: (2025)
TEAM: Temporal-Spatial Consistency Guided Expert Activation for MoE Diffusion Language Model Acceleration
par: Wei, Linye, et autres
Publié: (2026)
par: Wei, Linye, et autres
Publié: (2026)
An Empirical Study of Multi-Generation Sampling for Jailbreak Detection in Large Language Models
par: Luo, Hanrui, et autres
Publié: (2026)
par: Luo, Hanrui, et autres
Publié: (2026)
Glider: Global and Local Instruction-Driven Expert Router
par: Li, Pingzhi, et autres
Publié: (2024)
par: Li, Pingzhi, et autres
Publié: (2024)
MatryoshkaThinking: Recursive Test-Time Scaling Enables Efficient Reasoning
par: Chen, Hongwei, et autres
Publié: (2025)
par: Chen, Hongwei, et autres
Publié: (2025)
Iterative Deepening Sampling as Efficient Test-Time Scaling
par: Chen, Weizhe, et autres
Publié: (2025)
par: Chen, Weizhe, et autres
Publié: (2025)
Arch: An AI-Native Hardware Description Language for Register-Transfer Clocked Hardware Design
par: Zhao, Shuqing
Publié: (2026)
par: Zhao, Shuqing
Publié: (2026)
Why Diffusion Language Models Struggle with Truly Parallel (Non-Autoregressive) Decoding?
par: Li, Pengxiang, et autres
Publié: (2026)
par: Li, Pengxiang, et autres
Publié: (2026)
$\texttt{MoE-RBench}$: Towards Building Reliable Language Models with Sparse Mixture-of-Experts
par: Chen, Guanjie, et autres
Publié: (2024)
par: Chen, Guanjie, et autres
Publié: (2024)
Divide and Conquer: Accelerating Diffusion-Based Large Language Models via Adaptive Parallel Decoding
par: Luo, Xiangzhong, et autres
Publié: (2026)
par: Luo, Xiangzhong, et autres
Publié: (2026)
Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions
par: Tang, Bangsheng, et autres
Publié: (2025)
par: Tang, Bangsheng, et autres
Publié: (2025)
Accelerate Speculative Decoding with Sparse Computation in Verification
par: Wang, Jikai, et autres
Publié: (2025)
par: Wang, Jikai, et autres
Publié: (2025)
Reward-Shifted Speculative Sampling Is An Efficient Test-Time Weak-to-Strong Aligner
par: Li, Bolian, et autres
Publié: (2025)
par: Li, Bolian, et autres
Publié: (2025)
Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence
par: Ghasemabadi, Amirhosein, et autres
Publié: (2025)
par: Ghasemabadi, Amirhosein, et autres
Publié: (2025)
MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention
par: MiniMax, et autres
Publié: (2025)
par: MiniMax, et autres
Publié: (2025)
Efficient Sparse Attention needs Adaptive Token Release
par: Zhang, Chaoran, et autres
Publié: (2024)
par: Zhang, Chaoran, et autres
Publié: (2024)
AsyncMDE: Real-Time Monocular Depth Estimation via Asynchronous Spatial Memory
par: Ma, Lianjie, et autres
Publié: (2026)
par: Ma, Lianjie, et autres
Publié: (2026)
Cascade Reward Sampling for Efficient Decoding-Time Alignment
par: Li, Bolian, et autres
Publié: (2024)
par: Li, Bolian, et autres
Publié: (2024)
Timely Machine: Awareness of Time Makes Test-Time Scaling Agentic
par: Ma, Yichuan, et autres
Publié: (2026)
par: Ma, Yichuan, et autres
Publié: (2026)
Documents similaires
-
Hexa-MoE: Efficient and Heterogeneous-aware Training for Mixture-of-Experts
par: Luo, Shuqing, et autres
Publié: (2024) -
AsyncTLS: Efficient Generative LLM Inference with Asynchronous Two-level Sparse Attention
par: Hu, Yuxuan, et autres
Publié: (2026) -
AsyncSwitch: Asynchronous Text-Speech Adaptation for Code-Switched ASR
par: Nguyen, Tuan, et autres
Publié: (2025) -
Occult: Optimizing Collaborative Communication across Experts for Accelerated Parallel MoE Training and Inference
par: Luo, Shuqing, et autres
Publié: (2025) -
ATTS: Asynchronous Test-Time Scaling via Conformal Prediction
par: Xiong, Jing, et autres
Publié: (2025)