Guardado en:
| Autores principales: | Chang, Chi-Chih, Zhu, Siqi, Zeng, Zhichen, Lin, Haibin, You, Jiaxuan, Abdelfattah, Mohamed S., Jiang, Ziheng, Qian, Xuehai |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2601.09083 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Speculate Deep and Accurate: Lossless and Training-Free Acceleration for Offloaded LLMs via Substitute Speculative Decoding
por: Wang, Pei-Shuo, et al.
Publicado: (2025)
por: Wang, Pei-Shuo, et al.
Publicado: (2025)
DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism
por: Zeng, Zhichen, et al.
Publicado: (2026)
por: Zeng, Zhichen, et al.
Publicado: (2026)
SPEC-RL: Accelerating On-Policy Reinforcement Learning with Speculative Rollouts
por: Liu, Bingshuai, et al.
Publicado: (2025)
por: Liu, Bingshuai, et al.
Publicado: (2025)
OpenTinker: Separating Concerns in Agentic Reinforcement Learning
por: Zhu, Siqi, et al.
Publicado: (2026)
por: Zhu, Siqi, et al.
Publicado: (2026)
Accelerating Large-Scale Reasoning Model Inference with Sparse Self-Speculative Decoding
por: Zhao, Yilong, et al.
Publicado: (2025)
por: Zhao, Yilong, et al.
Publicado: (2025)
Mesh-Attention: A New Communication-Efficient Distributed Attention with Improved Data Locality
por: Chen, Sirui, et al.
Publicado: (2025)
por: Chen, Sirui, et al.
Publicado: (2025)
xKV: Cross-Layer KV-Cache Compression via Aligned Singular Vector Extraction
por: Chang, Chi-Chih, et al.
Publicado: (2025)
por: Chang, Chi-Chih, et al.
Publicado: (2025)
Palu: Compressing KV-Cache with Low-Rank Projection
por: Chang, Chi-Chih, et al.
Publicado: (2024)
por: Chang, Chi-Chih, et al.
Publicado: (2024)
Accelerating RL Post-Training Rollouts via System-Integrated Speculative Decoding
por: Iso, Hayate, et al.
Publicado: (2026)
por: Iso, Hayate, et al.
Publicado: (2026)
EVCAR-KG: A Knowledge-Infused Multi-Agent Reinforcement Learning Framework for Resilient Electric Vehicle Charging Network Recovery
por: Abdelfattah, Mohamed
Publicado: (2025)
por: Abdelfattah, Mohamed
Publicado: (2025)
SwiftSpec: Ultra-Low Latency LLM Decoding by Scaling Asynchronous Speculative Decoding
por: Zhang, Ziyi, et al.
Publicado: (2025)
por: Zhang, Ziyi, et al.
Publicado: (2025)
SpeCa: Accelerating Diffusion Transformers with Speculative Feature Caching
por: Liu, Jiacheng, et al.
Publicado: (2025)
por: Liu, Jiacheng, et al.
Publicado: (2025)
FlashDLM: Accelerating Diffusion Language Model Inference via Efficient KV Caching and Guided Diffusion
por: Hu, Zhanqiu, et al.
Publicado: (2025)
por: Hu, Zhanqiu, et al.
Publicado: (2025)
GreedySnake: Accelerating SSD-Offloaded LLM Training with Efficient Scheduling and Optimizer Step Overlapping
por: Yin, Yishu, et al.
Publicado: (2025)
por: Yin, Yishu, et al.
Publicado: (2025)
Faster LLM Inference via Sequential Monte Carlo
por: Emara, Yahya, et al.
Publicado: (2026)
por: Emara, Yahya, et al.
Publicado: (2026)
DARE: Diffusion Language Model Activation Reuse for Efficient Inference
por: Frumkin, Natalia, et al.
Publicado: (2026)
por: Frumkin, Natalia, et al.
Publicado: (2026)
ProCache: Constraint-Aware Feature Caching with Selective Computation for Diffusion Transformer Acceleration
por: Cao, Fanpu, et al.
Publicado: (2025)
por: Cao, Fanpu, et al.
Publicado: (2025)
Cacheback: Speculative Decoding With Nothing But Cache
por: Ma, Zhiyao, et al.
Publicado: (2025)
por: Ma, Zhiyao, et al.
Publicado: (2025)
Conservative Discrete Structure Stabilizes Autoregressive Rollouts in a 1D Drift Diffusion Poisson Benchmark
por: Wang, Yufeng, et al.
Publicado: (2026)
por: Wang, Yufeng, et al.
Publicado: (2026)
Quamba2: A Robust and Scalable Post-training Quantization Framework for Selective State Space Models
por: Chiang, Hung-Yueh, et al.
Publicado: (2025)
por: Chiang, Hung-Yueh, et al.
Publicado: (2025)
SplitReason: Learning To Offload Reasoning
por: Akhauri, Yash, et al.
Publicado: (2025)
por: Akhauri, Yash, et al.
Publicado: (2025)
BubbleSpec: Turning Long-Tail Bubbles into Speculative Rollout Drafts for Synchronous Reinforcement Learning
por: Xu, Yuhang, et al.
Publicado: (2026)
por: Xu, Yuhang, et al.
Publicado: (2026)
Accelerating Diffusion Transformer via Error-Optimized Cache
por: Qiu, Junxiang, et al.
Publicado: (2025)
por: Qiu, Junxiang, et al.
Publicado: (2025)
SparAMX: Accelerating Compressed LLMs Token Generation on AMX-powered CPUs
por: AbouElhamayed, Ahmed F., et al.
Publicado: (2025)
por: AbouElhamayed, Ahmed F., et al.
Publicado: (2025)
Minions: Accelerating Large Language Model Inference with Aggregated Speculative Execution
por: Wang, Siqi, et al.
Publicado: (2024)
por: Wang, Siqi, et al.
Publicado: (2024)
IndexCache: Accelerating Sparse Attention via Cross-Layer Index Reuse
por: Bai, Yushi, et al.
Publicado: (2026)
por: Bai, Yushi, et al.
Publicado: (2026)
GTAlign: Game-Theoretic Alignment of LLM Assistants for Social Welfare
por: Zhu, Siqi, et al.
Publicado: (2025)
por: Zhu, Siqi, et al.
Publicado: (2025)
Window-Diffusion: Accelerating Diffusion Language Model Inference with Windowed Token Pruning and Caching
por: Zuo, Fengrui, et al.
Publicado: (2026)
por: Zuo, Fengrui, et al.
Publicado: (2026)
UniQL: Unified Quantization and Low-rank Compression for Adaptive Edge LLMs
por: Chiang, Hung-Yueh, et al.
Publicado: (2025)
por: Chiang, Hung-Yueh, et al.
Publicado: (2025)
TokenButler: Token Importance is Predictable
por: Akhauri, Yash, et al.
Publicado: (2025)
por: Akhauri, Yash, et al.
Publicado: (2025)
Probing the Knowledge Boundary: An Interactive Agentic Framework for Deep Knowledge Extraction
por: Yang, Yuheng, et al.
Publicado: (2026)
por: Yang, Yuheng, et al.
Publicado: (2026)
Router-R1: Teaching LLMs Multi-Round Routing and Aggregation via Reinforcement Learning
por: Zhang, Haozhen, et al.
Publicado: (2025)
por: Zhang, Haozhen, et al.
Publicado: (2025)
BBS: Bi-directional Bit-level Sparsity for Deep Learning Acceleration
por: Chen, Yuzong, et al.
Publicado: (2024)
por: Chen, Yuzong, et al.
Publicado: (2024)
Compute Where it Counts: Self Optimizing Language Models
por: Akhauri, Yash, et al.
Publicado: (2026)
por: Akhauri, Yash, et al.
Publicado: (2026)
NITRO: LLM Inference on Intel Laptop NPUs
por: Fei, Anthony, et al.
Publicado: (2024)
por: Fei, Anthony, et al.
Publicado: (2024)
Encodings for Prediction-based Neural Architecture Search
por: Akhauri, Yash, et al.
Publicado: (2024)
por: Akhauri, Yash, et al.
Publicado: (2024)
On Latency Predictors for Neural Architecture Search
por: Akhauri, Yash, et al.
Publicado: (2024)
por: Akhauri, Yash, et al.
Publicado: (2024)
Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning
por: Xu, Yixuan Even, et al.
Publicado: (2025)
por: Xu, Yixuan Even, et al.
Publicado: (2025)
EchoRL: Reinforcement Learning via Rollout Echoing
por: Bi, Jinhe, et al.
Publicado: (2026)
por: Bi, Jinhe, et al.
Publicado: (2026)
CuSearch: Curriculum Rollout Sampling via Search Depth for Agentic RAG
por: Shen, Jianghan, et al.
Publicado: (2026)
por: Shen, Jianghan, et al.
Publicado: (2026)
Ejemplares similares
-
Speculate Deep and Accurate: Lossless and Training-Free Acceleration for Offloaded LLMs via Substitute Speculative Decoding
por: Wang, Pei-Shuo, et al.
Publicado: (2025) -
DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism
por: Zeng, Zhichen, et al.
Publicado: (2026) -
SPEC-RL: Accelerating On-Policy Reinforcement Learning with Speculative Rollouts
por: Liu, Bingshuai, et al.
Publicado: (2025) -
OpenTinker: Separating Concerns in Agentic Reinforcement Learning
por: Zhu, Siqi, et al.
Publicado: (2026) -
Accelerating Large-Scale Reasoning Model Inference with Sparse Self-Speculative Decoding
por: Zhao, Yilong, et al.
Publicado: (2025)