Gespeichert in:
| Hauptverfasser: | Chang, Chi-Chih, Zhu, Siqi, Zeng, Zhichen, Lin, Haibin, You, Jiaxuan, Abdelfattah, Mohamed S., Jiang, Ziheng, Qian, Xuehai |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | https://arxiv.org/abs/2601.09083 |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Speculate Deep and Accurate: Lossless and Training-Free Acceleration for Offloaded LLMs via Substitute Speculative Decoding
von: Wang, Pei-Shuo, et al.
Veröffentlicht: (2025)
von: Wang, Pei-Shuo, et al.
Veröffentlicht: (2025)
DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism
von: Zeng, Zhichen, et al.
Veröffentlicht: (2026)
von: Zeng, Zhichen, et al.
Veröffentlicht: (2026)
SPEC-RL: Accelerating On-Policy Reinforcement Learning with Speculative Rollouts
von: Liu, Bingshuai, et al.
Veröffentlicht: (2025)
von: Liu, Bingshuai, et al.
Veröffentlicht: (2025)
OpenTinker: Separating Concerns in Agentic Reinforcement Learning
von: Zhu, Siqi, et al.
Veröffentlicht: (2026)
von: Zhu, Siqi, et al.
Veröffentlicht: (2026)
Accelerating Large-Scale Reasoning Model Inference with Sparse Self-Speculative Decoding
von: Zhao, Yilong, et al.
Veröffentlicht: (2025)
von: Zhao, Yilong, et al.
Veröffentlicht: (2025)
Mesh-Attention: A New Communication-Efficient Distributed Attention with Improved Data Locality
von: Chen, Sirui, et al.
Veröffentlicht: (2025)
von: Chen, Sirui, et al.
Veröffentlicht: (2025)
xKV: Cross-Layer KV-Cache Compression via Aligned Singular Vector Extraction
von: Chang, Chi-Chih, et al.
Veröffentlicht: (2025)
von: Chang, Chi-Chih, et al.
Veröffentlicht: (2025)
Palu: Compressing KV-Cache with Low-Rank Projection
von: Chang, Chi-Chih, et al.
Veröffentlicht: (2024)
von: Chang, Chi-Chih, et al.
Veröffentlicht: (2024)
Accelerating RL Post-Training Rollouts via System-Integrated Speculative Decoding
von: Iso, Hayate, et al.
Veröffentlicht: (2026)
von: Iso, Hayate, et al.
Veröffentlicht: (2026)
EVCAR-KG: A Knowledge-Infused Multi-Agent Reinforcement Learning Framework for Resilient Electric Vehicle Charging Network Recovery
von: Abdelfattah, Mohamed
Veröffentlicht: (2025)
von: Abdelfattah, Mohamed
Veröffentlicht: (2025)
SwiftSpec: Ultra-Low Latency LLM Decoding by Scaling Asynchronous Speculative Decoding
von: Zhang, Ziyi, et al.
Veröffentlicht: (2025)
von: Zhang, Ziyi, et al.
Veröffentlicht: (2025)
SpeCa: Accelerating Diffusion Transformers with Speculative Feature Caching
von: Liu, Jiacheng, et al.
Veröffentlicht: (2025)
von: Liu, Jiacheng, et al.
Veröffentlicht: (2025)
FlashDLM: Accelerating Diffusion Language Model Inference via Efficient KV Caching and Guided Diffusion
von: Hu, Zhanqiu, et al.
Veröffentlicht: (2025)
von: Hu, Zhanqiu, et al.
Veröffentlicht: (2025)
GreedySnake: Accelerating SSD-Offloaded LLM Training with Efficient Scheduling and Optimizer Step Overlapping
von: Yin, Yishu, et al.
Veröffentlicht: (2025)
von: Yin, Yishu, et al.
Veröffentlicht: (2025)
Faster LLM Inference via Sequential Monte Carlo
von: Emara, Yahya, et al.
Veröffentlicht: (2026)
von: Emara, Yahya, et al.
Veröffentlicht: (2026)
DARE: Diffusion Language Model Activation Reuse for Efficient Inference
von: Frumkin, Natalia, et al.
Veröffentlicht: (2026)
von: Frumkin, Natalia, et al.
Veröffentlicht: (2026)
ProCache: Constraint-Aware Feature Caching with Selective Computation for Diffusion Transformer Acceleration
von: Cao, Fanpu, et al.
Veröffentlicht: (2025)
von: Cao, Fanpu, et al.
Veröffentlicht: (2025)
Cacheback: Speculative Decoding With Nothing But Cache
von: Ma, Zhiyao, et al.
Veröffentlicht: (2025)
von: Ma, Zhiyao, et al.
Veröffentlicht: (2025)
Conservative Discrete Structure Stabilizes Autoregressive Rollouts in a 1D Drift Diffusion Poisson Benchmark
von: Wang, Yufeng, et al.
Veröffentlicht: (2026)
von: Wang, Yufeng, et al.
Veröffentlicht: (2026)
Quamba2: A Robust and Scalable Post-training Quantization Framework for Selective State Space Models
von: Chiang, Hung-Yueh, et al.
Veröffentlicht: (2025)
von: Chiang, Hung-Yueh, et al.
Veröffentlicht: (2025)
SplitReason: Learning To Offload Reasoning
von: Akhauri, Yash, et al.
Veröffentlicht: (2025)
von: Akhauri, Yash, et al.
Veröffentlicht: (2025)
BubbleSpec: Turning Long-Tail Bubbles into Speculative Rollout Drafts for Synchronous Reinforcement Learning
von: Xu, Yuhang, et al.
Veröffentlicht: (2026)
von: Xu, Yuhang, et al.
Veröffentlicht: (2026)
Accelerating Diffusion Transformer via Error-Optimized Cache
von: Qiu, Junxiang, et al.
Veröffentlicht: (2025)
von: Qiu, Junxiang, et al.
Veröffentlicht: (2025)
SparAMX: Accelerating Compressed LLMs Token Generation on AMX-powered CPUs
von: AbouElhamayed, Ahmed F., et al.
Veröffentlicht: (2025)
von: AbouElhamayed, Ahmed F., et al.
Veröffentlicht: (2025)
Minions: Accelerating Large Language Model Inference with Aggregated Speculative Execution
von: Wang, Siqi, et al.
Veröffentlicht: (2024)
von: Wang, Siqi, et al.
Veröffentlicht: (2024)
IndexCache: Accelerating Sparse Attention via Cross-Layer Index Reuse
von: Bai, Yushi, et al.
Veröffentlicht: (2026)
von: Bai, Yushi, et al.
Veröffentlicht: (2026)
GTAlign: Game-Theoretic Alignment of LLM Assistants for Social Welfare
von: Zhu, Siqi, et al.
Veröffentlicht: (2025)
von: Zhu, Siqi, et al.
Veröffentlicht: (2025)
Window-Diffusion: Accelerating Diffusion Language Model Inference with Windowed Token Pruning and Caching
von: Zuo, Fengrui, et al.
Veröffentlicht: (2026)
von: Zuo, Fengrui, et al.
Veröffentlicht: (2026)
UniQL: Unified Quantization and Low-rank Compression for Adaptive Edge LLMs
von: Chiang, Hung-Yueh, et al.
Veröffentlicht: (2025)
von: Chiang, Hung-Yueh, et al.
Veröffentlicht: (2025)
TokenButler: Token Importance is Predictable
von: Akhauri, Yash, et al.
Veröffentlicht: (2025)
von: Akhauri, Yash, et al.
Veröffentlicht: (2025)
Probing the Knowledge Boundary: An Interactive Agentic Framework for Deep Knowledge Extraction
von: Yang, Yuheng, et al.
Veröffentlicht: (2026)
von: Yang, Yuheng, et al.
Veröffentlicht: (2026)
Router-R1: Teaching LLMs Multi-Round Routing and Aggregation via Reinforcement Learning
von: Zhang, Haozhen, et al.
Veröffentlicht: (2025)
von: Zhang, Haozhen, et al.
Veröffentlicht: (2025)
BBS: Bi-directional Bit-level Sparsity for Deep Learning Acceleration
von: Chen, Yuzong, et al.
Veröffentlicht: (2024)
von: Chen, Yuzong, et al.
Veröffentlicht: (2024)
Compute Where it Counts: Self Optimizing Language Models
von: Akhauri, Yash, et al.
Veröffentlicht: (2026)
von: Akhauri, Yash, et al.
Veröffentlicht: (2026)
NITRO: LLM Inference on Intel Laptop NPUs
von: Fei, Anthony, et al.
Veröffentlicht: (2024)
von: Fei, Anthony, et al.
Veröffentlicht: (2024)
Encodings for Prediction-based Neural Architecture Search
von: Akhauri, Yash, et al.
Veröffentlicht: (2024)
von: Akhauri, Yash, et al.
Veröffentlicht: (2024)
On Latency Predictors for Neural Architecture Search
von: Akhauri, Yash, et al.
Veröffentlicht: (2024)
von: Akhauri, Yash, et al.
Veröffentlicht: (2024)
Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning
von: Xu, Yixuan Even, et al.
Veröffentlicht: (2025)
von: Xu, Yixuan Even, et al.
Veröffentlicht: (2025)
EchoRL: Reinforcement Learning via Rollout Echoing
von: Bi, Jinhe, et al.
Veröffentlicht: (2026)
von: Bi, Jinhe, et al.
Veröffentlicht: (2026)
CuSearch: Curriculum Rollout Sampling via Search Depth for Agentic RAG
von: Shen, Jianghan, et al.
Veröffentlicht: (2026)
von: Shen, Jianghan, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Speculate Deep and Accurate: Lossless and Training-Free Acceleration for Offloaded LLMs via Substitute Speculative Decoding
von: Wang, Pei-Shuo, et al.
Veröffentlicht: (2025) -
DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism
von: Zeng, Zhichen, et al.
Veröffentlicht: (2026) -
SPEC-RL: Accelerating On-Policy Reinforcement Learning with Speculative Rollouts
von: Liu, Bingshuai, et al.
Veröffentlicht: (2025) -
OpenTinker: Separating Concerns in Agentic Reinforcement Learning
von: Zhu, Siqi, et al.
Veröffentlicht: (2026) -
Accelerating Large-Scale Reasoning Model Inference with Sparse Self-Speculative Decoding
von: Zhao, Yilong, et al.
Veröffentlicht: (2025)