Mosaic: Unlocking Long-Context Inference for Diffusion LLMs via Global Memory Planning and Dynamic Peak Taming
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zheng, Liang, Shi, Bowen, Hu, Yitao, Zhang, Jiawei, Li, Ruofan, Chen, Sheng, Li, Wenxin, Li, Keqiu |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Harpagon: Minimizing DNN Serving Cost via Efficient Dispatching, Scheduling and Splitting
par: Zhao, Zhixin, et autres
Publié: (2024)
par: Zhao, Zhixin, et autres
Publié: (2024)
PAT: Accelerating LLM Decoding via Prefix-Aware Attention with Resource Efficient Multi-Tile Kernel
par: Yi, Jinjun, et autres
Publié: (2025)
par: Yi, Jinjun, et autres
Publié: (2025)
LongLLaDA: Unlocking Long Context Capabilities in Diffusion LLMs
par: Liu, Xiaoran, et autres
Publié: (2025)
par: Liu, Xiaoran, et autres
Publié: (2025)
Taming Wild Knots with Mosaics
par: Deng, Mary Y., et autres
Publié: (2026)
par: Deng, Mary Y., et autres
Publié: (2026)
RAGPulse: An Open-Source RAG Workload Trace to Optimize RAG Serving Systems
par: Wang, Zhengchao, et autres
Publié: (2025)
par: Wang, Zhengchao, et autres
Publié: (2025)
UT-ACA: Uncertainty-Triggered Adaptive Context Allocation for Long-Context Inference
par: Zhou, Lang, et autres
Publié: (2026)
par: Zhou, Lang, et autres
Publié: (2026)
Long-Context LLMs Meet RAG: Overcoming Challenges for Long Inputs in RAG
par: Jin, Bowen, et autres
Publié: (2024)
par: Jin, Bowen, et autres
Publié: (2024)
Training-Inference Consistent Segmented Execution for Long-Context LLMs
par: Shang, Xianpeng, et autres
Publié: (2026)
par: Shang, Xianpeng, et autres
Publié: (2026)
Optimizing LLM Inference Throughput via Memory-aware and SLA-constrained Dynamic Batching
par: Pang, Bowen, et autres
Publié: (2025)
par: Pang, Bowen, et autres
Publié: (2025)
Taming Stable Diffusion for Computed Tomography Blind Super-Resolution
par: Li, Chunlei, et autres
Publié: (2025)
par: Li, Chunlei, et autres
Publié: (2025)
Long-Context Speech Synthesis with Context-Aware Memory
par: Li, Zhipeng, et autres
Publié: (2025)
par: Li, Zhipeng, et autres
Publié: (2025)
XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference
par: Li, Weizhuo, et autres
Publié: (2024)
par: Li, Weizhuo, et autres
Publié: (2024)
LongRM: Revealing and Unlocking the Context Boundary of Reward Modeling
par: Tang, Zecheng, et autres
Publié: (2025)
par: Tang, Zecheng, et autres
Publié: (2025)
Memory Mosaics
par: Zhang, Jianyu, et autres
Publié: (2024)
par: Zhang, Jianyu, et autres
Publié: (2024)
RAT: Retrieval Augmented Thoughts Elicit Context-Aware Reasoning in Long-Horizon Generation
par: Wang, Zihao, et autres
Publié: (2024)
par: Wang, Zihao, et autres
Publié: (2024)
A multi‐dimensional incentive mechanism based on age of update in hierarchical federated learning
par: Zhaohua Zheng, et autres
Publié: (2024)
par: Zhaohua Zheng, et autres
Publié: (2024)
Taming the Memory Footprint Crisis: System Design for Production Diffusion LLM Serving
par: Fan, Jiakun, et autres
Publié: (2025)
par: Fan, Jiakun, et autres
Publié: (2025)
Are Large Language Models In-Context Graph Learners?
par: Li, Jintang, et autres
Publié: (2025)
par: Li, Jintang, et autres
Publié: (2025)
ServerlessLoRA: Minimizing Latency and Cost in Serverless Inference for LoRA-Based LLMs
par: Sui, Yifan, et autres
Publié: (2025)
par: Sui, Yifan, et autres
Publié: (2025)
LLMs Know What to Drop: Self-Attention Guided KV Cache Eviction for Efficient Long-Context Inference
par: Wang, Guangtao, et autres
Publié: (2025)
par: Wang, Guangtao, et autres
Publié: (2025)
Dynamic Long Context Reasoning over Compressed Memory via End-to-End Reinforcement Learning
par: Chen, Zhuoen, et autres
Publié: (2026)
par: Chen, Zhuoen, et autres
Publié: (2026)
Diagonal Batching Unlocks Parallelism in Recurrent Memory Transformers for Long Contexts
par: Sivtsov, Danil, et autres
Publié: (2025)
par: Sivtsov, Danil, et autres
Publié: (2025)
HyperMem: Hypergraph Memory for Long-Term Conversations
par: Yue, Juwei, et autres
Publié: (2026)
par: Yue, Juwei, et autres
Publié: (2026)
Lookahead Path Likelihood Optimization for Diffusion LLMs
par: Liu, Xuejie, et autres
Publié: (2026)
par: Liu, Xuejie, et autres
Publié: (2026)
QwenLong-CPRS: Towards $\infty$-LLMs with Dynamic Context Optimization
par: Shen, Weizhou, et autres
Publié: (2025)
par: Shen, Weizhou, et autres
Publié: (2025)
Memory Mosaics at scale
par: Zhang, Jianyu, et autres
Publié: (2025)
par: Zhang, Jianyu, et autres
Publié: (2025)
Efficient Long-Context LLM Inference via KV Cache Clustering
par: Hu, Jie, et autres
Publié: (2025)
par: Hu, Jie, et autres
Publié: (2025)
Query-focused and Memory-aware Reranker for Long Context Processing
par: Li, Yuqing, et autres
Publié: (2026)
par: Li, Yuqing, et autres
Publié: (2026)
Mitigating Context-Memory Conflicts in LLMs through Dynamic Cognitive Reconciliation Decoding
par: Zhou, Yigeng, et autres
Publié: (2026)
par: Zhou, Yigeng, et autres
Publié: (2026)
DiT4SR: Taming Diffusion Transformer for Real-World Image Super-Resolution
par: Duan, Zheng-Peng, et autres
Publié: (2025)
par: Duan, Zheng-Peng, et autres
Publié: (2025)
Linear recurrence sequences and palindromic concatenations of two repdigits in base $β$
par: Li, Ruofan
Publié: (2026)
par: Li, Ruofan
Publié: (2026)
Dynamic Vocabulary Pruning: Stable LLM-RL by Taming the Tail
par: Li, Yingru, et autres
Publié: (2025)
par: Li, Yingru, et autres
Publié: (2025)
Activation-aware Probe-Query: Effective Key-Value Retrieval for Long-Context LLMs Inference
par: Xiao, Qingfa, et autres
Publié: (2025)
par: Xiao, Qingfa, et autres
Publié: (2025)
Chameleon: Taming Dynamic Operator Sequences for Memory-Intensive LLM Training
par: Wang, Zibo, et autres
Publié: (2025)
par: Wang, Zibo, et autres
Publié: (2025)
MiA-Signature: Approximating Global Activation for Long-Context Understanding
par: Li, Yuqing, et autres
Publié: (2026)
par: Li, Yuqing, et autres
Publié: (2026)
TalkMosaic: Interactive PhotoMosaic with Multi-modal LLM Q&A Interactions
par: Li, Kevin, et autres
Publié: (2024)
par: Li, Kevin, et autres
Publié: (2024)
DynamicKV: Task-Aware Adaptive KV Cache Compression for Long Context LLMs
par: Zhou, Xiabin, et autres
Publié: (2024)
par: Zhou, Xiabin, et autres
Publié: (2024)
CoDiCast: Conditional Diffusion Model for Global Weather Prediction with Uncertainty Quantification
par: Shi, Jimeng, et autres
Publié: (2024)
par: Shi, Jimeng, et autres
Publié: (2024)
Latent Context Compilation: Distilling Long Context into Compact Portable Memory
par: Li, Zeju, et autres
Publié: (2026)
par: Li, Zeju, et autres
Publié: (2026)
A Little Goes a Long Way: Efficient Long Context Training and Inference with Partial Contexts
par: Ge, Suyu, et autres
Publié: (2024)
par: Ge, Suyu, et autres
Publié: (2024)
Documents similaires
-
Harpagon: Minimizing DNN Serving Cost via Efficient Dispatching, Scheduling and Splitting
par: Zhao, Zhixin, et autres
Publié: (2024) -
PAT: Accelerating LLM Decoding via Prefix-Aware Attention with Resource Efficient Multi-Tile Kernel
par: Yi, Jinjun, et autres
Publié: (2025) -
LongLLaDA: Unlocking Long Context Capabilities in Diffusion LLMs
par: Liu, Xiaoran, et autres
Publié: (2025) -
Taming Wild Knots with Mosaics
par: Deng, Mary Y., et autres
Publié: (2026) -
RAGPulse: An Open-Source RAG Workload Trace to Optimize RAG Serving Systems
par: Wang, Zhengchao, et autres
Publié: (2025)