MemoSight: Unifying Context Compression and Multi Token Prediction for Reasoning Acceleration
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Xinyu, Liu, Xin, Jin, Bo, Zhao, Runsong, Huang, Pengcheng, Ruan, Junhao, Li, Bei, Xiao, Chunyang, Wang, Chenglong, Xiao, Tong, Zhu, Jingbo |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Position IDs Matter: An Enhanced Position Layout for Efficient Context Compression in Large Language Models
par: Zhao, Runsong, et autres
Publié: (2024)
par: Zhao, Runsong, et autres
Publié: (2024)
Autoencoding-Free Context Compression for LLMs via Contextual Semantic Anchors
par: Liu, Xin, et autres
Publié: (2025)
par: Liu, Xin, et autres
Publié: (2025)
Forgetting Curve: A Reliable Method for Evaluating Memorization Capability for Long-context Models
par: Liu, Xinyu, et autres
Publié: (2024)
par: Liu, Xinyu, et autres
Publié: (2024)
NDP: Next Distribution Prediction as a More Broad Target
par: Ruan, Junhao, et autres
Publié: (2024)
par: Ruan, Junhao, et autres
Publié: (2024)
PoC: Performance-oriented Context Compression for Large Language Models via Performance Prediction
par: Zhao, Runsong, et autres
Publié: (2026)
par: Zhao, Runsong, et autres
Publié: (2026)
Translate-and-Revise: Boosting Large Language Models for Constrained Translation
par: Huang, Pengcheng, et autres
Publié: (2024)
par: Huang, Pengcheng, et autres
Publié: (2024)
IIET: Efficient Numerical Transformer via Implicit Iterative Euler Method
par: Liu, Xinyu, et autres
Publié: (2025)
par: Liu, Xinyu, et autres
Publié: (2025)
CoMeT: Collaborative Memory Transformer for Efficient Long Context Modeling
par: Zhao, Runsong, et autres
Publié: (2026)
par: Zhao, Runsong, et autres
Publié: (2026)
MTR-Suite: A Framework for Evaluating and Synthesizing Conversational Retrieval Benchmarks
par: Ruan, Junhao, et autres
Publié: (2026)
par: Ruan, Junhao, et autres
Publié: (2026)
Causal Autoregressive Diffusion Language Model
par: Ruan, Junhao, et autres
Publié: (2026)
par: Ruan, Junhao, et autres
Publié: (2026)
SLAM: Towards Efficient Multilingual Reasoning via Selective Language Alignment
par: Fan, Yuchun, et autres
Publié: (2025)
par: Fan, Yuchun, et autres
Publié: (2025)
MTP-S2UT: Enhancing Speech-to-Speech Translation Quality with Multi-token Prediction
par: Wang, Jianjin, et autres
Publié: (2025)
par: Wang, Jianjin, et autres
Publié: (2025)
Hybrid Alignment Training for Large Language Models
par: Wang, Chenglong, et autres
Publié: (2024)
par: Wang, Chenglong, et autres
Publié: (2024)
MemoBrain: Executive Memory as an Agentic Brain for Reasoning
par: Qian, Hongjin, et autres
Publié: (2026)
par: Qian, Hongjin, et autres
Publié: (2026)
Attention Reveals More Than Tokens: Training-Free Long-Context Reasoning with Attention-guided Retrieval
par: Zhang, Yuwei, et autres
Publié: (2025)
par: Zhang, Yuwei, et autres
Publié: (2025)
CoMemo: LVLMs Need Image Context with Image Memory
par: Liu, Shi, et autres
Publié: (2025)
par: Liu, Shi, et autres
Publié: (2025)
EIT: Enhanced Interactive Transformer
par: Zheng, Tong, et autres
Publié: (2022)
par: Zheng, Tong, et autres
Publié: (2022)
RouteLMT: Learned Sample Routing for Hybrid LLM Translation Deployment
par: Luo, Yingfeng, et autres
Publié: (2026)
par: Luo, Yingfeng, et autres
Publié: (2026)
Unified Spatiotemporal Token Compression for Video-LLMs at Ultra-Low Retention
par: Du, Junhao, et autres
Publié: (2026)
par: Du, Junhao, et autres
Publié: (2026)
Read As Human: Compressing Context via Parallelizable Close Reading and Skimming
par: Tang, Jiwei, et autres
Publié: (2026)
par: Tang, Jiwei, et autres
Publié: (2026)
ArcMemo: Abstract Reasoning Composition with Lifelong LLM Memory
par: Ho, Matthew, et autres
Publié: (2025)
par: Ho, Matthew, et autres
Publié: (2025)
Memo
Publié: (2020)
Publié: (2020)
Foundations of Large Language Models
par: Xiao, Tong, et autres
Publié: (2025)
par: Xiao, Tong, et autres
Publié: (2025)
MRO: Enhancing Reasoning in Diffusion Language Models via Multi-Reward Optimization
par: Wang, Chenglong, et autres
Publié: (2025)
par: Wang, Chenglong, et autres
Publié: (2025)
MemoTime: Memory-Augmented Temporal Knowledge Graph Enhanced Large Language Model Reasoning
par: Tan, Xingyu, et autres
Publié: (2025)
par: Tan, Xingyu, et autres
Publié: (2025)
CM3AE: A Unified RGB Frame and Event-Voxel/-Frame Pre-training Framework
par: Wu, Wentao, et autres
Publié: (2025)
par: Wu, Wentao, et autres
Publié: (2025)
Efficient Prompting Methods for Large Language Models: A Survey
par: Chang, Kaiyan, et autres
Publié: (2024)
par: Chang, Kaiyan, et autres
Publié: (2024)
Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration
par: Zeng, Fanhu, et autres
Publié: (2025)
par: Zeng, Fanhu, et autres
Publié: (2025)
Dissecting Long-Chain-of-Thought Reasoning Models: An Empirical Study
par: Mu, Yongyu, et autres
Publié: (2025)
par: Mu, Yongyu, et autres
Publié: (2025)
APR: Penalizing Structural Redundancy in Large Reasoning Models via Anchor-based Process Rewards
par: Chang, Kaiyan, et autres
Publié: (2026)
par: Chang, Kaiyan, et autres
Publié: (2026)
SUBQRAG: Sub-Question Driven Dynamic Graph RAG
par: Li, Jiaoyang, et autres
Publié: (2025)
par: Li, Jiaoyang, et autres
Publié: (2025)
Storyline Memo
par: Anonymous
Publié: (2025)
par: Anonymous
Publié: (2025)
Prior Constraints-based Reward Model Training for Aligning Large Language Models
par: Zhou, Hang, et autres
Publié: (2024)
par: Zhou, Hang, et autres
Publié: (2024)
Does Compression Preserve Uncertainty? A Unified Benchmark for Quantized and Sparse LLMs via Conformal Prediction
par: Tong, Yujia, et autres
Publié: (2026)
par: Tong, Yujia, et autres
Publié: (2026)
VisionTrim: Unified Vision Token Compression for Training-Free MLLM Acceleration
par: Yu, Hanxun, et autres
Publié: (2026)
par: Yu, Hanxun, et autres
Publié: (2026)
MemoRAG: Boosting Long Context Processing with Global Memory-Enhanced Retrieval Augmentation
par: Qian, Hongjin, et autres
Publié: (2024)
par: Qian, Hongjin, et autres
Publié: (2024)
APB: Accelerating Distributed Long-Context Inference by Passing Compressed Context Blocks across GPUs
par: Huang, Yuxiang, et autres
Publié: (2025)
par: Huang, Yuxiang, et autres
Publié: (2025)
QUITO: Accelerating Long-Context Reasoning through Query-Guided Context Compression
par: Wang, Wenshan, et autres
Publié: (2024)
par: Wang, Wenshan, et autres
Publié: (2024)
GRAM-R$^2$: Self-Training Generative Foundation Reward Models for Reward Reasoning
par: Wang, Chenglong, et autres
Publié: (2025)
par: Wang, Chenglong, et autres
Publié: (2025)
PiERN: Token-Level Routing for Integrating High-Precision Computation and Reasoning
par: Xiao, Hengbo, et autres
Publié: (2025)
par: Xiao, Hengbo, et autres
Publié: (2025)
Documents similaires
-
Position IDs Matter: An Enhanced Position Layout for Efficient Context Compression in Large Language Models
par: Zhao, Runsong, et autres
Publié: (2024) -
Autoencoding-Free Context Compression for LLMs via Contextual Semantic Anchors
par: Liu, Xin, et autres
Publié: (2025) -
Forgetting Curve: A Reliable Method for Evaluating Memorization Capability for Long-context Models
par: Liu, Xinyu, et autres
Publié: (2024) -
NDP: Next Distribution Prediction as a More Broad Target
par: Ruan, Junhao, et autres
Publié: (2024) -
PoC: Performance-oriented Context Compression for Large Language Models via Performance Prediction
par: Zhao, Runsong, et autres
Publié: (2026)