D2O: Dynamic Discriminative Operations for Efficient Long-Context Inference of Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Wan, Zhongwei, Wu, Xinjian, Zhang, Yu, Xin, Yi, Tao, Chaofan, Zhu, Zhihong, Wang, Xin, Luo, Siqi, Xiong, Jing, Wang, Longyue, Zhang, Mi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MEDA: Dynamic KV Cache Allocation for Efficient Multimodal Long-Context Inference
por: Wan, Zhongwei, et al.
Publicado: (2025)
por: Wan, Zhongwei, et al.
Publicado: (2025)
LOOK-M: Look-Once Optimization in KV Cache for Efficient Multimodal Long-Context Inference
por: Wan, Zhongwei, et al.
Publicado: (2024)
por: Wan, Zhongwei, et al.
Publicado: (2024)
MEIT: Multimodal Electrocardiogram Instruction Tuning on Large Language Models for Report Generation
por: Wan, Zhongwei, et al.
Publicado: (2024)
por: Wan, Zhongwei, et al.
Publicado: (2024)
Enhancing Test-Time Scaling of Large Language Models with Hierarchical Retrieval-Augmented MCTS
por: Dou, Alex ZH, et al.
Publicado: (2025)
por: Dou, Alex ZH, et al.
Publicado: (2025)
SVD-LLM: Truncation-aware Singular Value Decomposition for Large Language Model Compression
por: Wang, Xin, et al.
Publicado: (2024)
por: Wang, Xin, et al.
Publicado: (2024)
Famba-V: Fast Vision Mamba with Cross-Layer Token Fusion
por: Shen, Hui, et al.
Publicado: (2024)
por: Shen, Hui, et al.
Publicado: (2024)
SVD-LLM V2: Optimizing Singular Value Truncation for Large Language Model Compression
por: Wang, Xin, et al.
Publicado: (2025)
por: Wang, Xin, et al.
Publicado: (2025)
Efficient Diffusion Models: A Survey
por: Shen, Hui, et al.
Publicado: (2025)
por: Shen, Hui, et al.
Publicado: (2025)
DSDR: Dual-Scale Diversity Regularization for Exploration in LLM Reasoning
por: Wan, Zhongwei, et al.
Publicado: (2026)
por: Wan, Zhongwei, et al.
Publicado: (2026)
Efficient Large Language Models: A Survey
por: Wan, Zhongwei, et al.
Publicado: (2023)
por: Wan, Zhongwei, et al.
Publicado: (2023)
Exploiting Defenses against GAN-Based Feature Inference Attacks in Federated Learning
por: Luo, Xinjian, et al.
Publicado: (2020)
por: Luo, Xinjian, et al.
Publicado: (2020)
SRPO: Enhancing Multimodal LLM Reasoning via Reflection-Aware Reinforcement Learning
por: Wan, Zhongwei, et al.
Publicado: (2025)
por: Wan, Zhongwei, et al.
Publicado: (2025)
MMDeepResearch-Bench: A Benchmark for Multimodal Deep Research Agents
por: Huang, Peizhou, et al.
Publicado: (2026)
por: Huang, Peizhou, et al.
Publicado: (2026)
Cocktail: Chunk-Adaptive Mixed-Precision Quantization for Long-Context LLM Inference
por: Tao, Wei, et al.
Publicado: (2025)
por: Tao, Wei, et al.
Publicado: (2025)
Prompt Inference Attack on Distributed Large Language Model Inference Frameworks
por: Luo, Xinjian, et al.
Publicado: (2025)
por: Luo, Xinjian, et al.
Publicado: (2025)
MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models
por: Zhang, Junyang, et al.
Publicado: (2025)
por: Zhang, Junyang, et al.
Publicado: (2025)
Designing Large Foundation Models for Efficient Training and Inference: A Survey
por: Liu, Dong, et al.
Publicado: (2024)
por: Liu, Dong, et al.
Publicado: (2024)
QuantVLA: Scale-Calibrated Post-Training Quantization for Vision-Language-Action Models
por: Zhang, Jingxuan, et al.
Publicado: (2026)
por: Zhang, Jingxuan, et al.
Publicado: (2026)
LongEmotion: Measuring Emotional Intelligence of Large Language Models in Long-Context Interaction
por: Liu, Weichu, et al.
Publicado: (2025)
por: Liu, Weichu, et al.
Publicado: (2025)
The Internet of Things in the Era of Generative AI: Vision and Challenges
por: Wang, Xin, et al.
Publicado: (2024)
por: Wang, Xin, et al.
Publicado: (2024)
Efficient Long-Context LLM Inference via KV Cache Clustering
por: Hu, Jie, et al.
Publicado: (2025)
por: Hu, Jie, et al.
Publicado: (2025)
Texture-guided Coding for Deep Features
por: Xiong, Lei, et al.
Publicado: (2024)
por: Xiong, Lei, et al.
Publicado: (2024)
Decoupled Reasoning with Implicit Fact Tokens (DRIFT): A Dual-Model Framework for Efficient Long-Context Inference
por: Xie, Wenxuan, et al.
Publicado: (2026)
por: Xie, Wenxuan, et al.
Publicado: (2026)
MMFormalizer: Multimodal Autoformalization in the Wild
por: Xiong, Jing, et al.
Publicado: (2026)
por: Xiong, Jing, et al.
Publicado: (2026)
An Efficient Hybrid Sparse Attention with CPU-GPU Parallelism for Long-Context Inference
por: Yao, Feiyu, et al.
Publicado: (2026)
por: Yao, Feiyu, et al.
Publicado: (2026)
VisionGraph: Leveraging Large Multimodal Models for Graph Theory Problems in Visual Context
por: Li, Yunxin, et al.
Publicado: (2024)
por: Li, Yunxin, et al.
Publicado: (2024)
TokenSelect: Efficient Long-Context Inference and Length Extrapolation for LLMs via Dynamic Token-Level KV Cache Selection
por: Wu, Wei, et al.
Publicado: (2024)
por: Wu, Wei, et al.
Publicado: (2024)
ParallelComp: Parallel Long-Context Compressor for Length Extrapolation
por: Xiong, Jing, et al.
Publicado: (2025)
por: Xiong, Jing, et al.
Publicado: (2025)
LongHeads: Multi-Head Attention is Secretly a Long Context Processor
por: Lu, Yi, et al.
Publicado: (2024)
por: Lu, Yi, et al.
Publicado: (2024)
Adamas: Hadamard Sparse Attention for Efficient Long-Context Inference
por: Yan, Siyuan, et al.
Publicado: (2025)
por: Yan, Siyuan, et al.
Publicado: (2025)
HyLRA: Hybrid Layer Reuse Attention for Efficient Long-Context Inference
por: Ai, Xuan, et al.
Publicado: (2026)
por: Ai, Xuan, et al.
Publicado: (2026)
LongWriter: Unleashing 10,000+ Word Generation from Long Context LLMs
por: Bai, Yushi, et al.
Publicado: (2024)
por: Bai, Yushi, et al.
Publicado: (2024)
MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts
por: Tao, Wei, et al.
Publicado: (2025)
por: Tao, Wei, et al.
Publicado: (2025)
ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox
por: Li, Yuanyang, et al.
Publicado: (2026)
por: Li, Yuanyang, et al.
Publicado: (2026)
DAM: Dynamic Attention Mask for Long-Context Large Language Model Inference Acceleration
por: Zhang, Hanzhi, et al.
Publicado: (2025)
por: Zhang, Hanzhi, et al.
Publicado: (2025)
Aligning Generative Denoising with Discriminative Objectives Unleashes Diffusion for Visual Perception
por: Pang, Ziqi, et al.
Publicado: (2025)
por: Pang, Ziqi, et al.
Publicado: (2025)
Feature Inference Attack on Shapley Values
por: Luo, Xinjian, et al.
Publicado: (2024)
por: Luo, Xinjian, et al.
Publicado: (2024)
EmoSURA: Towards Accurate Evaluation of Detailed and Long-Context Emotional Speech Captions
por: Jing, Xin, et al.
Publicado: (2026)
por: Jing, Xin, et al.
Publicado: (2026)
Membership Inference Attack against Long-Context Large Language Models
por: Wang, Zixiong, et al.
Publicado: (2024)
por: Wang, Zixiong, et al.
Publicado: (2024)
A Little Goes a Long Way: Efficient Long Context Training and Inference with Partial Contexts
por: Ge, Suyu, et al.
Publicado: (2024)
por: Ge, Suyu, et al.
Publicado: (2024)
Ejemplares similares
-
MEDA: Dynamic KV Cache Allocation for Efficient Multimodal Long-Context Inference
por: Wan, Zhongwei, et al.
Publicado: (2025) -
LOOK-M: Look-Once Optimization in KV Cache for Efficient Multimodal Long-Context Inference
por: Wan, Zhongwei, et al.
Publicado: (2024) -
MEIT: Multimodal Electrocardiogram Instruction Tuning on Large Language Models for Report Generation
por: Wan, Zhongwei, et al.
Publicado: (2024) -
Enhancing Test-Time Scaling of Large Language Models with Hierarchical Retrieval-Augmented MCTS
por: Dou, Alex ZH, et al.
Publicado: (2025) -
SVD-LLM: Truncation-aware Singular Value Decomposition for Large Language Model Compression
por: Wang, Xin, et al.
Publicado: (2024)