Near-Oracle KV Selection via Pre-hoc Sparsity for Long-Context Inference
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gao, Yifei, Wang, Lei, Tu, Rong-Cheng, Zhang, Qixin, Cheng, Jun, Tao, Dacheng |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Is (Selective) Round-To-Nearest Quantization All You Need?
par: Kogan, Alex
Publié: (2025)
par: Kogan, Alex
Publié: (2025)
Large Language Models as Oracles for Ontology Alignment
par: Lushnei, Sviatoslav, et autres
Publié: (2025)
par: Lushnei, Sviatoslav, et autres
Publié: (2025)
KV-Fold: One-Step KV-Cache Recurrence for Long-Context Inference
par: Nadali, Alireza, et autres
Publié: (2026)
par: Nadali, Alireza, et autres
Publié: (2026)
Homogeneous Keys, Heterogeneous Values: Exploiting Local KV Cache Asymmetry for Long-Context LLMs
par: Cui, Wanyun, et autres
Publié: (2025)
par: Cui, Wanyun, et autres
Publié: (2025)
Compensate Quantization Errors+: Quantized Models Are Inquisitive Learners
par: Gao, Yifei, et autres
Publié: (2024)
par: Gao, Yifei, et autres
Publié: (2024)
Breaking Free Transformer Models: Task-specific Context Attribution Promises Improved Generalizability Without Fine-tuning Pre-trained LLMs
par: Tytarenko, Stepan, et autres
Publié: (2024)
par: Tytarenko, Stepan, et autres
Publié: (2024)
SPHERICAL KV: Angle-Domain Attention and Rate-Distortion Retention for Efficient Long-Context Inference
par: Chauhan, Anay, et autres
Publié: (2026)
par: Chauhan, Anay, et autres
Publié: (2026)
Centers of quasi-homogeneous polynomial planar systems
par: Algaba, A., et autres
Publié: (2024)
par: Algaba, A., et autres
Publié: (2024)
Support Tokens, Stability Margins, and a New Foundation for Robust LLMs
par: Agarwal, Deepak, et autres
Publié: (2026)
par: Agarwal, Deepak, et autres
Publié: (2026)
CR-LT-KGQA: A Knowledge Graph Question Answering Dataset Requiring Commonsense Reasoning and Long-Tail Knowledge
par: Guo, Willis, et autres
Publié: (2024)
par: Guo, Willis, et autres
Publié: (2024)
An Evaluation of the Pedagogical Soundness and Usability of AI-Generated Lesson Plans Across Different Models and Prompt Frameworks in High-School Physics
par: Liu, Xincheng
Publié: (2025)
par: Liu, Xincheng
Publié: (2025)
KV Cache Optimization Strategies for Scalable and Efficient LLM Inference
par: Xu, Yichun, et autres
Publié: (2026)
par: Xu, Yichun, et autres
Publié: (2026)
Chat-Driven Text Generation and Interaction for Person Retrieval
par: Xie, Zequn, et autres
Publié: (2025)
par: Xie, Zequn, et autres
Publié: (2025)
Predicting the descent into extremism and terrorism
par: Lane, R. O., et autres
Publié: (2025)
par: Lane, R. O., et autres
Publié: (2025)
LongSumEval: Question-Answering Based Evaluation and Feedback-Driven Refinement for Long Document Summarization
par: Nguyen, Huyen, et autres
Publié: (2026)
par: Nguyen, Huyen, et autres
Publié: (2026)
SemanticAgent: A Semantics-Aware Framework for Text-to-SQL Data Synthesis
par: Gao, Qiang, et autres
Publié: (2026)
par: Gao, Qiang, et autres
Publié: (2026)
Pre-trained Language Model with Prompts for Temporal Knowledge Graph Completion
par: Xu, Wenjie, et autres
Publié: (2023)
par: Xu, Wenjie, et autres
Publié: (2023)
ROZA Graphs: Self-Improving Near-Deterministic RAG through Evidence-Centric Feedback
par: Penaroza, Matthew
Publié: (2026)
par: Penaroza, Matthew
Publié: (2026)
MIRAGE: Scaling Test-Time Inference with Parallel Graph-Retrieval-Augmented Reasoning Chains
par: Wei, Kaiwen, et autres
Publié: (2025)
par: Wei, Kaiwen, et autres
Publié: (2025)
Hierarchical Dual-Head Model for Suicide Risk Assessment via MentalRoBERTa
par: Yang, Chang, et autres
Publié: (2025)
par: Yang, Chang, et autres
Publié: (2025)
CG-TTRL: Context-Guided Test-Time Reinforcement Learning for On-Device Large Language Models
par: Hosseini, Peyman, et autres
Publié: (2025)
par: Hosseini, Peyman, et autres
Publié: (2025)
Aligning Multilingual News for Stock Return Prediction
par: Wu, Yuntao, et autres
Publié: (2025)
par: Wu, Yuntao, et autres
Publié: (2025)
LCFO: Long Context and Long Form Output Dataset and Benchmarking
par: Costa-jussà, Marta R., et autres
Publié: (2024)
par: Costa-jussà, Marta R., et autres
Publié: (2024)
Predicting Known Vulnerabilities from Attack Descriptions Using Sentence Transformers
par: Othman, Refat
Publié: (2026)
par: Othman, Refat
Publié: (2026)
The Limits of Obliviate: Evaluating Unlearning in LLMs via Stimulus-Knowledge Entanglement-Behavior Framework
par: Shah, Aakriti, et autres
Publié: (2025)
par: Shah, Aakriti, et autres
Publié: (2025)
OrbitFlow: SLO-Aware Long-Context LLM Serving with Fine-Grained KV Cache Reconfiguration
par: Ma, Xinyue, et autres
Publié: (2026)
par: Ma, Xinyue, et autres
Publié: (2026)
LLMs as Idiomatic Decompilers: Recovering High-Level Code from x86-64 Assembly for Dart
par: Abualazm, Raafat, et autres
Publié: (2026)
par: Abualazm, Raafat, et autres
Publié: (2026)
Ada-MK: Adaptive MegaKernel Optimization via Automated DAG-based Search for LLM Inference
par: Dong, Wenxin, et autres
Publié: (2026)
par: Dong, Wenxin, et autres
Publié: (2026)
Advanced Stock Market Prediction Using Long Short-Term Memory Networks: A Comprehensive Deep Learning Framework
par: Chaudhary, Rajneesh
Publié: (2025)
par: Chaudhary, Rajneesh
Publié: (2025)
Fidelity Probes for Specification--Code Alignment
par: Erata, Ferhat, et autres
Publié: (2026)
par: Erata, Ferhat, et autres
Publié: (2026)
Robustness of Large Language Models to Perturbations in Text
par: Singh, Ayush, et autres
Publié: (2024)
par: Singh, Ayush, et autres
Publié: (2024)
Improving LLMs with a knowledge from databases
par: Máša, Petr
Publié: (2025)
par: Máša, Petr
Publié: (2025)
Cross-Lingual Generalization and Compression: From Language-Specific to Shared Neurons
par: Riemenschneider, Frederick, et autres
Publié: (2025)
par: Riemenschneider, Frederick, et autres
Publié: (2025)
Pipeline and Dataset Generation for Automated Fact-checking in Almost Any Language
par: Drchal, Jan, et autres
Publié: (2023)
par: Drchal, Jan, et autres
Publié: (2023)
Kastor: Fine-tuned Small Language Models for Shape-based Active Relation Extraction
par: Celian, Ringwald, et autres
Publié: (2025)
par: Celian, Ringwald, et autres
Publié: (2025)
Overcoming the Generalization Limits of SLM Finetuning for Shape-Based Extraction of Datatype and Object Properties
par: Ringwald, Célian, et autres
Publié: (2025)
par: Ringwald, Célian, et autres
Publié: (2025)
RAPTOR-AI for Disaster OODA Loop: Hierarchical Multimodal RAG with Experience-Driven Agentic Decision-Making
par: Yasuno, Takato
Publié: (2026)
par: Yasuno, Takato
Publié: (2026)
From Fake Focus to Real Precision: Confusion-Driven Adversarial Attention Learning in Transformers
par: Liu, Yawei
Publié: (2025)
par: Liu, Yawei
Publié: (2025)
Automatic Prompt Optimization for Knowledge Graph Construction: Insights from an Empirical Study
par: Mihindukulasooriya, Nandana, et autres
Publié: (2025)
par: Mihindukulasooriya, Nandana, et autres
Publié: (2025)
Automating Clinical Information Retrieval from Finnish Electronic Health Records Using Large Language Models
par: Saukkoriipi, Mikko, et autres
Publié: (2026)
par: Saukkoriipi, Mikko, et autres
Publié: (2026)
Documents similaires
-
Is (Selective) Round-To-Nearest Quantization All You Need?
par: Kogan, Alex
Publié: (2025) -
Large Language Models as Oracles for Ontology Alignment
par: Lushnei, Sviatoslav, et autres
Publié: (2025) -
KV-Fold: One-Step KV-Cache Recurrence for Long-Context Inference
par: Nadali, Alireza, et autres
Publié: (2026) -
Homogeneous Keys, Heterogeneous Values: Exploiting Local KV Cache Asymmetry for Long-Context LLMs
par: Cui, Wanyun, et autres
Publié: (2025) -
Compensate Quantization Errors+: Quantized Models Are Inquisitive Learners
par: Gao, Yifei, et autres
Publié: (2024)