Enregistré dans:
| Auteurs principaux: | Xu, Yixing, Nag, Shivank, Li, Dong, Tian, Lu, Barsoum, Emad |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2501.01039 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Gumiho: A Hybrid Architecture to Prioritize Early Tokens in Speculative Decoding
par: Li, Jinze, et autres
Publié: (2025)
par: Li, Jinze, et autres
Publié: (2025)
Jakiro: Boosting Speculative Decoding with Decoupled Multi-Head via MoE
par: Huang, Haiduo, et autres
Publié: (2025)
par: Huang, Haiduo, et autres
Publié: (2025)
SparK: Query-Aware Unstructured Sparsity with Recoverable KV Cache Channel Pruning
par: Liao, Huanxuan, et autres
Publié: (2025)
par: Liao, Huanxuan, et autres
Publié: (2025)
Mitigating Attention Localization in Small Scale: Self-Attention Refinement via One-step Belief Propagation
par: Lee, Nakyung, et autres
Publié: (2025)
par: Lee, Nakyung, et autres
Publié: (2025)
Amphista: Bi-directional Multi-head Decoding for Accelerating LLM Inference
par: Li, Zeping, et autres
Publié: (2024)
par: Li, Zeping, et autres
Publié: (2024)
PARD-2: Target-Aligned Parallel Draft Model for Dual-Mode Speculative Decoding
par: An, Zihao, et autres
Publié: (2026)
par: An, Zihao, et autres
Publié: (2026)
Partial Convolution Meets Visual Attention
par: Huang, Haiduo, et autres
Publié: (2025)
par: Huang, Haiduo, et autres
Publié: (2025)
AdaptEvolve: Improving Efficiency of Evolutionary AI Agents through Adaptive Model Selection
par: Ray, Pretam, et autres
Publié: (2026)
par: Ray, Pretam, et autres
Publié: (2026)
Sliding Window Attention Training for Efficient Large Language Models
par: Fu, Zichuan, et autres
Publié: (2025)
par: Fu, Zichuan, et autres
Publié: (2025)
TTT-Bench: A Benchmark for Evaluating Reasoning Ability with Simple and Novel Tic-Tac-Toe-style Games
par: Mishra, Prakamya, et autres
Publié: (2025)
par: Mishra, Prakamya, et autres
Publié: (2025)
Athena: Enhancing Multimodal Reasoning with Data-efficient Process Reward Models
par: Wang, Shuai, et autres
Publié: (2025)
par: Wang, Shuai, et autres
Publié: (2025)
Affine-Scaled Attention: Towards Flexible and Stable Transformer Attention
par: Bae, Jeongin, et autres
Publié: (2026)
par: Bae, Jeongin, et autres
Publié: (2026)
CLAWS:Creativity detection for LLM-generated solutions using Attention Window of Sections
par: Kim, Keuntae, et autres
Publié: (2025)
par: Kim, Keuntae, et autres
Publié: (2025)
WAND: Windowed Attention and Knowledge Distillation for Efficient Autoregressive Text-to-Speech Models
par: Lee, Hanna, et autres
Publié: (2026)
par: Lee, Hanna, et autres
Publié: (2026)
DL-QAT: Weight-Decomposed Low-Rank Quantization-Aware Training for Large Language Models
par: Ke, Wenjin, et autres
Publié: (2025)
par: Ke, Wenjin, et autres
Publié: (2025)
SWAA: Sliding Window Attention Adaptation for Efficient and Quality Preserving Long Context Processing
par: Yu, Yijiong, et autres
Publié: (2025)
par: Yu, Yijiong, et autres
Publié: (2025)
Efficient Context Scaling with LongCat ZigZag Attention
par: Zhang, Chen, et autres
Publié: (2025)
par: Zhang, Chen, et autres
Publié: (2025)
RADLADS: Rapid Attention Distillation to Linear Attention Decoders at Scale
par: Goldstein, Daniel, et autres
Publié: (2025)
par: Goldstein, Daniel, et autres
Publié: (2025)
ReAttn: Improving Attention-based Re-ranking via Attention Re-weighting
par: Tian, Yuxing, et autres
Publié: (2026)
par: Tian, Yuxing, et autres
Publié: (2026)
Scaling Reasoning without Attention
par: Zhao, Xueliang, et autres
Publié: (2025)
par: Zhao, Xueliang, et autres
Publié: (2025)
Geak: Introducing Triton Kernel AI Agent & Evaluation Benchmarks
par: Wang, Jianghui, et autres
Publié: (2025)
par: Wang, Jianghui, et autres
Publié: (2025)
Attention-Aligned Reasoning for Large Language Models
par: Zhang, Hongxiang, et autres
Publié: (2025)
par: Zhang, Hongxiang, et autres
Publié: (2025)
Self-Selected Attention Span for Accelerating Large Language Model Inference
par: Jin, Tian, et autres
Publié: (2024)
par: Jin, Tian, et autres
Publié: (2024)
Reflection-Window Decoding: Text Generation with Selective Refinement
par: Tang, Zeyu, et autres
Publié: (2025)
par: Tang, Zeyu, et autres
Publié: (2025)
Mitigating Object Hallucinations in Large Vision-Language Models with Assembly of Global and Local Attention
par: An, Wenbin, et autres
Publié: (2024)
par: An, Wenbin, et autres
Publié: (2024)
When Prompt Optimization Becomes Jailbreaking: Adaptive Red-Teaming of Large Language Models
par: Shamsi, Zafir, et autres
Publié: (2026)
par: Shamsi, Zafir, et autres
Publié: (2026)
CoCA: Fusing Position Embedding with Collinear Constrained Attention in Transformers for Long Context Window Extending
par: Zhu, Shiyi, et autres
Publié: (2023)
par: Zhu, Shiyi, et autres
Publié: (2023)
ReAttention: Training-Free Infinite Context with Finite Attention Scope
par: Liu, Xiaoran, et autres
Publié: (2024)
par: Liu, Xiaoran, et autres
Publié: (2024)
Efficient Streaming Language Models with Attention Sinks
par: Xiao, Guangxuan, et autres
Publié: (2023)
par: Xiao, Guangxuan, et autres
Publié: (2023)
Block-Attention for Efficient Prefilling
par: Ma, Dongyang, et autres
Publié: (2024)
par: Ma, Dongyang, et autres
Publié: (2024)
Multi-granularity Interactive Attention Framework for Residual Hierarchical Pronunciation Assessment
par: Han, Hong, et autres
Publié: (2026)
par: Han, Hong, et autres
Publié: (2026)
Attention Editing: A Versatile Framework for Cross-Architecture Attention Conversion
par: Cheng, Zhen, et autres
Publié: (2026)
par: Cheng, Zhen, et autres
Publié: (2026)
LoRA-Mini : Adaptation Matrices Decomposition and Selective Training
par: Singh, Ayush, et autres
Publié: (2024)
par: Singh, Ayush, et autres
Publié: (2024)
LIMOPro: Reasoning Refinement for Efficient and Effective Test-time Scaling
par: Xiao, Yang, et autres
Publié: (2025)
par: Xiao, Yang, et autres
Publié: (2025)
ALPS: Attention Localization and Pruning Strategy for Efficient Alignment of Large Language Models
par: Chen, Hao, et autres
Publié: (2025)
par: Chen, Hao, et autres
Publié: (2025)
DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention
par: Huang, Yuxiang, et autres
Publié: (2026)
par: Huang, Yuxiang, et autres
Publié: (2026)
Stacked from One: Multi-Scale Self-Injection for Context Window Extension
par: Han, Wei, et autres
Publié: (2026)
par: Han, Wei, et autres
Publié: (2026)
LongHeads: Multi-Head Attention is Secretly a Long Context Processor
par: Lu, Yi, et autres
Publié: (2024)
par: Lu, Yi, et autres
Publié: (2024)
Dual LoRA: Enhancing LoRA with Magnitude and Direction Updates
par: Xu, Yixing, et autres
Publié: (2025)
par: Xu, Yixing, et autres
Publié: (2025)
LLM as Attention-Informed NTM and Topic Modeling as long-input Generation: Interpretability and long-Context Capability
par: Xu, Xuan, et autres
Publié: (2025)
par: Xu, Xuan, et autres
Publié: (2025)
Documents similaires
-
Gumiho: A Hybrid Architecture to Prioritize Early Tokens in Speculative Decoding
par: Li, Jinze, et autres
Publié: (2025) -
Jakiro: Boosting Speculative Decoding with Decoupled Multi-Head via MoE
par: Huang, Haiduo, et autres
Publié: (2025) -
SparK: Query-Aware Unstructured Sparsity with Recoverable KV Cache Channel Pruning
par: Liao, Huanxuan, et autres
Publié: (2025) -
Mitigating Attention Localization in Small Scale: Self-Attention Refinement via One-step Belief Propagation
par: Lee, Nakyung, et autres
Publié: (2025) -
Amphista: Bi-directional Multi-head Decoding for Accelerating LLM Inference
par: Li, Zeping, et autres
Publié: (2024)