Neural Attention Search
Fuente:
arXiv
Guardado en:
| Autores principales: | Deng, Difan, Lindauer, Marius |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Neural Attention Search Linear: Towards Adaptive Token-Level Hybrid Attention Models
por: Deng, Difan, et al.
Publicado: (2026)
por: Deng, Difan, et al.
Publicado: (2026)
Optimizing Time Series Forecasting Architectures: A Hierarchical Neural Architecture Search Approach
por: Deng, Difan, et al.
Publicado: (2024)
por: Deng, Difan, et al.
Publicado: (2024)
A Human-Like Reasoning Framework for Multi-Phases Planning Task with Large Language Models
por: Xie, Chengxing, et al.
Publicado: (2024)
por: Xie, Chengxing, et al.
Publicado: (2024)
Breaking Contextual Inertia: Reinforcement Learning with Single-Turn Anchors for Stable Multi-Turn Interaction
por: Chen, Xingwu, et al.
Publicado: (2026)
por: Chen, Xingwu, et al.
Publicado: (2026)
Differentiable Evolutionary Reinforcement Learning
por: Cheng, Sitao, et al.
Publicado: (2025)
por: Cheng, Sitao, et al.
Publicado: (2025)
Beyond Surface Structure: A Causal Assessment of LLMs' Comprehension Ability
por: Han, Yujin, et al.
Publicado: (2024)
por: Han, Yujin, et al.
Publicado: (2024)
Towards Generalization of Block Attention via Automatic Segmentation and Block Distillation
por: Li, Shuaiyi, et al.
Publicado: (2026)
por: Li, Shuaiyi, et al.
Publicado: (2026)
Does higher interpretability imply better utility? A Pairwise Analysis on Sparse Autoencoders
por: Wang, Xu, et al.
Publicado: (2025)
por: Wang, Xu, et al.
Publicado: (2025)
GTA: Grouped-head latenT Attention
por: Sun, Luoyang, et al.
Publicado: (2025)
por: Sun, Luoyang, et al.
Publicado: (2025)
How Sparse Attention Approximates Exact Attention? Your Attention is Naturally $n^C$-Sparse
por: Deng, Yichuan, et al.
Publicado: (2024)
por: Deng, Yichuan, et al.
Publicado: (2024)
Turning Internal Gap into Self-Improvement: Promoting the Generation-Understanding Unification in MLLMs
por: Han, Yujin, et al.
Publicado: (2025)
por: Han, Yujin, et al.
Publicado: (2025)
Self-Control of LLM Behaviors by Compressing Suffix Gradient into Prefix Controller
por: Cai, Min, et al.
Publicado: (2024)
por: Cai, Min, et al.
Publicado: (2024)
LM-Searcher: Cross-domain Neural Architecture Search with LLMs via Unified Numerical Encoding
por: Hu, Yuxuan, et al.
Publicado: (2025)
por: Hu, Yuxuan, et al.
Publicado: (2025)
On the Robustness of Transformers against Context Hijacking for Linear Classification
por: Li, Tianle, et al.
Publicado: (2025)
por: Li, Tianle, et al.
Publicado: (2025)
Towards Leveraging AutoML for Sustainable Deep Learning: A Multi-Objective HPO Approach on Deep Shift Neural Networks
por: Hennig, Leona, et al.
Publicado: (2024)
por: Hennig, Leona, et al.
Publicado: (2024)
SEKI: Self-Evolution and Knowledge Inspiration based Neural Architecture Search via Large Language Models
por: Cai, Zicheng, et al.
Publicado: (2025)
por: Cai, Zicheng, et al.
Publicado: (2025)
DepWiGNN: A Depth-wise Graph Neural Network for Multi-hop Spatial Reasoning in Text
por: Li, Shuaiyi, et al.
Publicado: (2023)
por: Li, Shuaiyi, et al.
Publicado: (2023)
Prosody-Guided Harmonic Attention for Phase-Coherent Neural Vocoding in the Complex Spectrum
por: Al-Radhi, Mohammed Salah, et al.
Publicado: (2026)
por: Al-Radhi, Mohammed Salah, et al.
Publicado: (2026)
Empirical Capacity Model for Self-Attention Neural Networks
por: Härmä, Aki, et al.
Publicado: (2024)
por: Härmä, Aki, et al.
Publicado: (2024)
Attention Needs to Focus: A Unified Perspective on Attention Allocation
por: Fu, Zichuan, et al.
Publicado: (2026)
por: Fu, Zichuan, et al.
Publicado: (2026)
Enhancing LLM Reasoning with Reward-guided Tree Search
por: Jiang, Jinhao, et al.
Publicado: (2024)
por: Jiang, Jinhao, et al.
Publicado: (2024)
MSWA: Refining Local Attention with Multi-ScaleWindow Attention
por: Xu, Yixing, et al.
Publicado: (2025)
por: Xu, Yixing, et al.
Publicado: (2025)
Affine-Scaled Attention: Towards Flexible and Stable Transformer Attention
por: Bae, Jeongin, et al.
Publicado: (2026)
por: Bae, Jeongin, et al.
Publicado: (2026)
DASH: Fast Differentiable Architecture Search for Hybrid Attention in Minutes on a Single GPU
por: Chen, Weizhe, et al.
Publicado: (2026)
por: Chen, Weizhe, et al.
Publicado: (2026)
On Early Detection of Hallucinations in Factual Question Answering
por: Snyder, Ben, et al.
Publicado: (2023)
por: Snyder, Ben, et al.
Publicado: (2023)
Towards Understanding Fine-Tuning Mechanisms of LLMs via Circuit Analysis
por: Wang, Xu, et al.
Publicado: (2025)
por: Wang, Xu, et al.
Publicado: (2025)
AttentionRAG: Attention-Guided Context Pruning in Retrieval-Augmented Generation
por: Fang, Yixiong, et al.
Publicado: (2025)
por: Fang, Yixiong, et al.
Publicado: (2025)
Compressed Convolutional Attention: Efficient Attention in a Compressed Latent Space
por: Figliolia, Tomas, et al.
Publicado: (2025)
por: Figliolia, Tomas, et al.
Publicado: (2025)
SPIN: Sparsifying and Integrating Internal Neurons in Large Language Models for Text Classification
por: Jiao, Difan, et al.
Publicado: (2023)
por: Jiao, Difan, et al.
Publicado: (2023)
DLM-Scope: Mechanistic Interpretability of Diffusion Language Models via Sparse Autoencoders
por: Wang, Xu, et al.
Publicado: (2026)
por: Wang, Xu, et al.
Publicado: (2026)
Attention Editing: A Versatile Framework for Cross-Architecture Attention Conversion
por: Cheng, Zhen, et al.
Publicado: (2026)
por: Cheng, Zhen, et al.
Publicado: (2026)
ReAttention: Training-Free Infinite Context with Finite Attention Scope
por: Liu, Xiaoran, et al.
Publicado: (2024)
por: Liu, Xiaoran, et al.
Publicado: (2024)
Don't Pay Attention
por: Hammoud, Mohammad, et al.
Publicado: (2025)
por: Hammoud, Mohammad, et al.
Publicado: (2025)
Mixture-of-Depths Attention
por: Zhu, Lianghui, et al.
Publicado: (2026)
por: Zhu, Lianghui, et al.
Publicado: (2026)
Shears: Unstructured Sparsity with Neural Low-rank Adapter Search
por: Muñoz, J. Pablo, et al.
Publicado: (2024)
por: Muñoz, J. Pablo, et al.
Publicado: (2024)
Search Wisely: Mitigating Sub-optimal Agentic Searches By Reducing Uncertainty
por: Wu, Peilin, et al.
Publicado: (2025)
por: Wu, Peilin, et al.
Publicado: (2025)
ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning
por: Chen, Mingyang, et al.
Publicado: (2025)
por: Chen, Mingyang, et al.
Publicado: (2025)
VibeSearchBench: Benchmarking Long-horizon Proactive Search in the Wild
por: Inc, Xiaohongshu
Publicado: (2026)
por: Inc, Xiaohongshu
Publicado: (2026)
Forecasting Frontier Language Model Agent Capabilities
por: Pimpale, Govind, et al.
Publicado: (2025)
por: Pimpale, Govind, et al.
Publicado: (2025)
InteractComp: Evaluating Search Agents With Ambiguous Queries
por: Deng, Mingyi, et al.
Publicado: (2025)
por: Deng, Mingyi, et al.
Publicado: (2025)
Ejemplares similares
-
Neural Attention Search Linear: Towards Adaptive Token-Level Hybrid Attention Models
por: Deng, Difan, et al.
Publicado: (2026) -
Optimizing Time Series Forecasting Architectures: A Hierarchical Neural Architecture Search Approach
por: Deng, Difan, et al.
Publicado: (2024) -
A Human-Like Reasoning Framework for Multi-Phases Planning Task with Large Language Models
por: Xie, Chengxing, et al.
Publicado: (2024) -
Breaking Contextual Inertia: Reinforcement Learning with Single-Turn Anchors for Stable Multi-Turn Interaction
por: Chen, Xingwu, et al.
Publicado: (2026) -
Differentiable Evolutionary Reinforcement Learning
por: Cheng, Sitao, et al.
Publicado: (2025)