Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hatamizadeh, Ali, Choi, Yejin, Kautz, Jan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Gated Delta Networks: Improving Mamba2 with Delta Rule
par: Yang, Songlin, et autres
Publié: (2024)
par: Yang, Songlin, et autres
Publié: (2024)
iGRPO: Self-Feedback-Driven LLM Reasoning
par: Hatamizadeh, Ali, et autres
Publié: (2026)
par: Hatamizadeh, Ali, et autres
Publié: (2026)
RLP: Reinforcement as a Pretraining Objective
par: Hatamizadeh, Ali, et autres
Publié: (2025)
par: Hatamizadeh, Ali, et autres
Publié: (2025)
DiffiT: Diffusion Vision Transformers for Image Generation
par: Hatamizadeh, Ali, et autres
Publié: (2023)
par: Hatamizadeh, Ali, et autres
Publié: (2023)
FasterViT: Fast Vision Transformers with Hierarchical Attention
par: Hatamizadeh, Ali, et autres
Publié: (2023)
par: Hatamizadeh, Ali, et autres
Publié: (2023)
Provably Shorter Scratchpads in Hybrid DeltaNet-Attention Decoders
par: Steifer, Tomasz
Publié: (2026)
par: Steifer, Tomasz
Publié: (2026)
MambaVision: A Hybrid Mamba-Transformer Vision Backbone
par: Hatamizadeh, Ali, et autres
Publié: (2024)
par: Hatamizadeh, Ali, et autres
Publié: (2024)
ViR: Towards Efficient Vision Retention Backbones
par: Hatamizadeh, Ali, et autres
Publié: (2023)
par: Hatamizadeh, Ali, et autres
Publié: (2023)
Preconditioned DeltaNet: Curvature-aware Sequence Modeling for Linear Recurrences
par: Tumma, Neehal, et autres
Publié: (2026)
par: Tumma, Neehal, et autres
Publié: (2026)
ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models
par: Liu, Mingjie, et autres
Publié: (2025)
par: Liu, Mingjie, et autres
Publié: (2025)
Patched-DeltaNet: Token-Level Event-Driven Memory for Linear-Time Anomaly Detection
par: Lee, Tae-Gyun, et autres
Publié: (2026)
par: Lee, Tae-Gyun, et autres
Publié: (2026)
GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
par: Liu, Shih-Yang, et autres
Publié: (2026)
par: Liu, Shih-Yang, et autres
Publié: (2026)
Gating is Weighting: Understanding Gated Linear Attention through In-context Learning
par: Li, Yingcong, et autres
Publié: (2025)
par: Li, Yingcong, et autres
Publié: (2025)
Opt-ICL at LeWiDi-2025: Maximizing In-Context Signal from Rater Examples via Meta-Learning
par: Sorensen, Taylor, et autres
Publié: (2025)
par: Sorensen, Taylor, et autres
Publié: (2025)
ViG: Linear-complexity Visual Sequence Learning with Gated Linear Attention
par: Liao, Bencheng, et autres
Publié: (2024)
par: Liao, Bencheng, et autres
Publié: (2024)
Towards Visually Grounded Multimodal Summarization via Cross-Modal Transformer and Gated Attention
par: Ali, Abid, et autres
Publié: (2026)
par: Ali, Abid, et autres
Publié: (2026)
Interpretable and Sparse Linear Attention with Decoupled Membership-Subspace Modeling via MCR2 Objective
par: Liu, Tianyuan, et autres
Publié: (2026)
par: Liu, Tianyuan, et autres
Publié: (2026)
Adaptive Dual Residual U-Net with Attention Gate and Multiscale Spatial Attention Mechanisms (ADRUwAMS)
par: Suraki, Mohsen Yaghoubi
Publié: (2026)
par: Suraki, Mohsen Yaghoubi
Publié: (2026)
DiG: Scalable and Efficient Diffusion Models with Gated Linear Attention
par: Zhu, Lianghui, et autres
Publié: (2024)
par: Zhu, Lianghui, et autres
Publié: (2024)
Selective Memory for Artificial Intelligence: Write-Time Gating with Hierarchical Archiving
par: Zahn, Oliver, et autres
Publié: (2026)
par: Zahn, Oliver, et autres
Publié: (2026)
STA-Net: A Decoupled Shape and Texture Attention Network for Lightweight Plant Disease Classification
par: Qiu, Zongsen
Publié: (2025)
par: Qiu, Zongsen
Publié: (2025)
WS-Net: Weak-Signal Representation Learning and Gated Abundance Reconstruction for Hyperspectral Unmixing via State-Space and Weak Signal Attention Fusion
par: Long, Zekun, et autres
Publié: (2026)
par: Long, Zekun, et autres
Publié: (2026)
Learning Advanced Self-Attention for Linear Transformers in the Singular Value Domain
par: Wi, Hyowon, et autres
Publié: (2025)
par: Wi, Hyowon, et autres
Publié: (2025)
Decoupling Search and Learning in Neural Net Training
par: Vegesna, Akshay, et autres
Publié: (2025)
par: Vegesna, Akshay, et autres
Publié: (2025)
ProfBench: Multi-Domain Rubrics requiring Professional Knowledge to Answer and Judge
par: Wang, Zhilin, et autres
Publié: (2025)
par: Wang, Zhilin, et autres
Publié: (2025)
Learning to Discover at Test Time
par: Yuksekgonul, Mert, et autres
Publié: (2026)
par: Yuksekgonul, Mert, et autres
Publié: (2026)
DynamicGate MLP Conditional Computation via Learned Structural Dropout and Input Dependent Gating for Functional Plasticity
par: Choi, Yong Il
Publié: (2026)
par: Choi, Yong Il
Publié: (2026)
HLA: Hadamard Linear Attention
par: Ackermann, Hanno, et autres
Publié: (2026)
par: Ackermann, Hanno, et autres
Publié: (2026)
From Explicit CoT to Implicit CoT: Learning to Internalize CoT Step by Step
par: Deng, Yuntian, et autres
Publié: (2024)
par: Deng, Yuntian, et autres
Publié: (2024)
Intuitions of Compromise: Utilitarianism vs. Contractualism
par: Moore, Jared, et autres
Publié: (2024)
par: Moore, Jared, et autres
Publié: (2024)
Understanding Dataset Difficulty with $\mathcal{V}$-Usable Information
par: Ethayarajh, Kawin, et autres
Publié: (2021)
par: Ethayarajh, Kawin, et autres
Publié: (2021)
DB-FGA-Net: Dual Backbone Frequency Gated Attention Network for Multi-Class Brain Tumor Classification with Grad-CAM Interpretability
par: Shreya, Saraf Anzum, et autres
Publié: (2025)
par: Shreya, Saraf Anzum, et autres
Publié: (2025)
Prediction of Highway Traffic Flow Based on Artificial Intelligence Algorithms Using California Traffic Data
par: Lee, Junseong, et autres
Publié: (2025)
par: Lee, Junseong, et autres
Publié: (2025)
Twin Transformer using Gated Dynamic Learnable Attention mechanism for Fault Detection and Diagnosis in the Tennessee Eastman Process
par: Labbaf-Khaniki, Mohammad Ali, et autres
Publié: (2024)
par: Labbaf-Khaniki, Mohammad Ali, et autres
Publié: (2024)
HALoGEN: Fantastic LLM Hallucinations and Where to Find Them
par: Ravichander, Abhilasha, et autres
Publié: (2025)
par: Ravichander, Abhilasha, et autres
Publié: (2025)
UniErase: Towards Balanced and Precise Unlearning in Language Models
par: Yu, Miao, et autres
Publié: (2025)
par: Yu, Miao, et autres
Publié: (2025)
ESC: Erasing Space Concept for Knowledge Deletion
par: Lee, Tae-Young, et autres
Publié: (2025)
par: Lee, Tae-Young, et autres
Publié: (2025)
Golden Goose: A Simple Trick to Synthesize Unlimited RLVR Tasks from Unverifiable Internet Text
par: Lu, Ximing, et autres
Publié: (2026)
par: Lu, Ximing, et autres
Publié: (2026)
Exact Linear Attention
par: Ou, Weinuo
Publié: (2026)
par: Ou, Weinuo
Publié: (2026)
Kaczmarz Linear Attention
par: Zou, Jiaxuan, et autres
Publié: (2026)
par: Zou, Jiaxuan, et autres
Publié: (2026)
Documents similaires
-
Gated Delta Networks: Improving Mamba2 with Delta Rule
par: Yang, Songlin, et autres
Publié: (2024) -
iGRPO: Self-Feedback-Driven LLM Reasoning
par: Hatamizadeh, Ali, et autres
Publié: (2026) -
RLP: Reinforcement as a Pretraining Objective
par: Hatamizadeh, Ali, et autres
Publié: (2025) -
DiffiT: Diffusion Vision Transformers for Image Generation
par: Hatamizadeh, Ali, et autres
Publié: (2023) -
FasterViT: Fast Vision Transformers with Hierarchical Attention
par: Hatamizadeh, Ali, et autres
Publié: (2023)