Provably Learning Attention with Queries
Fuente:
arXiv
Salvato in:
| Autori principali: | Bhattamishra, Satwik, Shah, Kulin, Hahn, Michael, Kanade, Varun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Separations in the Representational Capabilities of Transformers and Recurrent Architectures
di: Bhattamishra, Satwik, et al.
Pubblicazione: (2024)
di: Bhattamishra, Satwik, et al.
Pubblicazione: (2024)
Hardness of Learning Regular Languages in the Next Symbol Prediction Setting
di: Bhattamishra, Satwik, et al.
Pubblicazione: (2025)
di: Bhattamishra, Satwik, et al.
Pubblicazione: (2025)
Discovering Interpretable Algorithms by Decompiling Transformers to RASP
di: Huang, Xinting, et al.
Pubblicazione: (2026)
di: Huang, Xinting, et al.
Pubblicazione: (2026)
Benefits and Limitations of Communication in Multi-Agent Reasoning
di: Rizvi-Martel, Michael, et al.
Pubblicazione: (2025)
di: Rizvi-Martel, Michael, et al.
Pubblicazione: (2025)
A Formal Framework for Understanding Length Generalization in Transformers
di: Huang, Xinting, et al.
Pubblicazione: (2024)
di: Huang, Xinting, et al.
Pubblicazione: (2024)
Pause Tokens Strictly Increase the Expressivity of Constant-Depth Transformers
di: London, Charles, et al.
Pubblicazione: (2025)
di: London, Charles, et al.
Pubblicazione: (2025)
Inshrinkerator: Compressing Deep Learning Training Checkpoints via Dynamic Quantization
di: Agrawal, Amey, et al.
Pubblicazione: (2023)
di: Agrawal, Amey, et al.
Pubblicazione: (2023)
Learning general Gaussian mixtures with efficient score matching
di: Chen, Sitan, et al.
Pubblicazione: (2024)
di: Chen, Sitan, et al.
Pubblicazione: (2024)
Masked Diffusion for Generative Recommendation
di: Shah, Kulin, et al.
Pubblicazione: (2025)
di: Shah, Kulin, et al.
Pubblicazione: (2025)
Gating Enables Curvature: A Geometric Expressivity Gap in Attention
di: Bathula, Satwik, et al.
Pubblicazione: (2026)
di: Bathula, Satwik, et al.
Pubblicazione: (2026)
How Global Calibration Strengthens Multiaccuracy
di: Casacuberta, Sílvia, et al.
Pubblicazione: (2025)
di: Casacuberta, Sílvia, et al.
Pubblicazione: (2025)
ReGuidance: A Simple Diffusion Wrapper for Boosting Sample Quality on Hard Inverse Problems
di: Karan, Aayush, et al.
Pubblicazione: (2025)
di: Karan, Aayush, et al.
Pubblicazione: (2025)
Does Generation Require Memorization? Creative Diffusion Models using Ambient Diffusion
di: Shah, Kulin, et al.
Pubblicazione: (2025)
di: Shah, Kulin, et al.
Pubblicazione: (2025)
Causal Language Modeling Can Elicit Search and Reasoning Capabilities on Logic Puzzles
di: Shah, Kulin, et al.
Pubblicazione: (2024)
di: Shah, Kulin, et al.
Pubblicazione: (2024)
Simple Mechanisms for Representing, Indexing and Manipulating Concepts
di: Li, Yuanzhi, et al.
Pubblicazione: (2023)
di: Li, Yuanzhi, et al.
Pubblicazione: (2023)
The Transformer Cookbook
di: Yang, Andy, et al.
Pubblicazione: (2025)
di: Yang, Andy, et al.
Pubblicazione: (2025)
Train for the Worst, Plan for the Best: Understanding Token Ordering in Masked Diffusions
di: Kim, Jaeyeon, et al.
Pubblicazione: (2025)
di: Kim, Jaeyeon, et al.
Pubblicazione: (2025)
DEEDEE: Fast and Scalable Out-of-Distribution Dynamics Detection
di: Aljaafari, Tala, et al.
Pubblicazione: (2025)
di: Aljaafari, Tala, et al.
Pubblicazione: (2025)
Unrolled denoising networks provably learn optimal Bayesian inference
di: Karan, Aayush, et al.
Pubblicazione: (2024)
di: Karan, Aayush, et al.
Pubblicazione: (2024)
Continual Learning with Query-Only Attention
di: Bekal, Gautham, et al.
Pubblicazione: (2025)
di: Bekal, Gautham, et al.
Pubblicazione: (2025)
Verifiable and Provably Secure Machine Unlearning
di: Eisenhofer, Thorsten, et al.
Pubblicazione: (2022)
di: Eisenhofer, Thorsten, et al.
Pubblicazione: (2022)
Security Concerns in Quantum Machine Learning as a Service
di: Kundu, Satwik, et al.
Pubblicazione: (2024)
di: Kundu, Satwik, et al.
Pubblicazione: (2024)
Explainable Machine Learning for Pediatric Dental Risk Stratification Using Socio-Demographic Determinants
di: Kanade, Manasi, et al.
Pubblicazione: (2026)
di: Kanade, Manasi, et al.
Pubblicazione: (2026)
Minimalist Softmax Attention Provably Learns Constrained Boolean Functions
di: Hu, Jerry Yao-Chieh, et al.
Pubblicazione: (2025)
di: Hu, Jerry Yao-Chieh, et al.
Pubblicazione: (2025)
STIQ: Safeguarding Training and Inferencing of Quantum Neural Networks from Untrusted Cloud
di: Kundu, Satwik, et al.
Pubblicazione: (2024)
di: Kundu, Satwik, et al.
Pubblicazione: (2024)
Inverse-Transpilation: Reverse-Engineering Quantum Compiler Optimization Passes from Circuit Snapshots
di: Kundu, Satwik, et al.
Pubblicazione: (2025)
di: Kundu, Satwik, et al.
Pubblicazione: (2025)
Provably Shorter Scratchpads in Hybrid DeltaNet-Attention Decoders
di: Steifer, Tomasz
Pubblicazione: (2026)
di: Steifer, Tomasz
Pubblicazione: (2026)
Adversarial Threats in Quantum Machine Learning: A Survey of Attacks and Defenses
di: Ghosh, Archisman, et al.
Pubblicazione: (2025)
di: Ghosh, Archisman, et al.
Pubblicazione: (2025)
Not All Queries Need Rewriting: When Prompt-Only LLM Refinement Helps and Hurts Dense Retrieval
di: Kotte, Varun
Pubblicazione: (2026)
di: Kotte, Varun
Pubblicazione: (2026)
KQ-SVD: Compressing the KV Cache with Provable Guarantees on Attention Fidelity
di: Lesens, Damien, et al.
Pubblicazione: (2025)
di: Lesens, Damien, et al.
Pubblicazione: (2025)
Attention with Trained Embeddings Provably Selects Important Tokens
di: Wu, Diyuan, et al.
Pubblicazione: (2025)
di: Wu, Diyuan, et al.
Pubblicazione: (2025)
AttackGNN: Red-Teaming GNNs in Hardware Security Using Reinforcement Learning
di: Gohil, Vasudev, et al.
Pubblicazione: (2024)
di: Gohil, Vasudev, et al.
Pubblicazione: (2024)
Robust Learning of Diverse Code Edits
di: Aggarwal, Tushar, et al.
Pubblicazione: (2025)
di: Aggarwal, Tushar, et al.
Pubblicazione: (2025)
SpectraLDS: Provable Distillation for Linear Dynamical Systems
di: Shah, Devan, et al.
Pubblicazione: (2025)
di: Shah, Devan, et al.
Pubblicazione: (2025)
Optimised Grouped-Query Attention Mechanism for Transformers
di: Chen, Yuang, et al.
Pubblicazione: (2024)
di: Chen, Yuang, et al.
Pubblicazione: (2024)
Sparse Query Attention (SQA): A Computationally Efficient Attention Mechanism with Query Heads Reduction
di: Filipek, Adam
Pubblicazione: (2025)
di: Filipek, Adam
Pubblicazione: (2025)
Recoverability Has a Law: The ERR Measure for Tool-Augmented Agents
di: Vuddanti, Sri Vatsa, et al.
Pubblicazione: (2026)
di: Vuddanti, Sri Vatsa, et al.
Pubblicazione: (2026)
DyPP: Dynamic Parameter Prediction to Accelerate Convergence of Variational Quantum Algorithms
di: Kundu, Satwik, et al.
Pubblicazione: (2023)
di: Kundu, Satwik, et al.
Pubblicazione: (2023)
On Provable Benefits of Muon in Federated Learning
di: Zhang, Xinwen, et al.
Pubblicazione: (2025)
di: Zhang, Xinwen, et al.
Pubblicazione: (2025)
Provable Training for Graph Contrastive Learning
di: Yu, Yue, et al.
Pubblicazione: (2023)
di: Yu, Yue, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Separations in the Representational Capabilities of Transformers and Recurrent Architectures
di: Bhattamishra, Satwik, et al.
Pubblicazione: (2024) -
Hardness of Learning Regular Languages in the Next Symbol Prediction Setting
di: Bhattamishra, Satwik, et al.
Pubblicazione: (2025) -
Discovering Interpretable Algorithms by Decompiling Transformers to RASP
di: Huang, Xinting, et al.
Pubblicazione: (2026) -
Benefits and Limitations of Communication in Multi-Agent Reasoning
di: Rizvi-Martel, Michael, et al.
Pubblicazione: (2025) -
A Formal Framework for Understanding Length Generalization in Transformers
di: Huang, Xinting, et al.
Pubblicazione: (2024)