Self-Attention as Transport: Limits of Symmetric Spectral Diagnostics
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Dahlem, Dominik, Maniloff, Diego, Misiura, Mac |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Measuring Alignment-Induced Activation Shifts Correctly: A Template-Controlled Difference-in-Differences Protocol
par: Nakamura, Yuki
Publié: (2026)
par: Nakamura, Yuki
Publié: (2026)
OptPO: Optimal Rollout Allocation for Test-time Policy Optimization
par: Wang, Youkang, et autres
Publié: (2025)
par: Wang, Youkang, et autres
Publié: (2025)
Uncertainty Estimation and Quantification for LLMs: A Simple Supervised Approach
par: Liu, Linyu, et autres
Publié: (2024)
par: Liu, Linyu, et autres
Publié: (2024)
The Origin of Self-Attention: Pairwise Affinity Matrices in Feature Selection and the Emergence of Self-Attention
par: Roffo, Giorgio
Publié: (2025)
par: Roffo, Giorgio
Publié: (2025)
A Language Model-Driven Semi-Supervised Ensemble Framework for Illicit Market Detection Across Deep/Dark Web and Social Platforms
par: Yazdanjue, Navid, et autres
Publié: (2025)
par: Yazdanjue, Navid, et autres
Publié: (2025)
Clustering in pure-attention hardmax transformers and its role in sentiment analysis
par: Alcalde, Albert, et autres
Publié: (2024)
par: Alcalde, Albert, et autres
Publié: (2024)
Mechanistic Analysis of Catastrophic Forgetting in Large Language Models During Continual Fine-tuning
par: Imanov, Olaf Yunus Laitinen
Publié: (2026)
par: Imanov, Olaf Yunus Laitinen
Publié: (2026)
Latent Object Permanence: Topological Phase Transitions, Free-Energy Principles, and Renormalization Group Flows in Deep Transformer Manifolds
par: Alpay, Faruk, et autres
Publié: (2026)
par: Alpay, Faruk, et autres
Publié: (2026)
Inference acceleration for large language models using "stairs" assisted greedy generation
par: Grigaliūnas, Domas, et autres
Publié: (2024)
par: Grigaliūnas, Domas, et autres
Publié: (2024)
Strategic Doctrine Language Models (sdLM): A Learning-System Framework for Doctrinal Consistency and Geopolitical Forecasting
par: Imanov, Olaf Yunus Laitinen, et autres
Publié: (2026)
par: Imanov, Olaf Yunus Laitinen, et autres
Publié: (2026)
Pay Attention to What You Need
par: Gao, Yifei, et autres
Publié: (2023)
par: Gao, Yifei, et autres
Publié: (2023)
Hidden Coalitions in Multi-Agent AI: A Spectral Diagnostic from Internal Representations
par: Berg, Cameron, et autres
Publié: (2026)
par: Berg, Cameron, et autres
Publié: (2026)
Unraveling Media Perspectives: A Comprehensive Methodology Combining Large Language Models, Topic Modeling, Sentiment Analysis, and Ontology Learning to Analyse Media Bias
par: Jähde, Orlando, et autres
Publié: (2025)
par: Jähde, Orlando, et autres
Publié: (2025)
Cache-to-Cache: Direct Semantic Communication Between Large Language Models
par: Fu, Tianyu, et autres
Publié: (2025)
par: Fu, Tianyu, et autres
Publié: (2025)
HEFT: A Coarse-to-Fine Hierarchy for Enhancing the Efficiency and Accuracy of Language Model Reasoning
par: Hill, Brennen
Publié: (2025)
par: Hill, Brennen
Publié: (2025)
Evaluating Embedding Generalization: How LLMs, LoRA, and SLERP Shape Representational Geometry
par: Kabane, Siyaxolisa
Publié: (2025)
par: Kabane, Siyaxolisa
Publié: (2025)
mHC-SSM: Manifold-Constrained Hyper-Connections for State Space Language Models with Stream-Specialized Adapters
par: Mutlu, Abdulvahap, et autres
Publié: (2026)
par: Mutlu, Abdulvahap, et autres
Publié: (2026)
Extracting Sentence Embeddings from Pretrained Transformer Models
par: Stankevičius, Lukas, et autres
Publié: (2024)
par: Stankevičius, Lukas, et autres
Publié: (2024)
Sentiment Analysis of Lithuanian Online Reviews Using Large Language Models
par: Vileikytė, Brigita, et autres
Publié: (2024)
par: Vileikytė, Brigita, et autres
Publié: (2024)
ReFactor GNNs: Revisiting Factorisation-based Models from a Message-Passing Perspective
par: Chen, Yihong, et autres
Publié: (2022)
par: Chen, Yihong, et autres
Publié: (2022)
Parameter-Efficient Transformer Embeddings
par: Ndubuaku, Henry, et autres
Publié: (2025)
par: Ndubuaku, Henry, et autres
Publié: (2025)
DYNAMAX: Dynamic computing for Transformers and Mamba based architectures
par: Nogales, Miguel, et autres
Publié: (2025)
par: Nogales, Miguel, et autres
Publié: (2025)
OPENXRD: A Comprehensive Benchmark Framework for LLM/MLLM XRD Question Answering
par: Vosoughi, Ali, et autres
Publié: (2025)
par: Vosoughi, Ali, et autres
Publié: (2025)
Bridging the Language Gap: Enhancing Multilingual Prompt-Based Code Generation in LLMs via Zero-Shot Cross-Lingual Transfer
par: Li, Mingda, et autres
Publié: (2024)
par: Li, Mingda, et autres
Publié: (2024)
SAGE: Sign-Adaptive Gradient for Memory-Efficient LLM Optimization
par: Lee, Wooin, et autres
Publié: (2026)
par: Lee, Wooin, et autres
Publié: (2026)
Retrieval-augmented code completion for local projects using large language models
par: Hostnik, Marko, et autres
Publié: (2024)
par: Hostnik, Marko, et autres
Publié: (2024)
Exact Sequence Interpolation with Transformers
par: Alcalde, Albert, et autres
Publié: (2025)
par: Alcalde, Albert, et autres
Publié: (2025)
On the existence of minimizers in shallow residual ReLU neural network optimization landscapes
par: Dereich, Steffen, et autres
Publié: (2023)
par: Dereich, Steffen, et autres
Publié: (2023)
On the existence of optimal shallow feedforward networks with ReLU activation
par: Dereich, Steffen, et autres
Publié: (2023)
par: Dereich, Steffen, et autres
Publié: (2023)
Improving Recursive Transformers with Mixture of LoRAs
par: Nouriborji, Mohammadmahdi, et autres
Publié: (2025)
par: Nouriborji, Mohammadmahdi, et autres
Publié: (2025)
Surfing the modeling of PoS taggers in low-resource scenarios
par: Ferro, Manuel Vilares, et autres
Publié: (2024)
par: Ferro, Manuel Vilares, et autres
Publié: (2024)
Enhancing Ultra-Low-Bit Quantization of Large Language Models Through Saliency-Aware Partial Retraining
par: Cao, Deyu, et autres
Publié: (2025)
par: Cao, Deyu, et autres
Publié: (2025)
Forging GEMs: Advancing Greek NLP through Quality-Based Corpus Curation
par: Apostolopoulou, Alexandra, et autres
Publié: (2025)
par: Apostolopoulou, Alexandra, et autres
Publié: (2025)
PolyTruth: Multilingual Disinformation Detection using Transformer-Based Language Models
par: Gouliev, Zaur, et autres
Publié: (2025)
par: Gouliev, Zaur, et autres
Publié: (2025)
Empirical analysis of binding precedent efficiency in Brazilian Supreme Court via case classification
par: Tinarrage, Raphaël, et autres
Publié: (2024)
par: Tinarrage, Raphaël, et autres
Publié: (2024)
Beyond Long Context: When Semantics Matter More than Tokens
par: Chawdhury, Tarun Kumar, et autres
Publié: (2025)
par: Chawdhury, Tarun Kumar, et autres
Publié: (2025)
Smoothed Embeddings for Robust Language Models
par: Hase, Ryo, et autres
Publié: (2025)
par: Hase, Ryo, et autres
Publié: (2025)
LLM-Assisted Crisis Management: Building Advanced LLM Platforms for Effective Emergency Response and Public Collaboration
par: Otal, Hakan T., et autres
Publié: (2024)
par: Otal, Hakan T., et autres
Publié: (2024)
Transactional Attention: Semantic Sponsorship for KV-Cache Retention
par: Basu, Abhinaba
Publié: (2026)
par: Basu, Abhinaba
Publié: (2026)
Understanding Reinforcement Learning for Model Training, and future directions with GRAPE
par: Patel, Rohit
Publié: (2025)
par: Patel, Rohit
Publié: (2025)
Documents similaires
-
Measuring Alignment-Induced Activation Shifts Correctly: A Template-Controlled Difference-in-Differences Protocol
par: Nakamura, Yuki
Publié: (2026) -
OptPO: Optimal Rollout Allocation for Test-time Policy Optimization
par: Wang, Youkang, et autres
Publié: (2025) -
Uncertainty Estimation and Quantification for LLMs: A Simple Supervised Approach
par: Liu, Linyu, et autres
Publié: (2024) -
The Origin of Self-Attention: Pairwise Affinity Matrices in Feature Selection and the Emergence of Self-Attention
par: Roffo, Giorgio
Publié: (2025) -
A Language Model-Driven Semi-Supervised Ensemble Framework for Illicit Market Detection Across Deep/Dark Web and Social Platforms
par: Yazdanjue, Navid, et autres
Publié: (2025)