VORT: Adaptive Power-Law Memory for NLP Transformers
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Mlaiki, Nabil |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Unified Framework for Critical Scaling of Inverse Temperature in Self-Attention
par: Hayase, Tomohiro, et autres
Publié: (2026)
par: Hayase, Tomohiro, et autres
Publié: (2026)
Query-Aware Flow Diffusion for Graph-Based RAG with Retrieval Guarantees
par: Zhou, Zhuoping, et autres
Publié: (2026)
par: Zhou, Zhuoping, et autres
Publié: (2026)
Shallow ReLU$^s$ Networks in $L^p$-Type and Sobolev Spaces: Approximation and Path-Norm Controlled Generalization
par: Li, Weizhao, et autres
Publié: (2026)
par: Li, Weizhao, et autres
Publié: (2026)
When Does Content-Based Routing Work? Representation Requirements for Selective Attention in Hybrid Sequence Models
par: Basu, Abhinaba
Publié: (2026)
par: Basu, Abhinaba
Publié: (2026)
NOTAI.AI: Explainable Detection of Machine-Generated Text via Curvature and Feature Attribution
par: Breneur, Oleksandr Marchenko, et autres
Publié: (2026)
par: Breneur, Oleksandr Marchenko, et autres
Publié: (2026)
Rethinking the Multilingual Reasoning Gap with Layer Swap
par: Lasbordes, Maxence, et autres
Publié: (2026)
par: Lasbordes, Maxence, et autres
Publié: (2026)
Drift and selection in LLM text ecosystems
par: Riis, Søren
Publié: (2026)
par: Riis, Søren
Publié: (2026)
SAGE: Sign-Adaptive Gradient for Memory-Efficient LLM Optimization
par: Lee, Wooin, et autres
Publié: (2026)
par: Lee, Wooin, et autres
Publié: (2026)
Harnessing non-adversarial robustness in large language models
par: Zhou, Qinghua, et autres
Publié: (2026)
par: Zhou, Qinghua, et autres
Publié: (2026)
The Concept Allocation Zone: Tracking How Concepts Form Across Transformer Depth
par: Henry, James
Publié: (2026)
par: Henry, James
Publié: (2026)
CLMN: Concept based Language Models via Neural Symbolic Reasoning
par: Yang, Yibo
Publié: (2025)
par: Yang, Yibo
Publié: (2025)
Measuring Alignment-Induced Activation Shifts Correctly: A Template-Controlled Difference-in-Differences Protocol
par: Nakamura, Yuki
Publié: (2026)
par: Nakamura, Yuki
Publié: (2026)
Generative AI and the Transformation of Software Development Practices
par: Acharya, Vivek
Publié: (2025)
par: Acharya, Vivek
Publié: (2025)
Latent Object Permanence: Topological Phase Transitions, Free-Energy Principles, and Renormalization Group Flows in Deep Transformer Manifolds
par: Alpay, Faruk, et autres
Publié: (2026)
par: Alpay, Faruk, et autres
Publié: (2026)
Causal Dimensionality of Transformer Representations: Measurement, Scaling, and Layer Structure
par: Sarkar, Nilesh, et autres
Publié: (2026)
par: Sarkar, Nilesh, et autres
Publié: (2026)
Graded Transformers
par: Shaska Sr, Tony
Publié: (2025)
par: Shaska Sr, Tony
Publié: (2025)
How Pruning Reshapes Features: Sparse Autoencoder Analysis of Weight-Pruned Language Models
par: Borobia, Hector, et autres
Publié: (2026)
par: Borobia, Hector, et autres
Publié: (2026)
AIPsy-Affect: A Keyword-Free Clinical Stimulus Battery for Mechanistic Interpretability of Emotion in Language Models
par: Keeman, Michael
Publié: (2026)
par: Keeman, Michael
Publié: (2026)
Product-of-Experts Training Reduces Dataset Artifacts in Natural Language Inference
par: Mathew, Aby Mammen
Publié: (2026)
par: Mathew, Aby Mammen
Publié: (2026)
Alpay Algebra V: Multi-Layered Semantic Games and Transfinite Fixed-Point Simulation
par: Kilictas, Bugra, et autres
Publié: (2025)
par: Kilictas, Bugra, et autres
Publié: (2025)
Alpay Algebra IV: Symbiotic Semantics and the Fixed-Point Convergence of Observer Embeddings
par: Kilictas, Bugra, et autres
Publié: (2025)
par: Kilictas, Bugra, et autres
Publié: (2025)
Latent-Autoregressive GP-VAE Language Model
par: Ruffenach, Yves
Publié: (2025)
par: Ruffenach, Yves
Publié: (2025)
Multipole Semantic Attention: A Fast Approximation of Softmax Attention for Pretraining
par: Mitchell, Rupert, et autres
Publié: (2025)
par: Mitchell, Rupert, et autres
Publié: (2025)
DRO-InstructZero: Distributionally Robust Prompt Optimization for Large Language Models
par: Li, Yangyang
Publié: (2025)
par: Li, Yangyang
Publié: (2025)
ProactBench: Beyond What The User Asked For
par: Harfi, Sepehr, et autres
Publié: (2026)
par: Harfi, Sepehr, et autres
Publié: (2026)
Mechanistic Analysis of Catastrophic Forgetting in Large Language Models During Continual Fine-tuning
par: Imanov, Olaf Yunus Laitinen
Publié: (2026)
par: Imanov, Olaf Yunus Laitinen
Publié: (2026)
Inference acceleration for large language models using "stairs" assisted greedy generation
par: Grigaliūnas, Domas, et autres
Publié: (2024)
par: Grigaliūnas, Domas, et autres
Publié: (2024)
Strategic Doctrine Language Models (sdLM): A Learning-System Framework for Doctrinal Consistency and Geopolitical Forecasting
par: Imanov, Olaf Yunus Laitinen, et autres
Publié: (2026)
par: Imanov, Olaf Yunus Laitinen, et autres
Publié: (2026)
Conformal Path Reasoning: Trustworthy Knowledge Graph Question Answering via Path-Level Calibration
par: Lin, Shuhang, et autres
Publié: (2026)
par: Lin, Shuhang, et autres
Publié: (2026)
ProbeScale: Probing Analysis to Optimize Neural Scaling Laws for Efficient Small Language Model Inference
par: Das, Sourav
Publié: (2026)
par: Das, Sourav
Publié: (2026)
$δ$-STEAL: LLM Stealing Attack with Local Differential Privacy
par: Dang, Kieu, et autres
Publié: (2025)
par: Dang, Kieu, et autres
Publié: (2025)
SafeAnchor: Preventing Cumulative Safety Erosion in Continual Domain Adaptation of Large Language Models
par: Guo, Dongxin, et autres
Publié: (2026)
par: Guo, Dongxin, et autres
Publié: (2026)
Unpacking Hateful Memes: Presupposed Context and False Claims
par: Cai, Weibin, et autres
Publié: (2025)
par: Cai, Weibin, et autres
Publié: (2025)
Optimizing Large Language Models for OpenAPI Code Completion
par: Petryshyn, Bohdan, et autres
Publié: (2024)
par: Petryshyn, Bohdan, et autres
Publié: (2024)
Challenges and Applications of Large Language Models: A Comparison of GPT and DeepSeek family of models
par: Sharma, Shubham, et autres
Publié: (2025)
par: Sharma, Shubham, et autres
Publié: (2025)
Extracting Sentence Embeddings from Pretrained Transformer Models
par: Stankevičius, Lukas, et autres
Publié: (2024)
par: Stankevičius, Lukas, et autres
Publié: (2024)
Vis-CoT: A Human-in-the-Loop Framework for Interactive Visualization and Intervention in LLM Chain-of-Thought Reasoning
par: Pather, Kaviraj, et autres
Publié: (2025)
par: Pather, Kaviraj, et autres
Publié: (2025)
Compressive sensing inspired self-supervised single-pixel imaging
par: Lu, Jijun, et autres
Publié: (2026)
par: Lu, Jijun, et autres
Publié: (2026)
The Trilemma of Truth in Large Language Models
par: Savcisens, Germans, et autres
Publié: (2025)
par: Savcisens, Germans, et autres
Publié: (2025)
Optimizing Retrieval-Augmented Generation (RAG) for Colloquial Cantonese: A LoRA-Based Systematic Review
par: Calonge, David Santandreu, et autres
Publié: (2025)
par: Calonge, David Santandreu, et autres
Publié: (2025)
Documents similaires
-
A Unified Framework for Critical Scaling of Inverse Temperature in Self-Attention
par: Hayase, Tomohiro, et autres
Publié: (2026) -
Query-Aware Flow Diffusion for Graph-Based RAG with Retrieval Guarantees
par: Zhou, Zhuoping, et autres
Publié: (2026) -
Shallow ReLU$^s$ Networks in $L^p$-Type and Sobolev Spaces: Approximation and Path-Norm Controlled Generalization
par: Li, Weizhao, et autres
Publié: (2026) -
When Does Content-Based Routing Work? Representation Requirements for Selective Attention in Hybrid Sequence Models
par: Basu, Abhinaba
Publié: (2026) -
NOTAI.AI: Explainable Detection of Machine-Generated Text via Curvature and Feature Attribution
par: Breneur, Oleksandr Marchenko, et autres
Publié: (2026)