Mitigating Position-Shift Failures in Text-Based Modular Arithmetic via Position Curriculum and Template Diversity
Fuente:
arXiv
Salvato in:
| Autore principale: | Yudin, Nikolay |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
How much do LLMs learn from negative examples?
di: Hamdan, Shadi, et al.
Pubblicazione: (2025)
di: Hamdan, Shadi, et al.
Pubblicazione: (2025)
Transactional Attention: Semantic Sponsorship for KV-Cache Retention
di: Basu, Abhinaba
Pubblicazione: (2026)
di: Basu, Abhinaba
Pubblicazione: (2026)
From Noise to Diversity: Random Embedding Injection in LLM Reasoning
di: Kim, Heejun, et al.
Pubblicazione: (2026)
di: Kim, Heejun, et al.
Pubblicazione: (2026)
XAutoLM: Efficient Fine-Tuning of Language Models via Meta-Learning and AutoML
di: Estevanell-Valladares, Ernesto L., et al.
Pubblicazione: (2025)
di: Estevanell-Valladares, Ernesto L., et al.
Pubblicazione: (2025)
Mechanistic Analysis of Catastrophic Forgetting in Large Language Models During Continual Fine-tuning
di: Imanov, Olaf Yunus Laitinen
Pubblicazione: (2026)
di: Imanov, Olaf Yunus Laitinen
Pubblicazione: (2026)
Latent Object Permanence: Topological Phase Transitions, Free-Energy Principles, and Renormalization Group Flows in Deep Transformer Manifolds
di: Alpay, Faruk, et al.
Pubblicazione: (2026)
di: Alpay, Faruk, et al.
Pubblicazione: (2026)
Inference acceleration for large language models using "stairs" assisted greedy generation
di: Grigaliūnas, Domas, et al.
Pubblicazione: (2024)
di: Grigaliūnas, Domas, et al.
Pubblicazione: (2024)
Strategic Doctrine Language Models (sdLM): A Learning-System Framework for Doctrinal Consistency and Geopolitical Forecasting
di: Imanov, Olaf Yunus Laitinen, et al.
Pubblicazione: (2026)
di: Imanov, Olaf Yunus Laitinen, et al.
Pubblicazione: (2026)
NOTAI.AI: Explainable Detection of Machine-Generated Text via Curvature and Feature Attribution
di: Breneur, Oleksandr Marchenko, et al.
Pubblicazione: (2026)
di: Breneur, Oleksandr Marchenko, et al.
Pubblicazione: (2026)
No Memorization, No Detection: Output Distribution-Based Contamination Detection in Small Language Models
di: Sela, Omer
Pubblicazione: (2026)
di: Sela, Omer
Pubblicazione: (2026)
Hybrid Gated Flow (HGF): Stabilizing 1.58-bit LLMs via Selective Low-Rank Correction
di: Pizzo, David Alejandro Trejo
Pubblicazione: (2026)
di: Pizzo, David Alejandro Trejo
Pubblicazione: (2026)
lmfaoooo at SemEval-2026 Task 1: Humor Is an Audience. Preference Modeling for Constrained Humor Generation
di: Tikhonov, Alexey, et al.
Pubblicazione: (2026)
di: Tikhonov, Alexey, et al.
Pubblicazione: (2026)
Manipulating Transformer-Based Models: Controllability, Steerability, and Robust Interventions
di: Alpay, Faruk, et al.
Pubblicazione: (2025)
di: Alpay, Faruk, et al.
Pubblicazione: (2025)
Measuring and curing reasoning rigidity: from decorative chain-of-thought to genuine faithfulness
di: Basu, Abhinaba, et al.
Pubblicazione: (2026)
di: Basu, Abhinaba, et al.
Pubblicazione: (2026)
The Geometry of Persona: Disentangling Personality from Reasoning in Large Language Models
di: Wang, Zhixiang
Pubblicazione: (2025)
di: Wang, Zhixiang
Pubblicazione: (2025)
Measuring Alignment-Induced Activation Shifts Correctly: A Template-Controlled Difference-in-Differences Protocol
di: Nakamura, Yuki
Pubblicazione: (2026)
di: Nakamura, Yuki
Pubblicazione: (2026)
Targeted Lexical Injection: Unlocking Latent Cross-Lingual Alignment in Lugha-Llama via Early-Layer LoRA Fine-Tuning
di: Ngugi, Stanley
Pubblicazione: (2025)
di: Ngugi, Stanley
Pubblicazione: (2025)
Harnessing non-adversarial robustness in large language models
di: Zhou, Qinghua, et al.
Pubblicazione: (2026)
di: Zhou, Qinghua, et al.
Pubblicazione: (2026)
When Does Content-Based Routing Work? Representation Requirements for Selective Attention in Hybrid Sequence Models
di: Basu, Abhinaba
Pubblicazione: (2026)
di: Basu, Abhinaba
Pubblicazione: (2026)
Rethinking the Multilingual Reasoning Gap with Layer Swap
di: Lasbordes, Maxence, et al.
Pubblicazione: (2026)
di: Lasbordes, Maxence, et al.
Pubblicazione: (2026)
mHC-SSM: Manifold-Constrained Hyper-Connections for State Space Language Models with Stream-Specialized Adapters
di: Mutlu, Abdulvahap, et al.
Pubblicazione: (2026)
di: Mutlu, Abdulvahap, et al.
Pubblicazione: (2026)
Extracting Sentence Embeddings from Pretrained Transformer Models
di: Stankevičius, Lukas, et al.
Pubblicazione: (2024)
di: Stankevičius, Lukas, et al.
Pubblicazione: (2024)
Sentiment Analysis of Lithuanian Online Reviews Using Large Language Models
di: Vileikytė, Brigita, et al.
Pubblicazione: (2024)
di: Vileikytė, Brigita, et al.
Pubblicazione: (2024)
ReFactor GNNs: Revisiting Factorisation-based Models from a Message-Passing Perspective
di: Chen, Yihong, et al.
Pubblicazione: (2022)
di: Chen, Yihong, et al.
Pubblicazione: (2022)
IFMTBench: A Comprehensive Benchmark for Multilingual Translation Instruction Following
di: Sun, Mingrui, et al.
Pubblicazione: (2026)
di: Sun, Mingrui, et al.
Pubblicazione: (2026)
Fine-tuning of Large Language Models for Constituency Parsing Using a Sequence to Sequence Approach
di: Delgado, Francisco Jose Cortes, et al.
Pubblicazione: (2025)
di: Delgado, Francisco Jose Cortes, et al.
Pubblicazione: (2025)
Doğal Dil İşlemede Tokenizasyon Standartları ve Ölçümü: Türkçe Üzerinden Büyük Dil Modellerinin Karşılaştırmalı Analizi
di: Bayram, M. Ali, et al.
Pubblicazione: (2025)
di: Bayram, M. Ali, et al.
Pubblicazione: (2025)
Büyük Dil Modelleri için TR-MMLU Benchmarkı: Performans Değerlendirmesi, Zorluklar ve İyileştirme Fırsatları
di: Bayram, M. Ali, et al.
Pubblicazione: (2025)
di: Bayram, M. Ali, et al.
Pubblicazione: (2025)
How Human-Like Are Large Language Models? A Register-Aware Linguistic Evaluation Framework
di: Nieth, Björn, et al.
Pubblicazione: (2026)
di: Nieth, Björn, et al.
Pubblicazione: (2026)
CLMN: Concept based Language Models via Neural Symbolic Reasoning
di: Yang, Yibo
Pubblicazione: (2025)
di: Yang, Yibo
Pubblicazione: (2025)
Constitution or Collapse? Exploring Constitutional AI with Llama 3-8B
di: Zhang, Xue
Pubblicazione: (2025)
di: Zhang, Xue
Pubblicazione: (2025)
Position: Uncertainty Quantification in LLMs is Just Unsupervised Clustering
di: Chen, Tiejin, et al.
Pubblicazione: (2026)
di: Chen, Tiejin, et al.
Pubblicazione: (2026)
NeuroState-Bench: A Human-Calibrated Benchmark for Commitment Integrity in LLM Agent Profiles
di: Jia, Xiao
Pubblicazione: (2026)
di: Jia, Xiao
Pubblicazione: (2026)
Multi-Model Synthetic Training for Mission-Critical Small Language Models
di: Platt, Nolan, et al.
Pubblicazione: (2025)
di: Platt, Nolan, et al.
Pubblicazione: (2025)
Vis-CoT: A Human-in-the-Loop Framework for Interactive Visualization and Intervention in LLM Chain-of-Thought Reasoning
di: Pather, Kaviraj, et al.
Pubblicazione: (2025)
di: Pather, Kaviraj, et al.
Pubblicazione: (2025)
Semantic Convergence: Investigating Shared Representations Across Scaled LLMs
di: Son, Daniel, et al.
Pubblicazione: (2025)
di: Son, Daniel, et al.
Pubblicazione: (2025)
SafeAnchor: Preventing Cumulative Safety Erosion in Continual Domain Adaptation of Large Language Models
di: Guo, Dongxin, et al.
Pubblicazione: (2026)
di: Guo, Dongxin, et al.
Pubblicazione: (2026)
Rule Extraction in Machine Learning: Chat Incremental Pattern Constructor
di: Nwokocha, Caleb Princewill
Pubblicazione: (2022)
di: Nwokocha, Caleb Princewill
Pubblicazione: (2022)
Improving Commonsense Bias Classification by Mitigating the Influence of Demographic Terms
di: Lee, JinKyu, et al.
Pubblicazione: (2024)
di: Lee, JinKyu, et al.
Pubblicazione: (2024)
Measuring Intent Comprehension in LLMs
di: Kunievsky, Nadav, et al.
Pubblicazione: (2025)
di: Kunievsky, Nadav, et al.
Pubblicazione: (2025)
Documenti analoghi
-
How much do LLMs learn from negative examples?
di: Hamdan, Shadi, et al.
Pubblicazione: (2025) -
Transactional Attention: Semantic Sponsorship for KV-Cache Retention
di: Basu, Abhinaba
Pubblicazione: (2026) -
From Noise to Diversity: Random Embedding Injection in LLM Reasoning
di: Kim, Heejun, et al.
Pubblicazione: (2026) -
XAutoLM: Efficient Fine-Tuning of Language Models via Meta-Learning and AutoML
di: Estevanell-Valladares, Ernesto L., et al.
Pubblicazione: (2025) -
Mechanistic Analysis of Catastrophic Forgetting in Large Language Models During Continual Fine-tuning
di: Imanov, Olaf Yunus Laitinen
Pubblicazione: (2026)