Learning Large-Scale Modular Addition with an Auxiliary Modulus
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kikuchi, Hanato, Masuya, Ryosuke, Kawamoto, Kazuhiko, Kera, Hiroshi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Discovering Learning-Friendly Generation Orders for Sequential Computation
par: Sato, Yuta, et autres
Publié: (2025)
par: Sato, Yuta, et autres
Publié: (2025)
Learning Moderately Input-Sensitive Functions: A Case Study in QR Code Decoding
par: Yoda, Kazuki, et autres
Publié: (2025)
par: Yoda, Kazuki, et autres
Publié: (2025)
Guided Diffusion Sampling for Precipitation Forecast Interventions
par: Ueyama, Ayumu, et autres
Publié: (2026)
par: Ueyama, Ayumu, et autres
Publié: (2026)
VarteX: Enhancing Weather Forecast through Distributed Variable Representation
par: Ueyama, Ayumu, et autres
Publié: (2024)
par: Ueyama, Ayumu, et autres
Publié: (2024)
Identifying Important Group of Pixels using Interactions
par: Sumiyasu, Kosuke, et autres
Publié: (2024)
par: Sumiyasu, Kosuke, et autres
Publié: (2024)
Robustness Evaluation of Offline Reinforcement Learning for Robot Control Against Action Perturbations
par: Ayabe, Shingo, et autres
Publié: (2024)
par: Ayabe, Shingo, et autres
Publié: (2024)
Adversarially Trained Object Detector for Unsupervised Domain Adaptation
par: Fujii, Kazuma, et autres
Publié: (2021)
par: Fujii, Kazuma, et autres
Publié: (2021)
Adapter Merging with Centroid Prototype Mapping for Scalable Class-Incremental Learning
par: Fukuda, Takuma, et autres
Publié: (2024)
par: Fukuda, Takuma, et autres
Publié: (2024)
Robust Human Trajectory Prediction via Self-Supervised Skeleton Representation Learning
par: Arashima, Taishu, et autres
Publié: (2026)
par: Arashima, Taishu, et autres
Publié: (2026)
Reinforcement Learning with Adaptive Curriculum Dynamics Randomization for Fault-Tolerant Robot Control
par: Okamoto, Wataru, et autres
Publié: (2021)
par: Okamoto, Wataru, et autres
Publié: (2021)
Adversarial Fine-tuning in Offline-to-Online Reinforcement Learning for Robust Robot Control
par: Ayabe, Shingo, et autres
Publié: (2025)
par: Ayabe, Shingo, et autres
Publié: (2025)
Zero-Shot Faithful Textual Explanations via Directional-Derivative Influence on Predictions
par: Yamauchi, Toshinori, et autres
Publié: (2026)
par: Yamauchi, Toshinori, et autres
Publié: (2026)
Explaining Object Detectors via Collective Contribution of Pixels
par: Yamauchi, Toshinori, et autres
Publié: (2024)
par: Yamauchi, Toshinori, et autres
Publié: (2024)
Low-Quality Image Detection by Hierarchical VAE
par: Nanaumi, Tomoyasu, et autres
Publié: (2024)
par: Nanaumi, Tomoyasu, et autres
Publié: (2024)
Cross-Model Transfer of Task Vectors via Few-Shot Orthogonal Alignment
par: Kawamoto, Kazuhiko, et autres
Publié: (2025)
par: Kawamoto, Kazuhiko, et autres
Publié: (2025)
Zero-Shot Textual Explanations via Translating Decision-Critical Features
par: Yamauchi, Toshinori, et autres
Publié: (2025)
par: Yamauchi, Toshinori, et autres
Publié: (2025)
Fourier Analysis on Robustness of Graph Convolutional Neural Networks for Skeleton-based Action Recognition
par: Tanaka, Nariki, et autres
Publié: (2023)
par: Tanaka, Nariki, et autres
Publié: (2023)
Theoretical Understanding of Learning from Adversarial Perturbations
par: Kumano, Soichiro, et autres
Publié: (2024)
par: Kumano, Soichiro, et autres
Publié: (2024)
Wide Two-Layer Networks can Learn from Adversarial Perturbations
par: Kumano, Soichiro, et autres
Publié: (2024)
par: Kumano, Soichiro, et autres
Publié: (2024)
Improving Large-Scale Recommender Systems with Auxiliary Learning
par: Cokbas, Mertcan, et autres
Publié: (2025)
par: Cokbas, Mertcan, et autres
Publié: (2025)
Undertrained Image Reconstruction for Realistic Degradation in Blind Image Super-Resolution
par: Ito, Ru, et autres
Publié: (2025)
par: Ito, Ru, et autres
Publié: (2025)
Training on Plausible Counterfactuals Removes Spurious Correlations
par: Sadiku, Shpresim, et autres
Publié: (2025)
par: Sadiku, Shpresim, et autres
Publié: (2025)
Adversarial Training from Mean Field Perspective
par: Kumano, Soichiro, et autres
Publié: (2025)
par: Kumano, Soichiro, et autres
Publié: (2025)
CALT: A Library for Computer Algebra with Transformer
par: Kera, Hiroshi, et autres
Publié: (2025)
par: Kera, Hiroshi, et autres
Publié: (2025)
Adversarially Pretrained Transformers May Be Universally Robust In-Context Learners
par: Kumano, Soichiro, et autres
Publié: (2025)
par: Kumano, Soichiro, et autres
Publié: (2025)
Variable-Speed Teaching-Playback as Real-World Data Augmentation for Imitation Learning
par: Masuya, Nozomu, et autres
Publié: (2024)
par: Masuya, Nozomu, et autres
Publié: (2024)
Learning to Compute Gröbner Bases
par: Kera, Hiroshi, et autres
Publié: (2023)
par: Kera, Hiroshi, et autres
Publié: (2023)
Provable Benefits of Sinusoidal Activation for Modular Addition
par: Huang, Tianlong, et autres
Publié: (2025)
par: Huang, Tianlong, et autres
Publié: (2025)
Towards Viewpoint-Robust End-to-End Autonomous Driving with 3D Foundation Model Priors
par: Hashimoto, Hiroki, et autres
Publié: (2026)
par: Hashimoto, Hiroki, et autres
Publié: (2026)
Matching Semantically Similar Non-Identical Objects
par: Marumo, Yusuke, et autres
Publié: (2024)
par: Marumo, Yusuke, et autres
Publié: (2024)
Grokking of Diffusion Models: Case Study on Modular Addition
par: Kim, Joon Hyeok, et autres
Publié: (2026)
par: Kim, Joon Hyeok, et autres
Publié: (2026)
Clustering and Alignment: Understanding the Training Dynamics in Modular Addition
par: Musat, Tiberiu
Publié: (2024)
par: Musat, Tiberiu
Publié: (2024)
Q&A Label Learning
par: Kawamoto, Kota, et autres
Publié: (2023)
par: Kawamoto, Kota, et autres
Publié: (2023)
Computational Algebra with Attention: Transformer Oracles for Border Basis Algorithms
par: Kera, Hiroshi, et autres
Publié: (2025)
par: Kera, Hiroshi, et autres
Publié: (2025)
Survival of the Fittest Representation: A Case Study with Modular Addition
par: Ding, Xiaoman Delores, et autres
Publié: (2024)
par: Ding, Xiaoman Delores, et autres
Publié: (2024)
How Well Do Large-Scale Chemical Language Models Transfer to Downstream Tasks?
par: Sagawa, Tatsuya, et autres
Publié: (2026)
par: Sagawa, Tatsuya, et autres
Publié: (2026)
Why Do You Grok? A Theoretical Analysis of Grokking Modular Addition
par: Mohamadi, Mohamad Amin, et autres
Publié: (2024)
par: Mohamadi, Mohamad Amin, et autres
Publié: (2024)
Generating Auxiliary Tasks with Reinforcement Learning
par: Goldfeder, Judah, et autres
Publié: (2025)
par: Goldfeder, Judah, et autres
Publié: (2025)
On the Mechanism and Dynamics of Modular Addition: Fourier Features, Lottery Ticket, and Grokking
par: He, Jianliang, et autres
Publié: (2026)
par: He, Jianliang, et autres
Publié: (2026)
Uncovering a Universal Abstract Algorithm for Modular Addition in Neural Networks
par: McCracken, Gavin, et autres
Publié: (2025)
par: McCracken, Gavin, et autres
Publié: (2025)
Documents similaires
-
Discovering Learning-Friendly Generation Orders for Sequential Computation
par: Sato, Yuta, et autres
Publié: (2025) -
Learning Moderately Input-Sensitive Functions: A Case Study in QR Code Decoding
par: Yoda, Kazuki, et autres
Publié: (2025) -
Guided Diffusion Sampling for Precipitation Forecast Interventions
par: Ueyama, Ayumu, et autres
Publié: (2026) -
VarteX: Enhancing Weather Forecast through Distributed Variable Representation
par: Ueyama, Ayumu, et autres
Publié: (2024) -
Identifying Important Group of Pixels using Interactions
par: Sumiyasu, Kosuke, et autres
Publié: (2024)