Learning Large-Scale Modular Addition with an Auxiliary Modulus
Fuente:
arXiv
Salvato in:
| Autori principali: | Kikuchi, Hanato, Masuya, Ryosuke, Kawamoto, Kazuhiko, Kera, Hiroshi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Discovering Learning-Friendly Generation Orders for Sequential Computation
di: Sato, Yuta, et al.
Pubblicazione: (2025)
di: Sato, Yuta, et al.
Pubblicazione: (2025)
Learning Moderately Input-Sensitive Functions: A Case Study in QR Code Decoding
di: Yoda, Kazuki, et al.
Pubblicazione: (2025)
di: Yoda, Kazuki, et al.
Pubblicazione: (2025)
Guided Diffusion Sampling for Precipitation Forecast Interventions
di: Ueyama, Ayumu, et al.
Pubblicazione: (2026)
di: Ueyama, Ayumu, et al.
Pubblicazione: (2026)
VarteX: Enhancing Weather Forecast through Distributed Variable Representation
di: Ueyama, Ayumu, et al.
Pubblicazione: (2024)
di: Ueyama, Ayumu, et al.
Pubblicazione: (2024)
Identifying Important Group of Pixels using Interactions
di: Sumiyasu, Kosuke, et al.
Pubblicazione: (2024)
di: Sumiyasu, Kosuke, et al.
Pubblicazione: (2024)
Robustness Evaluation of Offline Reinforcement Learning for Robot Control Against Action Perturbations
di: Ayabe, Shingo, et al.
Pubblicazione: (2024)
di: Ayabe, Shingo, et al.
Pubblicazione: (2024)
Adversarially Trained Object Detector for Unsupervised Domain Adaptation
di: Fujii, Kazuma, et al.
Pubblicazione: (2021)
di: Fujii, Kazuma, et al.
Pubblicazione: (2021)
Adapter Merging with Centroid Prototype Mapping for Scalable Class-Incremental Learning
di: Fukuda, Takuma, et al.
Pubblicazione: (2024)
di: Fukuda, Takuma, et al.
Pubblicazione: (2024)
Robust Human Trajectory Prediction via Self-Supervised Skeleton Representation Learning
di: Arashima, Taishu, et al.
Pubblicazione: (2026)
di: Arashima, Taishu, et al.
Pubblicazione: (2026)
Reinforcement Learning with Adaptive Curriculum Dynamics Randomization for Fault-Tolerant Robot Control
di: Okamoto, Wataru, et al.
Pubblicazione: (2021)
di: Okamoto, Wataru, et al.
Pubblicazione: (2021)
Adversarial Fine-tuning in Offline-to-Online Reinforcement Learning for Robust Robot Control
di: Ayabe, Shingo, et al.
Pubblicazione: (2025)
di: Ayabe, Shingo, et al.
Pubblicazione: (2025)
Zero-Shot Faithful Textual Explanations via Directional-Derivative Influence on Predictions
di: Yamauchi, Toshinori, et al.
Pubblicazione: (2026)
di: Yamauchi, Toshinori, et al.
Pubblicazione: (2026)
Explaining Object Detectors via Collective Contribution of Pixels
di: Yamauchi, Toshinori, et al.
Pubblicazione: (2024)
di: Yamauchi, Toshinori, et al.
Pubblicazione: (2024)
Low-Quality Image Detection by Hierarchical VAE
di: Nanaumi, Tomoyasu, et al.
Pubblicazione: (2024)
di: Nanaumi, Tomoyasu, et al.
Pubblicazione: (2024)
Cross-Model Transfer of Task Vectors via Few-Shot Orthogonal Alignment
di: Kawamoto, Kazuhiko, et al.
Pubblicazione: (2025)
di: Kawamoto, Kazuhiko, et al.
Pubblicazione: (2025)
Zero-Shot Textual Explanations via Translating Decision-Critical Features
di: Yamauchi, Toshinori, et al.
Pubblicazione: (2025)
di: Yamauchi, Toshinori, et al.
Pubblicazione: (2025)
Fourier Analysis on Robustness of Graph Convolutional Neural Networks for Skeleton-based Action Recognition
di: Tanaka, Nariki, et al.
Pubblicazione: (2023)
di: Tanaka, Nariki, et al.
Pubblicazione: (2023)
Theoretical Understanding of Learning from Adversarial Perturbations
di: Kumano, Soichiro, et al.
Pubblicazione: (2024)
di: Kumano, Soichiro, et al.
Pubblicazione: (2024)
Wide Two-Layer Networks can Learn from Adversarial Perturbations
di: Kumano, Soichiro, et al.
Pubblicazione: (2024)
di: Kumano, Soichiro, et al.
Pubblicazione: (2024)
Improving Large-Scale Recommender Systems with Auxiliary Learning
di: Cokbas, Mertcan, et al.
Pubblicazione: (2025)
di: Cokbas, Mertcan, et al.
Pubblicazione: (2025)
Undertrained Image Reconstruction for Realistic Degradation in Blind Image Super-Resolution
di: Ito, Ru, et al.
Pubblicazione: (2025)
di: Ito, Ru, et al.
Pubblicazione: (2025)
Training on Plausible Counterfactuals Removes Spurious Correlations
di: Sadiku, Shpresim, et al.
Pubblicazione: (2025)
di: Sadiku, Shpresim, et al.
Pubblicazione: (2025)
Adversarial Training from Mean Field Perspective
di: Kumano, Soichiro, et al.
Pubblicazione: (2025)
di: Kumano, Soichiro, et al.
Pubblicazione: (2025)
CALT: A Library for Computer Algebra with Transformer
di: Kera, Hiroshi, et al.
Pubblicazione: (2025)
di: Kera, Hiroshi, et al.
Pubblicazione: (2025)
Adversarially Pretrained Transformers May Be Universally Robust In-Context Learners
di: Kumano, Soichiro, et al.
Pubblicazione: (2025)
di: Kumano, Soichiro, et al.
Pubblicazione: (2025)
Variable-Speed Teaching-Playback as Real-World Data Augmentation for Imitation Learning
di: Masuya, Nozomu, et al.
Pubblicazione: (2024)
di: Masuya, Nozomu, et al.
Pubblicazione: (2024)
Learning to Compute Gröbner Bases
di: Kera, Hiroshi, et al.
Pubblicazione: (2023)
di: Kera, Hiroshi, et al.
Pubblicazione: (2023)
Provable Benefits of Sinusoidal Activation for Modular Addition
di: Huang, Tianlong, et al.
Pubblicazione: (2025)
di: Huang, Tianlong, et al.
Pubblicazione: (2025)
Towards Viewpoint-Robust End-to-End Autonomous Driving with 3D Foundation Model Priors
di: Hashimoto, Hiroki, et al.
Pubblicazione: (2026)
di: Hashimoto, Hiroki, et al.
Pubblicazione: (2026)
Matching Semantically Similar Non-Identical Objects
di: Marumo, Yusuke, et al.
Pubblicazione: (2024)
di: Marumo, Yusuke, et al.
Pubblicazione: (2024)
Grokking of Diffusion Models: Case Study on Modular Addition
di: Kim, Joon Hyeok, et al.
Pubblicazione: (2026)
di: Kim, Joon Hyeok, et al.
Pubblicazione: (2026)
Clustering and Alignment: Understanding the Training Dynamics in Modular Addition
di: Musat, Tiberiu
Pubblicazione: (2024)
di: Musat, Tiberiu
Pubblicazione: (2024)
Q&A Label Learning
di: Kawamoto, Kota, et al.
Pubblicazione: (2023)
di: Kawamoto, Kota, et al.
Pubblicazione: (2023)
Computational Algebra with Attention: Transformer Oracles for Border Basis Algorithms
di: Kera, Hiroshi, et al.
Pubblicazione: (2025)
di: Kera, Hiroshi, et al.
Pubblicazione: (2025)
Survival of the Fittest Representation: A Case Study with Modular Addition
di: Ding, Xiaoman Delores, et al.
Pubblicazione: (2024)
di: Ding, Xiaoman Delores, et al.
Pubblicazione: (2024)
How Well Do Large-Scale Chemical Language Models Transfer to Downstream Tasks?
di: Sagawa, Tatsuya, et al.
Pubblicazione: (2026)
di: Sagawa, Tatsuya, et al.
Pubblicazione: (2026)
Why Do You Grok? A Theoretical Analysis of Grokking Modular Addition
di: Mohamadi, Mohamad Amin, et al.
Pubblicazione: (2024)
di: Mohamadi, Mohamad Amin, et al.
Pubblicazione: (2024)
Generating Auxiliary Tasks with Reinforcement Learning
di: Goldfeder, Judah, et al.
Pubblicazione: (2025)
di: Goldfeder, Judah, et al.
Pubblicazione: (2025)
On the Mechanism and Dynamics of Modular Addition: Fourier Features, Lottery Ticket, and Grokking
di: He, Jianliang, et al.
Pubblicazione: (2026)
di: He, Jianliang, et al.
Pubblicazione: (2026)
Uncovering a Universal Abstract Algorithm for Modular Addition in Neural Networks
di: McCracken, Gavin, et al.
Pubblicazione: (2025)
di: McCracken, Gavin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Discovering Learning-Friendly Generation Orders for Sequential Computation
di: Sato, Yuta, et al.
Pubblicazione: (2025) -
Learning Moderately Input-Sensitive Functions: A Case Study in QR Code Decoding
di: Yoda, Kazuki, et al.
Pubblicazione: (2025) -
Guided Diffusion Sampling for Precipitation Forecast Interventions
di: Ueyama, Ayumu, et al.
Pubblicazione: (2026) -
VarteX: Enhancing Weather Forecast through Distributed Variable Representation
di: Ueyama, Ayumu, et al.
Pubblicazione: (2024) -
Identifying Important Group of Pixels using Interactions
di: Sumiyasu, Kosuke, et al.
Pubblicazione: (2024)