Backpropagation Through Time For Networks With Long-Term Dependencies
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Bird, George, Polivoda, Maxim E. |
|---|---|
| Format: | Preprint |
| Publié: |
2021
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Frequency Principle: Fourier Analysis Sheds Light on Deep Neural Networks
par: Xu, Zhi-Qin John, et autres
Publié: (2019)
par: Xu, Zhi-Qin John, et autres
Publié: (2019)
Tricks and Plug-ins for Gradient Boosting with Transformers
par: Fang, Biyi, et autres
Publié: (2025)
par: Fang, Biyi, et autres
Publié: (2025)
Advances in Set Function Learning: A Survey of Techniques and Applications
par: Xie, Jiahao, et autres
Publié: (2025)
par: Xie, Jiahao, et autres
Publié: (2025)
Adaptive Discretization in Online Reinforcement Learning
par: Sinclair, Sean R., et autres
Publié: (2021)
par: Sinclair, Sean R., et autres
Publié: (2021)
Aligning Inductive Bias for Data-Efficient Generalization in State Space Models
par: Chen, Qiyu, et autres
Publié: (2025)
par: Chen, Qiyu, et autres
Publié: (2025)
Ambiguous Online Learning
par: Kosoy, Vanessa
Publié: (2025)
par: Kosoy, Vanessa
Publié: (2025)
Regret Bounds for Robust Online Decision Making
par: Appel, Alexander, et autres
Publié: (2025)
par: Appel, Alexander, et autres
Publié: (2025)
Theoretical Analysis of Positional Encodings in Transformer Models: Impact on Expressiveness and Generalization
par: Li, Yin
Publié: (2025)
par: Li, Yin
Publié: (2025)
QGraphLIME - Explaining Quantum Graph Neural Networks
par: Jena, Haribandhu, et autres
Publié: (2025)
par: Jena, Haribandhu, et autres
Publié: (2025)
Agnostic Learning under Targeted Poisoning: Optimal Rates and the Role of Randomness
par: Chornomaz, Bogdan, et autres
Publié: (2025)
par: Chornomaz, Bogdan, et autres
Publié: (2025)
The two clocks and the innovation window: When and how generative models learn rules
par: Wang, Binxu, et autres
Publié: (2026)
par: Wang, Binxu, et autres
Publié: (2026)
Causal Direction from Convergence Time: Faster Training in the True Causal Direction
par: Tamim, Abdulrahman
Publié: (2026)
par: Tamim, Abdulrahman
Publié: (2026)
Understanding the Nature of Generative AI as Threshold Logic in High-Dimensional Space
par: Levin, Ilya
Publié: (2026)
par: Levin, Ilya
Publié: (2026)
On the Origin of Algorithmic Progress in AI
par: Gundlach, Hans, et autres
Publié: (2025)
par: Gundlach, Hans, et autres
Publié: (2025)
Sparse Knowledge Distillation: A Mathematical Framework for Probability-Domain Temperature Scaling and Multi-Stage Compression
par: Flouro, Aaron R., et autres
Publié: (2026)
par: Flouro, Aaron R., et autres
Publié: (2026)
The Inhibitor: ReLU and Addition-Based Attention for Efficient Transformers under Fully Homomorphic Encryption on the Torus
par: Brännvall, Rickard, et autres
Publié: (2023)
par: Brännvall, Rickard, et autres
Publié: (2023)
Modularity in Transformers: Investigating Neuron Separability & Specialization
par: Pochinkov, Nicholas, et autres
Publié: (2024)
par: Pochinkov, Nicholas, et autres
Publié: (2024)
Superior Scoring Rules for Probabilistic Evaluation of Single-Label Multi-Class Classification Tasks
par: Ahmadian, Rouhollah, et autres
Publié: (2024)
par: Ahmadian, Rouhollah, et autres
Publié: (2024)
Binarized Neural Networks Converge Toward Algorithmic Simplicity: Empirical Support for the Learning-as-Compression Hypothesis
par: Sakabe, Eduardo Y., et autres
Publié: (2025)
par: Sakabe, Eduardo Y., et autres
Publié: (2025)
ZetA: A Riemann Zeta-Scaled Extension of Adam for Deep Learning
par: BC, Samiksha
Publié: (2025)
par: BC, Samiksha
Publié: (2025)
Margin in Abstract Spaces
par: Ashlagi, Yair, et autres
Publié: (2026)
par: Ashlagi, Yair, et autres
Publié: (2026)
Reinforcement Learning in MDPs with Information-Ordered Policies
par: Zhang, Zhongjun, et autres
Publié: (2025)
par: Zhang, Zhongjun, et autres
Publié: (2025)
InhibiDistilbert: Knowledge Distillation for a ReLU and Addition-based Transformer
par: Zhang, Tony, et autres
Publié: (2025)
par: Zhang, Tony, et autres
Publié: (2025)
Golden Handcuffs make safer AI agents
par: Ebtekar, Aram, et autres
Publié: (2026)
par: Ebtekar, Aram, et autres
Publié: (2026)
MAcPNN: Mutual Assisted Learning on Data Streams with Temporal Dependence
par: Giannini, Federico, et autres
Publié: (2026)
par: Giannini, Federico, et autres
Publié: (2026)
Think Thrice Before You Speak: Dual knowledge-enhanced Theory-of-Mind Reasoning for Persuasive Agents
par: Ma, Minghui, et autres
Publié: (2026)
par: Ma, Minghui, et autres
Publié: (2026)
Mitigating Catastrophic Forgetting in Streaming Generative and Predictive Learning via Stateful Replay
par: Du, Wenzhang
Publié: (2025)
par: Du, Wenzhang
Publié: (2025)
The Current and Future Perspectives of Zinc Oxide Nanoparticles in the Treatment of Diabetes Mellitus
par: Yousaf, Iqra
Publié: (2024)
par: Yousaf, Iqra
Publié: (2024)
From Features to Graphs: Exploring Graph Structures and Pairwise Interactions via GNNs
par: Yamchote, Phaphontee, et autres
Publié: (2025)
par: Yamchote, Phaphontee, et autres
Publié: (2025)
Just In Time Transformers
par: Benali, Ahmed Ala Eddine, et autres
Publié: (2024)
par: Benali, Ahmed Ala Eddine, et autres
Publié: (2024)
A Constraint-Preserving Neural Network Approach for Solving Mean-Field Games Equilibrium
par: Liu, Jinwei, et autres
Publié: (2025)
par: Liu, Jinwei, et autres
Publié: (2025)
Graded Transformers
par: Shaska Sr, Tony
Publié: (2025)
par: Shaska Sr, Tony
Publié: (2025)
MMD-Balls as Credal Sets: A PAC-Bayesian Framework for Epistemic Uncertainty in Test-Time Adaptation
par: Ariq, Ahanaf Hasan
Publié: (2026)
par: Ariq, Ahanaf Hasan
Publié: (2026)
Correction and Corruption: A Two-Rate View of Error Flow in LLM Protocols
par: Reitich, Fernando
Publié: (2026)
par: Reitich, Fernando
Publié: (2026)
Distinguished In Uniform: Self Attention Vs. Virtual Nodes
par: Rosenbluth, Eran, et autres
Publié: (2024)
par: Rosenbluth, Eran, et autres
Publié: (2024)
Retrieval-Augmented Memory for Online Learning
par: Du, Wenzhang
Publié: (2025)
par: Du, Wenzhang
Publié: (2025)
Statistical Guarantees for Lifelong Reinforcement Learning using PAC-Bayes Theory
par: Zhang, Zhi, et autres
Publié: (2024)
par: Zhang, Zhi, et autres
Publié: (2024)
A Theoretical Study of (Hyper) Self-Attention through the Lens of Interactions: Representation, Training, Generalization
par: Ustaomeroglu, Muhammed, et autres
Publié: (2025)
par: Ustaomeroglu, Muhammed, et autres
Publié: (2025)
Deep Hedging Under Non-Convexity: Limitations and a Case for AlphaZero
par: Maggiolo, Matteo, et autres
Publié: (2025)
par: Maggiolo, Matteo, et autres
Publié: (2025)
Stage-wise Dynamics of Classifier-Free Guidance in Diffusion Models
par: Jin, Cheng, et autres
Publié: (2025)
par: Jin, Cheng, et autres
Publié: (2025)
Documents similaires
-
Frequency Principle: Fourier Analysis Sheds Light on Deep Neural Networks
par: Xu, Zhi-Qin John, et autres
Publié: (2019) -
Tricks and Plug-ins for Gradient Boosting with Transformers
par: Fang, Biyi, et autres
Publié: (2025) -
Advances in Set Function Learning: A Survey of Techniques and Applications
par: Xie, Jiahao, et autres
Publié: (2025) -
Adaptive Discretization in Online Reinforcement Learning
par: Sinclair, Sean R., et autres
Publié: (2021) -
Aligning Inductive Bias for Data-Efficient Generalization in State Space Models
par: Chen, Qiyu, et autres
Publié: (2025)