GPU Memory Requirement Prediction for Deep Learning Task Based on Bidirectional Gated Recurrent Unit Optimization Transformer
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Chao, Wen, Zhizhao, Zhang, Ruoxin, Xu, Puyang, Jiang, Yifan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Optimization of bi-directional gated loop cell based on multi-head attention mechanism for SSD health state classification model
par: Wen, Zhizhao, et autres
Publié: (2025)
par: Wen, Zhizhao, et autres
Publié: (2025)
Quality analysis and evaluation prediction of RAG retrieval based on machine learning algorithms
par: Zhang, Ruoxin, et autres
Publié: (2025)
par: Zhang, Ruoxin, et autres
Publié: (2025)
BiTA: Bidirectional Gated Recurrent Unit-Transformer Aggregator in a Temporal Graph Network Framework for Alert Prediction in Computer Networks
par: Nayeri, Zahra Makki, et autres
Publié: (2026)
par: Nayeri, Zahra Makki, et autres
Publié: (2026)
Minion Gated Recurrent Unit for Continual Learning
par: Zyarah, Abdullah M., et autres
Publié: (2025)
par: Zyarah, Abdullah M., et autres
Publié: (2025)
A Bidirectional Gated Recurrent Unit Model for PUE Prediction in Data Centers
par: Kannan, Dhivya Dharshini, et autres
Publié: (2025)
par: Kannan, Dhivya Dharshini, et autres
Publié: (2025)
Gate Recurrent Unit for Efficient Industrial Gas Identification
par: Wang, Ding
Publié: (2024)
par: Wang, Ding
Publié: (2024)
Recurrent Action Transformer with Memory
par: Cherepanov, Egor, et autres
Publié: (2023)
par: Cherepanov, Egor, et autres
Publié: (2023)
IRNN: Innovation-driven Recurrent Neural Network for Time-Series Data Modeling and Prediction
par: Zhou, Yifan, et autres
Publié: (2025)
par: Zhou, Yifan, et autres
Publié: (2025)
Real-Time Recurrent Learning using Trace Units in Reinforcement Learning
par: Elelimy, Esraa, et autres
Publié: (2024)
par: Elelimy, Esraa, et autres
Publié: (2024)
GPU-Accelerated Deep Learning for Heatwave Prediction and Urban Heat Risk Assessment
par: Alihodžić, Adis
Publié: (2026)
par: Alihodžić, Adis
Publié: (2026)
BRATI: Bidirectional Recurrent Attention for Time-Series Imputation
par: Collado-Villaverde, Armando, et autres
Publié: (2025)
par: Collado-Villaverde, Armando, et autres
Publié: (2025)
Applied Machine Learning Methods with Long-Short Term Memory Based Recurrent Neural Networks for Multivariate Temperature Prediction
par: Lukić, Bojan
Publié: (2025)
par: Lukić, Bojan
Publié: (2025)
Deep Recurrent Learning Through Long Short Term Memory and TOPSIS
par: Kamal, Rossi
Publié: (2022)
par: Kamal, Rossi
Publié: (2022)
MIGT: Memory Instance Gated Transformer Framework for Financial Portfolio Management
par: Gu, Fengchen, et autres
Publié: (2025)
par: Gu, Fengchen, et autres
Publié: (2025)
Associative Recurrent Memory Transformer
par: Rodkin, Ivan, et autres
Publié: (2024)
par: Rodkin, Ivan, et autres
Publié: (2024)
ParaGate: Parasitic-Driven Domain Adaptation Transfer Learning for Netlist Performance Prediction
par: Sun, Bin, et autres
Publié: (2025)
par: Sun, Bin, et autres
Publié: (2025)
Multiobjective Hydropower Reservoir Operation Optimization with Transformer-Based Deep Reinforcement Learning
par: Wu, Rixin, et autres
Publié: (2023)
par: Wu, Rixin, et autres
Publié: (2023)
SGRU: A High-Performance Structured Gated Recurrent Unit for Traffic Flow Prediction
par: Zhang, Wenfeng, et autres
Publié: (2024)
par: Zhang, Wenfeng, et autres
Publié: (2024)
DeepGate3: Towards Scalable Circuit Representation Learning
par: Shi, Zhengyuan, et autres
Publié: (2024)
par: Shi, Zhengyuan, et autres
Publié: (2024)
GPU Memory Prediction for Multimodal Model Training
par: Jeong, Jinwoo, et autres
Publié: (2025)
par: Jeong, Jinwoo, et autres
Publié: (2025)
Dynamic Context Adaptation and Information Flow Control in Transformers: Introducing the Evaluator Adjuster Unit and Gated Residual Connections
par: Dhayalkar, Sahil Rajesh
Publié: (2024)
par: Dhayalkar, Sahil Rajesh
Publié: (2024)
SkillTree: Explainable Skill-Based Deep Reinforcement Learning for Long-Horizon Control Tasks
par: Wen, Yongyan, et autres
Publié: (2024)
par: Wen, Yongyan, et autres
Publié: (2024)
RNA Secondary Structure Prediction Using Transformer-Based Deep Learning Models
par: Zhou, Yanlin, et autres
Publié: (2024)
par: Zhou, Yanlin, et autres
Publié: (2024)
Tri-Accel: Curvature-Aware Precision-Adaptive and Memory-Elastic Optimization for Efficient GPU Usage
par: Sheibanian, Mohsen, et autres
Publié: (2025)
par: Sheibanian, Mohsen, et autres
Publié: (2025)
Task-Core Memory Management and Consolidation for Long-term Continual Learning
par: Huai, Tianyu, et autres
Publié: (2025)
par: Huai, Tianyu, et autres
Publié: (2025)
Memory Retention Is Not Enough to Master Memory Tasks in Reinforcement Learning
par: Shchendrigin, Oleg, et autres
Publié: (2026)
par: Shchendrigin, Oleg, et autres
Publié: (2026)
Interpreting Affine Recurrence Learning in GPT-style Transformers
par: Bhargav, Samarth, et autres
Publié: (2024)
par: Bhargav, Samarth, et autres
Publié: (2024)
Why Linear Recurrent Memory Works in Partially Observable Reinforcement Learning
par: Zhao, Yike, et autres
Publié: (2026)
par: Zhao, Yike, et autres
Publié: (2026)
Meta-Aligner: Bidirectional Preference-Policy Optimization for Multi-Objective LLMs Alignment
par: Xu, Wenzhe, et autres
Publié: (2026)
par: Xu, Wenzhe, et autres
Publié: (2026)
OptMATH: A Scalable Bidirectional Data Synthesis Framework for Optimization Modeling
par: Lu, Hongliang, et autres
Publié: (2025)
par: Lu, Hongliang, et autres
Publié: (2025)
On the Koopman-Based Generalization Bounds for Multi-Task Deep Learning
par: Mohammadigohari, Mahdi, et autres
Publié: (2025)
par: Mohammadigohari, Mahdi, et autres
Publié: (2025)
Bidirectional Hierarchical Protein Multi-Modal Representation Learning
par: Liu, Xuefeng, et autres
Publié: (2025)
par: Liu, Xuefeng, et autres
Publié: (2025)
CUROCKET: Optimizing ROCKET for GPU
par: Stüven, Ole, et autres
Publié: (2026)
par: Stüven, Ole, et autres
Publié: (2026)
Operator-Based Generalization Bound for Deep Learning: Insights on Multi-Task Learning
par: Mohammadigohari, Mahdi, et autres
Publié: (2025)
par: Mohammadigohari, Mahdi, et autres
Publié: (2025)
KernelBlaster: Continual Cross-Task CUDA Optimization via Memory-Augmented In-Context Reinforcement Learning
par: Dong, Kris Shengjun, et autres
Publié: (2026)
par: Dong, Kris Shengjun, et autres
Publié: (2026)
A Survey on Memory-Efficient Transformer-Based Model Training in AI for Science
par: Tian, Kaiyuan, et autres
Publié: (2025)
par: Tian, Kaiyuan, et autres
Publié: (2025)
DGTN: Graph-Enhanced Transformer with Diffusive Attention Gating Mechanism for Enzyme DDG Prediction
par: Lin, Abigail
Publié: (2025)
par: Lin, Abigail
Publié: (2025)
Text Sentiment Analysis and Classification Based on Bidirectional Gated Recurrent Units (GRUs) Model
par: Xu, Wei, et autres
Publié: (2024)
par: Xu, Wei, et autres
Publié: (2024)
GRSN: Gated Recurrent Spiking Neurons for POMDPs and MARL
par: Qin, Lang, et autres
Publié: (2024)
par: Qin, Lang, et autres
Publié: (2024)
Achieving Time Series Reasoning Requires Rethinking Model Design, Tasks Formulation, and Evaluation
par: Kong, Yaxuan, et autres
Publié: (2025)
par: Kong, Yaxuan, et autres
Publié: (2025)
Documents similaires
-
Optimization of bi-directional gated loop cell based on multi-head attention mechanism for SSD health state classification model
par: Wen, Zhizhao, et autres
Publié: (2025) -
Quality analysis and evaluation prediction of RAG retrieval based on machine learning algorithms
par: Zhang, Ruoxin, et autres
Publié: (2025) -
BiTA: Bidirectional Gated Recurrent Unit-Transformer Aggregator in a Temporal Graph Network Framework for Alert Prediction in Computer Networks
par: Nayeri, Zahra Makki, et autres
Publié: (2026) -
Minion Gated Recurrent Unit for Continual Learning
par: Zyarah, Abdullah M., et autres
Publié: (2025) -
A Bidirectional Gated Recurrent Unit Model for PUE Prediction in Data Centers
par: Kannan, Dhivya Dharshini, et autres
Publié: (2025)