The Hidden Power of Pure 16-bit Floating-Point Neural Networks
Fuente:
arXiv
Salvato in:
| Autori principali: | Yun, Juyoung, Kang, Byungkon, Fu, Zhoulai |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Revisiting 16-bit Neural Network Training: A Practical Approach for Resource-Limited Learning
di: Yun, Juyoung, et al.
Pubblicazione: (2023)
di: Yun, Juyoung, et al.
Pubblicazione: (2023)
The Power of Training: How Different Neural Network Setups Influence the Energy Demand
di: Geißler, Daniel, et al.
Pubblicazione: (2024)
di: Geißler, Daniel, et al.
Pubblicazione: (2024)
Exchangeability in Neural Network and its Application to Dynamic Pruning
di: Pu, et al.
Pubblicazione: (2025)
di: Pu, et al.
Pubblicazione: (2025)
Quantum Neural Networks for Wind Energy Forecasting: A Comparative Study of Performance and Scalability with Classical Models
di: Hangun, Batuhan, et al.
Pubblicazione: (2025)
di: Hangun, Batuhan, et al.
Pubblicazione: (2025)
Research on Low-Latency Inference and Training Efficiency Optimization for Graph Neural Network and Large Language Model-Based Recommendation Systems
di: Zhao, Yushang, et al.
Pubblicazione: (2025)
di: Zhao, Yushang, et al.
Pubblicazione: (2025)
Distilled Neural Networks for Efficient Learning to Rank
di: Nardini, F. M., et al.
Pubblicazione: (2022)
di: Nardini, F. M., et al.
Pubblicazione: (2022)
Ghosted Layers: Unconstrained Activation Alignment for Recovering Layer-Pruned LLMs
di: Yun, Vincent-Daniel, et al.
Pubblicazione: (2026)
di: Yun, Vincent-Daniel, et al.
Pubblicazione: (2026)
Comment on paper: Position: Rethinking Post-Hoc Search-Based Neural Approaches for Solving Large-Scale Traveling Salesman Problems
di: Min, Yimeng
Pubblicazione: (2024)
di: Min, Yimeng
Pubblicazione: (2024)
Automatic Generation of Fast and Accurate Performance Models for Deep Neural Network Accelerators
di: Lübeck, Konstantin, et al.
Pubblicazione: (2024)
di: Lübeck, Konstantin, et al.
Pubblicazione: (2024)
OSCAR: Offline Spectral Covariance-Aware Rotation for 2-bit KV Cache Quantization
di: Zhou, Zhongzhu, et al.
Pubblicazione: (2026)
di: Zhou, Zhongzhu, et al.
Pubblicazione: (2026)
Reducing Latency of LLM Search Agent via Speculation-based Algorithm-System Co-Design
di: Huang, Zixiao, et al.
Pubblicazione: (2025)
di: Huang, Zixiao, et al.
Pubblicazione: (2025)
Mitigating Gradient Overlap in Deep Residual Networks with Gradient Normalization for Improved Non-Convex Optimization
di: Yun, Juyoung
Pubblicazione: (2024)
di: Yun, Juyoung
Pubblicazione: (2024)
Search Your Block Floating Point Scales!
di: Gupta, Tanmaey, et al.
Pubblicazione: (2026)
di: Gupta, Tanmaey, et al.
Pubblicazione: (2026)
Stabilizing Backpropagation in 16-bit Neural Training with Modified Adam Optimizer
di: Yun, Juyoung
Pubblicazione: (2023)
di: Yun, Juyoung
Pubblicazione: (2023)
Scalable Floating-Point Satisfiability via Staged Optimization
di: Zhang, Yuanzhuo, et al.
Pubblicazione: (2026)
di: Zhang, Yuanzhuo, et al.
Pubblicazione: (2026)
Performance Modeling of Data Storage Systems using Generative Models
di: Al-Maeeni, Abdalaziz Rashid, et al.
Pubblicazione: (2023)
di: Al-Maeeni, Abdalaziz Rashid, et al.
Pubblicazione: (2023)
Machine Learning Methods for Evaluating Public Crisis: Meta-Analysis
di: Okpala, Izunna, et al.
Pubblicazione: (2023)
di: Okpala, Izunna, et al.
Pubblicazione: (2023)
Fairness in Serving Large Language Models
di: Sheng, Ying, et al.
Pubblicazione: (2023)
di: Sheng, Ying, et al.
Pubblicazione: (2023)
Leveraging Speculative Sampling and KV-Cache Optimizations Together for Generative AI using OpenVINO
di: Barad, Haim, et al.
Pubblicazione: (2023)
di: Barad, Haim, et al.
Pubblicazione: (2023)
FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models
di: Shao, Zishan, et al.
Pubblicazione: (2025)
di: Shao, Zishan, et al.
Pubblicazione: (2025)
SLiM: One-shot Quantization and Sparsity with Low-rank Approximation for LLM Weight Compression
di: Mozaffari, Mohammad, et al.
Pubblicazione: (2024)
di: Mozaffari, Mohammad, et al.
Pubblicazione: (2024)
Deploying Open-Source Large Language Models: A performance Analysis
di: Bendi-Ouis, Yannis, et al.
Pubblicazione: (2024)
di: Bendi-Ouis, Yannis, et al.
Pubblicazione: (2024)
Ragged Paged Attention: A High-Performance and Flexible LLM Inference Kernel for TPU
di: Jiang, Jevin, et al.
Pubblicazione: (2026)
di: Jiang, Jevin, et al.
Pubblicazione: (2026)
Generalizing Scaling Laws for Dense and Sparse Large Language Models
di: Hossain, Md Arafat, et al.
Pubblicazione: (2025)
di: Hossain, Md Arafat, et al.
Pubblicazione: (2025)
Rapid Augmentations for Time Series (RATS): A High-Performance Library for Time Series Augmentation
di: Skaf, Wadie, et al.
Pubblicazione: (2026)
di: Skaf, Wadie, et al.
Pubblicazione: (2026)
GreedySnake: Accelerating SSD-Offloaded LLM Training with Efficient Scheduling and Optimizer Step Overlapping
di: Yin, Yishu, et al.
Pubblicazione: (2025)
di: Yin, Yishu, et al.
Pubblicazione: (2025)
EXAQ: Exponent Aware Quantization For LLMs Acceleration
di: Shkolnik, Moran, et al.
Pubblicazione: (2024)
di: Shkolnik, Moran, et al.
Pubblicazione: (2024)
Energy-Efficient Transformer Inference: Optimization Strategies for Time Series Classification
di: Kermani, Arshia, et al.
Pubblicazione: (2025)
di: Kermani, Arshia, et al.
Pubblicazione: (2025)
Private LLM Inference on Consumer Blackwell GPUs: A Practical Guide for Cost-Effective Local Deployment in SMEs
di: Knoop, Jonathan, et al.
Pubblicazione: (2026)
di: Knoop, Jonathan, et al.
Pubblicazione: (2026)
APOLLO: SGD-like Memory, AdamW-level Performance
di: Zhu, Hanqing, et al.
Pubblicazione: (2024)
di: Zhu, Hanqing, et al.
Pubblicazione: (2024)
An Efficient Hybrid Sparse Attention with CPU-GPU Parallelism for Long-Context Inference
di: Yao, Feiyu, et al.
Pubblicazione: (2026)
di: Yao, Feiyu, et al.
Pubblicazione: (2026)
Energy per Successful Goal: Goal-Level Energy Accounting for Agentic AI Systems
di: Panigrahy, Deepak, et al.
Pubblicazione: (2026)
di: Panigrahy, Deepak, et al.
Pubblicazione: (2026)
FlashOmni: A Unified Sparse Attention Engine for Diffusion Transformers
di: Qiao, Liang, et al.
Pubblicazione: (2025)
di: Qiao, Liang, et al.
Pubblicazione: (2025)
Knowledge Grafting: A Mechanism for Optimizing AI Model Deployment in Resource-Constrained Environments
di: Almurshed, Osama, et al.
Pubblicazione: (2025)
di: Almurshed, Osama, et al.
Pubblicazione: (2025)
FlashSVD v1.5: Making Low-Rank Transformers Inference Actually Fast
di: Wu, Wenhao, et al.
Pubblicazione: (2026)
di: Wu, Wenhao, et al.
Pubblicazione: (2026)
The Race to Efficiency: A New Perspective on AI Scaling Laws
di: Lu, Chien-Ping
Pubblicazione: (2025)
di: Lu, Chien-Ping
Pubblicazione: (2025)
Profiling LoRA/QLoRA Fine-Tuning Efficiency on Consumer GPUs: An RTX 4060 Case Study
di: Avinash, MSR
Pubblicazione: (2025)
di: Avinash, MSR
Pubblicazione: (2025)
Dynamic Expert Quantization for Scalable Mixture-of-Experts Inference
di: Chu, Kexin, et al.
Pubblicazione: (2025)
di: Chu, Kexin, et al.
Pubblicazione: (2025)
AdaGradSelect: An adaptive gradient-guided layer selection method for efficient fine-tuning of SLMs
di: Kumar, Anshul, et al.
Pubblicazione: (2025)
di: Kumar, Anshul, et al.
Pubblicazione: (2025)
On the Sustainability of AI Inferences in the Edge
di: Sobhani, Ghazal, et al.
Pubblicazione: (2025)
di: Sobhani, Ghazal, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Revisiting 16-bit Neural Network Training: A Practical Approach for Resource-Limited Learning
di: Yun, Juyoung, et al.
Pubblicazione: (2023) -
The Power of Training: How Different Neural Network Setups Influence the Energy Demand
di: Geißler, Daniel, et al.
Pubblicazione: (2024) -
Exchangeability in Neural Network and its Application to Dynamic Pruning
di: Pu, et al.
Pubblicazione: (2025) -
Quantum Neural Networks for Wind Energy Forecasting: A Comparative Study of Performance and Scalability with Classical Models
di: Hangun, Batuhan, et al.
Pubblicazione: (2025) -
Research on Low-Latency Inference and Training Efficiency Optimization for Graph Neural Network and Large Language Model-Based Recommendation Systems
di: Zhao, Yushang, et al.
Pubblicazione: (2025)