Neural Thermodynamic Laws for Large Language Model Training
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Ziming, Liu, Yizhou, Gore, Jeff, Tegmark, Max |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Neural Scaling Law from Lottery Ticket Ensembling
di: Liu, Ziming, et al.
Pubblicazione: (2023)
di: Liu, Ziming, et al.
Pubblicazione: (2023)
Physics of Skill Learning
di: Liu, Ziming, et al.
Pubblicazione: (2025)
di: Liu, Ziming, et al.
Pubblicazione: (2025)
Superposition unifies power-law training dynamics
di: Chen, Zixin Jessie, et al.
Pubblicazione: (2026)
di: Chen, Zixin Jessie, et al.
Pubblicazione: (2026)
KAN 2.0: Kolmogorov-Arnold Networks Meet Science
di: Liu, Ziming, et al.
Pubblicazione: (2024)
di: Liu, Ziming, et al.
Pubblicazione: (2024)
A Resource Model For Neural Scaling Law
di: Song, Jinyeop, et al.
Pubblicazione: (2024)
di: Song, Jinyeop, et al.
Pubblicazione: (2024)
A Systematic Literature Review of Spatio-Temporal Graph Neural Network Models for Time Series Forecasting and Classification
di: Corradini, Flavio, et al.
Pubblicazione: (2024)
di: Corradini, Flavio, et al.
Pubblicazione: (2024)
Toward Dynamic Stability Assessment of Power Grid Topologies using Graph Neural Networks
di: Nauck, Christian, et al.
Pubblicazione: (2022)
di: Nauck, Christian, et al.
Pubblicazione: (2022)
DeepOHeat-v1: Efficient Operator Learning for Fast and Trustworthy Thermal Simulation and Optimization in 3D-IC Design
di: Yu, Xinling, et al.
Pubblicazione: (2025)
di: Yu, Xinling, et al.
Pubblicazione: (2025)
Bayesian Inference with Deep Weakly Nonlinear Networks
di: Hanin, Boris, et al.
Pubblicazione: (2024)
di: Hanin, Boris, et al.
Pubblicazione: (2024)
When Attention Collapses: Residual Evidence Modeling for Compositional Inference
di: Houba, Niklas
Pubblicazione: (2026)
di: Houba, Niklas
Pubblicazione: (2026)
Scalable Reinforcement Post-Training Beyond Static Human Prompts: Evolving Alignment via Asymmetric Self-Play
di: Ye, Ziyu, et al.
Pubblicazione: (2024)
di: Ye, Ziyu, et al.
Pubblicazione: (2024)
Lines of Thought in Large Language Models
di: Sarfati, Raphaël, et al.
Pubblicazione: (2024)
di: Sarfati, Raphaël, et al.
Pubblicazione: (2024)
PRL-Bench: A Comprehensive Benchmark Evaluating LLMs' Capabilities in Frontier Physics Research
di: Miao, Tingjia, et al.
Pubblicazione: (2026)
di: Miao, Tingjia, et al.
Pubblicazione: (2026)
L$^2$M: Mutual Information Scaling Law for Long-Context Language Modeling
di: Chen, Zhuo, et al.
Pubblicazione: (2025)
di: Chen, Zhuo, et al.
Pubblicazione: (2025)
From Data to Laws: Neural Discovery of Conservation Laws Without False Positives
di: Ray, Rahul D
Pubblicazione: (2026)
di: Ray, Rahul D
Pubblicazione: (2026)
Nonnegative matrix factorization and the principle of the common cause
di: Khalafyan, E., et al.
Pubblicazione: (2025)
di: Khalafyan, E., et al.
Pubblicazione: (2025)
On the continuity of flows
di: Sha, Congzhou M
Pubblicazione: (2025)
di: Sha, Congzhou M
Pubblicazione: (2025)
Mesh-free sparse identification of nonlinear dynamics
di: Gao, Mars Liyao, et al.
Pubblicazione: (2025)
di: Gao, Mars Liyao, et al.
Pubblicazione: (2025)
The most likely common cause
di: Hovhannisyan, A., et al.
Pubblicazione: (2023)
di: Hovhannisyan, A., et al.
Pubblicazione: (2023)
Optimal Symmetries in Binary Classification
di: Ngairangbam, Vishal S., et al.
Pubblicazione: (2024)
di: Ngairangbam, Vishal S., et al.
Pubblicazione: (2024)
Uncertainty Quantification with Bayesian Higher Order ReLU KANs
di: Giroux, James, et al.
Pubblicazione: (2024)
di: Giroux, James, et al.
Pubblicazione: (2024)
Practically Effective Adjustment Variable Selection in Causal Inference
di: Noda, Atsushi, et al.
Pubblicazione: (2025)
di: Noda, Atsushi, et al.
Pubblicazione: (2025)
Anomaly Detection in Soil Heavy Metal Contamination Using Unsupervised Learning for Environmental Risk Assessment
di: Adjokatse, Isaac Tettey, et al.
Pubblicazione: (2026)
di: Adjokatse, Isaac Tettey, et al.
Pubblicazione: (2026)
Deep Learning Domain Adaptation to Understand Physico-Chemical Processes from Fluorescence Spectroscopy Small Datasets: Application to Ageing of Olive Oil
di: Michelucci, Umberto, et al.
Pubblicazione: (2024)
di: Michelucci, Umberto, et al.
Pubblicazione: (2024)
Efficient Training of Deep Neural Operator Networks via Randomized Sampling
di: Karumuri, Sharmila, et al.
Pubblicazione: (2024)
di: Karumuri, Sharmila, et al.
Pubblicazione: (2024)
Global Tropical Cyclone Intensity Forecasting with Multi-modal Multi-scale Causal Autoregressive Model
di: Wang, Xinyu, et al.
Pubblicazione: (2024)
di: Wang, Xinyu, et al.
Pubblicazione: (2024)
Structured Kolmogorov-Arnold Neural ODEs for Interpretable Learning and Symbolic Discovery of Nonlinear Dynamics
di: Liu, Wei, et al.
Pubblicazione: (2025)
di: Liu, Wei, et al.
Pubblicazione: (2025)
Data-driven Progressive Discovery of Physical Laws
di: Xia, Mingkun, et al.
Pubblicazione: (2026)
di: Xia, Mingkun, et al.
Pubblicazione: (2026)
Characteristic Guidance: Non-linear Correction for Diffusion Model at Large Guidance Scale
di: Zheng, Candi, et al.
Pubblicazione: (2023)
di: Zheng, Candi, et al.
Pubblicazione: (2023)
Thermodynamic bounds on energy use in quasi-static Deep Neural Networks
di: Tkachenko, Alexei V.
Pubblicazione: (2025)
di: Tkachenko, Alexei V.
Pubblicazione: (2025)
PIED: Physics-Informed Experimental Design for Inverse Problems
di: Hemachandra, Apivich, et al.
Pubblicazione: (2025)
di: Hemachandra, Apivich, et al.
Pubblicazione: (2025)
Free Energy Risk Metrics for Systemically Safe AI: Gatekeeping Multi-Agent Study
di: Walters, Michael, et al.
Pubblicazione: (2025)
di: Walters, Michael, et al.
Pubblicazione: (2025)
Smart Ensemble Learning Framework for Predicting Groundwater Heavy Metal Pollution
di: Ansah-Narh, T., et al.
Pubblicazione: (2026)
di: Ansah-Narh, T., et al.
Pubblicazione: (2026)
PINNACLE: PINN Adaptive ColLocation and Experimental points selection
di: Lau, Gregory Kang Ruey, et al.
Pubblicazione: (2024)
di: Lau, Gregory Kang Ruey, et al.
Pubblicazione: (2024)
Adaptive Behavioral AI: Reinforcement Learning to Enhance Pharmacy Services
di: del Río, Ana Fernández, et al.
Pubblicazione: (2024)
di: del Río, Ana Fernández, et al.
Pubblicazione: (2024)
Understanding complex crowd dynamics with generative neural simulators
di: Minartz, Koen, et al.
Pubblicazione: (2024)
di: Minartz, Koen, et al.
Pubblicazione: (2024)
PRISM: Deriving a White-Box Transformer as a Signal-Noise Decomposition Operator via Maximum Coding Rate Reduction
di: Huang, Dongchen
Pubblicazione: (2026)
di: Huang, Dongchen
Pubblicazione: (2026)
The role of data embedding in quantum autoencoders for improved anomaly detection
di: Araz, Jack Y., et al.
Pubblicazione: (2024)
di: Araz, Jack Y., et al.
Pubblicazione: (2024)
PATHFINDER: Multi-objective discovery in structural and spectral spaces
di: Barakati, Kamyar, et al.
Pubblicazione: (2026)
di: Barakati, Kamyar, et al.
Pubblicazione: (2026)
Position: Solve Layerwise Linear Models First to Understand Neural Dynamical Phenomena (Neural Collapse, Emergence, Lazy/Rich Regime, and Grokking)
di: Nam, Yoonsoo, et al.
Pubblicazione: (2025)
di: Nam, Yoonsoo, et al.
Pubblicazione: (2025)
Documenti analoghi
-
A Neural Scaling Law from Lottery Ticket Ensembling
di: Liu, Ziming, et al.
Pubblicazione: (2023) -
Physics of Skill Learning
di: Liu, Ziming, et al.
Pubblicazione: (2025) -
Superposition unifies power-law training dynamics
di: Chen, Zixin Jessie, et al.
Pubblicazione: (2026) -
KAN 2.0: Kolmogorov-Arnold Networks Meet Science
di: Liu, Ziming, et al.
Pubblicazione: (2024) -
A Resource Model For Neural Scaling Law
di: Song, Jinyeop, et al.
Pubblicazione: (2024)