Scaling Laws for Precision in High-Dimensional Linear Regression
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Dechen, Tang, Xuan, Liang, Yingyu, Zou, Difan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Learning under Quantization for High-Dimensional Linear Regression
por: Zhang, Dechen, et al.
Publicado: (2025)
por: Zhang, Dechen, et al.
Publicado: (2025)
Kernel Regression in Structured Non-IID Settings: Theory and Implications for Denoising Score Learning
por: Zhang, Dechen, et al.
Publicado: (2025)
por: Zhang, Dechen, et al.
Publicado: (2025)
Scaling Law Phenomena Across Regression Paradigms: Multiple and Kernel Approaches
por: Chen, Yifang, et al.
Publicado: (2025)
por: Chen, Yifang, et al.
Publicado: (2025)
A Convergence Analysis of Adaptive Optimizers under Floating-point Quantization
por: Tang, Xuan, et al.
Publicado: (2025)
por: Tang, Xuan, et al.
Publicado: (2025)
Towards Theoretical Understanding of Transformer Test-Time Computing: Investigation on In-Context Linear Regression
por: Chen, Xingwu, et al.
Publicado: (2025)
por: Chen, Xingwu, et al.
Publicado: (2025)
Understanding the Generalization of Stochastic Gradient Adam in Learning Neural Networks
por: Tang, Xuan, et al.
Publicado: (2025)
por: Tang, Xuan, et al.
Publicado: (2025)
Scaling Laws in Linear Regression: Compute, Parameters, and Data
por: Lin, Licong, et al.
Publicado: (2024)
por: Lin, Licong, et al.
Publicado: (2024)
Structured Role-Aware Policy Optimization for Multimodal Reasoning
por: Jiang, Bingqing, et al.
Publicado: (2026)
por: Jiang, Bingqing, et al.
Publicado: (2026)
On the Memorization of Consistency Distillation for Diffusion Models
por: Jiang, Bingqing, et al.
Publicado: (2026)
por: Jiang, Bingqing, et al.
Publicado: (2026)
On the Robustness of Transformers against Context Hijacking for Linear Classification
por: Li, Tianle, et al.
Publicado: (2025)
por: Li, Tianle, et al.
Publicado: (2025)
Scaling Laws of SignSGD in Linear Regression: When Does It Outperform SGD?
por: Kim, Jihwan, et al.
Publicado: (2026)
por: Kim, Jihwan, et al.
Publicado: (2026)
A Human-Like Reasoning Framework for Multi-Phases Planning Task with Large Language Models
por: Xie, Chengxing, et al.
Publicado: (2024)
por: Xie, Chengxing, et al.
Publicado: (2024)
Reshaping Reasoning in LLMs: A Theoretical Analysis of RL Training Dynamics through Pattern Selection
por: Chen, Xingwu, et al.
Publicado: (2025)
por: Chen, Xingwu, et al.
Publicado: (2025)
On the Collapse Errors Induced by the Deterministic Sampler for Diffusion Models
por: Zhang, Yi, et al.
Publicado: (2025)
por: Zhang, Yi, et al.
Publicado: (2025)
Differential Privacy Mechanisms in Neural Tangent Kernel Regression
por: Gu, Jiuxiang, et al.
Publicado: (2024)
por: Gu, Jiuxiang, et al.
Publicado: (2024)
Training Tensor Attention Efficiently: From Cubic to Almost Linear Time
por: Cao, Yang, et al.
Publicado: (2024)
por: Cao, Yang, et al.
Publicado: (2024)
Physics-Informed Distillation of Diffusion Models for PDE-Constrained Generation
por: Zhang, Yi, et al.
Publicado: (2025)
por: Zhang, Yi, et al.
Publicado: (2025)
Effective Frontiers: A Unification of Neural Scaling Laws
por: Zou, Jiaxuan, et al.
Publicado: (2026)
por: Zou, Jiaxuan, et al.
Publicado: (2026)
Beyond Linear Approximations: A Novel Pruning Approach for Attention Matrix
por: Liang, Yingyu, et al.
Publicado: (2024)
por: Liang, Yingyu, et al.
Publicado: (2024)
Multi-Layer Transformers Gradient Can be Approximated in Almost Linear Time
por: Liang, Yingyu, et al.
Publicado: (2024)
por: Liang, Yingyu, et al.
Publicado: (2024)
Superiority of Multi-Head Attention in In-Context Linear Regression
por: Cui, Yingqian, et al.
Publicado: (2024)
por: Cui, Yingqian, et al.
Publicado: (2024)
Towards Neural Scaling Laws on Graphs
por: Liu, Jingzhe, et al.
Publicado: (2024)
por: Liu, Jingzhe, et al.
Publicado: (2024)
Does Scaling Law Apply in Time Series Forecasting?
por: Li, Zeyan, et al.
Publicado: (2025)
por: Li, Zeyan, et al.
Publicado: (2025)
Towards Precise Scaling Laws for Video Diffusion Transformers
por: Yin, Yuanyang, et al.
Publicado: (2024)
por: Yin, Yuanyang, et al.
Publicado: (2024)
Exploring the Frontiers of Softmax: Provable Optimization, Applications in Diffusion Model, and Beyond
por: Cao, Yang, et al.
Publicado: (2024)
por: Cao, Yang, et al.
Publicado: (2024)
Discovering the Gems in Early Layers: Accelerating Long-Context LLMs with 1000x Input Token Reduction
por: Shi, Zhenmei, et al.
Publicado: (2024)
por: Shi, Zhenmei, et al.
Publicado: (2024)
Wukong: Towards a Scaling Law for Large-Scale Recommendation
por: Zhang, Buyun, et al.
Publicado: (2024)
por: Zhang, Buyun, et al.
Publicado: (2024)
How Does Critical Batch Size Scale in Pre-training?
por: Zhang, Hanlin, et al.
Publicado: (2024)
por: Zhang, Hanlin, et al.
Publicado: (2024)
RoPE Attention Can Be Trained in Almost Linear Time
por: Cao, Yang, et al.
Publicado: (2024)
por: Cao, Yang, et al.
Publicado: (2024)
Grokking in Linear Models for Logistic Regression
por: Das, Nataraj, et al.
Publicado: (2026)
por: Das, Nataraj, et al.
Publicado: (2026)
Do Large Language Models Have Compositional Ability? An Investigation into Limitations and Scalability
por: Xu, Zhuoyan, et al.
Publicado: (2024)
por: Xu, Zhuoyan, et al.
Publicado: (2024)
Does higher interpretability imply better utility? A Pairwise Analysis on Sparse Autoencoders
por: Wang, Xu, et al.
Publicado: (2025)
por: Wang, Xu, et al.
Publicado: (2025)
Can Language Models Discover Scaling Laws?
por: Lin, Haowei, et al.
Publicado: (2025)
por: Lin, Haowei, et al.
Publicado: (2025)
What Makes a Strong Model? A Unified Spectral Analysis of Knowledge Transfer over High-dimensional Linear Regression
por: Wu, Wendao, et al.
Publicado: (2026)
por: Wu, Wendao, et al.
Publicado: (2026)
ProFlow: Zero-Shot Physics-Consistent Sampling via Proximal Flow Guidance
por: Yu, Zichao, et al.
Publicado: (2026)
por: Yu, Zichao, et al.
Publicado: (2026)
STGAN: Spatial-temporal Graph Autoregression Network for Pavement Distress Deterioration Prediction
por: Tong, Shilin, et al.
Publicado: (2025)
por: Tong, Shilin, et al.
Publicado: (2025)
Towards Neural Scaling Laws for Time Series Foundation Models
por: Yao, Qingren, et al.
Publicado: (2024)
por: Yao, Qingren, et al.
Publicado: (2024)
Understanding the Dynamics of Demonstration Conflict in In-Context Learning
por: Jiao, Difan, et al.
Publicado: (2026)
por: Jiao, Difan, et al.
Publicado: (2026)
Bypassing the Exponential Dependency: Looped Transformers Efficiently Learn In-context by Multi-step Gradient Descent
por: Chen, Bo, et al.
Publicado: (2024)
por: Chen, Bo, et al.
Publicado: (2024)
Curse of Attention: A Kernel-Based Perspective for Why Transformers Fail to Generalize on Time Series Forecasting and Beyond
por: Ke, Yekun, et al.
Publicado: (2024)
por: Ke, Yekun, et al.
Publicado: (2024)
Ejemplares similares
-
Learning under Quantization for High-Dimensional Linear Regression
por: Zhang, Dechen, et al.
Publicado: (2025) -
Kernel Regression in Structured Non-IID Settings: Theory and Implications for Denoising Score Learning
por: Zhang, Dechen, et al.
Publicado: (2025) -
Scaling Law Phenomena Across Regression Paradigms: Multiple and Kernel Approaches
por: Chen, Yifang, et al.
Publicado: (2025) -
A Convergence Analysis of Adaptive Optimizers under Floating-point Quantization
por: Tang, Xuan, et al.
Publicado: (2025) -
Towards Theoretical Understanding of Transformer Test-Time Computing: Investigation on In-Context Linear Regression
por: Chen, Xingwu, et al.
Publicado: (2025)