LLM Priors for ERM over Programs
Fuente:
arXiv
Salvato in:
| Autori principali: | Singhal, Shivam, Mishra, Priyadarsi, Malach, Eran, Galanti, Tomer |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
On the Alignment Between Supervised and Self-Supervised Contrastive Learning
di: Luthra, Achleshwar, et al.
Pubblicazione: (2025)
di: Luthra, Achleshwar, et al.
Pubblicazione: (2025)
Auto-Regressive Next-Token Predictors are Universal Learners
di: Malach, Eran
Pubblicazione: (2023)
di: Malach, Eran
Pubblicazione: (2023)
The Power of Random Features and the Limits of Distribution-Free Gradient Descent
di: Karchmer, Ari, et al.
Pubblicazione: (2025)
di: Karchmer, Ari, et al.
Pubblicazione: (2025)
Distribution-Aware Algorithm Design with LLM Agents
di: Koganti, Saharsh, et al.
Pubblicazione: (2026)
di: Koganti, Saharsh, et al.
Pubblicazione: (2026)
On the Power of Decision Trees in Auto-Regressive Language Modeling
di: Gan, Yulu, et al.
Pubblicazione: (2024)
di: Gan, Yulu, et al.
Pubblicazione: (2024)
Universal Length Generalization with Turing Programs
di: Hou, Kaiying, et al.
Pubblicazione: (2024)
di: Hou, Kaiying, et al.
Pubblicazione: (2024)
Scalable Principal-Agent Contract Design via Gradient-Based Optimization
di: Galanti, Tomer, et al.
Pubblicazione: (2025)
di: Galanti, Tomer, et al.
Pubblicazione: (2025)
Self-Supervised Contrastive Learning is Approximately Supervised Contrastive Learning
di: Luthra, Achleshwar, et al.
Pubblicazione: (2025)
di: Luthra, Achleshwar, et al.
Pubblicazione: (2025)
How Reinforcement Learning After Next-Token Prediction Facilitates Learning
di: Tsilivis, Nikolaos, et al.
Pubblicazione: (2025)
di: Tsilivis, Nikolaos, et al.
Pubblicazione: (2025)
Directional Neural Collapse Explains Few-Shot Transfer in Self-Supervised Learning
di: Luthra, Achleshwar, et al.
Pubblicazione: (2026)
di: Luthra, Achleshwar, et al.
Pubblicazione: (2026)
To Backtrack or Not to Backtrack: When Sequential Search Limits Model Reasoning
di: Qin, Tian, et al.
Pubblicazione: (2025)
di: Qin, Tian, et al.
Pubblicazione: (2025)
From Inverse Optimization to Feasibility to ERM
di: Mishra, Saurabh, et al.
Pubblicazione: (2024)
di: Mishra, Saurabh, et al.
Pubblicazione: (2024)
The Fair Language Model Paradox
di: Pinto, Andrea, et al.
Pubblicazione: (2024)
di: Pinto, Andrea, et al.
Pubblicazione: (2024)
SGD and Weight Decay Secretly Minimize the Rank of Your Neural Network
di: Galanti, Tomer, et al.
Pubblicazione: (2022)
di: Galanti, Tomer, et al.
Pubblicazione: (2022)
The Evolution of Statistical Induction Heads: In-Context Learning Markov Chains
di: Edelman, Benjamin L., et al.
Pubblicazione: (2024)
di: Edelman, Benjamin L., et al.
Pubblicazione: (2024)
Repeat After Me: Transformers are Better than State Space Models at Copying
di: Jelassi, Samy, et al.
Pubblicazione: (2024)
di: Jelassi, Samy, et al.
Pubblicazione: (2024)
Formation of Representations in Neural Networks
di: Ziyin, Liu, et al.
Pubblicazione: (2024)
di: Ziyin, Liu, et al.
Pubblicazione: (2024)
Don't Stop Me Now: Embedding Based Scheduling for LLMs
di: Shahout, Rana, et al.
Pubblicazione: (2024)
di: Shahout, Rana, et al.
Pubblicazione: (2024)
Loss-to-Loss Prediction: Scaling Laws for All Datasets
di: Brandfonbrener, David, et al.
Pubblicazione: (2024)
di: Brandfonbrener, David, et al.
Pubblicazione: (2024)
DisCO: Reinforcing Large Reasoning Models with Discriminative Constrained Optimization
di: Li, Gang, et al.
Pubblicazione: (2025)
di: Li, Gang, et al.
Pubblicazione: (2025)
Type-II Saddles and Probabilistic Stability of Stochastic Gradient Descent
di: Ziyin, Liu, et al.
Pubblicazione: (2023)
di: Ziyin, Liu, et al.
Pubblicazione: (2023)
On the ERM Principle in Meta-Learning
di: Alon, Yannay, et al.
Pubblicazione: (2024)
di: Alon, Yannay, et al.
Pubblicazione: (2024)
Correlated Proxies: A New Definition and Improved Mitigation for Reward Hacking
di: Laidlaw, Cassidy, et al.
Pubblicazione: (2024)
di: Laidlaw, Cassidy, et al.
Pubblicazione: (2024)
A New Perspective on Shampoo's Preconditioner
di: Morwani, Depen, et al.
Pubblicazione: (2024)
di: Morwani, Depen, et al.
Pubblicazione: (2024)
LoRA Soups: Merging LoRAs for Practical Skill Composition Tasks
di: Prabhakar, Akshara, et al.
Pubblicazione: (2024)
di: Prabhakar, Akshara, et al.
Pubblicazione: (2024)
Let Me Think! A Long Chain-of-Thought Can Be Worth Exponentially Many Short Ones
di: Mirtaheri, Parsa, et al.
Pubblicazione: (2025)
di: Mirtaheri, Parsa, et al.
Pubblicazione: (2025)
The Role of Sparsity for Length Generalization in Transformers
di: Golowich, Noah, et al.
Pubblicazione: (2025)
di: Golowich, Noah, et al.
Pubblicazione: (2025)
Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining
di: Zhao, Rosie, et al.
Pubblicazione: (2025)
di: Zhao, Rosie, et al.
Pubblicazione: (2025)
Universal rates of ERM for agnostic learning
di: Hanneke, Steve, et al.
Pubblicazione: (2025)
di: Hanneke, Steve, et al.
Pubblicazione: (2025)
On the Efficiency of ERM in Feature Learning
di: Hanchi, Ayoub El, et al.
Pubblicazione: (2024)
di: Hanchi, Ayoub El, et al.
Pubblicazione: (2024)
To Infinity and Beyond: Tool-Use Unlocks Length Generalization in State Space Models
di: Malach, Eran, et al.
Pubblicazione: (2025)
di: Malach, Eran, et al.
Pubblicazione: (2025)
ConceptSearch: Towards Efficient Program Search Using LLMs for Abstraction and Reasoning Corpus (ARC)
di: Singhal, Kartik, et al.
Pubblicazione: (2024)
di: Singhal, Kartik, et al.
Pubblicazione: (2024)
Integrating Feature Correlation in Differential Privacy with Applications in DP-ERM
di: Wang, Tianyu, et al.
Pubblicazione: (2026)
di: Wang, Tianyu, et al.
Pubblicazione: (2026)
ERM++: An Improved Baseline for Domain Generalization
di: Teterwak, Piotr, et al.
Pubblicazione: (2023)
di: Teterwak, Piotr, et al.
Pubblicazione: (2023)
Investigating Thematic Patterns and User Preferences in LLM Interactions using BERTopic
di: Bhandarkar, Abhay, et al.
Pubblicazione: (2025)
di: Bhandarkar, Abhay, et al.
Pubblicazione: (2025)
Rethinking JEPA: Compute-Efficient Video SSL with Frozen Teachers
di: Li, Xianhang, et al.
Pubblicazione: (2025)
di: Li, Xianhang, et al.
Pubblicazione: (2025)
Transcendence: Generative Models Can Outperform The Experts That Train Them
di: Zhang, Edwin, et al.
Pubblicazione: (2024)
di: Zhang, Edwin, et al.
Pubblicazione: (2024)
Risk-averse Total-reward MDPs with ERM and EVaR
di: Su, Xihong, et al.
Pubblicazione: (2024)
di: Su, Xihong, et al.
Pubblicazione: (2024)
Mixture of Parrots: Experts improve memorization more than reasoning
di: Jelassi, Samy, et al.
Pubblicazione: (2024)
di: Jelassi, Samy, et al.
Pubblicazione: (2024)
GeoERM: Geometry-Aware Multi-Task Representation Learning on Riemannian Manifolds
di: Chen, Aoran, et al.
Pubblicazione: (2025)
di: Chen, Aoran, et al.
Pubblicazione: (2025)
Documenti analoghi
-
On the Alignment Between Supervised and Self-Supervised Contrastive Learning
di: Luthra, Achleshwar, et al.
Pubblicazione: (2025) -
Auto-Regressive Next-Token Predictors are Universal Learners
di: Malach, Eran
Pubblicazione: (2023) -
The Power of Random Features and the Limits of Distribution-Free Gradient Descent
di: Karchmer, Ari, et al.
Pubblicazione: (2025) -
Distribution-Aware Algorithm Design with LLM Agents
di: Koganti, Saharsh, et al.
Pubblicazione: (2026) -
On the Power of Decision Trees in Auto-Regressive Language Modeling
di: Gan, Yulu, et al.
Pubblicazione: (2024)