Celo2: Towards Learned Optimization Free Lunch
Fuente:
arXiv
Salvato in:
| Autori principali: | Moudgil, Abhinav, Knyazev, Boris, Belilovsky, Eugene |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Celo: Training Versatile Learned Optimizers on a Compute Diet
di: Moudgil, Abhinav, et al.
Pubblicazione: (2025)
di: Moudgil, Abhinav, et al.
Pubblicazione: (2025)
Accelerating Training with Neuron Interaction and Nowcasting Networks
di: Knyazev, Boris, et al.
Pubblicazione: (2024)
di: Knyazev, Boris, et al.
Pubblicazione: (2024)
Meta-learning Optimizers for Communication-Efficient Learning
di: Joseph, Charles-Étienne, et al.
Pubblicazione: (2023)
di: Joseph, Charles-Étienne, et al.
Pubblicazione: (2023)
PyLO: Towards Accessible Learned Optimizers in PyTorch
di: Janson, Paul, et al.
Pubblicazione: (2025)
di: Janson, Paul, et al.
Pubblicazione: (2025)
Efficient Refusal Ablation in LLM through Optimal Transport
di: Nanfack, Geraldin, et al.
Pubblicazione: (2026)
di: Nanfack, Geraldin, et al.
Pubblicazione: (2026)
Warming Up for Zeroth-Order Federated Pre-Training with Low Resource Clients
di: Legate, Gwen, et al.
Pubblicazione: (2025)
di: Legate, Gwen, et al.
Pubblicazione: (2025)
Not Only the Last-Layer Features for Spurious Correlations: All Layer Deep Feature Reweighting
di: Hameed, Humza Wajid, et al.
Pubblicazione: (2024)
di: Hameed, Humza Wajid, et al.
Pubblicazione: (2024)
No Free Lunch: Fundamental Limits of Learning Non-Hallucinating Generative Models
di: Wu, Changlong, et al.
Pubblicazione: (2024)
di: Wu, Changlong, et al.
Pubblicazione: (2024)
$μ$LO: Compute-Efficient Meta-Generalization of Learned Optimizers
di: Thérien, Benjamin, et al.
Pubblicazione: (2024)
di: Thérien, Benjamin, et al.
Pubblicazione: (2024)
(Almost) Free Modality Stitching of Foundation Models
di: Singh, Jaisidh, et al.
Pubblicazione: (2025)
di: Singh, Jaisidh, et al.
Pubblicazione: (2025)
No Free Lunch: Rethinking Internal Feedback for LLM Reasoning
di: Zhang, Yanzhi, et al.
Pubblicazione: (2025)
di: Zhang, Yanzhi, et al.
Pubblicazione: (2025)
Less is More: Undertraining Experts Improves Model Upcycling
di: Horoi, Stefan, et al.
Pubblicazione: (2025)
di: Horoi, Stefan, et al.
Pubblicazione: (2025)
Non-Uniform Parameter-Wise Model Merging
di: Camacho, Albert Manuel Orozco, et al.
Pubblicazione: (2024)
di: Camacho, Albert Manuel Orozco, et al.
Pubblicazione: (2024)
Model Parallelism With Subnetwork Data Parallelism
di: Singh, Vaibhav, et al.
Pubblicazione: (2025)
di: Singh, Vaibhav, et al.
Pubblicazione: (2025)
A Free Lunch in LLM Compression: Revisiting Retraining after Pruning
di: Wagner, Moritz, et al.
Pubblicazione: (2025)
di: Wagner, Moritz, et al.
Pubblicazione: (2025)
DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone
di: Singh, Vaibhav, et al.
Pubblicazione: (2025)
di: Singh, Vaibhav, et al.
Pubblicazione: (2025)
Integer Scale: A Free Lunch for Faster Fine-grained Quantization of LLMs
di: Li, Qingyuan, et al.
Pubblicazione: (2024)
di: Li, Qingyuan, et al.
Pubblicazione: (2024)
ACCO: Accumulate While You Communicate for Communication-Overlapped Sharded LLM Training
di: Nabli, Adel, et al.
Pubblicazione: (2024)
di: Nabli, Adel, et al.
Pubblicazione: (2024)
Separable Power of Classical and Quantum Learning Protocols Through the Lens of No-Free-Lunch Theorem
di: Wang, Xinbiao, et al.
Pubblicazione: (2024)
di: Wang, Xinbiao, et al.
Pubblicazione: (2024)
A No Free Lunch Theorem for Human-AI Collaboration
di: Peng, Kenny, et al.
Pubblicazione: (2024)
di: Peng, Kenny, et al.
Pubblicazione: (2024)
No-Free-Lunch Theories for Tensor-Network Machine Learning Models
di: Wu, Jing-Chuan, et al.
Pubblicazione: (2024)
di: Wu, Jing-Chuan, et al.
Pubblicazione: (2024)
FreeBind: Free Lunch in Unified Multimodal Space via Knowledge Fusion
di: Wang, Zehan, et al.
Pubblicazione: (2024)
di: Wang, Zehan, et al.
Pubblicazione: (2024)
Graph Neural Networks for Learning Equivariant Representations of Neural Networks
di: Kofinas, Miltiadis, et al.
Pubblicazione: (2024)
di: Kofinas, Miltiadis, et al.
Pubblicazione: (2024)
Harmony in Diversity: Merging Neural Networks with Canonical Correlation Analysis
di: Horoi, Stefan, et al.
Pubblicazione: (2024)
di: Horoi, Stefan, et al.
Pubblicazione: (2024)
Free Lunch in Medical Image Foundation Model Pre-training via Randomized Synthesis and Disentanglement
di: Wei, Yuhan, et al.
Pubblicazione: (2026)
di: Wei, Yuhan, et al.
Pubblicazione: (2026)
CoPE: Clipped RoPE as A Scalable Free Lunch for Long Context LLMs
di: Li, Haoran, et al.
Pubblicazione: (2026)
di: Li, Haoran, et al.
Pubblicazione: (2026)
Free Lunch for Federated Remote Sensing Target Fine-Grained Classification: A Parameter-Efficient Framework
di: Chen, Shengchao, et al.
Pubblicazione: (2024)
di: Chen, Shengchao, et al.
Pubblicazione: (2024)
Preference Conditioned Multi-Objective Reinforcement Learning: Decomposed, Diversity-Driven Policy Optimization
di: Ambadkar, Tanmay, et al.
Pubblicazione: (2026)
di: Ambadkar, Tanmay, et al.
Pubblicazione: (2026)
LLMInit: A Free Lunch from Large Language Models for Selective Initialization of Recommendation
di: Zhang, Weizhi, et al.
Pubblicazione: (2025)
di: Zhang, Weizhi, et al.
Pubblicazione: (2025)
RL$^3$: Boosting Meta Reinforcement Learning via RL inside RL$^2$
di: Bhatia, Abhinav, et al.
Pubblicazione: (2023)
di: Bhatia, Abhinav, et al.
Pubblicazione: (2023)
Towards General-Purpose Model-Free Reinforcement Learning
di: Fujimoto, Scott, et al.
Pubblicazione: (2025)
di: Fujimoto, Scott, et al.
Pubblicazione: (2025)
VisionTS: Visual Masked Autoencoders Are Free-Lunch Zero-Shot Time Series Forecasters
di: Chen, Mouxiang, et al.
Pubblicazione: (2024)
di: Chen, Mouxiang, et al.
Pubblicazione: (2024)
Simple and Scalable Strategies to Continually Pre-train Large Language Models
di: Ibrahim, Adam, et al.
Pubblicazione: (2024)
di: Ibrahim, Adam, et al.
Pubblicazione: (2024)
Towards Understanding the Optimization Mechanisms in Deep Learning
di: Qi, Binchuan, et al.
Pubblicazione: (2025)
di: Qi, Binchuan, et al.
Pubblicazione: (2025)
REAM: Merging Improves Pruning of Experts in LLMs
di: Jha, Saurav, et al.
Pubblicazione: (2026)
di: Jha, Saurav, et al.
Pubblicazione: (2026)
Evolutionary Policy Optimization
di: Wang, Jianren, et al.
Pubblicazione: (2025)
di: Wang, Jianren, et al.
Pubblicazione: (2025)
Solver-Free Decision-Focused Learning for Linear Optimization Problems
di: Berden, Senne, et al.
Pubblicazione: (2025)
di: Berden, Senne, et al.
Pubblicazione: (2025)
Towards Operationalizing Right to Data Protection
di: Java, Abhinav, et al.
Pubblicazione: (2024)
di: Java, Abhinav, et al.
Pubblicazione: (2024)
Feedback Lunch: Learned Feedback Codes for Secure Communications
di: Zhou, Yingyao, et al.
Pubblicazione: (2025)
di: Zhou, Yingyao, et al.
Pubblicazione: (2025)
One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt
di: Liu, Tao, et al.
Pubblicazione: (2025)
di: Liu, Tao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Celo: Training Versatile Learned Optimizers on a Compute Diet
di: Moudgil, Abhinav, et al.
Pubblicazione: (2025) -
Accelerating Training with Neuron Interaction and Nowcasting Networks
di: Knyazev, Boris, et al.
Pubblicazione: (2024) -
Meta-learning Optimizers for Communication-Efficient Learning
di: Joseph, Charles-Étienne, et al.
Pubblicazione: (2023) -
PyLO: Towards Accessible Learned Optimizers in PyTorch
di: Janson, Paul, et al.
Pubblicazione: (2025) -
Efficient Refusal Ablation in LLM through Optimal Transport
di: Nanfack, Geraldin, et al.
Pubblicazione: (2026)