Nexus: Same Pretraining Loss, Better Downstream Generalization via Common Minima
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Chen, Huanran, Zhang, Huaqing, Li, Xiao, Dong, Yinpeng, Shen, Ke, Zhu, Jun |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Unveiling the Basin-Like Loss Landscape in Large Language Models
von: Chen, Huanran, et al.
Veröffentlicht: (2025)
von: Chen, Huanran, et al.
Veröffentlicht: (2025)
Alignment Dynamics in LLM Fine-Tuning
von: Huang, Yuhan, et al.
Veröffentlicht: (2026)
von: Huang, Yuhan, et al.
Veröffentlicht: (2026)
Towards the Worst-case Robustness of Large Language Models
von: Chen, Huanran, et al.
Veröffentlicht: (2025)
von: Chen, Huanran, et al.
Veröffentlicht: (2025)
Scaling Laws for Black box Adversarial Attacks
von: Liu, Chuan, et al.
Veröffentlicht: (2024)
von: Liu, Chuan, et al.
Veröffentlicht: (2024)
Robust Classification via a Single Diffusion Model
von: Chen, Huanran, et al.
Veröffentlicht: (2023)
von: Chen, Huanran, et al.
Veröffentlicht: (2023)
Your Diffusion Model is Secretly a Certifiably Robust Classifier
von: Chen, Huanran, et al.
Veröffentlicht: (2024)
von: Chen, Huanran, et al.
Veröffentlicht: (2024)
Mitigating Overthinking in Large Reasoning Models via Manifold Steering
von: Huang, Yao, et al.
Veröffentlicht: (2025)
von: Huang, Yao, et al.
Veröffentlicht: (2025)
Reliable Unlearning Harmful Information in LLMs with Metamorphosis Representation Projection
von: Wu, Chengcan, et al.
Veröffentlicht: (2025)
von: Wu, Chengcan, et al.
Veröffentlicht: (2025)
Sharp Minima Can Generalize: A Loss Landscape Perspective On Data
von: Fan, Raymond, et al.
Veröffentlicht: (2025)
von: Fan, Raymond, et al.
Veröffentlicht: (2025)
Unveiling Downstream Performance Scaling of LLMs: A Clustering-Based Perspective
von: Xu, Chengyin, et al.
Veröffentlicht: (2025)
von: Xu, Chengyin, et al.
Veröffentlicht: (2025)
Pretraining Induces a Reusable Spectral Basis for Downstream Task Adaptation
von: Yu, Junjie, et al.
Veröffentlicht: (2026)
von: Yu, Junjie, et al.
Veröffentlicht: (2026)
Finetune-Informed Pretraining Boosts Downstream Performance
von: Faysal, Atik, et al.
Veröffentlicht: (2026)
von: Faysal, Atik, et al.
Veröffentlicht: (2026)
Don't Stop Me Yet: Sampling Loss Minima via Dissipative Riemannian Mechanics
von: Jacobsen, Albert Kjøller, et al.
Veröffentlicht: (2026)
von: Jacobsen, Albert Kjøller, et al.
Veröffentlicht: (2026)
Evaluating Loss Functions for Graph Neural Networks: Towards Pretraining and Generalization
von: Abbas, Khushnood, et al.
Veröffentlicht: (2025)
von: Abbas, Khushnood, et al.
Veröffentlicht: (2025)
Panprediction: Optimal Predictions for Any Downstream Task and Loss
von: Balakrishnan, Sivaraman, et al.
Veröffentlicht: (2025)
von: Balakrishnan, Sivaraman, et al.
Veröffentlicht: (2025)
Why Do Unlearnable Examples Work: A Novel Perspective of Mutual Information
von: Zhu, Yifan, et al.
Veröffentlicht: (2026)
von: Zhu, Yifan, et al.
Veröffentlicht: (2026)
Exploring Aleatoric Uncertainty in Object Detection via Vision Foundation Models
von: Cui, Peng, et al.
Veröffentlicht: (2024)
von: Cui, Peng, et al.
Veröffentlicht: (2024)
Deep Fusion: Capturing Dependencies in Contrastive Learning via Transformer Projection Heads
von: Li, Huanran, et al.
Veröffentlicht: (2024)
von: Li, Huanran, et al.
Veröffentlicht: (2024)
Efficient Black-box Adversarial Attacks via Bayesian Optimization Guided by a Function Prior
von: Cheng, Shuyu, et al.
Veröffentlicht: (2024)
von: Cheng, Shuyu, et al.
Veröffentlicht: (2024)
Downstream-Pretext Domain Knowledge Traceback for Active Learning
von: Zhang, Beichen, et al.
Veröffentlicht: (2024)
von: Zhang, Beichen, et al.
Veröffentlicht: (2024)
T2VSafetyBench: Evaluating the Safety of Text-to-Video Generative Models
von: Miao, Yibo, et al.
Veröffentlicht: (2024)
von: Miao, Yibo, et al.
Veröffentlicht: (2024)
Distribution-Free Pretraining of Classification Losses via Evolutionary Dynamics
von: Xiang, Meng, et al.
Veröffentlicht: (2026)
von: Xiang, Meng, et al.
Veröffentlicht: (2026)
Value-Based Pre-Training with Downstream Feedback
von: Ke, Shuqi, et al.
Veröffentlicht: (2026)
von: Ke, Shuqi, et al.
Veröffentlicht: (2026)
Towards Robust Influence Functions with Flat Validation Minima
von: Ye, Xichen, et al.
Veröffentlicht: (2025)
von: Ye, Xichen, et al.
Veröffentlicht: (2025)
BiSSL: Enhancing the Alignment Between Self-Supervised Pretraining and Downstream Fine-Tuning via Bilevel Optimization
von: Zakarias, Gustav Wagner, et al.
Veröffentlicht: (2024)
von: Zakarias, Gustav Wagner, et al.
Veröffentlicht: (2024)
Rethinking the Starting Point: Collaborative Pre-Training for Federated Downstream Tasks
von: Chu, Yun-Wei, et al.
Veröffentlicht: (2024)
von: Chu, Yun-Wei, et al.
Veröffentlicht: (2024)
AdaLRS: Loss-Guided Adaptive Learning Rate Search for Efficient Foundation Model Pretraining
von: Dong, Hongyuan, et al.
Veröffentlicht: (2025)
von: Dong, Hongyuan, et al.
Veröffentlicht: (2025)
Towards Better Generalization via Distributional Input Projection Network
von: Hao, Yifan, et al.
Veröffentlicht: (2025)
von: Hao, Yifan, et al.
Veröffentlicht: (2025)
High Rank Matrix Completion via Grassmannian Proxy Fusion
von: Li, Huanran, et al.
Veröffentlicht: (2026)
von: Li, Huanran, et al.
Veröffentlicht: (2026)
Local Minima Structures in Gaussian Mixture Models
von: Chen, Yudong, et al.
Veröffentlicht: (2020)
von: Chen, Yudong, et al.
Veröffentlicht: (2020)
Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less
von: Liu, Yuxing, et al.
Veröffentlicht: (2026)
von: Liu, Yuxing, et al.
Veröffentlicht: (2026)
Flat Minima and Generalization: Insights from Stochastic Convex Optimization
von: Schliserman, Matan, et al.
Veröffentlicht: (2025)
von: Schliserman, Matan, et al.
Veröffentlicht: (2025)
ITGPT: Generative Pretraining on Irregular Timeseries
von: Honoré, Antoine, et al.
Veröffentlicht: (2026)
von: Honoré, Antoine, et al.
Veröffentlicht: (2026)
Toward Availability Attacks in 3D Point Clouds
von: Zhu, Yifan, et al.
Veröffentlicht: (2024)
von: Zhu, Yifan, et al.
Veröffentlicht: (2024)
AFN: Adaptive Fusion Normalization via an Encoder-Decoder Framework
von: Zhou, Zikai, et al.
Veröffentlicht: (2023)
von: Zhou, Zikai, et al.
Veröffentlicht: (2023)
NeuroTTT: Bridging Pretraining-Downstream Task Misalignment in EEG Foundation Models via Test-Time Training
von: Wang, Suli, et al.
Veröffentlicht: (2025)
von: Wang, Suli, et al.
Veröffentlicht: (2025)
Towards Better Generalization: Weight Decay Induces Low-rank Bias for Neural Networks
von: Chen, Ke, et al.
Veröffentlicht: (2024)
von: Chen, Ke, et al.
Veröffentlicht: (2024)
MultiTrust: A Comprehensive Benchmark Towards Trustworthy Multimodal Large Language Models
von: Zhang, Yichi, et al.
Veröffentlicht: (2024)
von: Zhang, Yichi, et al.
Veröffentlicht: (2024)
Are Flat Minima an Illusion?
von: Bennett, Michael Timothy
Veröffentlicht: (2026)
von: Bennett, Michael Timothy
Veröffentlicht: (2026)
An Empirical Study on Noisy Data and LLM Pretraining Loss Divergence
von: Zhang, Qizhen, et al.
Veröffentlicht: (2026)
von: Zhang, Qizhen, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Unveiling the Basin-Like Loss Landscape in Large Language Models
von: Chen, Huanran, et al.
Veröffentlicht: (2025) -
Alignment Dynamics in LLM Fine-Tuning
von: Huang, Yuhan, et al.
Veröffentlicht: (2026) -
Towards the Worst-case Robustness of Large Language Models
von: Chen, Huanran, et al.
Veröffentlicht: (2025) -
Scaling Laws for Black box Adversarial Attacks
von: Liu, Chuan, et al.
Veröffentlicht: (2024) -
Robust Classification via a Single Diffusion Model
von: Chen, Huanran, et al.
Veröffentlicht: (2023)