On the Blessing of Pre-training in Weak-to-Strong Generalization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yao, Wei, Zhaoyang, Wang, Xu, Gengze, Qian, Chen, Liu, Dongrui, Wang, Ziqiao, Liu, Yong, Xu, Yunbei |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
On the Emergence of Weak-to-Strong Generalization: A Bias-Variance Perspective
par: Xu, Gengze, et autres
Publié: (2025)
par: Xu, Gengze, et autres
Publié: (2025)
The Capabilities and Limitations of Weak-to-Strong Generalization: Generalization and Calibration
par: Yao, Wei, et autres
Publié: (2025)
par: Yao, Wei, et autres
Publié: (2025)
On Weak-to-Strong Generalization and f-Divergence
par: Yao, Wei, et autres
Publié: (2025)
par: Yao, Wei, et autres
Publié: (2025)
Revisiting Weak-to-Strong Generalization in Theory and Practice: Reverse KL vs. Forward KL
par: Yao, Wei, et autres
Publié: (2025)
par: Yao, Wei, et autres
Publié: (2025)
Theoretical Insights into Fine-Tuning Attention Mechanism: Generalization and Optimization
par: Yao, Xinhao, et autres
Publié: (2024)
par: Yao, Xinhao, et autres
Publié: (2024)
Graph Generative Pre-trained Transformer
par: Chen, Xiaohui, et autres
Publié: (2025)
par: Chen, Xiaohui, et autres
Publié: (2025)
ModelGrow: Continual Text-to-Video Pre-training with Model Expansion and Language Understanding Enhancement
par: Rao, Zhefan, et autres
Publié: (2024)
par: Rao, Zhefan, et autres
Publié: (2024)
Pointwise Generalization in Deep Neural Networks
par: Li, Shaojie, et autres
Publié: (2026)
par: Li, Shaojie, et autres
Publié: (2026)
Upper Counterfactual Confidence Bounds: a New Optimism Principle for Contextual Bandits
par: Xu, Yunbei, et autres
Publié: (2020)
par: Xu, Yunbei, et autres
Publié: (2020)
Timer: Generative Pre-trained Transformers Are Large Time Series Models
par: Liu, Yong, et autres
Publié: (2024)
par: Liu, Yong, et autres
Publié: (2024)
GraphSculptor: Sculpting Pre-training Coreset for Graph Self-supervised Learning
par: Liu, Chuang, et autres
Publié: (2026)
par: Liu, Chuang, et autres
Publié: (2026)
Bayesian Design Principles for Frequentist Sequential Learning
par: Xu, Yunbei, et autres
Publié: (2023)
par: Xu, Yunbei, et autres
Publié: (2023)
Autoregressive Learning in Joint KL: Sharp Oracle Bounds and Lower Bounds
par: Xu, Yunbei, et autres
Publié: (2026)
par: Xu, Yunbei, et autres
Publié: (2026)
On the Power of Adaptivity for $\varepsilon$-Best Arm Identification in Linear Bandits
par: Maiti, Arnab, et autres
Publié: (2026)
par: Maiti, Arnab, et autres
Publié: (2026)
LOST: Low-rank and Sparse Pre-training for Large Language Models
par: Li, Jiaxi, et autres
Publié: (2025)
par: Li, Jiaxi, et autres
Publié: (2025)
FlowletFormer: Network Behavioral Semantic Aware Pre-training Model for Traffic Classification
par: Liu, Liming, et autres
Publié: (2025)
par: Liu, Liming, et autres
Publié: (2025)
GraphGPT: Generative Pre-trained Graph Eulerian Transformer
par: Zhao, Qifang, et autres
Publié: (2023)
par: Zhao, Qifang, et autres
Publié: (2023)
OSF: On Pre-training and Scaling of Sleep Foundation Models
par: Shuai, Zitao, et autres
Publié: (2026)
par: Shuai, Zitao, et autres
Publié: (2026)
Statistical Properties of Robust Satisficing
par: Li, Zhiyi, et autres
Publié: (2024)
par: Li, Zhiyi, et autres
Publié: (2024)
FusionGen: Feature Fusion-Based Few-Shot EEG Data Generation
par: Chen, Yuheng, et autres
Publié: (2025)
par: Chen, Yuheng, et autres
Publié: (2025)
TrajGPT-R: Generating Urban Mobility Trajectory with Reinforcement Learning-Enhanced Generative Pre-trained Transformer
par: Wang, Jiawei, et autres
Publié: (2026)
par: Wang, Jiawei, et autres
Publié: (2026)
Generalization Bounds via Conditional $f$-Information
par: Wang, Ziqiao, et autres
Publié: (2024)
par: Wang, Ziqiao, et autres
Publié: (2024)
Finite-Time Minimax Bounds and an Optimal Lyapunov Policy in Queueing Control
par: Liu, Yujie, et autres
Publié: (2025)
par: Liu, Yujie, et autres
Publié: (2025)
Pre-training Epidemic Time Series Forecasters with Compartmental Prototypes
par: Liu, Zewen, et autres
Publié: (2025)
par: Liu, Zewen, et autres
Publié: (2025)
Can Distillation Mitigate Backdoor Attacks in Pre-trained Encoders?
par: Han, TIngxu, et autres
Publié: (2024)
par: Han, TIngxu, et autres
Publié: (2024)
Rethinking Federated Learning Over the Air: The Blessing of Scaling Up
par: Zhu, Jiaqi, et autres
Publié: (2025)
par: Zhu, Jiaqi, et autres
Publié: (2025)
Two Facets of SDE Under an Information-Theoretic Lens: Generalization of SGD via Training Trajectories and via Terminal States
par: Wang, Ziqiao, et autres
Publié: (2022)
par: Wang, Ziqiao, et autres
Publié: (2022)
Unleashing the Power of Pre-trained Language Models for Offline Reinforcement Learning
par: Shi, Ruizhe, et autres
Publié: (2023)
par: Shi, Ruizhe, et autres
Publié: (2023)
In-context Pre-trained Time-Series Foundation Models adapt to Unseen Tasks
par: Xu, Shangqing, et autres
Publié: (2026)
par: Xu, Shangqing, et autres
Publié: (2026)
Thompson Sampling for Repeated Newsvendor
par: Chen, Li, et autres
Publié: (2025)
par: Chen, Li, et autres
Publié: (2025)
Programming Every Example: Lifting Pre-training Data Quality Like Experts at Scale
par: Zhou, Fan, et autres
Publié: (2024)
par: Zhou, Fan, et autres
Publié: (2024)
NetMamba+: A Framework of Pre-trained Models for Efficient and Accurate Network Traffic Classification
par: Wang, Tongze, et autres
Publié: (2026)
par: Wang, Tongze, et autres
Publié: (2026)
MIA-Tuner: Adapting Large Language Models as Pre-training Text Detector
par: Fu, Wenjie, et autres
Publié: (2024)
par: Fu, Wenjie, et autres
Publié: (2024)
Brain-inspired continual pre-trained learner via silent synaptic consolidation
par: Ran, Xuming, et autres
Publié: (2024)
par: Ran, Xuming, et autres
Publié: (2024)
On SkipGram Word Embedding Models with Negative Sampling: Unified Framework and Impact of Noise Distributions
par: Liu, Dezhi, et autres
Publié: (2020)
par: Liu, Dezhi, et autres
Publié: (2020)
FastSurvival: Hidden Computational Blessings in Training Cox Proportional Hazards Models
par: Liu, Jiachang, et autres
Publié: (2024)
par: Liu, Jiachang, et autres
Publié: (2024)
Thinking Augmented Pre-training
par: Wang, Liang, et autres
Publié: (2025)
par: Wang, Liang, et autres
Publié: (2025)
Weak-to-Strong Generalization with Failure Trajectories: A Tree-based Approach to Elicit Optimal Policy in Strong Models
par: Ye, Ruimeng, et autres
Publié: (2025)
par: Ye, Ruimeng, et autres
Publié: (2025)
Graph Pre-Training Models Are Strong Anomaly Detectors
par: Cheng, Jiashun, et autres
Publié: (2024)
par: Cheng, Jiashun, et autres
Publié: (2024)
Towards a General Framework for Continual Learning with Pre-training
par: Wang, Liyuan, et autres
Publié: (2023)
par: Wang, Liyuan, et autres
Publié: (2023)
Documents similaires
-
On the Emergence of Weak-to-Strong Generalization: A Bias-Variance Perspective
par: Xu, Gengze, et autres
Publié: (2025) -
The Capabilities and Limitations of Weak-to-Strong Generalization: Generalization and Calibration
par: Yao, Wei, et autres
Publié: (2025) -
On Weak-to-Strong Generalization and f-Divergence
par: Yao, Wei, et autres
Publié: (2025) -
Revisiting Weak-to-Strong Generalization in Theory and Practice: Reverse KL vs. Forward KL
par: Yao, Wei, et autres
Publié: (2025) -
Theoretical Insights into Fine-Tuning Attention Mechanism: Generalization and Optimization
par: Yao, Xinhao, et autres
Publié: (2024)