Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xue, Yihao, Li, Jiping, Mirzasoleiman, Baharan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Tuning the Implicit Regularizer of Masked Diffusion Language Models: Enhancing Generalization via Insights from $k$-Parity
par: Huang, Jianhao, et autres
Publié: (2026)
par: Huang, Jianhao, et autres
Publié: (2026)
Data Distribution as a Lever for Guiding Optimizers Toward Superior Generalization in LLMs
par: Gangavarapu, Tushaar, et autres
Publié: (2026)
par: Gangavarapu, Tushaar, et autres
Publié: (2026)
Theoretical Perspectives on Data Quality and Synergistic Effects in Pre- and Post-Training Reasoning Models
par: Javanmard, Adel, et autres
Publié: (2026)
par: Javanmard, Adel, et autres
Publié: (2026)
Data-Efficient Contrastive Self-supervised Learning: Most Beneficial Examples for Supervised Learning Contribute the Least
par: Joshi, Siddharth, et autres
Publié: (2023)
par: Joshi, Siddharth, et autres
Publié: (2023)
LoRA is All You Need for Safety Alignment of Reasoning LLMs
par: Xue, Yihao, et autres
Publié: (2025)
par: Xue, Yihao, et autres
Publié: (2025)
Understanding the Role of Training Data in Test-Time Scaling
par: Javanmard, Adel, et autres
Publié: (2025)
par: Javanmard, Adel, et autres
Publié: (2025)
Investigating the Impact of Model Width and Density on Generalization in Presence of Label Noise
par: Xue, Yihao, et autres
Publié: (2022)
par: Xue, Yihao, et autres
Publié: (2022)
How Transformers Learn to Plan via Multi-Token Prediction
par: Huang, Jianhao, et autres
Publié: (2026)
par: Huang, Jianhao, et autres
Publié: (2026)
Changing the Training Data Distribution to Reduce Simplicity Bias Improves In-distribution Generalization
par: Nguyen, Dang, et autres
Publié: (2024)
par: Nguyen, Dang, et autres
Publié: (2024)
Better Safe than Sorry: Pre-training CLIP against Targeted Data Poisoning and Backdoor Attacks
par: Yang, Wenhan, et autres
Publié: (2023)
par: Yang, Wenhan, et autres
Publié: (2023)
SmallToLarge (S2L): Scalable Data Selection for Fine-tuning Large Language Models by Summarizing Training Trajectories of Small Models
par: Yang, Yu, et autres
Publié: (2024)
par: Yang, Yu, et autres
Publié: (2024)
Verify when Uncertain: Beyond Self-Consistency in Black Box Hallucination Detection
par: Xue, Yihao, et autres
Publié: (2025)
par: Xue, Yihao, et autres
Publié: (2025)
Mini-batch Coresets for Memory-efficient Language Model Training on Data Mixtures
par: Nguyen, Dang, et autres
Publié: (2024)
par: Nguyen, Dang, et autres
Publié: (2024)
Understanding the Robustness of Multi-modal Contrastive Learning to Distribution Shift
par: Xue, Yihao, et autres
Publié: (2023)
par: Xue, Yihao, et autres
Publié: (2023)
Investigating the Benefits of Projection Head for Representation Learning
par: Xue, Yihao, et autres
Publié: (2024)
par: Xue, Yihao, et autres
Publié: (2024)
Challenges and Opportunities in Improving Worst-Group Generalization in Presence of Spurious Features
par: Joshi, Siddharth, et autres
Publié: (2023)
par: Joshi, Siddharth, et autres
Publié: (2023)
Do We Need All the Synthetic Data? Targeted Image Augmentation via Diffusion Models
par: Nguyen, Dang, et autres
Publié: (2025)
par: Nguyen, Dang, et autres
Publié: (2025)
Few-shot Adaptation to Distribution Shifts By Mixing Source and Target Embeddings
par: Xue, Yihao, et autres
Publié: (2023)
par: Xue, Yihao, et autres
Publié: (2023)
Graph Contrastive Learning under Heterophily via Graph Filters
par: Yang, Wenhan, et autres
Publié: (2023)
par: Yang, Wenhan, et autres
Publié: (2023)
Beyond What Seems Necessary: Hidden Gains from Scaling Training-Time Reasoning Length under Outcome Supervision
par: Xue, Yihao, et autres
Publié: (2026)
par: Xue, Yihao, et autres
Publié: (2026)
Quantifying the Gain in Weak-to-Strong Generalization
par: Charikar, Moses, et autres
Publié: (2024)
par: Charikar, Moses, et autres
Publié: (2024)
Weak-to-Strong Generalization under Distribution Shifts
par: Jeon, Myeongho, et autres
Publié: (2025)
par: Jeon, Myeongho, et autres
Publié: (2025)
Why Representation Engineering Works: A Theoretical and Empirical Study in Vision-Language Models
par: Tian, Bowei, et autres
Publié: (2025)
par: Tian, Bowei, et autres
Publié: (2025)
Generalizing Trust: Weak-to-Strong Trustworthiness in Language Models
par: Pawelczyk, Martin, et autres
Publié: (2024)
par: Pawelczyk, Martin, et autres
Publié: (2024)
Weak-to-Strong Generalization Through the Data-Centric Lens
par: Shin, Changho, et autres
Publié: (2024)
par: Shin, Changho, et autres
Publié: (2024)
Risk Phase Transitions in Spiked Regression: Alignment Driven Benign and Catastrophic Overfitting
par: Li, Jiping, et autres
Publié: (2025)
par: Li, Jiping, et autres
Publié: (2025)
Dataset Distillation via Knowledge Distillation: Towards Efficient Self-Supervised Pre-Training of Deep Networks
par: Joshi, Siddharth, et autres
Publié: (2024)
par: Joshi, Siddharth, et autres
Publié: (2024)
Mixture of Weak & Strong Experts on Graphs
par: Zeng, Hanqing, et autres
Publié: (2023)
par: Zeng, Hanqing, et autres
Publié: (2023)
WST: Weak-to-Strong Knowledge Transfer via Reinforcement Learning
par: Ge, Haosen, et autres
Publié: (2025)
par: Ge, Haosen, et autres
Publié: (2025)
An Effective Information Theoretic Framework for Channel Pruning
par: Chen, Yihao, et autres
Publié: (2024)
par: Chen, Yihao, et autres
Publié: (2024)
Bayesian WeakS-to-Strong from Text Classification to Generation
par: Cui, Ziyun, et autres
Publié: (2024)
par: Cui, Ziyun, et autres
Publié: (2024)
Revisiting Weak-to-Strong Generalization in Theory and Practice: Reverse KL vs. Forward KL
par: Yao, Wei, et autres
Publié: (2025)
par: Yao, Wei, et autres
Publié: (2025)
GRC-Net: Gram Residual Co-attention Net for epilepsy prediction
par: You, Bihao, et autres
Publié: (2025)
par: You, Bihao, et autres
Publié: (2025)
An Information Theoretic Evaluation Metric For Strong Unlearning
par: Jeon, Dongjae, et autres
Publié: (2024)
par: Jeon, Dongjae, et autres
Publié: (2024)
Beyond Semantic Entropy: Boosting LLM Uncertainty Quantification with Pairwise Semantic Similarity
par: Nguyen, Dang, et autres
Publié: (2025)
par: Nguyen, Dang, et autres
Publié: (2025)
Empirical and Experimental Insights into Data Mining Techniques for Crime Prediction: A Comprehensive Survey
par: Taha, Kamal
Publié: (2024)
par: Taha, Kamal
Publié: (2024)
Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One
par: Song, Yiwen, et autres
Publié: (2025)
par: Song, Yiwen, et autres
Publié: (2025)
Bootstrapping LLM Robustness for VLM Safety via Reducing the Pretraining Modality Gap
par: Yang, Wenhan, et autres
Publié: (2025)
par: Yang, Wenhan, et autres
Publié: (2025)
When to Trust the Cheap Check: Weak and Strong Verification for Reasoning
par: Kiyani, Shayan, et autres
Publié: (2026)
par: Kiyani, Shayan, et autres
Publié: (2026)
A Unified and Stable Risk Minimization Framework for Weakly Supervised Learning with Theoretical Guarantees
par: Zhang, Miao, et autres
Publié: (2025)
par: Zhang, Miao, et autres
Publié: (2025)
Documents similaires
-
Tuning the Implicit Regularizer of Masked Diffusion Language Models: Enhancing Generalization via Insights from $k$-Parity
par: Huang, Jianhao, et autres
Publié: (2026) -
Data Distribution as a Lever for Guiding Optimizers Toward Superior Generalization in LLMs
par: Gangavarapu, Tushaar, et autres
Publié: (2026) -
Theoretical Perspectives on Data Quality and Synergistic Effects in Pre- and Post-Training Reasoning Models
par: Javanmard, Adel, et autres
Publié: (2026) -
Data-Efficient Contrastive Self-supervised Learning: Most Beneficial Examples for Supervised Learning Contribute the Least
par: Joshi, Siddharth, et autres
Publié: (2023) -
LoRA is All You Need for Safety Alignment of Reasoning LLMs
par: Xue, Yihao, et autres
Publié: (2025)