The Delta Learning Hypothesis: Preference Tuning on Weak Data can Yield Strong Gains
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Geng, Scott, Ivison, Hamish, Li, Chun-Liang, Sap, Maarten, Li, Jerry, Krishna, Ranjay, Koh, Pang Wei |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Large-Scale Data Selection for Instruction Tuning
von: Ivison, Hamish, et al.
Veröffentlicht: (2025)
von: Ivison, Hamish, et al.
Veröffentlicht: (2025)
Weak-to-Strong Generalization is Nearly Inevitable (in Linear Models)
von: Geng, Scott, et al.
Veröffentlicht: (2026)
von: Geng, Scott, et al.
Veröffentlicht: (2026)
The Unmet Promise of Synthetic Training Images: Using Retrieved Real Images Performs Better
von: Geng, Scott, et al.
Veröffentlicht: (2024)
von: Geng, Scott, et al.
Veröffentlicht: (2024)
Personalizing Reinforcement Learning from Human Feedback with Variational Preference Learning
von: Poddar, Sriyash, et al.
Veröffentlicht: (2024)
von: Poddar, Sriyash, et al.
Veröffentlicht: (2024)
The Curious Case of Factuality Finetuning: Models' Internal Beliefs Can Improve Factuality
von: Newman, Benjamin, et al.
Veröffentlicht: (2025)
von: Newman, Benjamin, et al.
Veröffentlicht: (2025)
Quantifying the Gain in Weak-to-Strong Generalization
von: Charikar, Moses, et al.
Veröffentlicht: (2024)
von: Charikar, Moses, et al.
Veröffentlicht: (2024)
Superfiltering: Weak-to-Strong Data Filtering for Fast Instruction-Tuning
von: Li, Ming, et al.
Veröffentlicht: (2024)
von: Li, Ming, et al.
Veröffentlicht: (2024)
Relative Information Gain and Gaussian Process Regression
von: Flynn, Hamish
Veröffentlicht: (2025)
von: Flynn, Hamish
Veröffentlicht: (2025)
From "Weak" Signals to Strong Models: Preference Delta Aggregation with LoRA Merging
von: Sun, Qi, et al.
Veröffentlicht: (2026)
von: Sun, Qi, et al.
Veröffentlicht: (2026)
When In-Distribution Gains Fail: Evaluating Weak-to-Strong Reward Models under Preference Shift
von: Le, Khoi, et al.
Veröffentlicht: (2026)
von: Le, Khoi, et al.
Veröffentlicht: (2026)
TESS 2: A Large-Scale Generalist Diffusion Language Model
von: Tae, Jaesung, et al.
Veröffentlicht: (2025)
von: Tae, Jaesung, et al.
Veröffentlicht: (2025)
Local Interpretations for Explainable Natural Language Processing: A Survey
von: Luo, Siwen, et al.
Veröffentlicht: (2021)
von: Luo, Siwen, et al.
Veröffentlicht: (2021)
Rethinking Human Preference Evaluation of LLM Rationales
von: Li, Ziang, et al.
Veröffentlicht: (2025)
von: Li, Ziang, et al.
Veröffentlicht: (2025)
MACPO: Weak-to-Strong Alignment via Multi-Agent Contrastive Preference Optimization
von: Lyu, Yougang, et al.
Veröffentlicht: (2024)
von: Lyu, Yougang, et al.
Veröffentlicht: (2024)
Fluid Language Model Benchmarking
von: Hofmann, Valentin, et al.
Veröffentlicht: (2025)
von: Hofmann, Valentin, et al.
Veröffentlicht: (2025)
FocalLens: Instruction Tuning Enables Zero-Shot Conditional Image Representations
von: Hsieh, Cheng-Yu, et al.
Veröffentlicht: (2025)
von: Hsieh, Cheng-Yu, et al.
Veröffentlicht: (2025)
Multilingual Diversity Improves Vision-Language Representations
von: Nguyen, Thao, et al.
Veröffentlicht: (2024)
von: Nguyen, Thao, et al.
Veröffentlicht: (2024)
Negative Token Merging: Image-based Adversarial Feature Guidance
von: Singh, Jaskirat, et al.
Veröffentlicht: (2024)
von: Singh, Jaskirat, et al.
Veröffentlicht: (2024)
Synergistic Weak-Strong Collaboration by Aligning Preferences
von: Jiao, Yizhu, et al.
Veröffentlicht: (2025)
von: Jiao, Yizhu, et al.
Veröffentlicht: (2025)
Examining the Effect of Explanations of AI Privacy Redaction in AI-mediated Interactions
von: Kaushik, Roshni, et al.
Veröffentlicht: (2026)
von: Kaushik, Roshni, et al.
Veröffentlicht: (2026)
Unpacking DPO and PPO: Disentangling Best Practices for Learning from Preference Feedback
von: Ivison, Hamish, et al.
Veröffentlicht: (2024)
von: Ivison, Hamish, et al.
Veröffentlicht: (2024)
Relating Misfit to Gain in Weak-to-Strong Generalization Beyond the Squared Loss
von: Mulgund, Abhijeet, et al.
Veröffentlicht: (2025)
von: Mulgund, Abhijeet, et al.
Veröffentlicht: (2025)
BIG5-CHAT: Shaping LLM Personalities Through Training on Human-Grounded Data
von: Li, Wenkai, et al.
Veröffentlicht: (2024)
von: Li, Wenkai, et al.
Veröffentlicht: (2024)
EvalTree: Profiling Language Model Weaknesses via Hierarchical Capability Trees
von: Zeng, Zhiyuan, et al.
Veröffentlicht: (2025)
von: Zeng, Zhiyuan, et al.
Veröffentlicht: (2025)
Weak-to-Strong Preference Optimization: Stealing Reward from Weak Aligned Model
von: Zhu, Wenhong, et al.
Veröffentlicht: (2024)
von: Zhu, Wenhong, et al.
Veröffentlicht: (2024)
Towards Acyclic Preference Evaluation of Language Models via Multiple Evaluators
von: Hu, Zhengyu, et al.
Veröffentlicht: (2024)
von: Hu, Zhengyu, et al.
Veröffentlicht: (2024)
Ivison [Publishers] May 14, 1858
von: Ivison & Phinney
Veröffentlicht: (1858)
von: Ivison & Phinney
Veröffentlicht: (1858)
Ivison [Publishers] Dec. 19, 1857
von: Ivison & Phinney
Veröffentlicht: (1857)
von: Ivison & Phinney
Veröffentlicht: (1857)
Spurious Rewards: Rethinking Training Signals in RLVR
von: Shao, Rulin, et al.
Veröffentlicht: (2025)
von: Shao, Rulin, et al.
Veröffentlicht: (2025)
From Linear to Nonlinear: Provable Weak-to-Strong Generalization through Feature Learning
von: Oh, Junsoo, et al.
Veröffentlicht: (2025)
von: Oh, Junsoo, et al.
Veröffentlicht: (2025)
Weak-to-Strong Jailbreaking on Large Language Models
von: Zhao, Xuandong, et al.
Veröffentlicht: (2024)
von: Zhao, Xuandong, et al.
Veröffentlicht: (2024)
Counterspeakers' Perspectives: Unveiling Barriers and AI Needs in the Fight against Online Hate
von: Mun, Jimin, et al.
Veröffentlicht: (2024)
von: Mun, Jimin, et al.
Veröffentlicht: (2024)
EVALUESTEER: Measuring Reward Model Steerability Towards Values and Preferences
von: Ghate, Kshitish, et al.
Veröffentlicht: (2025)
von: Ghate, Kshitish, et al.
Veröffentlicht: (2025)
Data Defenses Against Large Language Models
von: Agnew, William, et al.
Veröffentlicht: (2024)
von: Agnew, William, et al.
Veröffentlicht: (2024)
SIMS-V: Simulated Instruction-Tuning for Spatial Video Understanding
von: Brown, Ellis, et al.
Veröffentlicht: (2025)
von: Brown, Ellis, et al.
Veröffentlicht: (2025)
1-2-3 Check: Enhancing Contextual Privacy in LLM via Multi-Agent Reasoning
von: Li, Wenkai, et al.
Veröffentlicht: (2025)
von: Li, Wenkai, et al.
Veröffentlicht: (2025)
Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding
von: Song, Feifan, et al.
Veröffentlicht: (2025)
von: Song, Feifan, et al.
Veröffentlicht: (2025)
Videoshop: Localized Semantic Video Editing with Noise-Extrapolated Diffusion Inversion
von: Fan, Xiang, et al.
Veröffentlicht: (2024)
von: Fan, Xiang, et al.
Veröffentlicht: (2024)
Ablate-to-Validate: Are Vision-Language Models Really Using Continuous Thought Tokens?
von: Zhang, Tianyi, et al.
Veröffentlicht: (2026)
von: Zhang, Tianyi, et al.
Veröffentlicht: (2026)
Geometric Origin of Dark Components: A Causal-Asymmetry Hypothesis
von: Koh, Seong-Yeop
Veröffentlicht: (2026)
von: Koh, Seong-Yeop
Veröffentlicht: (2026)
Ähnliche Einträge
-
Large-Scale Data Selection for Instruction Tuning
von: Ivison, Hamish, et al.
Veröffentlicht: (2025) -
Weak-to-Strong Generalization is Nearly Inevitable (in Linear Models)
von: Geng, Scott, et al.
Veröffentlicht: (2026) -
The Unmet Promise of Synthetic Training Images: Using Retrieved Real Images Performs Better
von: Geng, Scott, et al.
Veröffentlicht: (2024) -
Personalizing Reinforcement Learning from Human Feedback with Variational Preference Learning
von: Poddar, Sriyash, et al.
Veröffentlicht: (2024) -
The Curious Case of Factuality Finetuning: Models' Internal Beliefs Can Improve Factuality
von: Newman, Benjamin, et al.
Veröffentlicht: (2025)