Improving Weak-to-Strong Generalization with Scalable Oversight and Ensemble Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sang, Jitao, Wang, Yuhang, Zhang, Jing, Zhu, Yanxu, Kong, Chao, Ye, Junhong, Wei, Shuyu, Xiao, Jinlin |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
KG-FPQ: Evaluating Factuality Hallucination in LLMs with Knowledge Graph-based False Premise Questions
par: Zhu, Yanxu, et autres
Publié: (2024)
par: Zhu, Yanxu, et autres
Publié: (2024)
CDEval: A Benchmark for Measuring the Cultural Dimensions of Large Language Models
par: Wang, Yuhang, et autres
Publié: (2023)
par: Wang, Yuhang, et autres
Publié: (2023)
Self-Guided Defense: Adaptive Safety Alignment for Reasoning Models via Synthesized Guidelines
par: Wang, Yuhang, et autres
Publié: (2025)
par: Wang, Yuhang, et autres
Publié: (2025)
Don't Command, Cultivate: An Exploratory Study of System-2 Alignment
par: Wang, Yuhang, et autres
Publié: (2024)
par: Wang, Yuhang, et autres
Publié: (2024)
Reasoning Shapes Alignment: Investigating Cultural Alignment in Large Reasoning Models with Cultural Norms
par: Wang, Yuhang, et autres
Publié: (2025)
par: Wang, Yuhang, et autres
Publié: (2025)
STAMP: Training Explicit Memory for Mobile GUI Agents in Controllable and Scalable Virtual Environments
par: Wang, Junyang, et autres
Publié: (2026)
par: Wang, Junyang, et autres
Publié: (2026)
Beyond Pipelines: A Survey of the Paradigm Shift toward Model-Native Agentic AI
par: Sang, Jitao, et autres
Publié: (2025)
par: Sang, Jitao, et autres
Publié: (2025)
Improving Weak-to-Strong Generalization with Reliability-Aware Alignment
par: Guo, Yue, et autres
Publié: (2024)
par: Guo, Yue, et autres
Publié: (2024)
Bayesian WeakS-to-Strong from Text Classification to Generation
par: Cui, Ziyun, et autres
Publié: (2024)
par: Cui, Ziyun, et autres
Publié: (2024)
Knowledge Divergence and the Value of Debate for Scalable Oversight
par: Young, Robin
Publié: (2026)
par: Young, Robin
Publié: (2026)
Weak-to-Strong Generalization beyond Accuracy: a Pilot Study in Safety, Toxicity, and Legal Reasoning
par: Ye, Ruimeng, et autres
Publié: (2024)
par: Ye, Ruimeng, et autres
Publié: (2024)
Taming the Thinker: Conditional Entropy Shaping for Adaptive LLM Reasoning
par: Wei, Shuyu, et autres
Publié: (2026)
par: Wei, Shuyu, et autres
Publié: (2026)
EnsemW2S: Enhancing Weak-to-Strong Generalization with Large Language Model Ensembles
par: Agrawal, Aakriti, et autres
Publié: (2025)
par: Agrawal, Aakriti, et autres
Publié: (2025)
OpenRFT: Adapting Reasoning Foundation Model for Domain-specific Tasks with Reinforcement Fine-Tuning
par: Zhang, Yuxiang, et autres
Publié: (2024)
par: Zhang, Yuxiang, et autres
Publié: (2024)
Weak Critics Make Strong Learners: On-Policy Critique Distillation for Scalable Oversight
par: Jin, Can, et autres
Publié: (2026)
par: Jin, Can, et autres
Publié: (2026)
Super(ficial)-alignment: Strong Models May Deceive Weak Models in Weak-to-Strong Generalization
par: Yang, Wenkai, et autres
Publié: (2024)
par: Yang, Wenkai, et autres
Publié: (2024)
Trust Functions: Near-Lossless Weak-to-Strong Generalization by Learning When to Trust the Weak Teacher
par: Uzunoglu, Arda, et autres
Publié: (2026)
par: Uzunoglu, Arda, et autres
Publié: (2026)
Scalable Oversight for Superhuman AI via Recursive Self-Critiquing
par: Wen, Xueru, et autres
Publié: (2025)
par: Wen, Xueru, et autres
Publié: (2025)
Weak-to-Strong Jailbreaking on Large Language Models
par: Zhao, Xuandong, et autres
Publié: (2024)
par: Zhao, Xuandong, et autres
Publié: (2024)
Towards Scalable Oversight via Partitioned Human Supervision
par: Yin, Ren, et autres
Publié: (2025)
par: Yin, Ren, et autres
Publié: (2025)
Weak-to-Strong Preference Optimization: Stealing Reward from Weak Aligned Model
par: Zhu, Wenhong, et autres
Publié: (2024)
par: Zhu, Wenhong, et autres
Publié: (2024)
WebSynthesis: World-Model-Guided MCTS for Efficient WebUI-Trajectory Synthesis
par: Gao, Yifei, et autres
Publié: (2025)
par: Gao, Yifei, et autres
Publié: (2025)
Alice: Proactive Learning with Teacher's Demonstrations for Weak-to-Strong Generalization
par: Wu, Shujin, et autres
Publié: (2025)
par: Wu, Shujin, et autres
Publié: (2025)
Xwin-LM: Strong and Scalable Alignment Practice for LLMs
par: Ni, Bolin, et autres
Publié: (2024)
par: Ni, Bolin, et autres
Publié: (2024)
Selective Weak-to-Strong Generalization
par: Lang, Hao, et autres
Publié: (2025)
par: Lang, Hao, et autres
Publié: (2025)
Hit the Sweet Spot! Span-Level Ensemble for Large Language Models
par: Xu, Yangyifan, et autres
Publié: (2024)
par: Xu, Yangyifan, et autres
Publié: (2024)
o1-Coder: an o1 Replication for Coding
par: Zhang, Yuxiang, et autres
Publié: (2024)
par: Zhang, Yuxiang, et autres
Publié: (2024)
Debate Helps Weak-to-Strong Generalization
par: Lang, Hao, et autres
Publié: (2025)
par: Lang, Hao, et autres
Publié: (2025)
Theoretical Analysis of Weak-to-Strong Generalization
par: Lang, Hunter, et autres
Publié: (2024)
par: Lang, Hunter, et autres
Publié: (2024)
Incentivizing Strong Reasoning from Weak Supervision
par: Yuan, Yige, et autres
Publié: (2025)
par: Yuan, Yige, et autres
Publié: (2025)
ODE: Open-Set Evaluation of Hallucinations in Multimodal Large Language Models
par: Tu, Yahan, et autres
Publié: (2024)
par: Tu, Yahan, et autres
Publié: (2024)
Cross-Domain Transfer and Few-Shot Learning for Personal Identifiable Information Recognition
par: Ye, Junhong, et autres
Publié: (2025)
par: Ye, Junhong, et autres
Publié: (2025)
FindTheFlaws: Annotated Errors for Detecting Flawed Reasoning and Scalable Oversight Research
par: Recchia, Gabriel, et autres
Publié: (2025)
par: Recchia, Gabriel, et autres
Publié: (2025)
AMBER: An LLM-free Multi-dimensional Benchmark for MLLMs Hallucination Evaluation
par: Wang, Junyang, et autres
Publié: (2023)
par: Wang, Junyang, et autres
Publié: (2023)
Prefix Teach, Suffix Fade: Local Teachability Collapse in Strong-to-Weak On-Policy Distillation
par: Liu, Kaiyuan, et autres
Publié: (2026)
par: Liu, Kaiyuan, et autres
Publié: (2026)
Weak-to-Strong Reasoning
par: Yang, Yuqing, et autres
Publié: (2024)
par: Yang, Yuqing, et autres
Publié: (2024)
Weak-to-Strong Elicitation via Mismatched Wrong Drafts
par: Deng, Wei
Publié: (2026)
par: Deng, Wei
Publié: (2026)
Positional Failures in Long-Context LLMs: A Blind Spot in Reasoning Benchmarks
par: Zhang, Chuyifei, et autres
Publié: (2026)
par: Zhang, Chuyifei, et autres
Publié: (2026)
BERT-LID: Leveraging BERT to Improve Spoken Language Identification
par: Nie, Yuting, et autres
Publié: (2022)
par: Nie, Yuting, et autres
Publié: (2022)
Superfiltering: Weak-to-Strong Data Filtering for Fast Instruction-Tuning
par: Li, Ming, et autres
Publié: (2024)
par: Li, Ming, et autres
Publié: (2024)
Documents similaires
-
KG-FPQ: Evaluating Factuality Hallucination in LLMs with Knowledge Graph-based False Premise Questions
par: Zhu, Yanxu, et autres
Publié: (2024) -
CDEval: A Benchmark for Measuring the Cultural Dimensions of Large Language Models
par: Wang, Yuhang, et autres
Publié: (2023) -
Self-Guided Defense: Adaptive Safety Alignment for Reasoning Models via Synthesized Guidelines
par: Wang, Yuhang, et autres
Publié: (2025) -
Don't Command, Cultivate: An Exploratory Study of System-2 Alignment
par: Wang, Yuhang, et autres
Publié: (2024) -
Reasoning Shapes Alignment: Investigating Cultural Alignment in Large Reasoning Models with Cultural Norms
par: Wang, Yuhang, et autres
Publié: (2025)