Improving Weak-to-Strong Generalization with Scalable Oversight and Ensemble Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Sang, Jitao, Wang, Yuhang, Zhang, Jing, Zhu, Yanxu, Kong, Chao, Ye, Junhong, Wei, Shuyu, Xiao, Jinlin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
KG-FPQ: Evaluating Factuality Hallucination in LLMs with Knowledge Graph-based False Premise Questions
di: Zhu, Yanxu, et al.
Pubblicazione: (2024)
di: Zhu, Yanxu, et al.
Pubblicazione: (2024)
CDEval: A Benchmark for Measuring the Cultural Dimensions of Large Language Models
di: Wang, Yuhang, et al.
Pubblicazione: (2023)
di: Wang, Yuhang, et al.
Pubblicazione: (2023)
Self-Guided Defense: Adaptive Safety Alignment for Reasoning Models via Synthesized Guidelines
di: Wang, Yuhang, et al.
Pubblicazione: (2025)
di: Wang, Yuhang, et al.
Pubblicazione: (2025)
Don't Command, Cultivate: An Exploratory Study of System-2 Alignment
di: Wang, Yuhang, et al.
Pubblicazione: (2024)
di: Wang, Yuhang, et al.
Pubblicazione: (2024)
Reasoning Shapes Alignment: Investigating Cultural Alignment in Large Reasoning Models with Cultural Norms
di: Wang, Yuhang, et al.
Pubblicazione: (2025)
di: Wang, Yuhang, et al.
Pubblicazione: (2025)
STAMP: Training Explicit Memory for Mobile GUI Agents in Controllable and Scalable Virtual Environments
di: Wang, Junyang, et al.
Pubblicazione: (2026)
di: Wang, Junyang, et al.
Pubblicazione: (2026)
Beyond Pipelines: A Survey of the Paradigm Shift toward Model-Native Agentic AI
di: Sang, Jitao, et al.
Pubblicazione: (2025)
di: Sang, Jitao, et al.
Pubblicazione: (2025)
Improving Weak-to-Strong Generalization with Reliability-Aware Alignment
di: Guo, Yue, et al.
Pubblicazione: (2024)
di: Guo, Yue, et al.
Pubblicazione: (2024)
Bayesian WeakS-to-Strong from Text Classification to Generation
di: Cui, Ziyun, et al.
Pubblicazione: (2024)
di: Cui, Ziyun, et al.
Pubblicazione: (2024)
Knowledge Divergence and the Value of Debate for Scalable Oversight
di: Young, Robin
Pubblicazione: (2026)
di: Young, Robin
Pubblicazione: (2026)
Weak-to-Strong Generalization beyond Accuracy: a Pilot Study in Safety, Toxicity, and Legal Reasoning
di: Ye, Ruimeng, et al.
Pubblicazione: (2024)
di: Ye, Ruimeng, et al.
Pubblicazione: (2024)
Taming the Thinker: Conditional Entropy Shaping for Adaptive LLM Reasoning
di: Wei, Shuyu, et al.
Pubblicazione: (2026)
di: Wei, Shuyu, et al.
Pubblicazione: (2026)
EnsemW2S: Enhancing Weak-to-Strong Generalization with Large Language Model Ensembles
di: Agrawal, Aakriti, et al.
Pubblicazione: (2025)
di: Agrawal, Aakriti, et al.
Pubblicazione: (2025)
OpenRFT: Adapting Reasoning Foundation Model for Domain-specific Tasks with Reinforcement Fine-Tuning
di: Zhang, Yuxiang, et al.
Pubblicazione: (2024)
di: Zhang, Yuxiang, et al.
Pubblicazione: (2024)
Weak Critics Make Strong Learners: On-Policy Critique Distillation for Scalable Oversight
di: Jin, Can, et al.
Pubblicazione: (2026)
di: Jin, Can, et al.
Pubblicazione: (2026)
Super(ficial)-alignment: Strong Models May Deceive Weak Models in Weak-to-Strong Generalization
di: Yang, Wenkai, et al.
Pubblicazione: (2024)
di: Yang, Wenkai, et al.
Pubblicazione: (2024)
Trust Functions: Near-Lossless Weak-to-Strong Generalization by Learning When to Trust the Weak Teacher
di: Uzunoglu, Arda, et al.
Pubblicazione: (2026)
di: Uzunoglu, Arda, et al.
Pubblicazione: (2026)
Scalable Oversight for Superhuman AI via Recursive Self-Critiquing
di: Wen, Xueru, et al.
Pubblicazione: (2025)
di: Wen, Xueru, et al.
Pubblicazione: (2025)
Weak-to-Strong Jailbreaking on Large Language Models
di: Zhao, Xuandong, et al.
Pubblicazione: (2024)
di: Zhao, Xuandong, et al.
Pubblicazione: (2024)
Towards Scalable Oversight via Partitioned Human Supervision
di: Yin, Ren, et al.
Pubblicazione: (2025)
di: Yin, Ren, et al.
Pubblicazione: (2025)
Weak-to-Strong Preference Optimization: Stealing Reward from Weak Aligned Model
di: Zhu, Wenhong, et al.
Pubblicazione: (2024)
di: Zhu, Wenhong, et al.
Pubblicazione: (2024)
WebSynthesis: World-Model-Guided MCTS for Efficient WebUI-Trajectory Synthesis
di: Gao, Yifei, et al.
Pubblicazione: (2025)
di: Gao, Yifei, et al.
Pubblicazione: (2025)
Alice: Proactive Learning with Teacher's Demonstrations for Weak-to-Strong Generalization
di: Wu, Shujin, et al.
Pubblicazione: (2025)
di: Wu, Shujin, et al.
Pubblicazione: (2025)
Xwin-LM: Strong and Scalable Alignment Practice for LLMs
di: Ni, Bolin, et al.
Pubblicazione: (2024)
di: Ni, Bolin, et al.
Pubblicazione: (2024)
Selective Weak-to-Strong Generalization
di: Lang, Hao, et al.
Pubblicazione: (2025)
di: Lang, Hao, et al.
Pubblicazione: (2025)
Hit the Sweet Spot! Span-Level Ensemble for Large Language Models
di: Xu, Yangyifan, et al.
Pubblicazione: (2024)
di: Xu, Yangyifan, et al.
Pubblicazione: (2024)
o1-Coder: an o1 Replication for Coding
di: Zhang, Yuxiang, et al.
Pubblicazione: (2024)
di: Zhang, Yuxiang, et al.
Pubblicazione: (2024)
Debate Helps Weak-to-Strong Generalization
di: Lang, Hao, et al.
Pubblicazione: (2025)
di: Lang, Hao, et al.
Pubblicazione: (2025)
Theoretical Analysis of Weak-to-Strong Generalization
di: Lang, Hunter, et al.
Pubblicazione: (2024)
di: Lang, Hunter, et al.
Pubblicazione: (2024)
Incentivizing Strong Reasoning from Weak Supervision
di: Yuan, Yige, et al.
Pubblicazione: (2025)
di: Yuan, Yige, et al.
Pubblicazione: (2025)
ODE: Open-Set Evaluation of Hallucinations in Multimodal Large Language Models
di: Tu, Yahan, et al.
Pubblicazione: (2024)
di: Tu, Yahan, et al.
Pubblicazione: (2024)
Cross-Domain Transfer and Few-Shot Learning for Personal Identifiable Information Recognition
di: Ye, Junhong, et al.
Pubblicazione: (2025)
di: Ye, Junhong, et al.
Pubblicazione: (2025)
FindTheFlaws: Annotated Errors for Detecting Flawed Reasoning and Scalable Oversight Research
di: Recchia, Gabriel, et al.
Pubblicazione: (2025)
di: Recchia, Gabriel, et al.
Pubblicazione: (2025)
AMBER: An LLM-free Multi-dimensional Benchmark for MLLMs Hallucination Evaluation
di: Wang, Junyang, et al.
Pubblicazione: (2023)
di: Wang, Junyang, et al.
Pubblicazione: (2023)
Prefix Teach, Suffix Fade: Local Teachability Collapse in Strong-to-Weak On-Policy Distillation
di: Liu, Kaiyuan, et al.
Pubblicazione: (2026)
di: Liu, Kaiyuan, et al.
Pubblicazione: (2026)
Weak-to-Strong Reasoning
di: Yang, Yuqing, et al.
Pubblicazione: (2024)
di: Yang, Yuqing, et al.
Pubblicazione: (2024)
Weak-to-Strong Elicitation via Mismatched Wrong Drafts
di: Deng, Wei
Pubblicazione: (2026)
di: Deng, Wei
Pubblicazione: (2026)
Positional Failures in Long-Context LLMs: A Blind Spot in Reasoning Benchmarks
di: Zhang, Chuyifei, et al.
Pubblicazione: (2026)
di: Zhang, Chuyifei, et al.
Pubblicazione: (2026)
BERT-LID: Leveraging BERT to Improve Spoken Language Identification
di: Nie, Yuting, et al.
Pubblicazione: (2022)
di: Nie, Yuting, et al.
Pubblicazione: (2022)
Superfiltering: Weak-to-Strong Data Filtering for Fast Instruction-Tuning
di: Li, Ming, et al.
Pubblicazione: (2024)
di: Li, Ming, et al.
Pubblicazione: (2024)
Documenti analoghi
-
KG-FPQ: Evaluating Factuality Hallucination in LLMs with Knowledge Graph-based False Premise Questions
di: Zhu, Yanxu, et al.
Pubblicazione: (2024) -
CDEval: A Benchmark for Measuring the Cultural Dimensions of Large Language Models
di: Wang, Yuhang, et al.
Pubblicazione: (2023) -
Self-Guided Defense: Adaptive Safety Alignment for Reasoning Models via Synthesized Guidelines
di: Wang, Yuhang, et al.
Pubblicazione: (2025) -
Don't Command, Cultivate: An Exploratory Study of System-2 Alignment
di: Wang, Yuhang, et al.
Pubblicazione: (2024) -
Reasoning Shapes Alignment: Investigating Cultural Alignment in Large Reasoning Models with Cultural Norms
di: Wang, Yuhang, et al.
Pubblicazione: (2025)