Weak Critics Make Strong Learners: On-Policy Critique Distillation for Scalable Oversight
Fuente:
arXiv
Guardado en:
| Autores principales: | Jin, Can, Li, Jiakang, Wu, Rui, Zhang, Eddy, Metaxas, Dimitris N. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Scalable Oversight for Superhuman AI via Recursive Self-Critiquing
por: Wen, Xueru, et al.
Publicado: (2025)
por: Wen, Xueru, et al.
Publicado: (2025)
Evidence Over Plans: Online Trajectory Verification for Skill Distillation
por: Zhou, Yang, et al.
Publicado: (2026)
por: Zhou, Yang, et al.
Publicado: (2026)
Two Heads are Better Than One: Test-time Scaling of Multi-agent Collaborative Reasoning
por: Jin, Can, et al.
Publicado: (2025)
por: Jin, Can, et al.
Publicado: (2025)
Latent Reward Steering: An Adaptive Inference-Time Framework that Implicitly Promotes Cognitive Behaviors in Reasoning LLMs
por: Li, Jiakang, et al.
Publicado: (2026)
por: Li, Jiakang, et al.
Publicado: (2026)
Learning from Teaching Regularization: Generalizable Correlations Should be Easy to Imitate
por: Jin, Can, et al.
Publicado: (2024)
por: Jin, Can, et al.
Publicado: (2024)
Calibrating Conservatism for Scalable Oversight
por: Overman, William, et al.
Publicado: (2026)
por: Overman, William, et al.
Publicado: (2026)
Steering LLMs via Scalable Interactive Oversight
por: Zhou, Enyu, et al.
Publicado: (2026)
por: Zhou, Enyu, et al.
Publicado: (2026)
A Benchmark for Scalable Oversight Protocols
por: Sudhir, Abhimanyu Pallavi, et al.
Publicado: (2025)
por: Sudhir, Abhimanyu Pallavi, et al.
Publicado: (2025)
LED: LLM Enhanced Open-Vocabulary Object Detection without Human Curated Data Generation
por: Zhou, Yang, et al.
Publicado: (2025)
por: Zhou, Yang, et al.
Publicado: (2025)
Scaling Laws For Scalable Oversight
por: Engels, Joshua, et al.
Publicado: (2025)
por: Engels, Joshua, et al.
Publicado: (2025)
Test-Time Spectrum-Aware Latent Steering for Zero-Shot Generalization in Vision-Language Models
por: Dafnis, Konstantinos M., et al.
Publicado: (2025)
por: Dafnis, Konstantinos M., et al.
Publicado: (2025)
M^3-Bench: Multi-Modal, Multi-Hop, Multi-Threaded Tool-Using MLLM Agent Benchmark
por: Zhou, Yang, et al.
Publicado: (2025)
por: Zhou, Yang, et al.
Publicado: (2025)
RAC: Rectified Flow Auto Coder
por: Fang, Sen, et al.
Publicado: (2026)
por: Fang, Sen, et al.
Publicado: (2026)
DTop-p MoE: Sparsity-Controlled Dynamic Top-p MoE for Foundation Model Pre-training
por: Jin, Can, et al.
Publicado: (2025)
por: Jin, Can, et al.
Publicado: (2025)
Scalable Stewardship of an LLM-Assisted Clinical Benchmark with Physician Oversight
por: Ye, Junze, et al.
Publicado: (2025)
por: Ye, Junze, et al.
Publicado: (2025)
Unlearning Backdoor Attacks for LLMs with Weak-to-Strong Knowledge Distillation
por: Zhao, Shuai, et al.
Publicado: (2024)
por: Zhao, Shuai, et al.
Publicado: (2024)
DiMSUM: Diffusion Mamba -- A Scalable and Unified Spatial-Frequency Method for Image Generation
por: Phung, Hao, et al.
Publicado: (2024)
por: Phung, Hao, et al.
Publicado: (2024)
SignVerse-2M: A Two-Million-Clip Pose-Native Universe of 55+ Sign Languages
por: Fang, Sen, et al.
Publicado: (2026)
por: Fang, Sen, et al.
Publicado: (2026)
Modeling Human Beliefs about AI Behavior for Scalable Oversight
por: Lang, Leon, et al.
Publicado: (2025)
por: Lang, Leon, et al.
Publicado: (2025)
APEER: Automatic Prompt Engineering Enhances Large Language Model Reranking
por: Jin, Can, et al.
Publicado: (2024)
por: Jin, Can, et al.
Publicado: (2024)
Reasoning over Precedents Alongside Statutes: Case-Augmented Deliberative Alignment for LLM Safety
por: Jin, Can, et al.
Publicado: (2026)
por: Jin, Can, et al.
Publicado: (2026)
Towards Scalable Oversight via Partitioned Human Supervision
por: Yin, Ren, et al.
Publicado: (2025)
por: Yin, Ren, et al.
Publicado: (2025)
DARE: Difficulty-Adaptive Reinforcement Learning with Co-Evolved Difficulty Estimation
por: Zhou, Yang, et al.
Publicado: (2026)
por: Zhou, Yang, et al.
Publicado: (2026)
The Critique of Critique
por: Sun, Shichao, et al.
Publicado: (2024)
por: Sun, Shichao, et al.
Publicado: (2024)
Weak-for-Strong: Training Weak Meta-Agent to Harness Strong Executors
por: Nie, Fan, et al.
Publicado: (2025)
por: Nie, Fan, et al.
Publicado: (2025)
Aligning Large Language Models with Healthcare Stakeholders: A Pathway to Trustworthy AI Integration
por: Ding, Kexin, et al.
Publicado: (2025)
por: Ding, Kexin, et al.
Publicado: (2025)
Concept Distillation from Strong to Weak Models via Hypotheses-to-Theories Prompting
por: Boateng, Emmanuel Aboah, et al.
Publicado: (2024)
por: Boateng, Emmanuel Aboah, et al.
Publicado: (2024)
FindTheFlaws: Annotated Errors for Detecting Flawed Reasoning and Scalable Oversight Research
por: Recchia, Gabriel, et al.
Publicado: (2025)
por: Recchia, Gabriel, et al.
Publicado: (2025)
Your Reward Function for RL is Your Best PRM for Search: Unifying RL and Search-Based TTS
por: Jin, Can, et al.
Publicado: (2025)
por: Jin, Can, et al.
Publicado: (2025)
Learn where to Click from Yourself: On-Policy Self-Distillation for GUI Grounding
por: Zhang, Yan, et al.
Publicado: (2026)
por: Zhang, Yan, et al.
Publicado: (2026)
Extreme Region Policy Distillation
por: Chen, Changyu, et al.
Publicado: (2026)
por: Chen, Changyu, et al.
Publicado: (2026)
Weak-Driven Learning: How Weak Agents make Strong Agents Stronger
por: Chen, Zehao, et al.
Publicado: (2026)
por: Chen, Zehao, et al.
Publicado: (2026)
Selective Weak-to-Strong Generalization
por: Lang, Hao, et al.
Publicado: (2025)
por: Lang, Hao, et al.
Publicado: (2025)
SINE: SINgle Image Editing with Text-to-Image Diffusion Models
por: Zhang, Zhixing, et al.
Publicado: (2022)
por: Zhang, Zhixing, et al.
Publicado: (2022)
Hybrid Policy Distillation for LLMs
por: Zhu, Wenhong, et al.
Publicado: (2026)
por: Zhu, Wenhong, et al.
Publicado: (2026)
Beyond Output Critique: Self-Correction via Task Distillation
por: Rahmani, Hossein A., et al.
Publicado: (2026)
por: Rahmani, Hossein A., et al.
Publicado: (2026)
OS-Themis: A Scalable Critic Framework for Generalist GUI Rewards
por: Li, Zehao, et al.
Publicado: (2026)
por: Li, Zehao, et al.
Publicado: (2026)
Anatomy-VLM: A Fine-grained Vision-Language Model for Medical Interpretation
por: Gu, Difei, et al.
Publicado: (2025)
por: Gu, Difei, et al.
Publicado: (2025)
PrefGen: Multimodal Preference Learning for Preference-Conditioned Image Generation
por: Mo, Wenyi, et al.
Publicado: (2025)
por: Mo, Wenyi, et al.
Publicado: (2025)
SafeSteer: Localized On-Policy Distillation for Efficient Safety Alignment
por: Li, Hao, et al.
Publicado: (2026)
por: Li, Hao, et al.
Publicado: (2026)
Ejemplares similares
-
Scalable Oversight for Superhuman AI via Recursive Self-Critiquing
por: Wen, Xueru, et al.
Publicado: (2025) -
Evidence Over Plans: Online Trajectory Verification for Skill Distillation
por: Zhou, Yang, et al.
Publicado: (2026) -
Two Heads are Better Than One: Test-time Scaling of Multi-agent Collaborative Reasoning
por: Jin, Can, et al.
Publicado: (2025) -
Latent Reward Steering: An Adaptive Inference-Time Framework that Implicitly Promotes Cognitive Behaviors in Reasoning LLMs
por: Li, Jiakang, et al.
Publicado: (2026) -
Learning from Teaching Regularization: Generalizable Correlations Should be Easy to Imitate
por: Jin, Can, et al.
Publicado: (2024)