Learning from Committee: Reasoning Distillation from a Mixture of Teachers with Peer-Review
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Zhuochun, Ji, Yuelyu, Meng, Rui, He, Daqing |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ReasoningRank: Teaching Student Models to Rank through Reasoning-Based Knowledge Distillation
por: Ji, Yuelyu, et al.
Publicado: (2024)
por: Ji, Yuelyu, et al.
Publicado: (2024)
Retrieval--Reasoning Processes for Multi-hop Question Answering: A Four-Axis Design Framework and Empirical Trends
por: Ji, Yuelyu, et al.
Publicado: (2026)
por: Ji, Yuelyu, et al.
Publicado: (2026)
Curriculum Guided Reinforcement Learning for Efficient Multi Hop Retrieval Augmented Generation
por: Ji, Yuelyu, et al.
Publicado: (2025)
por: Ji, Yuelyu, et al.
Publicado: (2025)
Memory-Aware and Uncertainty-Guided Retrieval for Multi-Hop Question Answering
por: Ji, Yuelyu, et al.
Publicado: (2025)
por: Ji, Yuelyu, et al.
Publicado: (2025)
StepGap: A Hybrid NLI-LLM Checker for Step-Level Evidence-Gap Detectionin Multi-Hop Question Answering
por: Ji, Yuelyu, et al.
Publicado: (2026)
por: Ji, Yuelyu, et al.
Publicado: (2026)
Rethinking LLM-as-a-Judge: Representation-as-a-Judge with Small Language Models via Semantic Capacity Asymmetry
por: Li, Zhuochun, et al.
Publicado: (2026)
por: Li, Zhuochun, et al.
Publicado: (2026)
Effects of Different Prompts on the Quality of GPT-4 Responses to Dementia Care Questions
por: Li, Zhuochun, et al.
Publicado: (2024)
por: Li, Zhuochun, et al.
Publicado: (2024)
RAG-RLRC-LaySum at BioLaySumm: Integrating Retrieval-Augmented Generation and Readability Control for Layman Summarization of Biomedical Texts
por: Ji, Yuelyu, et al.
Publicado: (2024)
por: Ji, Yuelyu, et al.
Publicado: (2024)
Scaling Medical Reasoning Verification via Tool-Integrated Reinforcement Learning
por: Zhang, Hang, et al.
Publicado: (2026)
por: Zhang, Hang, et al.
Publicado: (2026)
ReviewerToo: Should AI Join The Program Committee? A Look At The Future of Peer Review
por: Sahu, Gaurav, et al.
Publicado: (2025)
por: Sahu, Gaurav, et al.
Publicado: (2025)
Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process
por: Chen, Zhijun, et al.
Publicado: (2025)
por: Chen, Zhijun, et al.
Publicado: (2025)
EchoReview: Learning Peer Review from the Echoes of Scientific Citations
por: Zhang, Yinuo, et al.
Publicado: (2026)
por: Zhang, Yinuo, et al.
Publicado: (2026)
Extracting OPQRST in Electronic Health Records using Large Language Models with Reasoning
por: Luo, Zhimeng, et al.
Publicado: (2025)
por: Luo, Zhimeng, et al.
Publicado: (2025)
Beyond Imitation: Learning Key Reasoning Steps from Dual Chain-of-Thoughts in Reasoning Distillation
por: Dai, Chengwei, et al.
Publicado: (2024)
por: Dai, Chengwei, et al.
Publicado: (2024)
Think Globally, Group Locally: Evaluating LLMs Using Multi-Lingual Word Grouping Games
por: Guerra-Solano, César, et al.
Publicado: (2025)
por: Guerra-Solano, César, et al.
Publicado: (2025)
Detecting Distillation Data from Reasoning Models
por: Zhang, Hengxiang, et al.
Publicado: (2025)
por: Zhang, Hengxiang, et al.
Publicado: (2025)
Can AI Be a Good Peer Reviewer? A Survey of Peer Review Process, Evaluation, and the Future
por: Wu, Sihong, et al.
Publicado: (2026)
por: Wu, Sihong, et al.
Publicado: (2026)
Distilling the Essence: Efficient Reasoning Distillation via Sequence Truncation
por: Chen, Wei-Rui, et al.
Publicado: (2025)
por: Chen, Wei-Rui, et al.
Publicado: (2025)
Is Peer-Reviewing Worth the Effort?
por: Church, Kenneth, et al.
Publicado: (2024)
por: Church, Kenneth, et al.
Publicado: (2024)
Your Teacher Can't Help You Here: Combating Supervision Fidelity Decay in On-Policy Distillation
por: Liu, Yanjiang, et al.
Publicado: (2026)
por: Liu, Yanjiang, et al.
Publicado: (2026)
TUMIX: Multi-Agent Test-Time Scaling with Tool-Use Mixture
por: Chen, Yongchao, et al.
Publicado: (2025)
por: Chen, Yongchao, et al.
Publicado: (2025)
Measuring Competency, Not Performance: Item-Aware Evaluation Across Medical Benchmarks
por: Luo, Zhimeng, et al.
Publicado: (2025)
por: Luo, Zhimeng, et al.
Publicado: (2025)
Learning to Reason with Mixture of Tokens
por: Jain, Adit, et al.
Publicado: (2025)
por: Jain, Adit, et al.
Publicado: (2025)
PeerQA: A Scientific Question Answering Dataset from Peer Reviews
por: Baumgärtner, Tim, et al.
Publicado: (2025)
por: Baumgärtner, Tim, et al.
Publicado: (2025)
REM-CTX: Automated Peer Review via Reinforcement Learning with Auxiliary Context
por: Taechoyotin, Pawin, et al.
Publicado: (2026)
por: Taechoyotin, Pawin, et al.
Publicado: (2026)
PRAIB: Peer Review AI Benchmark of Behaviour of LLM-Assisted Reviewing
por: Żurawicki, Krzysztof, et al.
Publicado: (2026)
por: Żurawicki, Krzysztof, et al.
Publicado: (2026)
Reliable Reasoning Path: Distilling Effective Guidance for LLM Reasoning with Knowledge Graphs
por: Xiao, Yilin, et al.
Publicado: (2025)
por: Xiao, Yilin, et al.
Publicado: (2025)
Backtracking When It Strays: Mitigating Dual Exposure Biases in LLM Reasoning Distillation
por: Wang, Bing, et al.
Publicado: (2026)
por: Wang, Bing, et al.
Publicado: (2026)
Generative Foundation Model for Structured and Unstructured Electronic Health Records
por: Sivarajkumar, Sonish, et al.
Publicado: (2025)
por: Sivarajkumar, Sonish, et al.
Publicado: (2025)
RL from Teacher-Model Refinement: Gradual Imitation Learning for Machine Translation
por: Lee, Dongyub Jude, et al.
Publicado: (2025)
por: Lee, Dongyub Jude, et al.
Publicado: (2025)
When Reviews Disagree: Fine-Grained Contradiction Analysis in Scientific Peer Reviews
por: Kumar, Sandeep, et al.
Publicado: (2026)
por: Kumar, Sandeep, et al.
Publicado: (2026)
Mixed Distillation Helps Smaller Language Model Better Reasoning
por: Li, Chenglin, et al.
Publicado: (2023)
por: Li, Chenglin, et al.
Publicado: (2023)
Reinforcement Learning vs. Distillation: Understanding Accuracy and Capability in LLM Reasoning
por: Kim, Minwu, et al.
Publicado: (2025)
por: Kim, Minwu, et al.
Publicado: (2025)
Distilling Mathematical Reasoning Capabilities into Small Language Models
por: Zhu, Xunyu, et al.
Publicado: (2024)
por: Zhu, Xunyu, et al.
Publicado: (2024)
Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation
por: Yang, Wenkai, et al.
Publicado: (2026)
por: Yang, Wenkai, et al.
Publicado: (2026)
Is Your Paper Being Reviewed by an LLM? Investigating AI Text Detectability in Peer Review
por: Yu, Sungduk, et al.
Publicado: (2024)
por: Yu, Sungduk, et al.
Publicado: (2024)
Is Your Paper Being Reviewed by an LLM? Benchmarking AI Text Detection in Peer Review
por: Yu, Sungduk, et al.
Publicado: (2025)
por: Yu, Sungduk, et al.
Publicado: (2025)
Mixture of Reasonings: Teach Large Language Models to Reason with Adaptive Strategies
por: Xiong, Tao, et al.
Publicado: (2025)
por: Xiong, Tao, et al.
Publicado: (2025)
Speculative Knowledge Distillation: Bridging the Teacher-Student Gap Through Interleaved Sampling
por: Xu, Wenda, et al.
Publicado: (2024)
por: Xu, Wenda, et al.
Publicado: (2024)
MiCRo: Mixture Modeling and Context-aware Routing for Personalized Preference Learning
por: Shen, Jingyan, et al.
Publicado: (2025)
por: Shen, Jingyan, et al.
Publicado: (2025)
Ejemplares similares
-
ReasoningRank: Teaching Student Models to Rank through Reasoning-Based Knowledge Distillation
por: Ji, Yuelyu, et al.
Publicado: (2024) -
Retrieval--Reasoning Processes for Multi-hop Question Answering: A Four-Axis Design Framework and Empirical Trends
por: Ji, Yuelyu, et al.
Publicado: (2026) -
Curriculum Guided Reinforcement Learning for Efficient Multi Hop Retrieval Augmented Generation
por: Ji, Yuelyu, et al.
Publicado: (2025) -
Memory-Aware and Uncertainty-Guided Retrieval for Multi-Hop Question Answering
por: Ji, Yuelyu, et al.
Publicado: (2025) -
StepGap: A Hybrid NLI-LLM Checker for Step-Level Evidence-Gap Detectionin Multi-Hop Question Answering
por: Ji, Yuelyu, et al.
Publicado: (2026)