Aligning Teacher with Student Preferences for Tailored Training Data Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Yantao, Zhang, Zhao, Yao, Zijun, Cao, Shulin, Hou, Lei, Li, Juanzi |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Untangle the KNOT: Interweaving Conflicting Knowledge and Reasoning Skills in Large Language Models
par: Liu, Yantao, et autres
Publié: (2024)
par: Liu, Yantao, et autres
Publié: (2024)
RM-Bench: Benchmarking Reward Models of Language Models with Subtlety and Style
par: Liu, Yantao, et autres
Publié: (2024)
par: Liu, Yantao, et autres
Publié: (2024)
PairJudge RM: Perform Best-of-N Sampling with Knockout Tournament
par: Liu, Yantao, et autres
Publié: (2025)
par: Liu, Yantao, et autres
Publié: (2025)
Evaluating Generative Language Models in Information Extraction as Subjective Question Correction
par: Fan, Yuchen, et autres
Publié: (2024)
par: Fan, Yuchen, et autres
Publié: (2024)
AtomR: Atomic Operator-Empowered Large Language Models for Heterogeneous Knowledge Reasoning
par: Xin, Amy, et autres
Publié: (2024)
par: Xin, Amy, et autres
Publié: (2024)
SeaKR: Self-aware Knowledge Retrieval for Adaptive Retrieval Augmented Generation
par: Yao, Zijun, et autres
Publié: (2024)
par: Yao, Zijun, et autres
Publié: (2024)
Auxiliary Metrics Help Decoding Skill Neurons in the Wild
par: Zhao, Yixiu, et autres
Publié: (2025)
par: Zhao, Yixiu, et autres
Publié: (2025)
StockBench: Can LLM Agents Trade Stocks Profitably In Real-world Markets?
par: Chen, Yanxu, et autres
Publié: (2025)
par: Chen, Yanxu, et autres
Publié: (2025)
KB-Plugin: A Plug-and-play Framework for Large Language Models to Induce Programs over Low-resourced Knowledge Bases
par: Zhang, Jiajie, et autres
Publié: (2024)
par: Zhang, Jiajie, et autres
Publié: (2024)
Agentic Reward Modeling: Integrating Human Preferences with Verifiable Correctness Signals for Reliable Reward Systems
par: Peng, Hao, et autres
Publié: (2025)
par: Peng, Hao, et autres
Publié: (2025)
Are Reasoning Models More Prone to Hallucination?
par: Yao, Zijun, et autres
Publié: (2025)
par: Yao, Zijun, et autres
Publié: (2025)
StoryAlign: Evaluating and Training Reward Models for Story Generation
par: Xia, Haotian, et autres
Publié: (2026)
par: Xia, Haotian, et autres
Publié: (2026)
ReaRAG: Knowledge-guided Reasoning Enhances Factuality of Large Reasoning Models with Iterative Retrieval Augmented Generation
par: Lee, Zhicheng, et autres
Publié: (2025)
par: Lee, Zhicheng, et autres
Publié: (2025)
DICE: Detecting In-distribution Contamination in LLM's Fine-tuning Phase for Math Reasoning
par: Tu, Shangqing, et autres
Publié: (2024)
par: Tu, Shangqing, et autres
Publié: (2024)
A Cause-Effect Look at Alleviating Hallucination of Knowledge-grounded Dialogue Generation
par: Yu, Jifan, et autres
Publié: (2024)
par: Yu, Jifan, et autres
Publié: (2024)
How Proficient Are Large Language Models in Formal Languages? An In-Depth Insight for Knowledge Base Question Answering
par: Liu, Jinxin, et autres
Publié: (2024)
par: Liu, Jinxin, et autres
Publié: (2024)
WildReward: Learning Reward Models from In-the-Wild Human Interactions
par: Peng, Hao, et autres
Publié: (2026)
par: Peng, Hao, et autres
Publié: (2026)
Guiding LLM Post-training Data Engineering with Model Internals from Sparse Autoencoders
par: Jing, Yi, et autres
Publié: (2026)
par: Jing, Yi, et autres
Publié: (2026)
LinguaLens: Towards Interpreting Linguistic Mechanisms of Large Language Models via Sparse Auto-Encoder
par: Jing, Yi, et autres
Publié: (2025)
par: Jing, Yi, et autres
Publié: (2025)
ADELIE: Aligning Large Language Models on Information Extraction
par: Qi, Yunjia, et autres
Publié: (2024)
par: Qi, Yunjia, et autres
Publié: (2024)
Transferable and Efficient Non-Factual Content Detection via Probe Training with Offline Consistency Checking
par: Zhang, Xiaokang, et autres
Publié: (2024)
par: Zhang, Xiaokang, et autres
Publié: (2024)
Pre-training Distillation for Large Language Models: A Design Space Exploration
par: Peng, Hao, et autres
Publié: (2024)
par: Peng, Hao, et autres
Publié: (2024)
Towards Understanding Safety Alignment: A Mechanistic Perspective from Safety Neurons
par: Chen, Jianhui, et autres
Publié: (2024)
par: Chen, Jianhui, et autres
Publié: (2024)
LongCite: Enabling LLMs to Generate Fine-grained Citations in Long-context QA
par: Zhang, Jiajie, et autres
Publié: (2024)
par: Zhang, Jiajie, et autres
Publié: (2024)
LongReward: Improving Long-context Large Language Models with AI Feedback
par: Zhang, Jiajie, et autres
Publié: (2024)
par: Zhang, Jiajie, et autres
Publié: (2024)
LLMAEL: Large Language Models are Good Context Augmenters for Entity Linking
par: Xin, Amy, et autres
Publié: (2024)
par: Xin, Amy, et autres
Publié: (2024)
WebSeer: Training Deeper Search Agents through Reinforcement Learning with Self-Reflection
par: He, Guanzhong, et autres
Publié: (2025)
par: He, Guanzhong, et autres
Publié: (2025)
Reverse That Number! Decoding Order Matters in Arithmetic Learning
par: Zhang-Li, Daniel, et autres
Publié: (2024)
par: Zhang-Li, Daniel, et autres
Publié: (2024)
Montessori-Instruct: Generate Influential Training Data Tailored for Student Learning
par: Li, Xiaochuan, et autres
Publié: (2024)
par: Li, Xiaochuan, et autres
Publié: (2024)
MM-THEBench: Do Reasoning MLLMs Think Reasonably?
par: Huang, Zhidian, et autres
Publié: (2026)
par: Huang, Zhidian, et autres
Publié: (2026)
Chaining the Evidence: Robust Reinforcement Learning for Deep Search Agents with Citation-Aware Rubric Rewards
par: Zhang, Jiajie, et autres
Publié: (2026)
par: Zhang, Jiajie, et autres
Publié: (2026)
SpeechAlign: Aligning Speech Generation to Human Preferences
par: Zhang, Dong, et autres
Publié: (2024)
par: Zhang, Dong, et autres
Publié: (2024)
LongAlign: A Recipe for Long Context Alignment of Large Language Models
par: Bai, Yushi, et autres
Publié: (2024)
par: Bai, Yushi, et autres
Publié: (2024)
Boundary-Guided Policy Optimization for Memory-efficient RL of Diffusion Large Language Models
par: Lin, Nianyi, et autres
Publié: (2025)
par: Lin, Nianyi, et autres
Publié: (2025)
MRCEval: A Comprehensive, Challenging and Accessible Machine Reading Comprehension Benchmark
par: Ma, Shengkun, et autres
Publié: (2025)
par: Ma, Shengkun, et autres
Publié: (2025)
T1: Advancing Language Model Reasoning through Reinforcement Learning and Inference Scaling
par: Hou, Zhenyu, et autres
Publié: (2025)
par: Hou, Zhenyu, et autres
Publié: (2025)
Establishing Trustworthy LLM Evaluation via Shortcut Neuron Analysis
par: Zhu, Kejian, et autres
Publié: (2025)
par: Zhu, Kejian, et autres
Publié: (2025)
OpenEP: Open-Ended Future Event Prediction
par: Guan, Yong, et autres
Publié: (2024)
par: Guan, Yong, et autres
Publié: (2024)
MM-MATH: Advancing Multimodal Math Evaluation with Process Evaluation and Fine-grained Classification
par: Sun, Kai, et autres
Publié: (2024)
par: Sun, Kai, et autres
Publié: (2024)
Pre-DPO: Improving Data Utilization in Direct Preference Optimization Using a Guiding Reference Model
par: Pan, Junshu, et autres
Publié: (2025)
par: Pan, Junshu, et autres
Publié: (2025)
Documents similaires
-
Untangle the KNOT: Interweaving Conflicting Knowledge and Reasoning Skills in Large Language Models
par: Liu, Yantao, et autres
Publié: (2024) -
RM-Bench: Benchmarking Reward Models of Language Models with Subtlety and Style
par: Liu, Yantao, et autres
Publié: (2024) -
PairJudge RM: Perform Best-of-N Sampling with Knockout Tournament
par: Liu, Yantao, et autres
Publié: (2025) -
Evaluating Generative Language Models in Information Extraction as Subjective Question Correction
par: Fan, Yuchen, et autres
Publié: (2024) -
AtomR: Atomic Operator-Empowered Large Language Models for Heterogeneous Knowledge Reasoning
par: Xin, Amy, et autres
Publié: (2024)