YODA: Teacher-Student Progressive Learning for Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Lu, Jianqiao, Zhong, Wanjun, Wang, Yufei, Guo, Zhijiang, Zhu, Qi, Huang, Wenyong, Wang, Yanlin, Mi, Fei, Wang, Baojun, Wang, Yasheng, Shang, Lifeng, Jiang, Xin, Liu, Qun |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
SELF: Self-Evolution with Language Feedback
von: Lu, Jianqiao, et al.
Veröffentlicht: (2023)
von: Lu, Jianqiao, et al.
Veröffentlicht: (2023)
Data Management For Training Large Language Models: A Survey
von: Wang, Zige, et al.
Veröffentlicht: (2023)
von: Wang, Zige, et al.
Veröffentlicht: (2023)
FollowBench: A Multi-level Fine-grained Constraints Following Benchmark for Large Language Models
von: Jiang, Yuxin, et al.
Veröffentlicht: (2023)
von: Jiang, Yuxin, et al.
Veröffentlicht: (2023)
EssayBench: Evaluating Large Language Models in Multi-Genre Chinese Essay Writing
von: Gao, Fan, et al.
Veröffentlicht: (2025)
von: Gao, Fan, et al.
Veröffentlicht: (2025)
Planning, Creation, Usage: Benchmarking LLMs for Comprehensive Tool Utilization in Real-World Complex Scenarios
von: Huang, Shijue, et al.
Veröffentlicht: (2024)
von: Huang, Shijue, et al.
Veröffentlicht: (2024)
ToolACE-MT: Non-Autoregressive Generation for Agentic Multi-Turn Interaction
von: Zeng, Xingshan, et al.
Veröffentlicht: (2025)
von: Zeng, Xingshan, et al.
Veröffentlicht: (2025)
Teaching Large Reasoning Models Effective Reflection
von: Wang, Hanbin, et al.
Veröffentlicht: (2026)
von: Wang, Hanbin, et al.
Veröffentlicht: (2026)
DAST: Difficulty-Aware Self-Training on Large Language Models
von: Xue, Boyang, et al.
Veröffentlicht: (2025)
von: Xue, Boyang, et al.
Veröffentlicht: (2025)
ReliableMath: Benchmark of Reliable Mathematical Reasoning on Large Language Models
von: Xue, Boyang, et al.
Veröffentlicht: (2025)
von: Xue, Boyang, et al.
Veröffentlicht: (2025)
Stepwise Reasoning Checkpoint Analysis: A Test Time Scaling Method to Enhance LLMs' Reasoning
von: Wang, Zezhong, et al.
Veröffentlicht: (2025)
von: Wang, Zezhong, et al.
Veröffentlicht: (2025)
Chain-of-Probe: Examining the Necessity and Accuracy of CoT Step-by-Step
von: Wang, Zezhong, et al.
Veröffentlicht: (2024)
von: Wang, Zezhong, et al.
Veröffentlicht: (2024)
ARTIS: Agentic Risk-Aware Test-Time Scaling via Iterative Simulation
von: Zeng, Xingshan, et al.
Veröffentlicht: (2026)
von: Zeng, Xingshan, et al.
Veröffentlicht: (2026)
KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning
von: Xu, Hongling, et al.
Veröffentlicht: (2025)
von: Xu, Hongling, et al.
Veröffentlicht: (2025)
PROXYQA: An Alternative Framework for Evaluating Long-Form Text Generation with Large Language Models
von: Tan, Haochen, et al.
Veröffentlicht: (2024)
von: Tan, Haochen, et al.
Veröffentlicht: (2024)
Learning to Edit: Aligning LLMs with Knowledge Editing
von: Jiang, Yuxin, et al.
Veröffentlicht: (2024)
von: Jiang, Yuxin, et al.
Veröffentlicht: (2024)
Adaptive-Solver Framework for Dynamic Strategy Selection in Large Language Model Reasoning
von: Zhou, Jianpeng, et al.
Veröffentlicht: (2023)
von: Zhou, Jianpeng, et al.
Veröffentlicht: (2023)
Bridging and Modeling Correlations in Pairwise Data for Direct Preference Optimization
von: Jiang, Yuxin, et al.
Veröffentlicht: (2024)
von: Jiang, Yuxin, et al.
Veröffentlicht: (2024)
ToolFlow: Boosting LLM Tool-Calling Through Natural and Coherent Dialogue Synthesis
von: Wang, Zezhong, et al.
Veröffentlicht: (2024)
von: Wang, Zezhong, et al.
Veröffentlicht: (2024)
Teaching LLMs According to Their Aptitude: Adaptive Reasoning for Mathematical Problem Solving
von: Xu, Xin, et al.
Veröffentlicht: (2025)
von: Xu, Xin, et al.
Veröffentlicht: (2025)
Instruction-Tuning Data Synthesis from Scratch via Web Reconstruction
von: Jiang, Yuxin, et al.
Veröffentlicht: (2025)
von: Jiang, Yuxin, et al.
Veröffentlicht: (2025)
ToolACE-R: Model-aware Iterative Training and Adaptive Refinement for Tool Learning
von: Zeng, Xingshan, et al.
Veröffentlicht: (2025)
von: Zeng, Xingshan, et al.
Veröffentlicht: (2025)
Self-Error-Instruct: Generalizing from Errors for LLMs Mathematical Reasoning
von: Yu, Erxin, et al.
Veröffentlicht: (2025)
von: Yu, Erxin, et al.
Veröffentlicht: (2025)
Crowd Comparative Reasoning: Unlocking Comprehensive Evaluations for LLM-as-a-Judge
von: Zhang, Qiyuan, et al.
Veröffentlicht: (2025)
von: Zhang, Qiyuan, et al.
Veröffentlicht: (2025)
Group Pattern Selection Optimization: Let LRMs Pick the Right Pattern for Reasoning
von: Wang, Hanbin, et al.
Veröffentlicht: (2026)
von: Wang, Hanbin, et al.
Veröffentlicht: (2026)
RevisEval: Improving LLM-as-a-Judge via Response-Adapted References
von: Zhang, Qiyuan, et al.
Veröffentlicht: (2024)
von: Zhang, Qiyuan, et al.
Veröffentlicht: (2024)
AutoPSV: Automated Process-Supervised Verifier
von: Lu, Jianqiao, et al.
Veröffentlicht: (2024)
von: Lu, Jianqiao, et al.
Veröffentlicht: (2024)
Gaining Wisdom from Setbacks: Aligning Large Language Models via Mistake Analysis
von: Chen, Kai, et al.
Veröffentlicht: (2023)
von: Chen, Kai, et al.
Veröffentlicht: (2023)
Flat-LoRA: Low-Rank Adaptation over a Flat Loss Landscape
von: Li, Tao, et al.
Veröffentlicht: (2024)
von: Li, Tao, et al.
Veröffentlicht: (2024)
Safe: Enhancing Mathematical Reasoning in Large Language Models via Retrospective Step-aware Formal Verification
von: Liu, Chengwu, et al.
Veröffentlicht: (2025)
von: Liu, Chengwu, et al.
Veröffentlicht: (2025)
YODA: Yet Another One-step Diffusion-based Video Compressor
von: Li, Xingchen, et al.
Veröffentlicht: (2026)
von: Li, Xingchen, et al.
Veröffentlicht: (2026)
MT-Eval: A Multi-Turn Capabilities Evaluation Benchmark for Large Language Models
von: Kwan, Wai-Chung, et al.
Veröffentlicht: (2024)
von: Kwan, Wai-Chung, et al.
Veröffentlicht: (2024)
InfMem: Learning System-2 Memory Control for Long-Context Agent
von: Wang, Xinyu, et al.
Veröffentlicht: (2026)
von: Wang, Xinyu, et al.
Veröffentlicht: (2026)
PerLTQA: A Personal Long-Term Memory Dataset for Memory Classification, Retrieval, and Synthesis in Question Answering
von: Du, Yiming, et al.
Veröffentlicht: (2024)
von: Du, Yiming, et al.
Veröffentlicht: (2024)
Prompt-Based Length Controlled Generation with Multiple Control Types
von: Jie, Renlong, et al.
Veröffentlicht: (2024)
von: Jie, Renlong, et al.
Veröffentlicht: (2024)
Preparing Lessons for Progressive Training on Language Models
von: Pan, Yu, et al.
Veröffentlicht: (2024)
von: Pan, Yu, et al.
Veröffentlicht: (2024)
FormalAlign: Automated Alignment Evaluation for Autoformalization
von: Lu, Jianqiao, et al.
Veröffentlicht: (2024)
von: Lu, Jianqiao, et al.
Veröffentlicht: (2024)
Entropy Centroids as Intrinsic Rewards for Test-Time Scaling
von: Zhao, Wenshuo, et al.
Veröffentlicht: (2026)
von: Zhao, Wenshuo, et al.
Veröffentlicht: (2026)
DocPuzzle: A Process-Aware Benchmark for Evaluating Realistic Long-Context Reasoning Capabilities
von: Zhuang, Tianyi, et al.
Veröffentlicht: (2025)
von: Zhuang, Tianyi, et al.
Veröffentlicht: (2025)
Consistent, multidimensional differential histogramming and summary statistics with YODA 2
von: Buckley, Andy, et al.
Veröffentlicht: (2023)
von: Buckley, Andy, et al.
Veröffentlicht: (2023)
QFFT, Question-Free Fine-Tuning for Adaptive Reasoning
von: Liu, Wanlong, et al.
Veröffentlicht: (2025)
von: Liu, Wanlong, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
SELF: Self-Evolution with Language Feedback
von: Lu, Jianqiao, et al.
Veröffentlicht: (2023) -
Data Management For Training Large Language Models: A Survey
von: Wang, Zige, et al.
Veröffentlicht: (2023) -
FollowBench: A Multi-level Fine-grained Constraints Following Benchmark for Large Language Models
von: Jiang, Yuxin, et al.
Veröffentlicht: (2023) -
EssayBench: Evaluating Large Language Models in Multi-Genre Chinese Essay Writing
von: Gao, Fan, et al.
Veröffentlicht: (2025) -
Planning, Creation, Usage: Benchmarking LLMs for Comprehensive Tool Utilization in Real-World Complex Scenarios
von: Huang, Shijue, et al.
Veröffentlicht: (2024)