LLMs-as-Instructors: Learning from Errors Toward Automating Model Improvement
Fuente:
arXiv
Guardado en:
| Autores principales: | Ying, Jiahao, Lin, Mingbao, Cao, Yixin, Tang, Wei, Wang, Bo, Sun, Qianru, Huang, Xuanjing, Yan, Shuicheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Automating Dataset Updates Towards Reliable and Timely Evaluation of Large Language Models
por: Ying, Jiahao, et al.
Publicado: (2024)
por: Ying, Jiahao, et al.
Publicado: (2024)
Beyond Benchmarks: Understanding Mixture-of-Experts Models through Internal Mechanisms
por: Ying, Jiahao, et al.
Publicado: (2025)
por: Ying, Jiahao, et al.
Publicado: (2025)
Model Utility Law: Evaluating LLMs beyond Performance through Mechanism Interpretable Metric
por: Cao, Yixin, et al.
Publicado: (2025)
por: Cao, Yixin, et al.
Publicado: (2025)
UIO-LLMs: Unbiased Incremental Optimization for Long-Context LLMs
por: Li, Wenhao, et al.
Publicado: (2024)
por: Li, Wenhao, et al.
Publicado: (2024)
EvoWiki: Evaluating LLMs on Evolving Knowledge
por: Tang, Wei, et al.
Publicado: (2024)
por: Tang, Wei, et al.
Publicado: (2024)
Multi-Agent Sampling: Scaling Inference Compute for Data Synthesis with Tree Search-Based Agentic Collaboration
por: Ye, Hai, et al.
Publicado: (2024)
por: Ye, Hai, et al.
Publicado: (2024)
A + B: A General Generator-Reader Framework for Optimizing LLMs to Unleash Synergy Potential
por: Tang, Wei, et al.
Publicado: (2024)
por: Tang, Wei, et al.
Publicado: (2024)
QRMeM: Unleash the Length Limitation through Question then Reflection Memory Mechanism
por: Wang, Bo, et al.
Publicado: (2024)
por: Wang, Bo, et al.
Publicado: (2024)
Audio-Reasoner: Improving Reasoning Capability in Large Audio Language Models
por: Xie, Zhifei, et al.
Publicado: (2025)
por: Xie, Zhifei, et al.
Publicado: (2025)
Disentangling Language and Culture for Evaluating Multilingual Large Language Models
por: Ying, Jiahao, et al.
Publicado: (2025)
por: Ying, Jiahao, et al.
Publicado: (2025)
EasyInv: Toward Fast and Better DDIM Inversion
por: Zhang, Ziyue, et al.
Publicado: (2024)
por: Zhang, Ziyue, et al.
Publicado: (2024)
Intuitive or Dependent? Investigating LLMs' Behavior Style to Conflicting Prompts
por: Ying, Jiahao, et al.
Publicado: (2023)
por: Ying, Jiahao, et al.
Publicado: (2023)
EffiEval: Efficient and Generalizable Model Evaluation via Capability Coverage Maximization
por: Wang, Yaoning, et al.
Publicado: (2025)
por: Wang, Yaoning, et al.
Publicado: (2025)
Diagnosing and Remedying Knowledge Deficiencies in LLMs via Label-free Curricular Meaningful Learning
por: Xiong, Kai, et al.
Publicado: (2024)
por: Xiong, Kai, et al.
Publicado: (2024)
Error Classification of Large Language Models on Math Word Problems: A Dynamically Adaptive Framework
por: Sun, Yuhong, et al.
Publicado: (2025)
por: Sun, Yuhong, et al.
Publicado: (2025)
Towards Automated Kernel Generation in the Era of LLMs
por: Yu, Yang, et al.
Publicado: (2026)
por: Yu, Yang, et al.
Publicado: (2026)
General LLMs as Instructors for Domain-Specific LLMs: A Sequential Fusion Method to Integrate Extraction and Editing
por: Zhang, Xin, et al.
Publicado: (2024)
por: Zhang, Xin, et al.
Publicado: (2024)
CURP: Codebook-based Continuous User Representation for Personalized Generation with LLMs
por: Wang, Liang, et al.
Publicado: (2026)
por: Wang, Liang, et al.
Publicado: (2026)
Unveiling the Truth and Facilitating Change: Towards Agent-based Large-scale Social Movement Simulation
por: Mou, Xinyi, et al.
Publicado: (2024)
por: Mou, Xinyi, et al.
Publicado: (2024)
Feedback-Driven Tool-Use Improvements in Large Language Models via Automated Build Environments
por: Ye, Junjie, et al.
Publicado: (2025)
por: Ye, Junjie, et al.
Publicado: (2025)
Toward Generalizable Evaluation in the LLM Era: A Survey Beyond Benchmarks
por: Cao, Yixin, et al.
Publicado: (2025)
por: Cao, Yixin, et al.
Publicado: (2025)
DiffusionTrend: A Minimalist Approach to Virtual Fashion Try-On
por: Zhan, Wengyi, et al.
Publicado: (2024)
por: Zhan, Wengyi, et al.
Publicado: (2024)
Long Context vs. RAG for LLMs: An Evaluation and Revisits
por: Li, Xinze, et al.
Publicado: (2024)
por: Li, Xinze, et al.
Publicado: (2024)
Less Data Less Tokens: Multilingual Unification Learning for Efficient Test-Time Reasoning in LLMs
por: Chen, Kang, et al.
Publicado: (2025)
por: Chen, Kang, et al.
Publicado: (2025)
Towards Self-Improvement of LLMs via MCTS: Leveraging Stepwise Knowledge with Curriculum Preference Learning
por: Wang, Xiyao, et al.
Publicado: (2024)
por: Wang, Xiyao, et al.
Publicado: (2024)
Synergistic Multi-Agent Framework with Trajectory Learning for Knowledge-Intensive Tasks
por: Yue, Shengbin, et al.
Publicado: (2024)
por: Yue, Shengbin, et al.
Publicado: (2024)
Towards Scalable Automated Alignment of LLMs: A Survey
por: Cao, Boxi, et al.
Publicado: (2024)
por: Cao, Boxi, et al.
Publicado: (2024)
Reversible Diffusion Decoding for Diffusion Language Models
por: Wang, Xinyun, et al.
Publicado: (2026)
por: Wang, Xinyun, et al.
Publicado: (2026)
Towards Verifiable Generation: A Benchmark for Knowledge-aware Language Model Attribution
por: Li, Xinze, et al.
Publicado: (2023)
por: Li, Xinze, et al.
Publicado: (2023)
Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs
por: Liu, Chris Yuhao, et al.
Publicado: (2024)
por: Liu, Chris Yuhao, et al.
Publicado: (2024)
AutoLogi: Automated Generation of Logic Puzzles for Evaluating Reasoning Abilities of Large Language Models
por: Zhu, Qin, et al.
Publicado: (2025)
por: Zhu, Qin, et al.
Publicado: (2025)
Draft-Thinking: Learning Efficient Reasoning in Long Chain-of-Thought LLMs
por: Cao, Jie, et al.
Publicado: (2026)
por: Cao, Jie, et al.
Publicado: (2026)
Demystifying Reinforcement Learning in Agentic Reasoning
por: Yu, Zhaochen, et al.
Publicado: (2025)
por: Yu, Zhaochen, et al.
Publicado: (2025)
LifeSim: Long-Horizon User Life Simulator for Personalized Assistant Evaluation
por: Duan, Feiyu, et al.
Publicado: (2026)
por: Duan, Feiyu, et al.
Publicado: (2026)
EvaLearn: Quantifying the Learning Capability and Efficiency of LLMs via Sequential Problem Solving
por: Dou, Shihan, et al.
Publicado: (2025)
por: Dou, Shihan, et al.
Publicado: (2025)
AdaptR1: Reinforcement Learning Based Adaptive Interleaved Thinking in Multi-hop Question Answering
por: Wang, Yuxin, et al.
Publicado: (2026)
por: Wang, Yuxin, et al.
Publicado: (2026)
R-Horizon: How Far Can Your Large Reasoning Model Really Go in Breadth and Depth?
por: Lu, Yi, et al.
Publicado: (2025)
por: Lu, Yi, et al.
Publicado: (2025)
MemGen: Weaving Generative Latent Memory for Self-Evolving Agents
por: Zhang, Guibin, et al.
Publicado: (2025)
por: Zhang, Guibin, et al.
Publicado: (2025)
UniVST: A Unified Framework for Training-free Localized Video Style Transfer
por: Song, Quanjian, et al.
Publicado: (2024)
por: Song, Quanjian, et al.
Publicado: (2024)
The End of Manual Decoding: Towards Truly End-to-End Language Models
por: Wang, Zhichao, et al.
Publicado: (2025)
por: Wang, Zhichao, et al.
Publicado: (2025)
Ejemplares similares
-
Automating Dataset Updates Towards Reliable and Timely Evaluation of Large Language Models
por: Ying, Jiahao, et al.
Publicado: (2024) -
Beyond Benchmarks: Understanding Mixture-of-Experts Models through Internal Mechanisms
por: Ying, Jiahao, et al.
Publicado: (2025) -
Model Utility Law: Evaluating LLMs beyond Performance through Mechanism Interpretable Metric
por: Cao, Yixin, et al.
Publicado: (2025) -
UIO-LLMs: Unbiased Incremental Optimization for Long-Context LLMs
por: Li, Wenhao, et al.
Publicado: (2024) -
EvoWiki: Evaluating LLMs on Evolving Knowledge
por: Tang, Wei, et al.
Publicado: (2024)