Teaching Language Models to Self-Improve by Learning from Language Feedback
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Hu, Chi, Hu, Yimin, Cao, Hang, Xiao, Tong, Zhu, Jingbo |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Prior Constraints-based Reward Model Training for Aligning Large Language Models
von: Zhou, Hang, et al.
Veröffentlicht: (2024)
von: Zhou, Hang, et al.
Veröffentlicht: (2024)
RankPrompt: Step-by-Step Comparisons Make Language Models Better Reasoners
von: Hu, Chi, et al.
Veröffentlicht: (2024)
von: Hu, Chi, et al.
Veröffentlicht: (2024)
Foundations of Large Language Models
von: Xiao, Tong, et al.
Veröffentlicht: (2025)
von: Xiao, Tong, et al.
Veröffentlicht: (2025)
Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models
von: Chang, Kaiyan, et al.
Veröffentlicht: (2025)
von: Chang, Kaiyan, et al.
Veröffentlicht: (2025)
Learning Evaluation Models from Large Language Models for Sequence Generation
von: Wang, Chenglong, et al.
Veröffentlicht: (2023)
von: Wang, Chenglong, et al.
Veröffentlicht: (2023)
Teaching Language Models to Self-Improve through Interactive Demonstrations
von: Yu, Xiao, et al.
Veröffentlicht: (2023)
von: Yu, Xiao, et al.
Veröffentlicht: (2023)
Hybrid Alignment Training for Large Language Models
von: Wang, Chenglong, et al.
Veröffentlicht: (2024)
von: Wang, Chenglong, et al.
Veröffentlicht: (2024)
MRO: Enhancing Reasoning in Diffusion Language Models via Multi-Reward Optimization
von: Wang, Chenglong, et al.
Veröffentlicht: (2025)
von: Wang, Chenglong, et al.
Veröffentlicht: (2025)
Improving Retrieval Augmented Language Model with Self-Reasoning
von: Xia, Yuan, et al.
Veröffentlicht: (2024)
von: Xia, Yuan, et al.
Veröffentlicht: (2024)
Revealing the Parallel Multilingual Learning within Large Language Models
von: Mu, Yongyu, et al.
Veröffentlicht: (2024)
von: Mu, Yongyu, et al.
Veröffentlicht: (2024)
StyleBench: Evaluating Speech Language Models on Conversational Speaking Style Control
von: Zhao, Haishu, et al.
Veröffentlicht: (2026)
von: Zhao, Haishu, et al.
Veröffentlicht: (2026)
The Path of Self-Evolving Large Language Models: Achieving Data-Efficient Learning via Intrinsic Feedback
von: Zhang, Hangfan, et al.
Veröffentlicht: (2025)
von: Zhang, Hangfan, et al.
Veröffentlicht: (2025)
Language-Specific Layer Matters: Efficient Multilingual Enhancement for Large Vision-Language Models
von: Fan, Yuchun, et al.
Veröffentlicht: (2025)
von: Fan, Yuchun, et al.
Veröffentlicht: (2025)
Efficient Prompting Methods for Large Language Models: A Survey
von: Chang, Kaiyan, et al.
Veröffentlicht: (2024)
von: Chang, Kaiyan, et al.
Veröffentlicht: (2024)
Position IDs Matter: An Enhanced Position Layout for Efficient Context Compression in Large Language Models
von: Zhao, Runsong, et al.
Veröffentlicht: (2024)
von: Zhao, Runsong, et al.
Veröffentlicht: (2024)
Translate-and-Revise: Boosting Large Language Models for Constrained Translation
von: Huang, Pengcheng, et al.
Veröffentlicht: (2024)
von: Huang, Pengcheng, et al.
Veröffentlicht: (2024)
Let Me Teach You: Pedagogical Foundations of Feedback for Language Models
von: Borges, Beatriz, et al.
Veröffentlicht: (2023)
von: Borges, Beatriz, et al.
Veröffentlicht: (2023)
Teaching Large Language Models an Unseen Language on the Fly
von: Zhang, Chen, et al.
Veröffentlicht: (2024)
von: Zhang, Chen, et al.
Veröffentlicht: (2024)
Improving the Language Understanding Capabilities of Large Language Models Using Reinforcement Learning
von: Hu, Bokai, et al.
Veröffentlicht: (2024)
von: Hu, Bokai, et al.
Veröffentlicht: (2024)
Learning to Reason via Self-Iterative Process Feedback for Small Language Models
von: Chen, Kaiyuan, et al.
Veröffentlicht: (2024)
von: Chen, Kaiyuan, et al.
Veröffentlicht: (2024)
Recursive Introspection: Teaching Language Model Agents How to Self-Improve
von: Qu, Yuxiao, et al.
Veröffentlicht: (2024)
von: Qu, Yuxiao, et al.
Veröffentlicht: (2024)
Fine-tuning Large Language Models for Improving Factuality in Legal Question Answering
von: Hu, Yinghao, et al.
Veröffentlicht: (2025)
von: Hu, Yinghao, et al.
Veröffentlicht: (2025)
LoRM: Learning the Language of Rotating Machinery for Self-Supervised Condition Monitoring
von: Qin, Xiao, et al.
Veröffentlicht: (2026)
von: Qin, Xiao, et al.
Veröffentlicht: (2026)
Beyond Decoder-only: Large Language Models Can be Good Encoders for Machine Translation
von: Luo, Yingfeng, et al.
Veröffentlicht: (2025)
von: Luo, Yingfeng, et al.
Veröffentlicht: (2025)
Intuitionistic Fuzzy Sets for Large Language Model Data Annotation: A Novel Approach to Side-by-Side Preference Labeling
von: Du, Yimin
Veröffentlicht: (2025)
von: Du, Yimin
Veröffentlicht: (2025)
Smaller Language Models are capable of selecting Instruction-Tuning Training Data for Larger Language Models
von: Mekala, Dheeraj, et al.
Veröffentlicht: (2024)
von: Mekala, Dheeraj, et al.
Veröffentlicht: (2024)
SERM: Self-Evolving Relevance Model with Agent-Driven Learning from Massive Query Streams
von: Wang, Chenglong, et al.
Veröffentlicht: (2026)
von: Wang, Chenglong, et al.
Veröffentlicht: (2026)
Teaching LLMs to Abstain across Languages via Multilingual Feedback
von: Feng, Shangbin, et al.
Veröffentlicht: (2024)
von: Feng, Shangbin, et al.
Veröffentlicht: (2024)
Improving Small Language Models for Code Generation with Reinforcement Learning from Verification Feedback
von: Skopin, Egor, et al.
Veröffentlicht: (2026)
von: Skopin, Egor, et al.
Veröffentlicht: (2026)
Improving Attributed Text Generation of Large Language Models via Preference Learning
von: Li, Dongfang, et al.
Veröffentlicht: (2024)
von: Li, Dongfang, et al.
Veröffentlicht: (2024)
SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models
von: Huo, Yifu, et al.
Veröffentlicht: (2026)
von: Huo, Yifu, et al.
Veröffentlicht: (2026)
Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences
von: Rosset, Corby, et al.
Veröffentlicht: (2024)
von: Rosset, Corby, et al.
Veröffentlicht: (2024)
Importance Weighting Can Help Large Language Models Self-Improve
von: Jiang, Chunyang, et al.
Veröffentlicht: (2024)
von: Jiang, Chunyang, et al.
Veröffentlicht: (2024)
Post-Training Large Language Models via Reinforcement Learning from Self-Feedback
von: van Niekerk, Carel, et al.
Veröffentlicht: (2025)
von: van Niekerk, Carel, et al.
Veröffentlicht: (2025)
Improving Language Model Reasoning with Self-motivated Learning
von: Feng, Yunlong, et al.
Veröffentlicht: (2024)
von: Feng, Yunlong, et al.
Veröffentlicht: (2024)
Extensive Self-Contrast Enables Feedback-Free Language Model Alignment
von: Liu, Xiao, et al.
Veröffentlicht: (2024)
von: Liu, Xiao, et al.
Veröffentlicht: (2024)
Boosting Large Language Models with Socratic Method for Conversational Mathematics Teaching
von: Ding, Yuyang, et al.
Veröffentlicht: (2024)
von: Ding, Yuyang, et al.
Veröffentlicht: (2024)
LongReward: Improving Long-context Large Language Models with AI Feedback
von: Zhang, Jiajie, et al.
Veröffentlicht: (2024)
von: Zhang, Jiajie, et al.
Veröffentlicht: (2024)
Improving Mathematical Reasoning Capabilities of Small Language Models via Feedback-Driven Distillation
von: Zhu, Xunyu, et al.
Veröffentlicht: (2024)
von: Zhu, Xunyu, et al.
Veröffentlicht: (2024)
EIT: Enhanced Interactive Transformer
von: Zheng, Tong, et al.
Veröffentlicht: (2022)
von: Zheng, Tong, et al.
Veröffentlicht: (2022)
Ähnliche Einträge
-
Prior Constraints-based Reward Model Training for Aligning Large Language Models
von: Zhou, Hang, et al.
Veröffentlicht: (2024) -
RankPrompt: Step-by-Step Comparisons Make Language Models Better Reasoners
von: Hu, Chi, et al.
Veröffentlicht: (2024) -
Foundations of Large Language Models
von: Xiao, Tong, et al.
Veröffentlicht: (2025) -
Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models
von: Chang, Kaiyan, et al.
Veröffentlicht: (2025) -
Learning Evaluation Models from Large Language Models for Sequence Generation
von: Wang, Chenglong, et al.
Veröffentlicht: (2023)