A Critical Evaluation of AI Feedback for Aligning Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Sharma, Archit, Keh, Sedrick, Mitchell, Eric, Finn, Chelsea, Arora, Kushal, Kollar, Thomas |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
RLVF: Learning from Verbal Feedback without Overgeneralization
von: Stephan, Moritz, et al.
Veröffentlicht: (2024)
von: Stephan, Moritz, et al.
Veröffentlicht: (2024)
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
von: Rafailov, Rafael, et al.
Veröffentlicht: (2023)
von: Rafailov, Rafael, et al.
Veröffentlicht: (2023)
Calibrating Language Models with Adaptive Temperature Scaling
von: Xie, Johnathan, et al.
Veröffentlicht: (2024)
von: Xie, Johnathan, et al.
Veröffentlicht: (2024)
Linearizing Large Language Models
von: Mercat, Jean, et al.
Veröffentlicht: (2024)
von: Mercat, Jean, et al.
Veröffentlicht: (2024)
FSPO: Few-Shot Optimization of Synthetic Preferences Personalizes to Real Users
von: Singh, Anikait, et al.
Veröffentlicht: (2025)
von: Singh, Anikait, et al.
Veröffentlicht: (2025)
Grounding by Trying: LLMs with Reinforcement Learning-Enhanced Retrieval
von: Hsu, Sheryl, et al.
Veröffentlicht: (2024)
von: Hsu, Sheryl, et al.
Veröffentlicht: (2024)
Are Retrials All You Need? Enhancing Large Language Model Reasoning Without Verbalized Feedback
von: Potamitis, Nearchos, et al.
Veröffentlicht: (2025)
von: Potamitis, Nearchos, et al.
Veröffentlicht: (2025)
Peering Through Preferences: Unraveling Feedback Acquisition for Aligning Large Language Models
von: Bansal, Hritik, et al.
Veröffentlicht: (2023)
von: Bansal, Hritik, et al.
Veröffentlicht: (2023)
Towards Aligning Language Models with Textual Feedback
von: Lloret, Saüc Abadal, et al.
Veröffentlicht: (2024)
von: Lloret, Saüc Abadal, et al.
Veröffentlicht: (2024)
Clarify: Improving Model Robustness With Natural Language Corrections
von: Lee, Yoonho, et al.
Veröffentlicht: (2024)
von: Lee, Yoonho, et al.
Veröffentlicht: (2024)
Neural Diversity Regularizes Hallucinations in Language Models
von: Chakrabarti, Kushal, et al.
Veröffentlicht: (2025)
von: Chakrabarti, Kushal, et al.
Veröffentlicht: (2025)
Unraveling the cognitive patterns of Large Language Models through module communities
von: Bhandari, Kushal Raj, et al.
Veröffentlicht: (2025)
von: Bhandari, Kushal Raj, et al.
Veröffentlicht: (2025)
Evaluating the Robustness of Analogical Reasoning in Large Language Models
von: Lewis, Martha, et al.
Veröffentlicht: (2024)
von: Lewis, Martha, et al.
Veröffentlicht: (2024)
Align to Structure: Aligning Large Language Models with Structural Information
von: Kim, Zae Myung, et al.
Veröffentlicht: (2025)
von: Kim, Zae Myung, et al.
Veröffentlicht: (2025)
Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators
von: Liu, Yinhong, et al.
Veröffentlicht: (2024)
von: Liu, Yinhong, et al.
Veröffentlicht: (2024)
UltraFeedback: Boosting Language Models with Scaled AI Feedback
von: Cui, Ganqu, et al.
Veröffentlicht: (2023)
von: Cui, Ganqu, et al.
Veröffentlicht: (2023)
Towards Data-Centric RLHF: Simple Metrics for Preference Dataset Comparison
von: Shen, Judy Hanwen, et al.
Veröffentlicht: (2024)
von: Shen, Judy Hanwen, et al.
Veröffentlicht: (2024)
GUNDAM: Aligning Large Language Models with Graph Understanding
von: Ouyang, Sheng, et al.
Veröffentlicht: (2024)
von: Ouyang, Sheng, et al.
Veröffentlicht: (2024)
Aligning Large Language Models by On-Policy Self-Judgment
von: Lee, Sangkyu, et al.
Veröffentlicht: (2024)
von: Lee, Sangkyu, et al.
Veröffentlicht: (2024)
Aligning Large Language Models via Fine-grained Supervision
von: Xu, Dehong, et al.
Veröffentlicht: (2024)
von: Xu, Dehong, et al.
Veröffentlicht: (2024)
AlignBench: Benchmarking Chinese Alignment of Large Language Models
von: Liu, Xiao, et al.
Veröffentlicht: (2023)
von: Liu, Xiao, et al.
Veröffentlicht: (2023)
Mitigating Over-Refusal in Aligned Large Language Models via Inference-Time Activation Energy
von: Jiang, Eric Hanchen, et al.
Veröffentlicht: (2025)
von: Jiang, Eric Hanchen, et al.
Veröffentlicht: (2025)
VLA Foundry: A Unified Framework for Training Vision-Language-Action Models
von: Mercat, Jean, et al.
Veröffentlicht: (2026)
von: Mercat, Jean, et al.
Veröffentlicht: (2026)
Aligning Language Models from User Interactions
von: Buening, Thomas Kleine, et al.
Veröffentlicht: (2026)
von: Buening, Thomas Kleine, et al.
Veröffentlicht: (2026)
Stream of Search (SoS): Learning to Search in Language
von: Gandhi, Kanishk, et al.
Veröffentlicht: (2024)
von: Gandhi, Kanishk, et al.
Veröffentlicht: (2024)
CHAI for LLMs: Improving Code-Mixed Translation in Large Language Models through Reinforcement Learning with AI Feedback
von: Zhang, Wenbo, et al.
Veröffentlicht: (2024)
von: Zhang, Wenbo, et al.
Veröffentlicht: (2024)
A Systematic Survey and Critical Review on Evaluating Large Language Models: Challenges, Limitations, and Recommendations
von: Laskar, Md Tahmid Rahman, et al.
Veröffentlicht: (2024)
von: Laskar, Md Tahmid Rahman, et al.
Veröffentlicht: (2024)
Self-Rewarding PPO: Aligning Large Language Models with Demonstrations Only
von: Zhang, Qingru, et al.
Veröffentlicht: (2025)
von: Zhang, Qingru, et al.
Veröffentlicht: (2025)
Alignment Studio: Aligning Large Language Models to Particular Contextual Regulations
von: Achintalwar, Swapnaja, et al.
Veröffentlicht: (2024)
von: Achintalwar, Swapnaja, et al.
Veröffentlicht: (2024)
Beyond Labels: Aligning Large Language Models with Human-like Reasoning
von: Kabir, Muhammad Rafsan, et al.
Veröffentlicht: (2024)
von: Kabir, Muhammad Rafsan, et al.
Veröffentlicht: (2024)
Yell At Your Robot: Improving On-the-Fly from Language Corrections
von: Shi, Lucy Xiaoyang, et al.
Veröffentlicht: (2024)
von: Shi, Lucy Xiaoyang, et al.
Veröffentlicht: (2024)
DeepCritic: Deliberate Critique with Large Language Models
von: Yang, Wenkai, et al.
Veröffentlicht: (2025)
von: Yang, Wenkai, et al.
Veröffentlicht: (2025)
Weak-to-Strong Search: Align Large Language Models via Searching over Small Language Models
von: Zhou, Zhanhui, et al.
Veröffentlicht: (2024)
von: Zhou, Zhanhui, et al.
Veröffentlicht: (2024)
Reward Collapse in Aligning Large Language Models
von: Song, Ziang, et al.
Veröffentlicht: (2023)
von: Song, Ziang, et al.
Veröffentlicht: (2023)
CoLa: Learning to Interactively Collaborate with Large Language Models
von: Sharma, Abhishek, et al.
Veröffentlicht: (2025)
von: Sharma, Abhishek, et al.
Veröffentlicht: (2025)
Evaluating Text Summaries Generated by Large Language Models Using OpenAI's GPT
von: Shakil, Hassan, et al.
Veröffentlicht: (2024)
von: Shakil, Hassan, et al.
Veröffentlicht: (2024)
Gaining Wisdom from Setbacks: Aligning Large Language Models via Mistake Analysis
von: Chen, Kai, et al.
Veröffentlicht: (2023)
von: Chen, Kai, et al.
Veröffentlicht: (2023)
Wikontic: Constructing Wikidata-Aligned, Ontology-Aware Knowledge Graphs with Large Language Models
von: Chepurova, Alla, et al.
Veröffentlicht: (2025)
von: Chepurova, Alla, et al.
Veröffentlicht: (2025)
Mitigating Geospatial Knowledge Hallucination in Large Language Models: Benchmarking and Dynamic Factuality Aligning
von: Wang, Shengyuan, et al.
Veröffentlicht: (2025)
von: Wang, Shengyuan, et al.
Veröffentlicht: (2025)
LatentBreak: Jailbreaking Large Language Models through Latent Space Feedback
von: Mura, Raffaele, et al.
Veröffentlicht: (2025)
von: Mura, Raffaele, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
RLVF: Learning from Verbal Feedback without Overgeneralization
von: Stephan, Moritz, et al.
Veröffentlicht: (2024) -
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
von: Rafailov, Rafael, et al.
Veröffentlicht: (2023) -
Calibrating Language Models with Adaptive Temperature Scaling
von: Xie, Johnathan, et al.
Veröffentlicht: (2024) -
Linearizing Large Language Models
von: Mercat, Jean, et al.
Veröffentlicht: (2024) -
FSPO: Few-Shot Optimization of Synthetic Preferences Personalizes to Real Users
von: Singh, Anikait, et al.
Veröffentlicht: (2025)