Clarify: Improving Model Robustness With Natural Language Corrections
Fuente:
arXiv
Salvato in:
| Autori principali: | Lee, Yoonho, Lam, Michelle S., Vasconcelos, Helena, Bernstein, Michael S., Finn, Chelsea |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Calibrating Language Models with Adaptive Temperature Scaling
di: Xie, Johnathan, et al.
Pubblicazione: (2024)
di: Xie, Johnathan, et al.
Pubblicazione: (2024)
RLAD: Training LLMs to Discover Abstractions for Solving Reasoning Problems
di: Qu, Yuxiao, et al.
Pubblicazione: (2025)
di: Qu, Yuxiao, et al.
Pubblicazione: (2025)
Self-Guided Masked Autoencoders for Domain-Agnostic Self-Supervised Learning
di: Xie, Johnathan, et al.
Pubblicazione: (2024)
di: Xie, Johnathan, et al.
Pubblicazione: (2024)
A Critical Evaluation of AI Feedback for Aligning Large Language Models
di: Sharma, Archit, et al.
Pubblicazione: (2024)
di: Sharma, Archit, et al.
Pubblicazione: (2024)
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
di: Rafailov, Rafael, et al.
Pubblicazione: (2023)
di: Rafailov, Rafael, et al.
Pubblicazione: (2023)
Bidirectional Decoding: Improving Action Chunking via Guided Test-Time Sampling
di: Liu, Yuejiang, et al.
Pubblicazione: (2024)
di: Liu, Yuejiang, et al.
Pubblicazione: (2024)
Conservative Prediction via Data-Driven Confidence Minimization
di: Choi, Caroline, et al.
Pubblicazione: (2023)
di: Choi, Caroline, et al.
Pubblicazione: (2023)
Resolving Intent Ambiguities by Retrieving Discriminative Clarifying Questions
di: Dhole, Kaustubh D.
Pubblicazione: (2020)
di: Dhole, Kaustubh D.
Pubblicazione: (2020)
Harnessing Large Language Models: Fine-tuned BERT for Detecting Charismatic Leadership Tactics in Natural Language
di: Saeid, Yasser, et al.
Pubblicazione: (2024)
di: Saeid, Yasser, et al.
Pubblicazione: (2024)
Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms
di: Rafailov, Rafael, et al.
Pubblicazione: (2024)
di: Rafailov, Rafael, et al.
Pubblicazione: (2024)
Clarify, Abstain or Answer? Strategising in Conversation with Belief-Augmented Generation
di: Baan, Joris, et al.
Pubblicazione: (2026)
di: Baan, Joris, et al.
Pubblicazione: (2026)
When Correct Isn't Usable: Improving Structured Output Reliability in Small Language Models
di: Galeone, Cosimo, et al.
Pubblicazione: (2026)
di: Galeone, Cosimo, et al.
Pubblicazione: (2026)
On the Robustness of Reward Models for Language Model Alignment
di: Hong, Jiwoo, et al.
Pubblicazione: (2025)
di: Hong, Jiwoo, et al.
Pubblicazione: (2025)
Planning In Natural Language Improves LLM Search For Code Generation
di: Wang, Evan, et al.
Pubblicazione: (2024)
di: Wang, Evan, et al.
Pubblicazione: (2024)
RLVF: Learning from Verbal Feedback without Overgeneralization
di: Stephan, Moritz, et al.
Pubblicazione: (2024)
di: Stephan, Moritz, et al.
Pubblicazione: (2024)
Protein Language Models Diverge from Natural Language: Comparative Analysis and Improved Inference
di: Hart, Anna, et al.
Pubblicazione: (2026)
di: Hart, Anna, et al.
Pubblicazione: (2026)
Learning to Clarify: Multi-turn Conversations with Action-Based Contrastive Self-Training
di: Chen, Maximillian, et al.
Pubblicazione: (2024)
di: Chen, Maximillian, et al.
Pubblicazione: (2024)
Report Cards: Qualitative Evaluation of Language Models Using Natural Language Summaries
di: Yang, Blair, et al.
Pubblicazione: (2024)
di: Yang, Blair, et al.
Pubblicazione: (2024)
Quantifying and Improving the Robustness of Retrieval-Augmented Language Models Against Spurious Features in Grounding Data
di: Yang, Shiping, et al.
Pubblicazione: (2025)
di: Yang, Shiping, et al.
Pubblicazione: (2025)
Improving Large Language Models with Concept-Aware Fine-Tuning
di: Chen, Michael K., et al.
Pubblicazione: (2025)
di: Chen, Michael K., et al.
Pubblicazione: (2025)
Structured Prompts Improve Evaluation of Language Models
di: Aali, Asad, et al.
Pubblicazione: (2025)
di: Aali, Asad, et al.
Pubblicazione: (2025)
CodeIt: Self-Improving Language Models with Prioritized Hindsight Replay
di: Butt, Natasha, et al.
Pubblicazione: (2024)
di: Butt, Natasha, et al.
Pubblicazione: (2024)
Outlier-Safe Pre-Training for Robust 4-Bit Quantization of Large Language Models
di: Park, Jungwoo, et al.
Pubblicazione: (2025)
di: Park, Jungwoo, et al.
Pubblicazione: (2025)
FragileFlow: Spectral Control of Correct-but-Fragile Predictions for Foundation Model Robustness
di: Li, Zhuoyun, et al.
Pubblicazione: (2026)
di: Li, Zhuoyun, et al.
Pubblicazione: (2026)
Fewer Truncations Improve Language Modeling
di: Ding, Hantian, et al.
Pubblicazione: (2024)
di: Ding, Hantian, et al.
Pubblicazione: (2024)
Improving Instruction Following in Language Models through Proxy-Based Uncertainty Estimation
di: Lee, JoonHo, et al.
Pubblicazione: (2024)
di: Lee, JoonHo, et al.
Pubblicazione: (2024)
Self-Correction Bench: Uncovering and Addressing the Self-Correction Blind Spot in Large Language Models
di: Tsui, Ken
Pubblicazione: (2025)
di: Tsui, Ken
Pubblicazione: (2025)
Improving Context-Aware Preference Modeling for Language Models
di: Pitis, Silviu, et al.
Pubblicazione: (2024)
di: Pitis, Silviu, et al.
Pubblicazione: (2024)
Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences
di: Rosset, Corby, et al.
Pubblicazione: (2024)
di: Rosset, Corby, et al.
Pubblicazione: (2024)
Correcting Large Language Model Behavior via Influence Function
di: Zhang, Han, et al.
Pubblicazione: (2024)
di: Zhang, Han, et al.
Pubblicazione: (2024)
The Confidence Manifold: Geometric Structure of Correctness Representations in Language Models
di: Cho, Seonglae, et al.
Pubblicazione: (2026)
di: Cho, Seonglae, et al.
Pubblicazione: (2026)
Explaining Datasets in Words: Statistical Models with Natural Language Parameters
di: Zhong, Ruiqi, et al.
Pubblicazione: (2024)
di: Zhong, Ruiqi, et al.
Pubblicazione: (2024)
Unlocking In-Context Learning for Natural Datasets Beyond Language Modelling
di: Bratulić, Jelena, et al.
Pubblicazione: (2025)
di: Bratulić, Jelena, et al.
Pubblicazione: (2025)
LaFFi: Leveraging Hybrid Natural Language Feedback for Fine-tuning Language Models
di: Li, Qianxi, et al.
Pubblicazione: (2023)
di: Li, Qianxi, et al.
Pubblicazione: (2023)
Enhancing Antibiotic Stewardship using a Natural Language Approach for Better Feature Representation
di: Lee, Simon A., et al.
Pubblicazione: (2024)
di: Lee, Simon A., et al.
Pubblicazione: (2024)
ProgCo: Program Helps Self-Correction of Large Language Models
di: Song, Xiaoshuai, et al.
Pubblicazione: (2025)
di: Song, Xiaoshuai, et al.
Pubblicazione: (2025)
Uncovering Customer Issues through Topological Natural Language Analysis
di: Pi, Shu-Ting, et al.
Pubblicazione: (2024)
di: Pi, Shu-Ting, et al.
Pubblicazione: (2024)
Assessing Large Language Models on Climate Information
di: Bulian, Jannis, et al.
Pubblicazione: (2023)
di: Bulian, Jannis, et al.
Pubblicazione: (2023)
Improving Code Generation by Training with Natural Language Feedback
di: Chen, Angelica, et al.
Pubblicazione: (2023)
di: Chen, Angelica, et al.
Pubblicazione: (2023)
ROPO: Robust Preference Optimization for Large Language Models
di: Liang, Xize, et al.
Pubblicazione: (2024)
di: Liang, Xize, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Calibrating Language Models with Adaptive Temperature Scaling
di: Xie, Johnathan, et al.
Pubblicazione: (2024) -
RLAD: Training LLMs to Discover Abstractions for Solving Reasoning Problems
di: Qu, Yuxiao, et al.
Pubblicazione: (2025) -
Self-Guided Masked Autoencoders for Domain-Agnostic Self-Supervised Learning
di: Xie, Johnathan, et al.
Pubblicazione: (2024) -
A Critical Evaluation of AI Feedback for Aligning Large Language Models
di: Sharma, Archit, et al.
Pubblicazione: (2024) -
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
di: Rafailov, Rafael, et al.
Pubblicazione: (2023)