Safer-Instruct: Aligning Language Models with Automated Preference Data
Fuente:
arXiv
Salvato in:
| Autori principali: | Shi, Taiwei, Chen, Kai, Zhao, Jieyu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Aligning Large Language Models with Searcher Preferences
di: Wu, Wei, et al.
Pubblicazione: (2026)
di: Wu, Wei, et al.
Pubblicazione: (2026)
Capturing Nuanced Preferences: Preference-Aligned Distillation for Small Language Models
di: Gu, Yanggan, et al.
Pubblicazione: (2025)
di: Gu, Yanggan, et al.
Pubblicazione: (2025)
Icon$^{2}$: Aligning Large Language Models Using Self-Synthetic Preference Data via Inherent Regulation
di: Chen, Qiyuan, et al.
Pubblicazione: (2025)
di: Chen, Qiyuan, et al.
Pubblicazione: (2025)
Aligning Large Language Model Behavior with Human Citation Preferences
di: Ando, Kenichiro, et al.
Pubblicazione: (2026)
di: Ando, Kenichiro, et al.
Pubblicazione: (2026)
InvThink: Premortem Reasoning for Safer Language Models
di: Kim, Yubin, et al.
Pubblicazione: (2025)
di: Kim, Yubin, et al.
Pubblicazione: (2025)
Infinity Instruct: Scaling Instruction Selection and Synthesis to Enhance Language Models
di: Li, Jijie, et al.
Pubblicazione: (2025)
di: Li, Jijie, et al.
Pubblicazione: (2025)
WizardCoder: Empowering Code Large Language Models with Evol-Instruct
di: Luo, Ziyang, et al.
Pubblicazione: (2023)
di: Luo, Ziyang, et al.
Pubblicazione: (2023)
Steering Risk Preferences in Large Language Models by Aligning Behavioral and Neural Representations
di: Zhu, Jian-Qiao, et al.
Pubblicazione: (2025)
di: Zhu, Jian-Qiao, et al.
Pubblicazione: (2025)
Towards Acyclic Preference Evaluation of Language Models via Multiple Evaluators
di: Hu, Zhengyu, et al.
Pubblicazione: (2024)
di: Hu, Zhengyu, et al.
Pubblicazione: (2024)
ReviewInstruct: A Review-Driven Multi-Turn Conversations Generation Method for Large Language Models
di: Wu, Jiangxu, et al.
Pubblicazione: (2025)
di: Wu, Jiangxu, et al.
Pubblicazione: (2025)
The Hallucination Tax of Reinforcement Finetuning
di: Song, Linxin, et al.
Pubblicazione: (2025)
di: Song, Linxin, et al.
Pubblicazione: (2025)
ExpertPrompting: Instructing Large Language Models to be Distinguished Experts
di: Xu, Benfeng, et al.
Pubblicazione: (2023)
di: Xu, Benfeng, et al.
Pubblicazione: (2023)
TPO: Aligning Large Language Models with Multi-branch & Multi-step Preference Trees
di: Liao, Weibin, et al.
Pubblicazione: (2024)
di: Liao, Weibin, et al.
Pubblicazione: (2024)
LexInstructEval: Lexical Instruction Following Evaluation for Large Language Models
di: Ren, Huimin, et al.
Pubblicazione: (2025)
di: Ren, Huimin, et al.
Pubblicazione: (2025)
Preference Consistency Matters: Enhancing Preference Learning in Language Models with Automated Self-Curation of Training Corpora
di: Lee, JoonHo, et al.
Pubblicazione: (2024)
di: Lee, JoonHo, et al.
Pubblicazione: (2024)
Merge and Conquer: Instructing Multilingual Models by Adding Target Language Weights
di: Valero, Eneko, et al.
Pubblicazione: (2026)
di: Valero, Eneko, et al.
Pubblicazione: (2026)
Comparing Bad Apples to Good Oranges: Aligning Large Language Models via Joint Preference Optimization
di: Bansal, Hritik, et al.
Pubblicazione: (2024)
di: Bansal, Hritik, et al.
Pubblicazione: (2024)
Preventing Catastrophic Forgetting: Behavior-Aware Sampling for Safer Language Model Fine-Tuning
di: Pham, Anh, et al.
Pubblicazione: (2025)
di: Pham, Anh, et al.
Pubblicazione: (2025)
"You Gotta be a Doctor, Lin": An Investigation of Name-Based Bias of Large Language Models in Employment Recommendations
di: Nghiem, Huy, et al.
Pubblicazione: (2024)
di: Nghiem, Huy, et al.
Pubblicazione: (2024)
BioInstruct: Instruction Tuning of Large Language Models for Biomedical Natural Language Processing
di: Tran, Hieu, et al.
Pubblicazione: (2023)
di: Tran, Hieu, et al.
Pubblicazione: (2023)
Aligning Large Language Models to Follow Instructions and Hallucinate Less via Effective Data Filtering
di: Si, Shuzheng, et al.
Pubblicazione: (2025)
di: Si, Shuzheng, et al.
Pubblicazione: (2025)
SimulPL: Aligning Human Preferences in Simultaneous Machine Translation
di: Yu, Donglei, et al.
Pubblicazione: (2025)
di: Yu, Donglei, et al.
Pubblicazione: (2025)
Self-supervised Preference Optimization: Enhance Your Language Model with Preference Degree Awareness
di: Li, Jian, et al.
Pubblicazione: (2024)
di: Li, Jian, et al.
Pubblicazione: (2024)
Deliberative Alignment: Reasoning Enables Safer Language Models
di: Guan, Melody Y., et al.
Pubblicazione: (2024)
di: Guan, Melody Y., et al.
Pubblicazione: (2024)
Models That Know How Evaluations Are Designed Score Safer
di: Deckenbach, Katharina, et al.
Pubblicazione: (2026)
di: Deckenbach, Katharina, et al.
Pubblicazione: (2026)
GraphInstruct: Empowering Large Language Models with Graph Understanding and Reasoning Capability
di: Luo, Zihan, et al.
Pubblicazione: (2024)
di: Luo, Zihan, et al.
Pubblicazione: (2024)
STAR-1: Safer Alignment of Reasoning LLMs with 1K Data
di: Wang, Zijun, et al.
Pubblicazione: (2025)
di: Wang, Zijun, et al.
Pubblicazione: (2025)
Emotion-Aligned Generation in Diffusion Text to Speech Models via Preference-Guided Optimization
di: Shi, Jiacheng, et al.
Pubblicazione: (2025)
di: Shi, Jiacheng, et al.
Pubblicazione: (2025)
RAG LLMs are Not Safer: A Safety Analysis of Retrieval-Augmented Generation for Large Language Models
di: An, Bang, et al.
Pubblicazione: (2025)
di: An, Bang, et al.
Pubblicazione: (2025)
Safer or Luckier? LLMs as Safety Evaluators Are Not Robust to Artifacts
di: Chen, Hongyu, et al.
Pubblicazione: (2025)
di: Chen, Hongyu, et al.
Pubblicazione: (2025)
LifeAlign: Lifelong Alignment for Large Language Models with Memory-Augmented Focalized Preference Optimization
di: Li, Junsong, et al.
Pubblicazione: (2025)
di: Li, Junsong, et al.
Pubblicazione: (2025)
Can Language Model Moderators Improve the Health of Online Discourse?
di: Cho, Hyundong, et al.
Pubblicazione: (2023)
di: Cho, Hyundong, et al.
Pubblicazione: (2023)
Clean First, Align Later: Benchmarking Preference Data Cleaning for Reliable LLM Alignment
di: Yeh, Samuel, et al.
Pubblicazione: (2025)
di: Yeh, Samuel, et al.
Pubblicazione: (2025)
Peering Through Preferences: Unraveling Feedback Acquisition for Aligning Large Language Models
di: Bansal, Hritik, et al.
Pubblicazione: (2023)
di: Bansal, Hritik, et al.
Pubblicazione: (2023)
Aligning with Human Judgement: The Role of Pairwise Preference in Large Language Model Evaluators
di: Liu, Yinhong, et al.
Pubblicazione: (2024)
di: Liu, Yinhong, et al.
Pubblicazione: (2024)
Improving Instruct Models for Free: A Study on Partial Adaptation
di: İrsoy, Ozan, et al.
Pubblicazione: (2025)
di: İrsoy, Ozan, et al.
Pubblicazione: (2025)
Self-Boosting Large Language Models with Synthetic Preference Data
di: Dong, Qingxiu, et al.
Pubblicazione: (2024)
di: Dong, Qingxiu, et al.
Pubblicazione: (2024)
Configurable Safety Tuning of Language Models with Synthetic Preference Data
di: Gallego, Victor
Pubblicazione: (2024)
di: Gallego, Victor
Pubblicazione: (2024)
The Real, the Better: Aligning Large Language Models with Online Human Behaviors
di: Jiang, Guanying, et al.
Pubblicazione: (2024)
di: Jiang, Guanying, et al.
Pubblicazione: (2024)
Aligning Model Evaluations with Human Preferences: Mitigating Token Count Bias in Language Model Assessments
di: Daynauth, Roland, et al.
Pubblicazione: (2024)
di: Daynauth, Roland, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Aligning Large Language Models with Searcher Preferences
di: Wu, Wei, et al.
Pubblicazione: (2026) -
Capturing Nuanced Preferences: Preference-Aligned Distillation for Small Language Models
di: Gu, Yanggan, et al.
Pubblicazione: (2025) -
Icon$^{2}$: Aligning Large Language Models Using Self-Synthetic Preference Data via Inherent Regulation
di: Chen, Qiyuan, et al.
Pubblicazione: (2025) -
Aligning Large Language Model Behavior with Human Citation Preferences
di: Ando, Kenichiro, et al.
Pubblicazione: (2026) -
InvThink: Premortem Reasoning for Safer Language Models
di: Kim, Yubin, et al.
Pubblicazione: (2025)