Alignment Data Map for Efficient Preference Data Selection and Diagnosis
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lee, Seohyeong, Kim, Eunwon, Lee, Hwaran, Chang, Buru |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SHARE: Shared Memory-Aware Open-Domain Long-Term Dialogue Dataset Constructed from Movie Script
par: Kim, Eunwon, et autres
Publié: (2024)
par: Kim, Eunwon, et autres
Publié: (2024)
Drift: Decoding-time Personalized Alignments with Implicit User Preferences
par: Kim, Minbeom, et autres
Publié: (2025)
par: Kim, Minbeom, et autres
Publié: (2025)
MAQA: Evaluating Uncertainty Quantification in LLMs Regarding Data Uncertainty
par: Yang, Yongjin, et autres
Publié: (2024)
par: Yang, Yongjin, et autres
Publié: (2024)
Review-driven Personalized Preference Reasoning with Large Language Models for Recommendation
par: Kim, Jieyong, et autres
Publié: (2024)
par: Kim, Jieyong, et autres
Publié: (2024)
KorNAT: LLM Alignment Benchmark for Korean Social Values and Common Knowledge
par: Lee, Jiyoung, et autres
Publié: (2024)
par: Lee, Jiyoung, et autres
Publié: (2024)
HarDBench: A Benchmark for Draft-Based Co-Authoring Jailbreak Attacks for Safe Human-LLM Collaborative Writing
par: Kim, Euntae, et autres
Publié: (2026)
par: Kim, Euntae, et autres
Publié: (2026)
Improving Fisher Information Estimation and Efficiency for LoRA-based LLM Unlearning
par: Kim, Yejin, et autres
Publié: (2025)
par: Kim, Yejin, et autres
Publié: (2025)
Spread Preference Annotation: Direct Preference Judgment for Efficient LLM Alignment
par: Kim, Dongyoung, et autres
Publié: (2024)
par: Kim, Dongyoung, et autres
Publié: (2024)
AdvisorQA: Towards Helpful and Harmless Advice-seeking Question Answering with Collective Intelligence
par: Kim, Minbeom, et autres
Publié: (2024)
par: Kim, Minbeom, et autres
Publié: (2024)
Code-Switching Red-Teaming: LLM Evaluation for Safety and Multilingual Understanding
par: Yoo, Haneul, et autres
Publié: (2024)
par: Yoo, Haneul, et autres
Publié: (2024)
LifeTox: Unveiling Implicit Toxicity in Life Advice
par: Kim, Minbeom, et autres
Publié: (2023)
par: Kim, Minbeom, et autres
Publié: (2023)
PAD: Towards Efficient Data Generation for Transfer Learning Using Phrase Alignment
par: Kim, Jong Myoung, et autres
Publié: (2025)
par: Kim, Jong Myoung, et autres
Publié: (2025)
TimeChara: Evaluating Point-in-Time Character Hallucination of Role-Playing Large Language Models
par: Ahn, Jaewoo, et autres
Publié: (2024)
par: Ahn, Jaewoo, et autres
Publié: (2024)
KoBBQ: Korean Bias Benchmark for Question Answering
par: Jin, Jiho, et autres
Publié: (2023)
par: Jin, Jiho, et autres
Publié: (2023)
Improving Conversational Abilities of Quantized Large Language Models via Direct Preference Alignment
par: Lee, Janghwan, et autres
Publié: (2024)
par: Lee, Janghwan, et autres
Publié: (2024)
In-Context Learning with Noisy Labels
par: Kang, Junyong, et autres
Publié: (2024)
par: Kang, Junyong, et autres
Publié: (2024)
DSPA: Dynamic SAE Steering for Data-Efficient Preference Alignment
par: Wedgwood, James, et autres
Publié: (2026)
par: Wedgwood, James, et autres
Publié: (2026)
Guaranteed Generation from Large Language Models
par: Kim, Minbeom, et autres
Publié: (2024)
par: Kim, Minbeom, et autres
Publié: (2024)
Less is More: Improving LLM Alignment via Preference Data Selection
par: Deng, Xun, et autres
Publié: (2025)
par: Deng, Xun, et autres
Publié: (2025)
ESREAL: Exploiting Semantic Reconstruction to Mitigate Hallucinations in Vision-Language Models
par: Kim, Minchan, et autres
Publié: (2024)
par: Kim, Minchan, et autres
Publié: (2024)
Margin Matching Preference Optimization: Enhanced Model Alignment with Granular Feedback
par: Kim, Kyuyoung, et autres
Publié: (2024)
par: Kim, Kyuyoung, et autres
Publié: (2024)
Who Wrote this Code? Watermarking for Code Generation
par: Lee, Taehyun, et autres
Publié: (2023)
par: Lee, Taehyun, et autres
Publié: (2023)
Finding the Sweet Spot: Preference Data Construction for Scaling Preference Optimization
par: Xiao, Yao, et autres
Publié: (2025)
par: Xiao, Yao, et autres
Publié: (2025)
Pedagogical Alignment for Vision-Language-Action Models: A Comprehensive Framework for Data, Architecture, and Evaluation in Education
par: Lee, Unggi, et autres
Publié: (2026)
par: Lee, Unggi, et autres
Publié: (2026)
Exploring LLM-based Data Annotation Strategies for Medical Dialogue Preference Alignment
par: Dou, Chengfeng, et autres
Publié: (2024)
par: Dou, Chengfeng, et autres
Publié: (2024)
Towards Efficient Visual-Language Alignment of the Q-Former for Visual Reasoning Tasks
par: Kim, Sungkyung, et autres
Publié: (2024)
par: Kim, Sungkyung, et autres
Publié: (2024)
Probing-RAG: Self-Probing to Guide Language Models in Selective Document Retrieval
par: Baek, Ingeol, et autres
Publié: (2024)
par: Baek, Ingeol, et autres
Publié: (2024)
A Two-Step Approach for Data-Efficient French Pronunciation Learning
par: Lee, Hoyeon, et autres
Publié: (2024)
par: Lee, Hoyeon, et autres
Publié: (2024)
FaST: Feature-aware Sampling and Tuning for Personalized Preference Alignment with Limited Data
par: Thonet, Thibaut, et autres
Publié: (2025)
par: Thonet, Thibaut, et autres
Publié: (2025)
Refined Direct Preference Optimization with Synthetic Data for Behavioral Alignment of LLMs
par: Gallego, Víctor
Publié: (2024)
par: Gallego, Víctor
Publié: (2024)
Code-Switching Curriculum Learning for Multilingual Transfer in LLMs
par: Yoo, Haneul, et autres
Publié: (2024)
par: Yoo, Haneul, et autres
Publié: (2024)
FineScope : SAE-guided Data Selection Enables Domain Specific LLM Pruning and Finetuning
par: Bhattacharyya, Chaitali, et autres
Publié: (2025)
par: Bhattacharyya, Chaitali, et autres
Publié: (2025)
Assessing Socio-Cultural Alignment and Technical Safety of Sovereign LLMs
par: Chae, Kyubyung, et autres
Publié: (2025)
par: Chae, Kyubyung, et autres
Publié: (2025)
Disentangling Preference Representation and Text Generation for Efficient Individual Preference Alignment
par: Zhang, Jianfei, et autres
Publié: (2024)
par: Zhang, Jianfei, et autres
Publié: (2024)
Mixed Preference Optimization: Reinforcement Learning with Data Selection and Better Reference Model
par: Gou, Qi, et autres
Publié: (2024)
par: Gou, Qi, et autres
Publié: (2024)
CURATRON: Complete and Robust Preference Data for Rigorous Alignment of Large Language Models
par: Nguyen, Son The, et autres
Publié: (2024)
par: Nguyen, Son The, et autres
Publié: (2024)
ReGUIDE: Data Efficient GUI Grounding via Spatial Reasoning and Search
par: Lee, Hyunseok, et autres
Publié: (2025)
par: Lee, Hyunseok, et autres
Publié: (2025)
Calibrating Large Language Models Using Their Generations Only
par: Ulmer, Dennis, et autres
Publié: (2024)
par: Ulmer, Dennis, et autres
Publié: (2024)
Solar Open Technical Report
par: Park, Sungrae, et autres
Publié: (2026)
par: Park, Sungrae, et autres
Publié: (2026)
Efficient-Empathy: Towards Efficient and Effective Selection of Empathy Data
par: Sun, Linzhuang, et autres
Publié: (2024)
par: Sun, Linzhuang, et autres
Publié: (2024)
Documents similaires
-
SHARE: Shared Memory-Aware Open-Domain Long-Term Dialogue Dataset Constructed from Movie Script
par: Kim, Eunwon, et autres
Publié: (2024) -
Drift: Decoding-time Personalized Alignments with Implicit User Preferences
par: Kim, Minbeom, et autres
Publié: (2025) -
MAQA: Evaluating Uncertainty Quantification in LLMs Regarding Data Uncertainty
par: Yang, Yongjin, et autres
Publié: (2024) -
Review-driven Personalized Preference Reasoning with Large Language Models for Recommendation
par: Kim, Jieyong, et autres
Publié: (2024) -
KorNAT: LLM Alignment Benchmark for Korean Social Values and Common Knowledge
par: Lee, Jiyoung, et autres
Publié: (2024)