From Distributional to Overton Pluralism: Investigating Large Language Model Alignment
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lake, Thom, Choi, Eunsol, Durrett, Greg |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PropMEND: Hypernetworks for Knowledge Propagation in LLMs
par: Liu, Zeyu Leo, et autres
Publié: (2025)
par: Liu, Zeyu Leo, et autres
Publié: (2025)
Contrastive Learning to Improve Retrieval for Real-world Fact Checking
par: Sriram, Aniruddh, et autres
Publié: (2024)
par: Sriram, Aniruddh, et autres
Publié: (2024)
A Long Way to Go: Investigating Length Correlations in RLHF
par: Singhal, Prasann, et autres
Publié: (2023)
par: Singhal, Prasann, et autres
Publié: (2023)
SynthesizRR: Generating Diverse Datasets with Retrieval Augmentation
par: Divekar, Abhishek, et autres
Publié: (2024)
par: Divekar, Abhishek, et autres
Publié: (2024)
Failing to Falsify: Evaluating and Mitigating Confirmation Bias in Language Models
par: Jhaveri, Ayush Rajesh, et autres
Publié: (2026)
par: Jhaveri, Ayush Rajesh, et autres
Publié: (2026)
Exploring Design Choices for Building Language-Specific LLMs
par: Tejaswi, Atula, et autres
Publié: (2024)
par: Tejaswi, Atula, et autres
Publié: (2024)
VeriSoftBench: Repository-Scale Formal Verification Benchmarks for Lean
par: Xin, Yutong, et autres
Publié: (2026)
par: Xin, Yutong, et autres
Publié: (2026)
Complex Claim Verification with Evidence Retrieved in the Wild
par: Chen, Jifan, et autres
Publié: (2023)
par: Chen, Jifan, et autres
Publié: (2023)
Adaptive Margin RLHF via Preference over Preferences
par: Chittepu, Yaswanth, et autres
Publié: (2025)
par: Chittepu, Yaswanth, et autres
Publié: (2025)
PluralLLM: Pluralistic Alignment in LLMs via Federated Learning
par: Srewa, Mahmoud, et autres
Publié: (2025)
par: Srewa, Mahmoud, et autres
Publié: (2025)
CodeUpdateArena: Benchmarking Knowledge Editing on API Updates
par: Liu, Zeyu Leo, et autres
Publié: (2024)
par: Liu, Zeyu Leo, et autres
Publié: (2024)
Confidence Under the Hood: An Investigation into the Confidence-Probability Alignment in Large Language Models
par: Kumar, Abhishek, et autres
Publié: (2024)
par: Kumar, Abhishek, et autres
Publié: (2024)
ProofWala: A Framework for Multilingual Proof Data Synthesis and Theorem-Proving
par: Thakur, Amitayush, et autres
Publié: (2025)
par: Thakur, Amitayush, et autres
Publié: (2025)
Coeditor: Leveraging Contextual Changes for Multi-round Code Auto-editing
par: Wei, Jiayi, et autres
Publié: (2023)
par: Wei, Jiayi, et autres
Publié: (2023)
Differentially Private Steering for Large Language Model Alignment
par: Goel, Anmol, et autres
Publié: (2025)
par: Goel, Anmol, et autres
Publié: (2025)
Discovering Implicit Large Language Model Alignment Objectives
par: Chen, Edward, et autres
Publié: (2026)
par: Chen, Edward, et autres
Publié: (2026)
Investigating Symbolic Capabilities of Large Language Models
par: Dave, Neisarg, et autres
Publié: (2024)
par: Dave, Neisarg, et autres
Publié: (2024)
Investigating Layer Importance in Large Language Models
par: Zhang, Yang, et autres
Publié: (2024)
par: Zhang, Yang, et autres
Publié: (2024)
Identifying the Source of Generation for Large Language Models
par: Park, Bumjin, et autres
Publié: (2024)
par: Park, Bumjin, et autres
Publié: (2024)
Detecting and Suppressing Reward Hacking with Gradient Fingerprints
par: Wang, Songtao, et autres
Publié: (2026)
par: Wang, Songtao, et autres
Publié: (2026)
Efficient Alignment of Large Language Models via Data Sampling
par: Khera, Amrit, et autres
Publié: (2024)
par: Khera, Amrit, et autres
Publié: (2024)
A Survey on Training-free Alignment of Large Language Models
par: Pan, Birong, et autres
Publié: (2025)
par: Pan, Birong, et autres
Publié: (2025)
Flextron: Many-in-One Flexible Large Language Model
par: Cai, Ruisi, et autres
Publié: (2024)
par: Cai, Ruisi, et autres
Publié: (2024)
MULTIVERSE: Exposing Large Language Model Alignment Problems in Diverse Worlds
par: Jin, Xiaolong, et autres
Publié: (2024)
par: Jin, Xiaolong, et autres
Publié: (2024)
OCEAN: Offline Chain-of-thought Evaluation and Alignment in Large Language Models
par: Wu, Junda, et autres
Publié: (2024)
par: Wu, Junda, et autres
Publié: (2024)
Large Language Models Encode Semantics and Alignment in Linearly Separable Representations
par: Saglam, Baturay, et autres
Publié: (2025)
par: Saglam, Baturay, et autres
Publié: (2025)
On Almost Surely Safe Alignment of Large Language Models at Inference-Time
par: Ji, Xiaotong, et autres
Publié: (2025)
par: Ji, Xiaotong, et autres
Publié: (2025)
Feature Alignment and Representation Transfer in Knowledge Distillation for Large Language Models
par: Yang, Junjie, et autres
Publié: (2025)
par: Yang, Junjie, et autres
Publié: (2025)
ORCE: Order-Aware Alignment of Verbalized Confidence in Large Language Models
par: Li, Chen, et autres
Publié: (2026)
par: Li, Chen, et autres
Publié: (2026)
Investigating Automatic Scoring and Feedback using Large Language Models
par: Katuka, Gloria Ashiya, et autres
Publié: (2024)
par: Katuka, Gloria Ashiya, et autres
Publié: (2024)
CRUST-Bench: A Comprehensive Benchmark for C-to-safe-Rust Transpilation
par: Khatry, Anirudh, et autres
Publié: (2025)
par: Khatry, Anirudh, et autres
Publié: (2025)
LongAlign: A Recipe for Long Context Alignment of Large Language Models
par: Bai, Yushi, et autres
Publié: (2024)
par: Bai, Yushi, et autres
Publié: (2024)
AlignTune: Modular Toolkit for Post-Training Alignment of Large Language Models
par: Lyngkhoi, R E Zera Marveen, et autres
Publié: (2026)
par: Lyngkhoi, R E Zera Marveen, et autres
Publié: (2026)
BoNBoN Alignment for Large Language Models and the Sweetness of Best-of-n Sampling
par: Gui, Lin, et autres
Publié: (2024)
par: Gui, Lin, et autres
Publié: (2024)
Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models
par: Zhang, Yang, et autres
Publié: (2025)
par: Zhang, Yang, et autres
Publié: (2025)
FedPDPO: Federated Personalized Direct Preference Optimization for Large Language Model Alignment
par: Zhu, Kewen, et autres
Publié: (2026)
par: Zhu, Kewen, et autres
Publié: (2026)
COPAL: Continual Pruning in Large Language Generative Models
par: Malla, Srikanth, et autres
Publié: (2024)
par: Malla, Srikanth, et autres
Publié: (2024)
Investigating the Impact of Data Contamination of Large Language Models in Text-to-SQL Translation
par: Ranaldi, Federico, et autres
Publié: (2024)
par: Ranaldi, Federico, et autres
Publié: (2024)
Binary Classifier Optimization for Large Language Model Alignment
par: Jung, Seungjae, et autres
Publié: (2024)
par: Jung, Seungjae, et autres
Publié: (2024)
Accelerated Preference Optimization for Large Language Model Alignment
par: He, Jiafan, et autres
Publié: (2024)
par: He, Jiafan, et autres
Publié: (2024)
Documents similaires
-
PropMEND: Hypernetworks for Knowledge Propagation in LLMs
par: Liu, Zeyu Leo, et autres
Publié: (2025) -
Contrastive Learning to Improve Retrieval for Real-world Fact Checking
par: Sriram, Aniruddh, et autres
Publié: (2024) -
A Long Way to Go: Investigating Length Correlations in RLHF
par: Singhal, Prasann, et autres
Publié: (2023) -
SynthesizRR: Generating Diverse Datasets with Retrieval Augmentation
par: Divekar, Abhishek, et autres
Publié: (2024) -
Failing to Falsify: Evaluating and Mitigating Confirmation Bias in Language Models
par: Jhaveri, Ayush Rajesh, et autres
Publié: (2026)