Theoretical Limits of Language Model Alignment
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Paes, Lucas Monteiro, Mackraz, Natalie, Theobald, Barry-John, Danieli, Federico |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Aligning LLMs by Predicting Preferences from User Writing Samples
par: Aroca-Ouellette, Stéphane, et autres
Publié: (2025)
par: Aroca-Ouellette, Stéphane, et autres
Publié: (2025)
DSO: Direct Steering Optimization for Bias Mitigation
par: Paes, Lucas Monteiro, et autres
Publié: (2025)
par: Paes, Lucas Monteiro, et autres
Publié: (2025)
Bias after Prompting: Persistent Discrimination in Large Language Models
par: Sivakumar, Nivedha, et autres
Publié: (2025)
par: Sivakumar, Nivedha, et autres
Publié: (2025)
Multi-Group Fairness Evaluation via Conditional Value-at-Risk Testing
par: Paes, Lucas Monteiro, et autres
Publié: (2023)
par: Paes, Lucas Monteiro, et autres
Publié: (2023)
Evaluating Gender Bias Transfer between Pre-trained and Prompt-Adapted Language Models
par: Mackraz, Natalie, et autres
Publié: (2024)
par: Mackraz, Natalie, et autres
Publié: (2024)
Selective Explanations
par: Paes, Lucas Monteiro, et autres
Publié: (2024)
par: Paes, Lucas Monteiro, et autres
Publié: (2024)
Fundamental Limits of Prompt Compression: A Rate-Distortion Framework for Black-Box Language Models
par: Nagle, Alliot, et autres
Publié: (2024)
par: Nagle, Alliot, et autres
Publié: (2024)
Aleatoric and Epistemic Discrimination: Fundamental Limits of Fairness Interventions
par: Wang, Hao, et autres
Publié: (2023)
par: Wang, Hao, et autres
Publié: (2023)
Multi-Draft Speculative Sampling: Canonical Decomposition and Theoretical Limits
par: Khisti, Ashish, et autres
Publié: (2024)
par: Khisti, Ashish, et autres
Publié: (2024)
Scalable Identification and Prioritization of Requisition-Specific Personal Competencies Using Large Language Models
par: Li, Wanxin, et autres
Publié: (2026)
par: Li, Wanxin, et autres
Publié: (2026)
Algorithmic Arbitrariness in Content Moderation
par: Gomez, Juan Felipe, et autres
Publié: (2024)
par: Gomez, Juan Felipe, et autres
Publié: (2024)
Theoretical guarantees on the best-of-n alignment policy
par: Beirami, Ahmad, et autres
Publié: (2024)
par: Beirami, Ahmad, et autres
Publié: (2024)
Is Your Model Fairly Certain? Uncertainty-Aware Fairness Evaluation for LLMs
par: Wang, Yinong Oliver, et autres
Publié: (2025)
par: Wang, Yinong Oliver, et autres
Publié: (2025)
Information-Theoretic Generative Clustering of Documents
par: Du, Xin, et autres
Publié: (2024)
par: Du, Xin, et autres
Publié: (2024)
Latent Space Alignment for Semantic Channel Equalization
par: Hüttebräucker, Tomás, et autres
Publié: (2024)
par: Hüttebräucker, Tomás, et autres
Publié: (2024)
Evaluating the Performance of Large Language Models in Scientific Claim Detection and Classification
par: Faruk, Tanjim Bin
Publié: (2024)
par: Faruk, Tanjim Bin
Publié: (2024)
Moderating New Waves of Online Hate with Chain-of-Thought Reasoning in Large Language Models
par: Vishwamitra, Nishant, et autres
Publié: (2023)
par: Vishwamitra, Nishant, et autres
Publié: (2023)
Limits to Predicting Online Speech Using Large Language Models
par: Remeli, Mina, et autres
Publié: (2024)
par: Remeli, Mina, et autres
Publié: (2024)
Steering into New Embedding Spaces: Analyzing Cross-Lingual Alignment Induced by Model Interventions in Multilingual Language Models
par: Sundar, Anirudh, et autres
Publié: (2025)
par: Sundar, Anirudh, et autres
Publié: (2025)
An Enhanced Text Compression Approach Using Transformer-based Language Models
par: Rahman, Chowdhury Mofizur, et autres
Publié: (2024)
par: Rahman, Chowdhury Mofizur, et autres
Publié: (2024)
Moderating Illicit Online Image Promotion for Unsafe User-Generated Content Games Using Large Vision-Language Models
par: Guo, Keyan, et autres
Publié: (2024)
par: Guo, Keyan, et autres
Publié: (2024)
Skip-It? Theoretical Conditions for Layer Skipping in Vision-Language Models
par: Hartman, Max, et autres
Publié: (2025)
par: Hartman, Max, et autres
Publié: (2025)
Epistemic Diversity and Knowledge Collapse in Large Language Models
par: Wright, Dustin, et autres
Publié: (2025)
par: Wright, Dustin, et autres
Publié: (2025)
Cultural Alignment in Large Language Models: An Explanatory Analysis Based on Hofstede's Cultural Dimensions
par: Masoud, Reem I., et autres
Publié: (2023)
par: Masoud, Reem I., et autres
Publié: (2023)
HeavyWater and SimplexWater: Distortion-Free LLM Watermarks for Low-Entropy Next-Token Predictions
par: Tsur, Dor, et autres
Publié: (2025)
par: Tsur, Dor, et autres
Publié: (2025)
On the Theoretical Limitations of Embedding-Based Retrieval
par: Weller, Orion, et autres
Publié: (2025)
par: Weller, Orion, et autres
Publié: (2025)
Quantifying Logical Consistency in Transformers via Query-Key Alignment
par: Tulchinskii, Eduard, et autres
Publié: (2025)
par: Tulchinskii, Eduard, et autres
Publié: (2025)
Know Your Limits: Entropy Estimation Modeling for Compression and Generalization
par: Badger, Benjamin L., et autres
Publié: (2025)
par: Badger, Benjamin L., et autres
Publié: (2025)
Evidence Is All You Need: Ordering Imaging Studies via Language Model Alignment with the ACR Appropriateness Criteria
par: Yao, Michael S., et autres
Publié: (2024)
par: Yao, Michael S., et autres
Publié: (2024)
Breaking Language Barriers with MMTweets: Advancing Cross-Lingual Debunked Narrative Retrieval for Fact-Checking
par: Singh, Iknoor, et autres
Publié: (2023)
par: Singh, Iknoor, et autres
Publié: (2023)
An Information Theoretic Perspective on Agentic System Design
par: He, Shizhe, et autres
Publié: (2025)
par: He, Shizhe, et autres
Publié: (2025)
Analysing the Public Discourse around OpenAI's Text-To-Video Model 'Sora' using Topic Modeling
par: Parikh, Vatsal Vinay
Publié: (2024)
par: Parikh, Vatsal Vinay
Publié: (2024)
A Mathematical Theory for Learning Semantic Languages by Abstract Learners
par: Liao, Kuo-Yu, et autres
Publié: (2024)
par: Liao, Kuo-Yu, et autres
Publié: (2024)
Deliberative Alignment: Reasoning Enables Safer Language Models
par: Guan, Melody Y., et autres
Publié: (2024)
par: Guan, Melody Y., et autres
Publié: (2024)
An Information-theoretic Multi-task Representation Learning Framework for Natural Language Understanding
par: Hu, Dou, et autres
Publié: (2025)
par: Hu, Dou, et autres
Publié: (2025)
SyllabusQA: A Course Logistics Question Answering Dataset
par: Fernandez, Nigel, et autres
Publié: (2024)
par: Fernandez, Nigel, et autres
Publié: (2024)
Navigating the Peril of Generated Alternative Facts: A ChatGPT-4 Fabricated Omega Variant Case as a Cautionary Tale in Medical Misinformation
par: Sallam, Malik, et autres
Publié: (2024)
par: Sallam, Malik, et autres
Publié: (2024)
Language Modeling Is Compression
par: Delétang, Grégoire, et autres
Publié: (2023)
par: Delétang, Grégoire, et autres
Publié: (2023)
Demystifying Local and Global Fairness Trade-offs in Federated Learning Using Partial Information Decomposition
par: Hamman, Faisal, et autres
Publié: (2023)
par: Hamman, Faisal, et autres
Publié: (2023)
A Unified View of Group Fairness Tradeoffs Using Partial Information Decomposition
par: Hamman, Faisal, et autres
Publié: (2024)
par: Hamman, Faisal, et autres
Publié: (2024)
Documents similaires
-
Aligning LLMs by Predicting Preferences from User Writing Samples
par: Aroca-Ouellette, Stéphane, et autres
Publié: (2025) -
DSO: Direct Steering Optimization for Bias Mitigation
par: Paes, Lucas Monteiro, et autres
Publié: (2025) -
Bias after Prompting: Persistent Discrimination in Large Language Models
par: Sivakumar, Nivedha, et autres
Publié: (2025) -
Multi-Group Fairness Evaluation via Conditional Value-at-Risk Testing
par: Paes, Lucas Monteiro, et autres
Publié: (2023) -
Evaluating Gender Bias Transfer between Pre-trained and Prompt-Adapted Language Models
par: Mackraz, Natalie, et autres
Publié: (2024)