CALMA: A Process for Deriving Context-aligned Axes for Language Model Alignment
Fuente:
arXiv
Salvato in:
| Autori principali: | Soni, Prajna, Raman, Deepika, Hadfield-Menell, Dylan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Randomness, Not Representation: The Unreliability of Evaluating Cultural Alignment in LLMs
di: Khan, Ariba, et al.
Pubblicazione: (2025)
di: Khan, Ariba, et al.
Pubblicazione: (2025)
Pitfalls of Evidence-Based AI Policy
di: Casper, Stephen, et al.
Pubblicazione: (2025)
di: Casper, Stephen, et al.
Pubblicazione: (2025)
Activation Steering via Generative Causal Mediation
di: Sankaranarayanan, Aruna, et al.
Pubblicazione: (2026)
di: Sankaranarayanan, Aruna, et al.
Pubblicazione: (2026)
Safety Drift After Fine-Tuning: Evidence from High-Stakes Domains
di: Khan, Emaan Bilal, et al.
Pubblicazione: (2026)
di: Khan, Emaan Bilal, et al.
Pubblicazione: (2026)
Disjoint Processing Mechanisms of Hierarchical and Linear Grammars in Large Language Models
di: Sankaranarayanan, Aruna, et al.
Pubblicazione: (2025)
di: Sankaranarayanan, Aruna, et al.
Pubblicazione: (2025)
Diverse Preference Learning for Capabilities and Alignment
di: Slocum, Stewart, et al.
Pubblicazione: (2025)
di: Slocum, Stewart, et al.
Pubblicazione: (2025)
Alignment Tampering: How Reinforcement Learning from Human Feedback Is Exploited to Optimize Misaligned Biases
di: Hahm, Dongyoon, et al.
Pubblicazione: (2026)
di: Hahm, Dongyoon, et al.
Pubblicazione: (2026)
Flexible Agent Alignment with Goal Inference from Open-Ended Dialog
di: Ma, Rachel, et al.
Pubblicazione: (2025)
di: Ma, Rachel, et al.
Pubblicazione: (2025)
Prompt Injection as Role Confusion
di: Ye, Charles, et al.
Pubblicazione: (2026)
di: Ye, Charles, et al.
Pubblicazione: (2026)
Distributional Process Reward Models: Calibrated Prediction of Future Rewards via Conditional Optimal Transport
di: Ma, Rachel, et al.
Pubblicazione: (2026)
di: Ma, Rachel, et al.
Pubblicazione: (2026)
Distributional Preference Learning: Understanding and Accounting for Hidden Context in RLHF
di: Siththaranjan, Anand, et al.
Pubblicazione: (2023)
di: Siththaranjan, Anand, et al.
Pubblicazione: (2023)
AI Safety, Alignment, and Ethics (AI SAE)
di: Waldner, Dylan
Pubblicazione: (2025)
di: Waldner, Dylan
Pubblicazione: (2025)
The Three Axes of Success: A Three-Dimensional Framework for Career Decision-Making
di: Chen, Meng-Chi
Pubblicazione: (2026)
di: Chen, Meng-Chi
Pubblicazione: (2026)
Towards New Benchmark for AI Alignment & Sentiment Analysis in Socially Important Issues: A Comparative Study of Human and LLMs in the Context of AGI
di: Bojic, Ljubisa, et al.
Pubblicazione: (2025)
di: Bojic, Ljubisa, et al.
Pubblicazione: (2025)
AI Model Registries: A Foundational Tool for AI Governance
di: McKernon, Elliot, et al.
Pubblicazione: (2024)
di: McKernon, Elliot, et al.
Pubblicazione: (2024)
Eight Methods to Evaluate Robust Unlearning in LLMs
di: Lynch, Aengus, et al.
Pubblicazione: (2024)
di: Lynch, Aengus, et al.
Pubblicazione: (2024)
Rational Silence and False Polarization: How Viewpoint Organizations and Recommender Systems Distort the Expression of Public Opinion
di: Sarkar, Atrisha, et al.
Pubblicazione: (2024)
di: Sarkar, Atrisha, et al.
Pubblicazione: (2024)
Conversational Alignment with Artificial Intelligence in Context
di: Sterken, Rachel Katharine, et al.
Pubblicazione: (2025)
di: Sterken, Rachel Katharine, et al.
Pubblicazione: (2025)
Assessing Human Rights Risks in AI: A Framework for Model Evaluation
di: Raman, Vyoma, et al.
Pubblicazione: (2025)
di: Raman, Vyoma, et al.
Pubblicazione: (2025)
Who Gets Left Behind? Auditing Disability Inclusivity in Large Language Models
di: Dash, Deepika, et al.
Pubblicazione: (2025)
di: Dash, Deepika, et al.
Pubblicazione: (2025)
Investigating Cultural Alignment of Large Language Models
di: AlKhamissi, Badr, et al.
Pubblicazione: (2024)
di: AlKhamissi, Badr, et al.
Pubblicazione: (2024)
The Global Representativeness Index: A Total Variation Distance Framework for Measuring Demographic Fidelity in Survey Research
di: Hadfield, Evan, et al.
Pubblicazione: (2026)
di: Hadfield, Evan, et al.
Pubblicazione: (2026)
Intolerable Risk Threshold Recommendations for Artificial Intelligence
di: Raman, Deepika, et al.
Pubblicazione: (2025)
di: Raman, Deepika, et al.
Pubblicazione: (2025)
Evaluating Intra-firm LLM Alignment Strategies in Business Contexts
di: Broestl, Noah, et al.
Pubblicazione: (2025)
di: Broestl, Noah, et al.
Pubblicazione: (2025)
Legal Alignment for Safe and Ethical AI
di: Kolt, Noam, et al.
Pubblicazione: (2026)
di: Kolt, Noam, et al.
Pubblicazione: (2026)
Societal Alignment Frameworks Can Improve LLM Alignment
di: Stańczak, Karolina, et al.
Pubblicazione: (2025)
di: Stańczak, Karolina, et al.
Pubblicazione: (2025)
AI Risk-Management Standards Profile for General-Purpose AI (GPAI) and Foundation Models
di: Barrett, Anthony M., et al.
Pubblicazione: (2025)
di: Barrett, Anthony M., et al.
Pubblicazione: (2025)
Decentralising LLM Alignment: A Case for Context, Pluralism, and Participation
di: Peter, Oriane, et al.
Pubblicazione: (2025)
di: Peter, Oriane, et al.
Pubblicazione: (2025)
Customizing Large Language Models for Business Context: Framework and Experiments
di: Wang, Wen, et al.
Pubblicazione: (2023)
di: Wang, Wen, et al.
Pubblicazione: (2023)
Formal Contracts Mitigate Social Dilemmas in Multi-Agent RL
di: Haupt, Andreas A., et al.
Pubblicazione: (2022)
di: Haupt, Andreas A., et al.
Pubblicazione: (2022)
Chain of Alignment: Integrating Public Will with Expert Intelligence for Language Model Alignment
di: Konya, Andrew, et al.
Pubblicazione: (2024)
di: Konya, Andrew, et al.
Pubblicazione: (2024)
Theoretical Limits of Language Model Alignment
di: Paes, Lucas Monteiro, et al.
Pubblicazione: (2026)
di: Paes, Lucas Monteiro, et al.
Pubblicazione: (2026)
Ethics Readiness of Technology: The case for aligning ethical approaches with technological maturity
di: de Jong, Eline
Pubblicazione: (2025)
di: de Jong, Eline
Pubblicazione: (2025)
Understanding the Process of Human-AI Value Alignment
di: McKinlay, Jack, et al.
Pubblicazione: (2025)
di: McKinlay, Jack, et al.
Pubblicazione: (2025)
Improving Graduate Outcomes by Identifying Skills Gaps and Recommending Courses Based on Career Interests
di: Soni, Rahul, et al.
Pubblicazione: (2025)
di: Soni, Rahul, et al.
Pubblicazione: (2025)
Toward Preference-aligned Large Language Models via Residual-based Model Steering
di: La Cava, Lucio, et al.
Pubblicazione: (2025)
di: La Cava, Lucio, et al.
Pubblicazione: (2025)
Culturally Grounded Personas in Large Language Models: Characterization and Alignment with Socio-Psychological Value Frameworks
di: Greco, Candida M., et al.
Pubblicazione: (2026)
di: Greco, Candida M., et al.
Pubblicazione: (2026)
Layered Unlearning for Adversarial Relearning
di: Qian, Timothy, et al.
Pubblicazione: (2025)
di: Qian, Timothy, et al.
Pubblicazione: (2025)
Cooperative Inverse Reinforcement Learning
di: Hadfield-Menell, Dylan, et al.
Pubblicazione: (2016)
di: Hadfield-Menell, Dylan, et al.
Pubblicazione: (2016)
Defending Against Unforeseen Failure Modes with Latent Adversarial Training
di: Casper, Stephen, et al.
Pubblicazione: (2024)
di: Casper, Stephen, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Randomness, Not Representation: The Unreliability of Evaluating Cultural Alignment in LLMs
di: Khan, Ariba, et al.
Pubblicazione: (2025) -
Pitfalls of Evidence-Based AI Policy
di: Casper, Stephen, et al.
Pubblicazione: (2025) -
Activation Steering via Generative Causal Mediation
di: Sankaranarayanan, Aruna, et al.
Pubblicazione: (2026) -
Safety Drift After Fine-Tuning: Evidence from High-Stakes Domains
di: Khan, Emaan Bilal, et al.
Pubblicazione: (2026) -
Disjoint Processing Mechanisms of Hierarchical and Linear Grammars in Large Language Models
di: Sankaranarayanan, Aruna, et al.
Pubblicazione: (2025)