Superalignment with Dynamic Human Values
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Mai, Florian, Kaczér, David, Corrêa, Nicholas Kluge, Flek, Lucie |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Reasoning Primitives in Hybrid and Non-Hybrid LLMs: Do Architectural Differences Yield Advantages in State-Tracking and Recall?
par: Rawat, Shivam, et autres
Publié: (2026)
par: Rawat, Shivam, et autres
Publié: (2026)
Raising Bars, Not Parameters: LilMoo Compact Language Model for Hindi
par: Fatimah, Shiza, et autres
Publié: (2026)
par: Fatimah, Shiza, et autres
Publié: (2026)
In-Training Defenses against Emergent Misalignment in Language Models
par: Kaczér, David, et autres
Publié: (2025)
par: Kaczér, David, et autres
Publié: (2025)
IKnow: Instruction-Knowledge-Aware Continual Pretraining for Effective Domain Adaptation
par: Zhang, Tianyi, et autres
Publié: (2025)
par: Zhang, Tianyi, et autres
Publié: (2025)
Dynamic Normativity: Necessary and Sufficient Conditions for Value Alignment
par: Corrêa, Nicholas Kluge
Publié: (2024)
par: Corrêa, Nicholas Kluge
Publié: (2024)
Survey-to-Behavior: Downstream Alignment of Human Values in LLMs via Survey Questions
par: Nie, Shangrui, et autres
Publié: (2025)
par: Nie, Shangrui, et autres
Publié: (2025)
Understanding Artificial Theory of Mind: Perturbed Tasks and Reasoning in Large Language Models
par: Nickel, Christian, et autres
Publié: (2026)
par: Nickel, Christian, et autres
Publié: (2026)
Tucano 2 Cool: Better Open Source LLMs for Portuguese
par: Corrêa, Nicholas Kluge, et autres
Publié: (2026)
par: Corrêa, Nicholas Kluge, et autres
Publié: (2026)
Plausible but Wrong: A case study on Agentic Failures in Astrophysical Workflows
par: Rawat, Shivam, et autres
Publié: (2026)
par: Rawat, Shivam, et autres
Publié: (2026)
Multi-Hop Reasoning for Question Answering with Hyperbolic Representations
par: Welz, Simon, et autres
Publié: (2025)
par: Welz, Simon, et autres
Publié: (2025)
Probing the Robustness of Theory of Mind in Large Language Models
par: Nickel, Christian, et autres
Publié: (2024)
par: Nickel, Christian, et autres
Publié: (2024)
Reinforcement Learning Amplifies Emergent Misalignment from Harmless Rewards
par: Jørgenvåg, Magnus, et autres
Publié: (2026)
par: Jørgenvåg, Magnus, et autres
Publié: (2026)
More Agents Improve Math Problem Solving but Adversarial Robustness Gap Persists
par: Alavi, Khashayar, et autres
Publié: (2025)
par: Alavi, Khashayar, et autres
Publié: (2025)
Pitfalls of Conversational LLMs on News Debiasing
par: Schlicht, Ipek Baris, et autres
Publié: (2024)
par: Schlicht, Ipek Baris, et autres
Publié: (2024)
On the Limitations of Language Targeted Pruning: Investigating the Calibration Language Impact in Multilingual LLM Pruning
par: Kurz, Simon, et autres
Publié: (2024)
par: Kurz, Simon, et autres
Publié: (2024)
Research Superalignment Should Advance Now with Alternating Competence and Conformity Optimization
par: Kim, HyunJin, et autres
Publié: (2025)
par: Kim, HyunJin, et autres
Publié: (2025)
Judging Quality Across Languages: A Multilingual Approach to Pretraining Data Filtering with Language Models
par: Ali, Mehdi, et autres
Publié: (2025)
par: Ali, Mehdi, et autres
Publié: (2025)
A Moral Imperative: The Need for Continual Superalignment of Large Language Models
par: Puthumanaillam, Gokul, et autres
Publié: (2024)
par: Puthumanaillam, Gokul, et autres
Publié: (2024)
Can Stories Help LLMs Reason? Curating Information Space Through Narrative
par: Javadi, Vahid Sadiri, et autres
Publié: (2024)
par: Javadi, Vahid Sadiri, et autres
Publié: (2024)
Improving Low-Resource Dialect Classification Using Retrieval-based Voice Conversion
par: Fischbach, Lea, et autres
Publié: (2025)
par: Fischbach, Lea, et autres
Publié: (2025)
Tucano: Advancing Neural Text Generation for Portuguese
par: Corrêa, Nicholas Kluge, et autres
Publié: (2024)
par: Corrêa, Nicholas Kluge, et autres
Publié: (2024)
USDC: A Dataset of $\underline{U}$ser $\underline{S}$tance and $\underline{D}$ogmatism in Long $\underline{C}$onversations
par: Marreddy, Mounika, et autres
Publié: (2024)
par: Marreddy, Mounika, et autres
Publié: (2024)
Do LLMs Provide Consistent Answers to Health-Related Questions across Languages?
par: Schlicht, Ipek Baris, et autres
Publié: (2025)
par: Schlicht, Ipek Baris, et autres
Publié: (2025)
AI Alignment Strategies from a Risk Perspective: Independent Safety Mechanisms or Shared Failures?
par: Dung, Leonard, et autres
Publié: (2025)
par: Dung, Leonard, et autres
Publié: (2025)
Tailored Conversations beyond LLMs: A RL-Based Dialogue Manager
par: Galland, Lucie, et autres
Publié: (2025)
par: Galland, Lucie, et autres
Publié: (2025)
From FLOPs to Footprints: The Resource Cost of Artificial Intelligence
par: Falk, Sophia, et autres
Publié: (2025)
par: Falk, Sophia, et autres
Publié: (2025)
INTIMA: A Benchmark for Human-AI Companionship Behavior
par: Kaffee, Lucie-Aimée, et autres
Publié: (2025)
par: Kaffee, Lucie-Aimée, et autres
Publié: (2025)
Machine Theory of Mind and the Structure of Human Values
par: de Font-Reaulx, Paul
Publié: (2025)
par: de Font-Reaulx, Paul
Publié: (2025)
ValueCompass: A Framework for Measuring Contextual Value Alignment Between Human and LLMs
par: Shen, Hua, et autres
Publié: (2024)
par: Shen, Hua, et autres
Publié: (2024)
Learning to Plan Long-Term for Language Modeling
par: Mai, Florian, et autres
Publié: (2024)
par: Mai, Florian, et autres
Publié: (2024)
Learning to Plan for Language Modeling from Unlabeled Data
par: Cornille, Nathan, et autres
Publié: (2024)
par: Cornille, Nathan, et autres
Publié: (2024)
Deliberative Dynamics and Value Alignment in LLM Debates
par: Sachdeva, Pratik S., et autres
Publié: (2025)
par: Sachdeva, Pratik S., et autres
Publié: (2025)
Value Kaleidoscope: Engaging AI with Pluralistic Human Values, Rights, and Duties
par: Sorensen, Taylor, et autres
Publié: (2023)
par: Sorensen, Taylor, et autres
Publié: (2023)
Towards Dialogues for Joint Human-AI Reasoning and Value Alignment
par: Bezou-Vrakatseli, Elfia, et autres
Publié: (2024)
par: Bezou-Vrakatseli, Elfia, et autres
Publié: (2024)
Learning Human-like Representations to Enable Learning Human Values
par: Wynn, Andrea, et autres
Publié: (2023)
par: Wynn, Andrea, et autres
Publié: (2023)
Speculations on Uncertainty and Humane Algorithms
par: Gray, Nicholas
Publié: (2024)
par: Gray, Nicholas
Publié: (2024)
Value Imprint: A Technique for Auditing the Human Values Embedded in RLHF Datasets
par: Obi, Ike, et autres
Publié: (2024)
par: Obi, Ike, et autres
Publié: (2024)
Rethinking How AI Embeds and Adapts to Human Values: Challenges and Opportunities
par: Tzeng, Sz-Ting, et autres
Publié: (2025)
par: Tzeng, Sz-Ting, et autres
Publié: (2025)
DNB-AI-Project at SemEval-2025 Task 5: An LLM-Ensemble Approach for Automated Subject Indexing
par: Kluge, Lisa, et autres
Publié: (2025)
par: Kluge, Lisa, et autres
Publié: (2025)
Understanding the Process of Human-AI Value Alignment
par: McKinlay, Jack, et autres
Publié: (2025)
par: McKinlay, Jack, et autres
Publié: (2025)
Documents similaires
-
Reasoning Primitives in Hybrid and Non-Hybrid LLMs: Do Architectural Differences Yield Advantages in State-Tracking and Recall?
par: Rawat, Shivam, et autres
Publié: (2026) -
Raising Bars, Not Parameters: LilMoo Compact Language Model for Hindi
par: Fatimah, Shiza, et autres
Publié: (2026) -
In-Training Defenses against Emergent Misalignment in Language Models
par: Kaczér, David, et autres
Publié: (2025) -
IKnow: Instruction-Knowledge-Aware Continual Pretraining for Effective Domain Adaptation
par: Zhang, Tianyi, et autres
Publié: (2025) -
Dynamic Normativity: Necessary and Sufficient Conditions for Value Alignment
par: Corrêa, Nicholas Kluge
Publié: (2024)