A Moral Imperative: The Need for Continual Superalignment of Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Puthumanaillam, Gokul, Vora, Manav, Thangeda, Pranay, Ornik, Melkior |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
The Lazy Student's Dream: ChatGPT Passing an Engineering Course on Its Own
par: Puthumanaillam, Gokul, et autres
Publié: (2025)
par: Puthumanaillam, Gokul, et autres
Publié: (2025)
ComTraQ-MPC: Meta-Trained DQN-MPC Integration for Trajectory Tracking with Limited Active Localization Updates
par: Puthumanaillam, Gokul, et autres
Publié: (2024)
par: Puthumanaillam, Gokul, et autres
Publié: (2024)
SCoUT: Scalable Communication via Utility-Guided Temporal Grouping in Multi-Agent Reinforcement Learning
par: Vora, Manav, et autres
Publié: (2026)
par: Vora, Manav, et autres
Publié: (2026)
Welfare Maximization Algorithm for Solving Budget-Constrained Multi-Component POMDPs
par: Vora, Manav, et autres
Publié: (2023)
par: Vora, Manav, et autres
Publié: (2023)
Capacity-Aware Planning and Scheduling in Budget-Constrained Multi-Agent MDPs: A Meta-RL Approach
par: Vora, Manav, et autres
Publié: (2024)
par: Vora, Manav, et autres
Publié: (2024)
InfraLib: Enabling Reinforcement Learning and Decision-Making for Large-Scale Infrastructure Management
par: Thangeda, Pranay, et autres
Publié: (2024)
par: Thangeda, Pranay, et autres
Publié: (2024)
Optimizing Agricultural Order Fulfillment Systems: A Hybrid Tree Search Approach
par: Thangeda, Pranay, et autres
Publié: (2024)
par: Thangeda, Pranay, et autres
Publié: (2024)
Enhancing Robot Navigation Policies with Task-Specific Uncertainty Managements
par: Puthumanaillam, Gokul, et autres
Publié: (2025)
par: Puthumanaillam, Gokul, et autres
Publié: (2025)
GreedLlama: Performance of Financial Value-Aligned Large Language Models in Moral Reasoning
par: Yu, Jeffy, et autres
Publié: (2024)
par: Yu, Jeffy, et autres
Publié: (2024)
Solving Truly Massive Budgeted Monotonic POMDPs with Oracle-Guided Meta-Reinforcement Learning
par: Vora, Manav, et autres
Publié: (2024)
par: Vora, Manav, et autres
Publié: (2024)
GUIDEd Agents: Enhancing Navigation Policies through Task-Specific Uncertainty Abstraction in Localization-Limited Environments
par: Puthumanaillam, Gokul, et autres
Publié: (2024)
par: Puthumanaillam, Gokul, et autres
Publié: (2024)
Subtle Biases Need Subtler Measures: Dual Metrics for Evaluating Representative and Affinity Bias in Large Language Models
par: Kumar, Abhishek, et autres
Publié: (2024)
par: Kumar, Abhishek, et autres
Publié: (2024)
Does Cross-Cultural Alignment Change the Commonsense Morality of Language Models?
par: Jinnai, Yuu
Publié: (2024)
par: Jinnai, Yuu
Publié: (2024)
Research Superalignment Should Advance Now with Alternating Competence and Conformity Optimization
par: Kim, HyunJin, et autres
Publié: (2025)
par: Kim, HyunJin, et autres
Publié: (2025)
A Taxonomy of Stereotype Content in Large Language Models
par: Nicolas, Gandalf, et autres
Publié: (2024)
par: Nicolas, Gandalf, et autres
Publié: (2024)
Bias and Fairness in Large Language Models: A Survey
par: Gallegos, Isabel O., et autres
Publié: (2023)
par: Gallegos, Isabel O., et autres
Publié: (2023)
Hypothesis Generation with Large Language Models
par: Zhou, Yangqiaoyu, et autres
Publié: (2024)
par: Zhou, Yangqiaoyu, et autres
Publié: (2024)
Large Language Models are Geographically Biased
par: Manvi, Rohin, et autres
Publié: (2024)
par: Manvi, Rohin, et autres
Publié: (2024)
Correlated Errors in Large Language Models
par: Kim, Elliot, et autres
Publié: (2025)
par: Kim, Elliot, et autres
Publié: (2025)
TAB-Fields: A Maximum Entropy Framework for Mission-Aware Adversarial Planning
par: Puthumanaillam, Gokul, et autres
Publié: (2024)
par: Puthumanaillam, Gokul, et autres
Publié: (2024)
Psychological Counseling Ability of Large Language Models
par: Peng, Fangyu, et autres
Publié: (2025)
par: Peng, Fangyu, et autres
Publié: (2025)
Assessing Large Language Models on Climate Information
par: Bulian, Jannis, et autres
Publié: (2023)
par: Bulian, Jannis, et autres
Publié: (2023)
Motion Planning and Control with Unknown Nonlinear Dynamics through Predicted Reachability
par: Zhang, Zhiquan, et autres
Publié: (2025)
par: Zhang, Zhiquan, et autres
Publié: (2025)
Transforming Agency. On the mode of existence of Large Language Models
par: Barandiaran, Xabier E., et autres
Publié: (2024)
par: Barandiaran, Xabier E., et autres
Publié: (2024)
LLMCarbon: Modeling the end-to-end Carbon Footprint of Large Language Models
par: Faiz, Ahmad, et autres
Publié: (2023)
par: Faiz, Ahmad, et autres
Publié: (2023)
Predicting Learning Performance with Large Language Models: A Study in Adult Literacy
par: Zhang, Liang, et autres
Publié: (2024)
par: Zhang, Liang, et autres
Publié: (2024)
Siren's Song in the AI Ocean: A Survey on Hallucination in Large Language Models
par: Zhang, Yue, et autres
Publié: (2023)
par: Zhang, Yue, et autres
Publié: (2023)
ResumeAtlas: Revisiting Resume Classification with Large-Scale Datasets and Large Language Models
par: Heakl, Ahmed, et autres
Publié: (2024)
par: Heakl, Ahmed, et autres
Publié: (2024)
Foundational Challenges in Assuring Alignment and Safety of Large Language Models
par: Anwar, Usman, et autres
Publié: (2024)
par: Anwar, Usman, et autres
Publié: (2024)
Exploring Accuracy-Fairness Trade-off in Large Language Models
par: Zhang, Qingquan, et autres
Publié: (2024)
par: Zhang, Qingquan, et autres
Publié: (2024)
Are Large Language Models Chameleons? An Attempt to Simulate Social Surveys
par: Geng, Mingmeng, et autres
Publié: (2024)
par: Geng, Mingmeng, et autres
Publié: (2024)
Towards Large Language Models that Benefit for All: Benchmarking Group Fairness in Reward Models
par: Song, Kefan, et autres
Publié: (2025)
par: Song, Kefan, et autres
Publié: (2025)
REQUAL-LM: Reliability and Equity through Aggregation in Large Language Models
par: Ebrahimi, Sana, et autres
Publié: (2024)
par: Ebrahimi, Sana, et autres
Publié: (2024)
Emissions and Performance Trade-off Between Small and Large Language Models
par: Garg, Anandita, et autres
Publié: (2025)
par: Garg, Anandita, et autres
Publié: (2025)
Democratizing Diplomacy: A Harness for Evaluating Any Large Language Model on Full-Press Diplomacy
par: Duffy, Alexander, et autres
Publié: (2025)
par: Duffy, Alexander, et autres
Publié: (2025)
Do VLMs Have a Moral Backbone? A Study on the Fragile Morality of Vision-Language Models
par: Liu, Zhining, et autres
Publié: (2026)
par: Liu, Zhining, et autres
Publié: (2026)
Fairer Preferences Elicit Improved Human-Aligned Large Language Model Judgments
par: Zhou, Han, et autres
Publié: (2024)
par: Zhou, Han, et autres
Publié: (2024)
What's in a Name? Auditing Large Language Models for Race and Gender Bias
par: Salinas, Alejandro, et autres
Publié: (2024)
par: Salinas, Alejandro, et autres
Publié: (2024)
Large Language Models Assume People are More Rational than We Really are
par: Liu, Ryan, et autres
Publié: (2024)
par: Liu, Ryan, et autres
Publié: (2024)
Self-Debiasing Large Language Models: Zero-Shot Recognition and Reduction of Stereotypes
par: Gallegos, Isabel O., et autres
Publié: (2024)
par: Gallegos, Isabel O., et autres
Publié: (2024)
Documents similaires
-
The Lazy Student's Dream: ChatGPT Passing an Engineering Course on Its Own
par: Puthumanaillam, Gokul, et autres
Publié: (2025) -
ComTraQ-MPC: Meta-Trained DQN-MPC Integration for Trajectory Tracking with Limited Active Localization Updates
par: Puthumanaillam, Gokul, et autres
Publié: (2024) -
SCoUT: Scalable Communication via Utility-Guided Temporal Grouping in Multi-Agent Reinforcement Learning
par: Vora, Manav, et autres
Publié: (2026) -
Welfare Maximization Algorithm for Solving Budget-Constrained Multi-Component POMDPs
par: Vora, Manav, et autres
Publié: (2023) -
Capacity-Aware Planning and Scheduling in Budget-Constrained Multi-Agent MDPs: A Meta-RL Approach
par: Vora, Manav, et autres
Publié: (2024)