Pitfalls of Evidence-Based AI Policy
Fuente:
arXiv
Salvato in:
| Autori principali: | Casper, Stephen, Krueger, David, Hadfield-Menell, Dylan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Randomness, Not Representation: The Unreliability of Evaluating Cultural Alignment in LLMs
di: Khan, Ariba, et al.
Pubblicazione: (2025)
di: Khan, Ariba, et al.
Pubblicazione: (2025)
CALMA: A Process for Deriving Context-aligned Axes for Language Model Alignment
di: Soni, Prajna, et al.
Pubblicazione: (2025)
di: Soni, Prajna, et al.
Pubblicazione: (2025)
Safety Drift After Fine-Tuning: Evidence from High-Stakes Domains
di: Khan, Emaan Bilal, et al.
Pubblicazione: (2026)
di: Khan, Emaan Bilal, et al.
Pubblicazione: (2026)
Activation Steering via Generative Causal Mediation
di: Sankaranarayanan, Aruna, et al.
Pubblicazione: (2026)
di: Sankaranarayanan, Aruna, et al.
Pubblicazione: (2026)
Eight Methods to Evaluate Robust Unlearning in LLMs
di: Lynch, Aengus, et al.
Pubblicazione: (2024)
di: Lynch, Aengus, et al.
Pubblicazione: (2024)
Defending Against Unforeseen Failure Modes with Latent Adversarial Training
di: Casper, Stephen, et al.
Pubblicazione: (2024)
di: Casper, Stephen, et al.
Pubblicazione: (2024)
Black-Box Access is Insufficient for Rigorous AI Audits
di: Casper, Stephen, et al.
Pubblicazione: (2024)
di: Casper, Stephen, et al.
Pubblicazione: (2024)
Disjoint Processing Mechanisms of Hierarchical and Linear Grammars in Large Language Models
di: Sankaranarayanan, Aruna, et al.
Pubblicazione: (2025)
di: Sankaranarayanan, Aruna, et al.
Pubblicazione: (2025)
Alignment Tampering: How Reinforcement Learning from Human Feedback Is Exploited to Optimize Misaligned Biases
di: Hahm, Dongyoon, et al.
Pubblicazione: (2026)
di: Hahm, Dongyoon, et al.
Pubblicazione: (2026)
Prompt Injection as Role Confusion
di: Ye, Charles, et al.
Pubblicazione: (2026)
di: Ye, Charles, et al.
Pubblicazione: (2026)
AI Researchers' Views on Automating AI R&D and Intelligence Explosions
di: Field, Severin, et al.
Pubblicazione: (2026)
di: Field, Severin, et al.
Pubblicazione: (2026)
Audit Cards: Contextualizing AI Evaluations
di: Staufer, Leon, et al.
Pubblicazione: (2025)
di: Staufer, Leon, et al.
Pubblicazione: (2025)
Practical Principles for AI Cost and Compute Accounting
di: Casper, Stephen, et al.
Pubblicazione: (2025)
di: Casper, Stephen, et al.
Pubblicazione: (2025)
Diverse Preference Learning for Capabilities and Alignment
di: Slocum, Stewart, et al.
Pubblicazione: (2025)
di: Slocum, Stewart, et al.
Pubblicazione: (2025)
AI Gossip
di: Krueger, Joel, et al.
Pubblicazione: (2025)
di: Krueger, Joel, et al.
Pubblicazione: (2025)
AI Model Registries: A Foundational Tool for AI Governance
di: McKernon, Elliot, et al.
Pubblicazione: (2024)
di: McKernon, Elliot, et al.
Pubblicazione: (2024)
AI Safety, Alignment, and Ethics (AI SAE)
di: Waldner, Dylan
Pubblicazione: (2025)
di: Waldner, Dylan
Pubblicazione: (2025)
Expanding External Access To Frontier AI Models For Dangerous Capability Evaluations
di: Charnock, Jacob, et al.
Pubblicazione: (2026)
di: Charnock, Jacob, et al.
Pubblicazione: (2026)
Advancing Science- and Evidence-based AI Policy
di: Bommasani, Rishi, et al.
Pubblicazione: (2025)
di: Bommasani, Rishi, et al.
Pubblicazione: (2025)
Flexible Agent Alignment with Goal Inference from Open-Ended Dialog
di: Ma, Rachel, et al.
Pubblicazione: (2025)
di: Ma, Rachel, et al.
Pubblicazione: (2025)
An FDA for AI? Pitfalls and Plausibility of Approval Regulation for Frontier Artificial Intelligence
di: Carpenter, Daniel, et al.
Pubblicazione: (2024)
di: Carpenter, Daniel, et al.
Pubblicazione: (2024)
Gradual Disempowerment: Systemic Existential Risks from Incremental AI Development
di: Kulveit, Jan, et al.
Pubblicazione: (2025)
di: Kulveit, Jan, et al.
Pubblicazione: (2025)
Legal Alignment for Safe and Ethical AI
di: Kolt, Noam, et al.
Pubblicazione: (2026)
di: Kolt, Noam, et al.
Pubblicazione: (2026)
Regulatory Markets for AI Safety
di: Clark, Jack, et al.
Pubblicazione: (2019)
di: Clark, Jack, et al.
Pubblicazione: (2019)
Safety Cases: How to Justify the Safety of Advanced AI Systems
di: Clymer, Joshua, et al.
Pubblicazione: (2024)
di: Clymer, Joshua, et al.
Pubblicazione: (2024)
Distributional Process Reward Models: Calibrated Prediction of Future Rewards via Conditional Optimal Transport
di: Ma, Rachel, et al.
Pubblicazione: (2026)
di: Ma, Rachel, et al.
Pubblicazione: (2026)
Distributional Preference Learning: Understanding and Accounting for Hidden Context in RLHF
di: Siththaranjan, Anand, et al.
Pubblicazione: (2023)
di: Siththaranjan, Anand, et al.
Pubblicazione: (2023)
The Pitfalls of "Security by Obscurity" And What They Mean for Transparent AI
di: Hall, Peter, et al.
Pubblicazione: (2025)
di: Hall, Peter, et al.
Pubblicazione: (2025)
Rational Silence and False Polarization: How Viewpoint Organizations and Recommender Systems Distort the Expression of Public Opinion
di: Sarkar, Atrisha, et al.
Pubblicazione: (2024)
di: Sarkar, Atrisha, et al.
Pubblicazione: (2024)
Exploring the Feasibility of Multimodal Chatbot AI as Copilot in Pathology Diagnostics: Generalist Model's Pitfall
di: Liu, Mianxin, et al.
Pubblicazione: (2024)
di: Liu, Mianxin, et al.
Pubblicazione: (2024)
Faults and Pitfalls in Implementing the Right to be Forgotten
di: Sun, Chen, et al.
Pubblicazione: (2026)
di: Sun, Chen, et al.
Pubblicazione: (2026)
It is Too Many Options: Pitfalls of Multiple-Choice Questions in Generative AI and Medical Education
di: Singh, Shrutika, et al.
Pubblicazione: (2025)
di: Singh, Shrutika, et al.
Pubblicazione: (2025)
The 2025 AI Agent Index: Documenting Technical and Safety Features of Deployed Agentic AI Systems
di: Staufer, Leon, et al.
Pubblicazione: (2026)
di: Staufer, Leon, et al.
Pubblicazione: (2026)
Thinking Upstream: Ethics and Policy Opportunities in AI Supply Chains
di: Widder, David Gray, et al.
Pubblicazione: (2023)
di: Widder, David Gray, et al.
Pubblicazione: (2023)
Mind the Gap: Pitfalls of LLM Alignment with Asian Public Opinion
di: Shankar, Hari, et al.
Pubblicazione: (2026)
di: Shankar, Hari, et al.
Pubblicazione: (2026)
Affirmative safety: An approach to risk management for high-risk AI
di: Wasil, Akash R., et al.
Pubblicazione: (2024)
di: Wasil, Akash R., et al.
Pubblicazione: (2024)
Graph-Based Analysis of AI-Driven Labor Market Transitions: Evidence from 10,000 Egyptian Jobs and Policy Implications
di: Dawoud, Ahmed, et al.
Pubblicazione: (2026)
di: Dawoud, Ahmed, et al.
Pubblicazione: (2026)
Evaluating the Promise and Pitfalls of LLMs in Hiring Decisions
di: Anzenberg, Eitan, et al.
Pubblicazione: (2025)
di: Anzenberg, Eitan, et al.
Pubblicazione: (2025)
Kaleidoscope Gallery: Exploring Ethics and Generative AI Through Art
di: Issak, Alayt, et al.
Pubblicazione: (2025)
di: Issak, Alayt, et al.
Pubblicazione: (2025)
The Global Representativeness Index: A Total Variation Distance Framework for Measuring Demographic Fidelity in Survey Research
di: Hadfield, Evan, et al.
Pubblicazione: (2026)
di: Hadfield, Evan, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Randomness, Not Representation: The Unreliability of Evaluating Cultural Alignment in LLMs
di: Khan, Ariba, et al.
Pubblicazione: (2025) -
CALMA: A Process for Deriving Context-aligned Axes for Language Model Alignment
di: Soni, Prajna, et al.
Pubblicazione: (2025) -
Safety Drift After Fine-Tuning: Evidence from High-Stakes Domains
di: Khan, Emaan Bilal, et al.
Pubblicazione: (2026) -
Activation Steering via Generative Causal Mediation
di: Sankaranarayanan, Aruna, et al.
Pubblicazione: (2026) -
Eight Methods to Evaluate Robust Unlearning in LLMs
di: Lynch, Aengus, et al.
Pubblicazione: (2024)