Salvato in:
| Autori principali: | Liu, Grace, Christian, Brian, Dumbalska, Tsvetomira, Bakker, Michiel A., Dubey, Rachit |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2604.04721 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Reward Model Interpretability via Optimal and Pessimal Tokens
di: Christian, Brian, et al.
Pubblicazione: (2025)
di: Christian, Brian, et al.
Pubblicazione: (2025)
Reward Models Inherit Value Biases from Pretraining
di: Christian, Brian, et al.
Pubblicazione: (2026)
di: Christian, Brian, et al.
Pubblicazione: (2026)
What do we mean when we talk about socioeconomic status? Implications for measurement, mechanisms and interventions from a critical review on adolescent mental health
di: Mirela Zaneva, et al.
Pubblicazione: (2024)
di: Mirela Zaneva, et al.
Pubblicazione: (2024)
Adding New Capability in Existing Scientific Application with LLM Assistance
di: Dubey, Anshu, et al.
Pubblicazione: (2025)
di: Dubey, Anshu, et al.
Pubblicazione: (2025)
Evaluating Human-AI Safety: A Framework for Measuring Harmful Capability Uplift
di: Vaccaro, Michelle, et al.
Pubblicazione: (2026)
di: Vaccaro, Michelle, et al.
Pubblicazione: (2026)
From Delegates to Trustees: How Optimizing for Long-Term Interests Shapes Bias and Alignment in LLM
di: Fulay, Suyash, et al.
Pubblicazione: (2025)
di: Fulay, Suyash, et al.
Pubblicazione: (2025)
Context Length Alone Hurts LLM Performance Despite Perfect Retrieval
di: Du, Yufeng, et al.
Pubblicazione: (2025)
di: Du, Yufeng, et al.
Pubblicazione: (2025)
AI and Collective Decisions: Strengthening Legitimacy and Losers' Consent
di: Fulay, Suyash, et al.
Pubblicazione: (2026)
di: Fulay, Suyash, et al.
Pubblicazione: (2026)
Digital Epidemiology: Leveraging Social Media for Insight into Epilepsy and Mental Health
di: Dahiya, Liza, et al.
Pubblicazione: (2024)
di: Dahiya, Liza, et al.
Pubblicazione: (2024)
Benchmarking Overton Pluralism in LLMs
di: Poole-Dayan, Elinor, et al.
Pubblicazione: (2025)
di: Poole-Dayan, Elinor, et al.
Pubblicazione: (2025)
Belief Engine: Configurable and Inspectable Stance Dynamics in Multi-Agent LLM Deliberation
di: Yang, Joshua C., et al.
Pubblicazione: (2026)
di: Yang, Joshua C., et al.
Pubblicazione: (2026)
Agora: Teaching the Skill of Consensus-Finding with AI Personas Grounded in Human Voice
di: Ravi, Prerna, et al.
Pubblicazione: (2026)
di: Ravi, Prerna, et al.
Pubblicazione: (2026)
AI for Service: Proactive Assistance with AI Glasses
di: Wen, Zichen, et al.
Pubblicazione: (2025)
di: Wen, Zichen, et al.
Pubblicazione: (2025)
The Pitfalls of Memorization: When Memorization Hurts Generalization
di: Bayat, Reza, et al.
Pubblicazione: (2024)
di: Bayat, Reza, et al.
Pubblicazione: (2024)
Tell Me Why: Incentivizing Explanations
di: Srinivasan, Siddarth, et al.
Pubblicazione: (2025)
di: Srinivasan, Siddarth, et al.
Pubblicazione: (2025)
Quantization Hurts Reasoning? An Empirical Study on Quantized Reasoning Models
di: Liu, Ruikang, et al.
Pubblicazione: (2025)
di: Liu, Ruikang, et al.
Pubblicazione: (2025)
AI Readiness in Healthcare through Storytelling XAI
di: Dubey, Akshat, et al.
Pubblicazione: (2024)
di: Dubey, Akshat, et al.
Pubblicazione: (2024)
RE-PO: Robust Enhanced Policy Optimization as a General Framework for LLM Alignment
di: Cao, Xiaoyang, et al.
Pubblicazione: (2025)
di: Cao, Xiaoyang, et al.
Pubblicazione: (2025)
Data Shifts Hurt CoT: A Theoretical Study
di: Yin, Lang, et al.
Pubblicazione: (2025)
di: Yin, Lang, et al.
Pubblicazione: (2025)
Detecting AI Assistance in Abstract Complex Tasks
di: King, Tyler, et al.
Pubblicazione: (2025)
di: King, Tyler, et al.
Pubblicazione: (2025)
Independence Is Not an Issue in Neurosymbolic AI
di: Faronius, Håkan Karlsson, et al.
Pubblicazione: (2025)
di: Faronius, Håkan Karlsson, et al.
Pubblicazione: (2025)
Zero-shot counting with a dual-stream neural network model
di: Thompson, Jessica A. F., et al.
Pubblicazione: (2024)
di: Thompson, Jessica A. F., et al.
Pubblicazione: (2024)
Can AI mediation improve democratic deliberation?
di: Tessler, Michael Henry, et al.
Pubblicazione: (2026)
di: Tessler, Michael Henry, et al.
Pubblicazione: (2026)
When More Thinking Hurts: Overthinking in LLM Test-Time Compute Scaling
di: Zhou, Shu, et al.
Pubblicazione: (2026)
di: Zhou, Shu, et al.
Pubblicazione: (2026)
Unmasking On-Policy Distillation: Where It Helps, Where It Hurts, and Why
di: Armandpour, Mohammadreza, et al.
Pubblicazione: (2026)
di: Armandpour, Mohammadreza, et al.
Pubblicazione: (2026)
PHAX: A Structured Argumentation Framework for User-Centered Explainable AI in Public Health and Biomedical Sciences
di: İlgen, Bahar, et al.
Pubblicazione: (2025)
di: İlgen, Bahar, et al.
Pubblicazione: (2025)
AssistanceZero: Scalably Solving Assistance Games
di: Laidlaw, Cassidy, et al.
Pubblicazione: (2025)
di: Laidlaw, Cassidy, et al.
Pubblicazione: (2025)
Measuring Mid-2025 LLM-Assistance on Novice Performance in Biology
di: Hong, Shen Zhou, et al.
Pubblicazione: (2026)
di: Hong, Shen Zhou, et al.
Pubblicazione: (2026)
Activation Steering for Bias Mitigation: An Interpretable Approach to Safer LLMs
di: Dubey, Shivam
Pubblicazione: (2025)
di: Dubey, Shivam
Pubblicazione: (2025)
When Verification Hurts: Asymmetric Effects of Multi-Agent Feedback in Logic Proof Tutoring
di: Yasir, Tahreem, et al.
Pubblicazione: (2026)
di: Yasir, Tahreem, et al.
Pubblicazione: (2026)
Invoice Information Extraction: Methods and Performance Evaluation
di: Yashwant, Sai, et al.
Pubblicazione: (2025)
di: Yashwant, Sai, et al.
Pubblicazione: (2025)
Probing Embodied LLMs: When Higher Observation Fidelity Hurts Problem Solving
di: Zenkri, Oussama, et al.
Pubblicazione: (2026)
di: Zenkri, Oussama, et al.
Pubblicazione: (2026)
When Correct Demonstrations Hurt: Rethinking the Role of Exemplars in In-Context Learning
di: Qiu, Chenghao, et al.
Pubblicazione: (2026)
di: Qiu, Chenghao, et al.
Pubblicazione: (2026)
Difficult Examples Hurt Unsupervised Contrastive Learning: A Theoretical Perspective
di: Zhang, Yi-Ge, et al.
Pubblicazione: (2025)
di: Zhang, Yi-Ge, et al.
Pubblicazione: (2025)
AI-Enhanced Operator Assistance for UNICOS Applications
di: Tam, Bernard, et al.
Pubblicazione: (2025)
di: Tam, Bernard, et al.
Pubblicazione: (2025)
ED-Copilot: Reduce Emergency Department Wait Time with Language Model Diagnostic Assistance
di: Sun, Liwen, et al.
Pubblicazione: (2024)
di: Sun, Liwen, et al.
Pubblicazione: (2024)
User-in-the-loop Evaluation of Multimodal LLMs for Activity Assistance
di: Verghese, Mrinal, et al.
Pubblicazione: (2024)
di: Verghese, Mrinal, et al.
Pubblicazione: (2024)
AstraAI: LLMs, Retrieval, and AST-Guided Assistance for HPC Codebases
di: Natarajan, Mahesh, et al.
Pubblicazione: (2026)
di: Natarajan, Mahesh, et al.
Pubblicazione: (2026)
Value of Assistance for Grasping
di: Masarwy, Mohammad, et al.
Pubblicazione: (2023)
di: Masarwy, Mohammad, et al.
Pubblicazione: (2023)
Causal Predictive Optimization and Generation for Business AI
di: Zhao, Liyang, et al.
Pubblicazione: (2025)
di: Zhao, Liyang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Reward Model Interpretability via Optimal and Pessimal Tokens
di: Christian, Brian, et al.
Pubblicazione: (2025) -
Reward Models Inherit Value Biases from Pretraining
di: Christian, Brian, et al.
Pubblicazione: (2026) -
What do we mean when we talk about socioeconomic status? Implications for measurement, mechanisms and interventions from a critical review on adolescent mental health
di: Mirela Zaneva, et al.
Pubblicazione: (2024) -
Adding New Capability in Existing Scientific Application with LLM Assistance
di: Dubey, Anshu, et al.
Pubblicazione: (2025) -
Evaluating Human-AI Safety: A Framework for Measuring Harmful Capability Uplift
di: Vaccaro, Michelle, et al.
Pubblicazione: (2026)