Modeling Human Beliefs about AI Behavior for Scalable Oversight
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lang, Leon, Forré, Patrick |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
The Perils of Optimizing Learned Reward Functions: Low Training Error Does Not Guarantee Low Regret
par: Fluri, Lukas, et autres
Publié: (2024)
par: Fluri, Lukas, et autres
Publié: (2024)
Towards Scalable Oversight via Partitioned Human Supervision
par: Yin, Ren, et autres
Publié: (2025)
par: Yin, Ren, et autres
Publié: (2025)
Multivector Neurons: Better and Faster O(n)-Equivariant Clifford Graph Neural Networks
par: Liu, Cong, et autres
Publié: (2024)
par: Liu, Cong, et autres
Publié: (2024)
Steering LLMs via Scalable Interactive Oversight
par: Zhou, Enyu, et autres
Publié: (2026)
par: Zhou, Enyu, et autres
Publié: (2026)
Scalable Oversight for Superhuman AI via Recursive Self-Critiquing
par: Wen, Xueru, et autres
Publié: (2025)
par: Wen, Xueru, et autres
Publié: (2025)
Scaling Laws For Scalable Oversight
par: Engels, Joshua, et autres
Publié: (2025)
par: Engels, Joshua, et autres
Publié: (2025)
On the Utility of Accounting for Human Beliefs about AI Intention in Human-AI Collaboration
par: Yu, Guanghui, et autres
Publié: (2024)
par: Yu, Guanghui, et autres
Publié: (2024)
Clifford Group Equivariant Diffusion Models for 3D Molecular Generation
par: Liu, Cong, et autres
Publié: (2025)
par: Liu, Cong, et autres
Publié: (2025)
Great Models Think Alike and this Undermines AI Oversight
par: Goel, Shashwat, et autres
Publié: (2025)
par: Goel, Shashwat, et autres
Publié: (2025)
Early-Exit Neural Networks with Nested Prediction Sets
par: Jazbec, Metod, et autres
Publié: (2023)
par: Jazbec, Metod, et autres
Publié: (2023)
Latent Representation and Simulation of Markov Processes via Time-Lagged Information Bottleneck
par: Federici, Marco, et autres
Publié: (2023)
par: Federici, Marco, et autres
Publié: (2023)
The Oversight Game: Learning to Cooperatively Balance an AI Agent's Safety and Autonomy
par: Overman, William, et autres
Publié: (2025)
par: Overman, William, et autres
Publié: (2025)
Clifford-Steerable Convolutional Neural Networks
par: Zhdanov, Maksim, et autres
Publié: (2024)
par: Zhdanov, Maksim, et autres
Publié: (2024)
AdS-GNN -- a Conformally Equivariant Graph Neural Network
par: Zhdanov, Maksim, et autres
Publié: (2025)
par: Zhdanov, Maksim, et autres
Publié: (2025)
Building a Precise Video Language with Human-AI Oversight
par: Lin, Zhiqiu, et autres
Publié: (2026)
par: Lin, Zhiqiu, et autres
Publié: (2026)
A Descriptive and Normative Theory of Human Beliefs in RLHF
par: Dandekar, Sylee, et autres
Publié: (2025)
par: Dandekar, Sylee, et autres
Publié: (2025)
Scalable AI Inference: Performance Analysis and Optimization of AI Model Serving
par: Pham, Hung Cuong, et autres
Publié: (2026)
par: Pham, Hung Cuong, et autres
Publié: (2026)
When Your AIs Deceive You: Challenges of Partial Observability in Reinforcement Learning from Human Feedback
par: Lang, Leon, et autres
Publié: (2024)
par: Lang, Leon, et autres
Publié: (2024)
Scalable Valuation of Human Feedback through Provably Robust Model Alignment
par: Fujisawa, Masahiro, et autres
Publié: (2025)
par: Fujisawa, Masahiro, et autres
Publié: (2025)
Deep Belief Markov Models for POMDP Inference
par: Arcieri, Giacomo, et autres
Publié: (2025)
par: Arcieri, Giacomo, et autres
Publié: (2025)
Model Science: getting serious about verification, explanation and control of AI systems
par: Biecek, Przemyslaw, et autres
Publié: (2025)
par: Biecek, Przemyslaw, et autres
Publié: (2025)
BCR-DRL: Behavior- and Context-aware Reward for Deep Reinforcement Learning in Human-AI Coordination
par: Hao, Xin, et autres
Publié: (2024)
par: Hao, Xin, et autres
Publié: (2024)
Inner Speech as Behavior Guides: Steerable Imitation of Diverse Behaviors for Human-AI coordination
par: Trivedi, Rakshit, et autres
Publié: (2026)
par: Trivedi, Rakshit, et autres
Publié: (2026)
Agential AI for Integrated Continual Learning, Deliberative Behavior, and Comprehensible Models
par: Erden, Zeki Doruk, et autres
Publié: (2025)
par: Erden, Zeki Doruk, et autres
Publié: (2025)
Belief Aided Navigation using Bayesian Reinforcement Learning for Avoiding Humans in Blind Spots
par: Kim, Jinyeob, et autres
Publié: (2024)
par: Kim, Jinyeob, et autres
Publié: (2024)
Stargazer: A Scalable Model-Fitting Benchmark Environment for AI Agents under Astrophysical Constraints
par: Liu, Xinge, et autres
Publié: (2026)
par: Liu, Xinge, et autres
Publié: (2026)
NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations
par: Liao, Huan, et autres
Publié: (2025)
par: Liao, Huan, et autres
Publié: (2025)
Conceptual Belief-Informed Reinforcement Learning
par: Gu, Xingrui, et autres
Publié: (2024)
par: Gu, Xingrui, et autres
Publié: (2024)
Differentiable Belief-based Opponent Shaping
par: Sane, Aarav G, et autres
Publié: (2026)
par: Sane, Aarav G, et autres
Publié: (2026)
MC-DBN: A Deep Belief Network-Based Model for Modality Completion
par: Luo, Zihong, et autres
Publié: (2024)
par: Luo, Zihong, et autres
Publié: (2024)
Bidirectional Distillation: A Mixed-Play Framework for Multi-Agent Generalizable Behaviors
par: Feng, Lang, et autres
Publié: (2025)
par: Feng, Lang, et autres
Publié: (2025)
Scalable Equilibrium Sampling with Sequential Boltzmann Generators
par: Tan, Charlie B., et autres
Publié: (2025)
par: Tan, Charlie B., et autres
Publié: (2025)
Circular Belief Propagation for Approximate Probabilistic Inference
par: Bouttier, Vincent, et autres
Publié: (2024)
par: Bouttier, Vincent, et autres
Publié: (2024)
Mobility-Aware Cache Framework for Scalable LLM-Based Human Mobility Simulation
par: Yan, Hua, et autres
Publié: (2026)
par: Yan, Hua, et autres
Publié: (2026)
Learnable Behavior Control: Breaking Atari Human World Records via Sample-Efficient Behavior Selection
par: Fan, Jiajun, et autres
Publié: (2023)
par: Fan, Jiajun, et autres
Publié: (2023)
Discovering Behavioral Predispositions in Data to Improve Human Activity Recognition
par: Popko, Maximilian, et autres
Publié: (2022)
par: Popko, Maximilian, et autres
Publié: (2022)
Selecting Belief-State Approximations in Simulators with Latent States
par: Jiang, Nan
Publié: (2025)
par: Jiang, Nan
Publié: (2025)
Heuristic Transformer: Belief Augmented In-Context Reinforcement Learning
par: Dippel, Oliver, et autres
Publié: (2025)
par: Dippel, Oliver, et autres
Publié: (2025)
How to Explore with Belief: State Entropy Maximization in POMDPs
par: Zamboni, Riccardo, et autres
Publié: (2024)
par: Zamboni, Riccardo, et autres
Publié: (2024)
Belief or Circuitry? Causal Evidence for In-Context Graph Learning
par: Kowalyshyn, Katharine, et autres
Publié: (2026)
par: Kowalyshyn, Katharine, et autres
Publié: (2026)
Documents similaires
-
The Perils of Optimizing Learned Reward Functions: Low Training Error Does Not Guarantee Low Regret
par: Fluri, Lukas, et autres
Publié: (2024) -
Towards Scalable Oversight via Partitioned Human Supervision
par: Yin, Ren, et autres
Publié: (2025) -
Multivector Neurons: Better and Faster O(n)-Equivariant Clifford Graph Neural Networks
par: Liu, Cong, et autres
Publié: (2024) -
Steering LLMs via Scalable Interactive Oversight
par: Zhou, Enyu, et autres
Publié: (2026) -
Scalable Oversight for Superhuman AI via Recursive Self-Critiquing
par: Wen, Xueru, et autres
Publié: (2025)