Guardado en:
| Autores principales: | Sane, Aarav G, Sivachandran, Karthik, Paleja, Rohan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2605.29042 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Opponent Shaping in LLM Agents
por: Segura, Marta Emili Garcia, et al.
Publicado: (2025)
por: Segura, Marta Emili Garcia, et al.
Publicado: (2025)
Analysing the Sample Complexity of Opponent Shaping
por: Fung, Kitty, et al.
Publicado: (2024)
por: Fung, Kitty, et al.
Publicado: (2024)
Towards Automated Semantic Interpretability in Reinforcement Learning via Vision-Language Models
por: Li, Zhaoxin, et al.
Publicado: (2025)
por: Li, Zhaoxin, et al.
Publicado: (2025)
Optimal Scaling Laws for Efficiency Gains in a Theoretical Transformer-Augmented Sectional MoE Framework
por: Sane, Soham
Publicado: (2025)
por: Sane, Soham
Publicado: (2025)
Hybrid Group Relative Policy Optimization: A Multi-Sample Approach to Enhancing Policy Optimization
por: Sane, Soham
Publicado: (2025)
por: Sane, Soham
Publicado: (2025)
Decision-making with Speculative Opponent Models
por: Sun, Jing, et al.
Publicado: (2022)
por: Sun, Jing, et al.
Publicado: (2022)
Learning Pareto-Optimal Rewards from Noisy Preferences: A Framework for Multi-Objective Inverse Reinforcement Learning
por: Cherukuri, Kalyan, et al.
Publicado: (2025)
por: Cherukuri, Kalyan, et al.
Publicado: (2025)
Beyond Partner Diversity: An Influence-Based Team Steering Framework for Zero-Shot Human-Machine Teaming
por: Sheng, Wei, et al.
Publicado: (2026)
por: Sheng, Wei, et al.
Publicado: (2026)
Quantum-Evolutionary Neural Networks for Multi-Agent Federated Learning
por: Lala, Aarav, et al.
Publicado: (2025)
por: Lala, Aarav, et al.
Publicado: (2025)
Adaptive Self-Supervised Learning Strategies for Dynamic On-Device LLM Personalization
por: Mendoza, Rafael, et al.
Publicado: (2024)
por: Mendoza, Rafael, et al.
Publicado: (2024)
AlphaGrad: Non-Linear Gradient Normalization Optimizer
por: Sane, Soham
Publicado: (2025)
por: Sane, Soham
Publicado: (2025)
AM-PPO: (Advantage) Alpha-Modulation with Proximal Policy Optimization
por: Sane, Soham
Publicado: (2025)
por: Sane, Soham
Publicado: (2025)
Q-Policy: Quantum-Enhanced Policy Evaluation for Scalable Reinforcement Learning
por: Cherukuri, Kalyan, et al.
Publicado: (2025)
por: Cherukuri, Kalyan, et al.
Publicado: (2025)
LOQA: Learning with Opponent Q-Learning Awareness
por: Aghajohari, Milad, et al.
Publicado: (2024)
por: Aghajohari, Milad, et al.
Publicado: (2024)
SignSpeak: Open-Source Time Series Classification for ASL Translation
por: Makkar, Aditya, et al.
Publicado: (2024)
por: Makkar, Aditya, et al.
Publicado: (2024)
Adaptive Opponent Policy Detection in Multi-Agent MDPs: Real-Time Strategy Switch Identification Using Running Error Estimation
por: Mridul, Mohidul Haque, et al.
Publicado: (2024)
por: Mridul, Mohidul Haque, et al.
Publicado: (2024)
Deep Belief Markov Models for POMDP Inference
por: Arcieri, Giacomo, et al.
Publicado: (2025)
por: Arcieri, Giacomo, et al.
Publicado: (2025)
Predictive Crash Analytics for Traffic Safety using Deep Learning
por: Sivakoti, Karthik
Publicado: (2025)
por: Sivakoti, Karthik
Publicado: (2025)
PALADIN: Self-Correcting Language Model Agents to Cure Tool-Failure Cases
por: Vuddanti, Sri Vatsa, et al.
Publicado: (2025)
por: Vuddanti, Sri Vatsa, et al.
Publicado: (2025)
Conceptual Belief-Informed Reinforcement Learning
por: Gu, Xingrui, et al.
Publicado: (2024)
por: Gu, Xingrui, et al.
Publicado: (2024)
First Order Model-Based RL through Decoupled Backpropagation
por: Amigo, Joseph, et al.
Publicado: (2025)
por: Amigo, Joseph, et al.
Publicado: (2025)
Circular Belief Propagation for Approximate Probabilistic Inference
por: Bouttier, Vincent, et al.
Publicado: (2024)
por: Bouttier, Vincent, et al.
Publicado: (2024)
The Belief State Transformer
por: Hu, Edward S., et al.
Publicado: (2024)
por: Hu, Edward S., et al.
Publicado: (2024)
Belief or Circuitry? Causal Evidence for In-Context Graph Learning
por: Kowalyshyn, Katharine, et al.
Publicado: (2026)
por: Kowalyshyn, Katharine, et al.
Publicado: (2026)
A Descriptive and Normative Theory of Human Beliefs in RLHF
por: Dandekar, Sylee, et al.
Publicado: (2025)
por: Dandekar, Sylee, et al.
Publicado: (2025)
Selecting Belief-State Approximations in Simulators with Latent States
por: Jiang, Nan
Publicado: (2025)
por: Jiang, Nan
Publicado: (2025)
Heuristic Transformer: Belief Augmented In-Context Reinforcement Learning
por: Dippel, Oliver, et al.
Publicado: (2025)
por: Dippel, Oliver, et al.
Publicado: (2025)
How to Explore with Belief: State Entropy Maximization in POMDPs
por: Zamboni, Riccardo, et al.
Publicado: (2024)
por: Zamboni, Riccardo, et al.
Publicado: (2024)
Event-Grounded Sparse Autoencoders for Vision-Language-Action Policies
por: Jin, Xinchen, et al.
Publicado: (2026)
por: Jin, Xinchen, et al.
Publicado: (2026)
Think Locally, Explain Globally: Graph-Guided LLM Investigations via Local Reasoning and Belief Propagation
por: Jha, Saurabh, et al.
Publicado: (2026)
por: Jha, Saurabh, et al.
Publicado: (2026)
ThinkSwitch: Context Distillation with LoRA and Weight Interpolation for Specific-Purpose Reasoning Tasks
por: Saini, Dhruv, et al.
Publicado: (2026)
por: Saini, Dhruv, et al.
Publicado: (2026)
Regularized Offline Policy Optimization with Posterior Hybrid Bayesian Belief
por: Lin, Hongqiang, et al.
Publicado: (2026)
por: Lin, Hongqiang, et al.
Publicado: (2026)
Contextual Preference Collaborative Measure Framework Based on Belief System
por: Yu, Hang, et al.
Publicado: (2025)
por: Yu, Hang, et al.
Publicado: (2025)
Choice Between Partial Trajectories: Disentangling Goals from Beliefs
por: Marklund, Henrik, et al.
Publicado: (2024)
por: Marklund, Henrik, et al.
Publicado: (2024)
Modeling Human Beliefs about AI Behavior for Scalable Oversight
por: Lang, Leon, et al.
Publicado: (2025)
por: Lang, Leon, et al.
Publicado: (2025)
Scaling Opponent Shaping to High Dimensional Games
por: Khan, Akbir, et al.
Publicado: (2023)
por: Khan, Akbir, et al.
Publicado: (2023)
Fuzzy Rule-based Differentiable Representation Learning
por: Zhang, Wei, et al.
Publicado: (2025)
por: Zhang, Wei, et al.
Publicado: (2025)
Subgoal-based Reward Shaping to Improve Efficiency in Reinforcement Learning
por: Okudo, Takato, et al.
Publicado: (2021)
por: Okudo, Takato, et al.
Publicado: (2021)
Belief-Based Offline Reinforcement Learning for Delay-Robust Policy Optimization
por: Zhan, Simon Sinong, et al.
Publicado: (2025)
por: Zhan, Simon Sinong, et al.
Publicado: (2025)
Manifold-based Sampling for In-Context Hallucination Detection in Large Language Models
por: Vamshi, Bodla Krishna, et al.
Publicado: (2026)
por: Vamshi, Bodla Krishna, et al.
Publicado: (2026)
Ejemplares similares
-
Opponent Shaping in LLM Agents
por: Segura, Marta Emili Garcia, et al.
Publicado: (2025) -
Analysing the Sample Complexity of Opponent Shaping
por: Fung, Kitty, et al.
Publicado: (2024) -
Towards Automated Semantic Interpretability in Reinforcement Learning via Vision-Language Models
por: Li, Zhaoxin, et al.
Publicado: (2025) -
Optimal Scaling Laws for Efficiency Gains in a Theoretical Transformer-Augmented Sectional MoE Framework
por: Sane, Soham
Publicado: (2025) -
Hybrid Group Relative Policy Optimization: A Multi-Sample Approach to Enhancing Policy Optimization
por: Sane, Soham
Publicado: (2025)