OLIVIA: Online Learning via Inference-time Action Adaptation for Decision Making in LLM ReAct Agents
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yu, Sheldon, Wu, Junda, Li, Xintong, Kuang, Nikki Lijing, Zhou, Sizhe, Yu, Tong, Han, Jiawei, Shang, Jingbo, McAuley, Julian |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Explainable Chain-of-Thought Reasoning: An Empirical Analysis on State-Aware Reasoning Dynamics
par: Yu, Sheldon, et autres
Publié: (2025)
par: Yu, Sheldon, et autres
Publié: (2025)
Skill-R1: Agent Skill Evolution via Reinforcement Learning
par: Vishe, Yash, et autres
Publié: (2026)
par: Vishe, Yash, et autres
Publié: (2026)
Active Learning for Direct Preference Optimization
par: Kveton, Branislav, et autres
Publié: (2025)
par: Kveton, Branislav, et autres
Publié: (2025)
Importance Sampling for Multi-Negative Multimodal Direct Preference Optimization
par: Li, Xintong, et autres
Publié: (2025)
par: Li, Xintong, et autres
Publié: (2025)
CTRLS: Chain-of-Thought Reasoning via Latent State-Transition
par: Wu, Junda, et autres
Publié: (2025)
par: Wu, Junda, et autres
Publié: (2025)
MASS-DPO: Multi-negative Active Sample Selection for Direct Policy Optimization
par: Surana, Rohan, et autres
Publié: (2026)
par: Surana, Rohan, et autres
Publié: (2026)
AMPS: Adaptive Modality Preference Steering via Functional Entropy
par: Huang, Zihan, et autres
Publié: (2026)
par: Huang, Zihan, et autres
Publié: (2026)
CoMMIT: Coordinated Multimodal Instruction Tuning
par: Li, Xintong, et autres
Publié: (2024)
par: Li, Xintong, et autres
Publié: (2024)
F-GRPO: Factorized Group-Relative Policy Optimization for Unified Candidate Generation and Ranking
par: Surana, Rohan, et autres
Publié: (2026)
par: Surana, Rohan, et autres
Publié: (2026)
WS-GRPO: Weakly-Supervised Group-Relative Policy Optimization for Rollout-Efficient Reasoning
par: Mundada, Gagan, et autres
Publié: (2026)
par: Mundada, Gagan, et autres
Publié: (2026)
Co-ReAct: Rubrics as Step-Level Collaborators for ReAct Agents
par: Kang, Jiazheng, et autres
Publié: (2026)
par: Kang, Jiazheng, et autres
Publié: (2026)
Focused ReAct: Improving ReAct through Reiterate and Early Stop
par: Li, Shuoqiu, et autres
Publié: (2024)
par: Li, Shuoqiu, et autres
Publié: (2024)
SceneAlign: Aligning Multimodal Reasoning to Scene Graphs in Complex Visual Scenes
par: Wang, Chuhan, et autres
Publié: (2026)
par: Wang, Chuhan, et autres
Publié: (2026)
A Low-Latency Fraud Detection Layer for Detecting Adversarial Interaction Patterns in LLM-Powered Agents
par: Yu, Sheldon, et autres
Publié: (2026)
par: Yu, Sheldon, et autres
Publié: (2026)
Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning
par: Surana, Rohan, et autres
Publié: (2026)
par: Surana, Rohan, et autres
Publié: (2026)
OCEAN: Offline Chain-of-thought Evaluation and Alignment in Large Language Models
par: Wu, Junda, et autres
Publié: (2024)
par: Wu, Junda, et autres
Publié: (2024)
Reason-Plan-ReAct: A Reasoner-Planner Supervising a ReAct Executor for Complex Enterprise Tasks
par: Molinari, Gianni, et autres
Publié: (2025)
par: Molinari, Gianni, et autres
Publié: (2025)
Mitigating Visual Knowledge Forgetting in MLLM Instruction-tuning via Modality-decoupled Gradient Descent
par: Wu, Junda, et autres
Publié: (2025)
par: Wu, Junda, et autres
Publié: (2025)
SAND: Boosting LLM Agents with Self-Taught Action Deliberation
par: Xia, Yu, et autres
Publié: (2025)
par: Xia, Yu, et autres
Publié: (2025)
Cognitive Bias in Decision-Making with LLMs
par: Echterhoff, Jessica, et autres
Publié: (2024)
par: Echterhoff, Jessica, et autres
Publié: (2024)
Listwise Preference Diffusion Optimization for User Behavior Trajectories Prediction
par: Huang, Hongtao, et autres
Publié: (2025)
par: Huang, Hongtao, et autres
Publié: (2025)
Weakly-supervised VLM-guided Partial Contrastive Learning for Visual Language Navigation
par: Wang, Ruoyu, et autres
Publié: (2025)
par: Wang, Ruoyu, et autres
Publié: (2025)
ReAct: Reflection Attack Mitigation For Asymmetric Routing
par: Hay, David, et autres
Publié: (2026)
par: Hay, David, et autres
Publié: (2026)
ReAct! An Interactive Tool for Hybrid Planning in Robotics
par: Dogmus, Zeynep, et autres
Publié: (2013)
par: Dogmus, Zeynep, et autres
Publié: (2013)
ReAct Meets ActRe: When Language Agents Enjoy Training Data Autonomy
par: Yang, Zonghan, et autres
Publié: (2024)
par: Yang, Zonghan, et autres
Publié: (2024)
FAMOSE: A ReAct Approach to Automated Feature Discovery
par: Burghardt, Keith, et autres
Publié: (2026)
par: Burghardt, Keith, et autres
Publié: (2026)
DICE: Dynamic In-Context Example Selection in LLM Agents via Efficient Knowledge Transfer
par: Wang, Ruoyu, et autres
Publié: (2025)
par: Wang, Ruoyu, et autres
Publié: (2025)
Knowledge-Aware Query Expansion with Large Language Models for Textual and Relational Retrieval
par: Xia, Yu, et autres
Publié: (2024)
par: Xia, Yu, et autres
Publié: (2024)
Skill-CMIB: Multimodal Agent Skill for Consistent Action via Conditional Multimodal Information Bottleneck
par: Huang, Zihan, et autres
Publié: (2026)
par: Huang, Zihan, et autres
Publié: (2026)
A Survey on Personalized and Pluralistic Preference Alignment in Large Language Models
par: Xie, Zhouhang, et autres
Publié: (2025)
par: Xie, Zhouhang, et autres
Publié: (2025)
Evaluation on Entity Matching in Recommender Systems
par: Huang, Zihan, et autres
Publié: (2026)
par: Huang, Zihan, et autres
Publié: (2026)
EZBlender: Efficient 3D Editing with Plan-and-ReAct Agent
par: Wang, Hao, et autres
Publié: (2026)
par: Wang, Hao, et autres
Publié: (2026)
On the Brittle Foundations of ReAct Prompting for Agentic Large Language Models
par: Verma, Mudit, et autres
Publié: (2024)
par: Verma, Mudit, et autres
Publié: (2024)
Gradientsys: A Multi-Agent LLM Scheduler with ReAct Orchestration
par: Song, Xinyuan, et autres
Publié: (2025)
par: Song, Xinyuan, et autres
Publié: (2025)
Exploring ReAct Prompting for Task-Oriented Dialogue: Insights and Shortcomings
par: Elizabeth, Michelle, et autres
Publié: (2024)
par: Elizabeth, Michelle, et autres
Publié: (2024)
Breaking ReAct Agents: Foot-in-the-Door Attack Will Get You In
par: Nakash, Itay, et autres
Publié: (2024)
par: Nakash, Itay, et autres
Publié: (2024)
Diffusion-BBO: Diffusion-Based Inverse Modeling for Online Black-Box Optimization
par: Wu, Dongxia, et autres
Publié: (2024)
par: Wu, Dongxia, et autres
Publié: (2024)
Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions
par: Hu, Yuanzhe, et autres
Publié: (2025)
par: Hu, Yuanzhe, et autres
Publié: (2025)
CoRAL: Collaborative Retrieval-Augmented Large Language Models Improve Long-tail Recommendation
par: Wu, Junda, et autres
Publié: (2024)
par: Wu, Junda, et autres
Publié: (2024)
Reddit2Deezer: A Scalable Dataset for Real-World Grounded Conversational Music Recommendation
par: Kim, Haven, et autres
Publié: (2026)
par: Kim, Haven, et autres
Publié: (2026)
Documents similaires
-
Explainable Chain-of-Thought Reasoning: An Empirical Analysis on State-Aware Reasoning Dynamics
par: Yu, Sheldon, et autres
Publié: (2025) -
Skill-R1: Agent Skill Evolution via Reinforcement Learning
par: Vishe, Yash, et autres
Publié: (2026) -
Active Learning for Direct Preference Optimization
par: Kveton, Branislav, et autres
Publié: (2025) -
Importance Sampling for Multi-Negative Multimodal Direct Preference Optimization
par: Li, Xintong, et autres
Publié: (2025) -
CTRLS: Chain-of-Thought Reasoning via Latent State-Transition
par: Wu, Junda, et autres
Publié: (2025)