SteP: Stacked LLM Policies for Web Actions
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sodhi, Paloma, Branavan, S. R. K., Artzi, Yoav, McDonald, Ryan |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Better than Your Teacher: LLM Agents that learn from Privileged AI Feedback
par: Choudhury, Sanjiban, et autres
Publié: (2024)
par: Choudhury, Sanjiban, et autres
Publié: (2024)
No Mean Feat: Simple, Strong Baselines for Context Compression
par: Feldman, Yair, et autres
Publié: (2025)
par: Feldman, Yair, et autres
Publié: (2025)
Knot So Simple: A Minimalistic Environment for Spatial Reasoning
par: Chen, Zizhao, et autres
Publié: (2025)
par: Chen, Zizhao, et autres
Publié: (2025)
Talk Less, Interact Better: Evaluating In-context Conversational Adaptation in Multimodal LLMs
par: Hua, Yilun, et autres
Publié: (2024)
par: Hua, Yilun, et autres
Publié: (2024)
Post-training for Efficient Communication via Convention Formation
par: Hua, Yilun, et autres
Publié: (2025)
par: Hua, Yilun, et autres
Publié: (2025)
A Surprising Failure? Multimodal LLMs and the NLVR Challenge
par: Wu, Anne, et autres
Publié: (2024)
par: Wu, Anne, et autres
Publié: (2024)
CoGen: Learning from Feedback with Coupled Comprehension and Generation
par: Gul, Mustafa Omer, et autres
Publié: (2024)
par: Gul, Mustafa Omer, et autres
Publié: (2024)
Imitation Learning from a Single Temporally Misaligned Video
par: Huey, William, et autres
Publié: (2025)
par: Huey, William, et autres
Publié: (2025)
LLMs Are In-Context Bandit Reinforcement Learners
par: Monea, Giovanni, et autres
Publié: (2024)
par: Monea, Giovanni, et autres
Publié: (2024)
Log-Concave Coupling for Sampling Neural Net Posteriors
par: McDonald, Curtis, et autres
Publié: (2024)
par: McDonald, Curtis, et autres
Publié: (2024)
IncDSI: Incrementally Updatable Document Retrieval
par: Kishore, Varsha, et autres
Publié: (2023)
par: Kishore, Varsha, et autres
Publié: (2023)
Deep Latent Force Models: ODE-based Process Convolutions for Bayesian Deep Learning
par: Baldwin-McDonald, Thomas, et autres
Publié: (2023)
par: Baldwin-McDonald, Thomas, et autres
Publié: (2023)
Robot Arm Control via Cognitive Map Learners
par: McDonald, Nathan, et autres
Publié: (2026)
par: McDonald, Nathan, et autres
Publié: (2026)
Zero-shot and Few-shot Generation Strategies for Artificial Clinical Records
par: Frayling, Erlend, et autres
Publié: (2024)
par: Frayling, Erlend, et autres
Publié: (2024)
Adaptive RKHS Fourier Features for Compositional Gaussian Process Models
par: Shi, Xinxing, et autres
Publié: (2024)
par: Shi, Xinxing, et autres
Publié: (2024)
OrgFlow: Generative Modeling of Organic Crystal Structures from Molecular Graphs
par: Vahediahmar, Mohammadmahdi, et autres
Publié: (2026)
par: Vahediahmar, Mohammadmahdi, et autres
Publié: (2026)
Retrospective Learning from Interactions
par: Chen, Zizhao, et autres
Publié: (2024)
par: Chen, Zizhao, et autres
Publié: (2024)
Multi-Agent Reinforcement Learning for Unmanned Aerial Vehicle Coordination by Multi-Critic Policy Gradient Optimization
par: Alon, Yoav, et autres
Publié: (2020)
par: Alon, Yoav, et autres
Publié: (2020)
Log-linear Guardedness and its Implications
par: Ravfogel, Shauli, et autres
Publié: (2022)
par: Ravfogel, Shauli, et autres
Publié: (2022)
A Unified View on Solving Objective Mismatch in Model-Based Reinforcement Learning
par: Wei, Ran, et autres
Publié: (2023)
par: Wei, Ran, et autres
Publié: (2023)
Get RICH or Die Scaling: Profitably Trading Inference Compute for Robustness
par: McDonald, Tavish, et autres
Publié: (2025)
par: McDonald, Tavish, et autres
Publié: (2025)
WEBSERV: A Full-Stack and RL-Ready Web Environment for Training Web Agents at Scale
par: Lu, Yuxuan, et autres
Publié: (2025)
par: Lu, Yuxuan, et autres
Publié: (2025)
Pre-training Limited Memory Language Models with Internal and External Knowledge
par: Zhao, Linxi, et autres
Publié: (2025)
par: Zhao, Linxi, et autres
Publié: (2025)
On the Identifiability of Latent Action Policies
par: Lachapelle, Sébastien
Publié: (2025)
par: Lachapelle, Sébastien
Publié: (2025)
Web Content Strategy in Academic Libraries: Methods and Maturity
par: McDonald, Courtney, et autres
Publié: (2022)
par: McDonald, Courtney, et autres
Publié: (2022)
WoodScape Motion Segmentation for Autonomous Driving -- CVPR 2023 OmniCV Workshop Challenge
par: Ramachandran, Saravanabalagi, et autres
Publié: (2023)
par: Ramachandran, Saravanabalagi, et autres
Publié: (2023)
A Bayesian Approach to Robust Inverse Reinforcement Learning
par: Wei, Ran, et autres
Publié: (2023)
par: Wei, Ran, et autres
Publié: (2023)
Kernelized Concept Erasure
par: Ravfogel, Shauli, et autres
Publié: (2022)
par: Ravfogel, Shauli, et autres
Publié: (2022)
Linear Adversarial Concept Erasure
par: Ravfogel, Shauli, et autres
Publié: (2022)
par: Ravfogel, Shauli, et autres
Publié: (2022)
Imitate Optimal Policy: Prevail and Induce Action Collapse in Policy Gradient
par: Zhou, Zhongzhu, et autres
Publié: (2025)
par: Zhou, Zhongzhu, et autres
Publié: (2025)
Counterfactual Learning of Stochastic Policies with Continuous Actions
par: Zenati, Houssam, et autres
Publié: (2020)
par: Zenati, Houssam, et autres
Publié: (2020)
Short-Long Policy Evaluation with Novel Actions
par: Nam, Hyunji Alex, et autres
Publié: (2024)
par: Nam, Hyunji Alex, et autres
Publié: (2024)
Action-Graph Policies: Learning Action Co-dependencies in Multi-Agent Reinforcement Learning
par: Gupta, Nikunj, et autres
Publié: (2026)
par: Gupta, Nikunj, et autres
Publié: (2026)
Lost in Backpropagation: The LM Head is a Gradient Bottleneck
par: Godey, Nathan, et autres
Publié: (2026)
par: Godey, Nathan, et autres
Publié: (2026)
RescueLens: LLM-Powered Triage and Action on Volunteer Feedback for Food Rescue
par: Raman, Naveen, et autres
Publié: (2025)
par: Raman, Naveen, et autres
Publié: (2025)
A Practical Method for Generating String Counterfactuals
par: Avitan, Matan, et autres
Publié: (2024)
par: Avitan, Matan, et autres
Publié: (2024)
Impatient Bandits: Optimizing for the Long-Term Without Delay
par: Zhang, Kelly W., et autres
Publié: (2025)
par: Zhang, Kelly W., et autres
Publié: (2025)
WebATLAS: An LLM Agent with Experience-Driven Memory and Action Simulation
par: Cheng, Jiali, et autres
Publié: (2025)
par: Cheng, Jiali, et autres
Publié: (2025)
WebLLM: A High-Performance In-Browser LLM Inference Engine
par: Ruan, Charlie F., et autres
Publié: (2024)
par: Ruan, Charlie F., et autres
Publié: (2024)
POTEC: Off-Policy Learning for Large Action Spaces via Two-Stage Policy Decomposition
par: Saito, Yuta, et autres
Publié: (2024)
par: Saito, Yuta, et autres
Publié: (2024)
Documents similaires
-
Better than Your Teacher: LLM Agents that learn from Privileged AI Feedback
par: Choudhury, Sanjiban, et autres
Publié: (2024) -
No Mean Feat: Simple, Strong Baselines for Context Compression
par: Feldman, Yair, et autres
Publié: (2025) -
Knot So Simple: A Minimalistic Environment for Spatial Reasoning
par: Chen, Zizhao, et autres
Publié: (2025) -
Talk Less, Interact Better: Evaluating In-context Conversational Adaptation in Multimodal LLMs
par: Hua, Yilun, et autres
Publié: (2024) -
Post-training for Efficient Communication via Convention Formation
par: Hua, Yilun, et autres
Publié: (2025)