WebGym: Scaling Training Environments for Visual Web Agents with Realistic Tasks
Fuente:
arXiv
Guardado en:
| Autores principales: | Bai, Hao, Taymanov, Alexey, Zhang, Tong, Kumar, Aviral, Whitehead, Spencer |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
VisualWebArena: Evaluating Multimodal Agents on Realistic Visual Web Tasks
por: Koh, Jing Yu, et al.
Publicado: (2024)
por: Koh, Jing Yu, et al.
Publicado: (2024)
Weblica: Scalable and Reproducible Training Environments for Visual Web Agents
por: Kar, Oğuzhan Fatih, et al.
Publicado: (2026)
por: Kar, Oğuzhan Fatih, et al.
Publicado: (2026)
OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents
por: Yang, Rui, et al.
Publicado: (2026)
por: Yang, Rui, et al.
Publicado: (2026)
OceanGym: A Benchmark Environment for Underwater Embodied Agents
por: Xue, Yida, et al.
Publicado: (2025)
por: Xue, Yida, et al.
Publicado: (2025)
WALT: Web Agents that Learn Tools
por: Prabhu, Viraj, et al.
Publicado: (2025)
por: Prabhu, Viraj, et al.
Publicado: (2025)
WebSerial Vision Training for Microcontrollers: A Browser-Based Companion to On-Device CNN Training
por: Ellis, Jeremy
Publicado: (2026)
por: Ellis, Jeremy
Publicado: (2026)
Conditional Diffusion on Web-Scale Image Pairs leads to Diverse Image Variations
por: Kumar, Manoj, et al.
Publicado: (2024)
por: Kumar, Manoj, et al.
Publicado: (2024)
LAION-C: An Out-of-Distribution Benchmark for Web-Scale Vision Models
por: Li, Fanfei, et al.
Publicado: (2025)
por: Li, Fanfei, et al.
Publicado: (2025)
WebInject: Prompt Injection Attack to Web Agents
por: Wang, Xilong, et al.
Publicado: (2025)
por: Wang, Xilong, et al.
Publicado: (2025)
Web-based Melanoma Detection
por: Kim, SangHyuk, et al.
Publicado: (2024)
por: Kim, SangHyuk, et al.
Publicado: (2024)
No Training Wheels: Steering Vectors for Bias Correction at Inference Time
por: Gupta, Aviral, et al.
Publicado: (2025)
por: Gupta, Aviral, et al.
Publicado: (2025)
The Unified Balance Theory of Second-Moment Exponential Scaling Optimizers in Visual Tasks
por: Zhang, Gongyue, et al.
Publicado: (2024)
por: Zhang, Gongyue, et al.
Publicado: (2024)
Walking the Web of Concept-Class Relationships in Incrementally Trained Interpretable Models
por: Agrawal, Susmit, et al.
Publicado: (2025)
por: Agrawal, Susmit, et al.
Publicado: (2025)
InfiniteWeb: Scalable Web Environment Synthesis for GUI Agent Training
por: Zhang, Ziyun, et al.
Publicado: (2026)
por: Zhang, Ziyun, et al.
Publicado: (2026)
HistoGym: A Reinforcement Learning Environment for Histopathological Image Analysis
por: Liu, Zhi-Bo, et al.
Publicado: (2024)
por: Liu, Zhi-Bo, et al.
Publicado: (2024)
Web2Grasp: Learning Functional Grasps from Web Images of Hand-Object Interactions
por: Chen, Hongyi, et al.
Publicado: (2025)
por: Chen, Hongyi, et al.
Publicado: (2025)
GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation
por: Cheang, Chi-Lam, et al.
Publicado: (2024)
por: Cheang, Chi-Lam, et al.
Publicado: (2024)
EEO-TFV: Escape-Explore Optimizer for Web-Scale Time-Series Forecasting and Vision Analysis
por: Wang, Hua, et al.
Publicado: (2026)
por: Wang, Hua, et al.
Publicado: (2026)
Noise-Tolerant Hybrid Prototypical Learning with Noisy Web Data
por: Liang, Chao, et al.
Publicado: (2025)
por: Liang, Chao, et al.
Publicado: (2025)
Structuring a Training Strategy to Robustify Perception Models with Realistic Image Augmentations
por: Hammam, Ahmed, et al.
Publicado: (2024)
por: Hammam, Ahmed, et al.
Publicado: (2024)
TimeWarp: Evaluating Web Agents by Revisiting the Past
por: Ishmam, Md Farhan, et al.
Publicado: (2026)
por: Ishmam, Md Farhan, et al.
Publicado: (2026)
MolmoWeb: Open Visual Web Agent and Open Data for the Open Web
por: Gupta, Tanmay, et al.
Publicado: (2026)
por: Gupta, Tanmay, et al.
Publicado: (2026)
DRAGON: A Large-Scale Dataset of Realistic Images Generated by Diffusion Models
por: Bertazzini, Giulia, et al.
Publicado: (2025)
por: Bertazzini, Giulia, et al.
Publicado: (2025)
TextSquare: Scaling up Text-Centric Visual Instruction Tuning
por: Tang, Jingqun, et al.
Publicado: (2024)
por: Tang, Jingqun, et al.
Publicado: (2024)
CUA-Gym: Scaling Verifiable Training Environments and Tasks for Computer-Use Agents
por: Wang, Bowen, et al.
Publicado: (2026)
por: Wang, Bowen, et al.
Publicado: (2026)
Vision-Language Models Provide Promptable Representations for Reinforcement Learning
por: Chen, William, et al.
Publicado: (2024)
por: Chen, William, et al.
Publicado: (2024)
InnoGym: Benchmarking the Innovation Potential of AI Agents
por: Zhang, Jintian, et al.
Publicado: (2025)
por: Zhang, Jintian, et al.
Publicado: (2025)
Descripción automática de secciones delgadas de rocas: una aplicación Web
por: Paucar, Stalyn, et al.
Publicado: (2024)
por: Paucar, Stalyn, et al.
Publicado: (2024)
Growing Visual Generative Capacity for Pre-Trained MLLMs
por: Wang, Hanyu, et al.
Publicado: (2025)
por: Wang, Hanyu, et al.
Publicado: (2025)
Learning an Actionable Discrete Diffusion Policy via Large-Scale Actionless Video Pre-Training
por: He, Haoran, et al.
Publicado: (2024)
por: He, Haoran, et al.
Publicado: (2024)
Pix2Fact: When Vision Is Not Enough -- Benchmarking Fine-Grained VQA with Web Verification on High-Resolution Real-World Scenes
por: Jiang, Yifan, et al.
Publicado: (2026)
por: Jiang, Yifan, et al.
Publicado: (2026)
ZeroMimic: Distilling Robotic Manipulation Skills from Web Videos
por: Shi, Junyao, et al.
Publicado: (2025)
por: Shi, Junyao, et al.
Publicado: (2025)
Time-, Memory- and Parameter-Efficient Visual Adaptation
por: Mercea, Otniel-Bogdan, et al.
Publicado: (2024)
por: Mercea, Otniel-Bogdan, et al.
Publicado: (2024)
Visual Test-time Scaling for GUI Agent Grounding
por: Luo, Tiange, et al.
Publicado: (2025)
por: Luo, Tiange, et al.
Publicado: (2025)
Hierarchical Invariance for Robust and Interpretable Vision Tasks at Larger Scales
por: Qi, Shuren, et al.
Publicado: (2024)
por: Qi, Shuren, et al.
Publicado: (2024)
Scaling Laws for Task-Optimized Models of the Primate Visual Ventral Stream
por: Gokce, Abdulkadir, et al.
Publicado: (2024)
por: Gokce, Abdulkadir, et al.
Publicado: (2024)
Generating a Biometrically Unique and Realistic Iris Database
por: Zhang, Jingxuan, et al.
Publicado: (2025)
por: Zhang, Jingxuan, et al.
Publicado: (2025)
WebCryptoAgent: Agentic Crypto Trading with Web Informatics
por: Kurban, Ali, et al.
Publicado: (2026)
por: Kurban, Ali, et al.
Publicado: (2026)
Tensor-Train Point Cloud Compression and Efficient Approximate Nearest-Neighbor Search
por: Novikov, Georgii, et al.
Publicado: (2024)
por: Novikov, Georgii, et al.
Publicado: (2024)
Vision Learners Meet Web Image-Text Pairs
por: Zhao, Bingchen, et al.
Publicado: (2023)
por: Zhao, Bingchen, et al.
Publicado: (2023)
Ejemplares similares
-
VisualWebArena: Evaluating Multimodal Agents on Realistic Visual Web Tasks
por: Koh, Jing Yu, et al.
Publicado: (2024) -
Weblica: Scalable and Reproducible Training Environments for Visual Web Agents
por: Kar, Oğuzhan Fatih, et al.
Publicado: (2026) -
OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents
por: Yang, Rui, et al.
Publicado: (2026) -
OceanGym: A Benchmark Environment for Underwater Embodied Agents
por: Xue, Yida, et al.
Publicado: (2025) -
WALT: Web Agents that Learn Tools
por: Prabhu, Viraj, et al.
Publicado: (2025)