D3-Gym: Constructing Real-World Verifiable Environments for Data-Driven Discovery
Fuente:
arXiv
Guardado en:
| Autores principales: | Moussa, Hanane Nour, Li, Yifei, Li, Zhuoyang, Yang, Yankai, Tang, Cheng, Zhang, Tianshu, Ahmed, Nesreen K., Payani, Ali, Chen, Ziru, Sun, Huan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AutoSDT: Scaling Data-Driven Discovery Tasks Toward Open Co-Scientists
por: Li, Yifei, et al.
Publicado: (2025)
por: Li, Yifei, et al.
Publicado: (2025)
Toxicity and Tolerability of the OEPA/COPDAC Regimen in Children and Adolescents With Hodgkin Lymphoma: A Real‐World Experience
por: Hala Bekhit, et al.
Publicado: (2025)
por: Hala Bekhit, et al.
Publicado: (2025)
When is Tree Search Useful for LLM Planning? It Depends on the Discriminator
por: Chen, Ziru, et al.
Publicado: (2024)
por: Chen, Ziru, et al.
Publicado: (2024)
WorldGym: World Model as An Environment for Policy Evaluation
por: Quevedo, Julian, et al.
Publicado: (2025)
por: Quevedo, Julian, et al.
Publicado: (2025)
CUA-Gym: Scaling Verifiable Training Environments and Tasks for Computer-Use Agents
por: Wang, Bowen, et al.
Publicado: (2026)
por: Wang, Bowen, et al.
Publicado: (2026)
TableLlama: Towards Open Large Generalist Models for Tables
por: Zhang, Tianshu, et al.
Publicado: (2023)
por: Zhang, Tianshu, et al.
Publicado: (2023)
SWE-Universe: Scale Real-World Verifiable Environments to Millions
por: Chen, Mouxiang, et al.
Publicado: (2026)
por: Chen, Mouxiang, et al.
Publicado: (2026)
UserBench: An Interactive Gym Environment for User-Centric Agents
por: Qian, Cheng, et al.
Publicado: (2025)
por: Qian, Cheng, et al.
Publicado: (2025)
SearchGym: Bootstrapping Real-World Search Agents via Cost-Effective and High-Fidelity Environment Simulation
por: Zhang, Xichen, et al.
Publicado: (2026)
por: Zhang, Xichen, et al.
Publicado: (2026)
Training Software Engineering Agents and Verifiers with SWE-Gym
por: Pan, Jiayi, et al.
Publicado: (2024)
por: Pan, Jiayi, et al.
Publicado: (2024)
R2E-Gym: Procedural Environments and Hybrid Verifiers for Scaling Open-Weights SWE Agents
por: Jain, Naman, et al.
Publicado: (2025)
por: Jain, Naman, et al.
Publicado: (2025)
The Station: An Open-World Environment for AI-Driven Discovery
por: Chung, Stephen, et al.
Publicado: (2025)
por: Chung, Stephen, et al.
Publicado: (2025)
The Station: An Open-World Environment for AI-Driven Discovery
por: Chung, Stephen, et al.
Publicado: (2025)
por: Chung, Stephen, et al.
Publicado: (2025)
Severe Domain Shift in Skeleton-Based Action Recognition:A Study of Uncertainty Failure in Real-World Gym Environments
por: Khanal, Aaditya, et al.
Publicado: (2026)
por: Khanal, Aaditya, et al.
Publicado: (2026)
Multilingual Reasoning Gym: Multilingual Scaling of Procedural Reasoning Environments
por: Dobler, Konstantin, et al.
Publicado: (2026)
por: Dobler, Konstantin, et al.
Publicado: (2026)
PC-Gym: Benchmark Environments For Process Control Problems
por: Bloor, Maximilian, et al.
Publicado: (2024)
por: Bloor, Maximilian, et al.
Publicado: (2024)
ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery
por: Chen, Ziru, et al.
Publicado: (2024)
por: Chen, Ziru, et al.
Publicado: (2024)
BoxingGym: Benchmarking Progress in Automated Experimental Design and Model Discovery
por: Gandhi, Kanishk, et al.
Publicado: (2025)
por: Gandhi, Kanishk, et al.
Publicado: (2025)
Graffiti and the Discursive Construction of Fitness in Gyms
por: Raymond Echitchi
Publicado: (2022)
por: Raymond Echitchi
Publicado: (2022)
Deliberate Reasoning in Language Models as Structure-Aware Planning with an Accurate World Model
por: Xiong, Siheng, et al.
Publicado: (2024)
por: Xiong, Siheng, et al.
Publicado: (2024)
DataEnvGym: Data Generation Agents in Teacher Environments with Student Feedback
por: Khan, Zaid, et al.
Publicado: (2024)
por: Khan, Zaid, et al.
Publicado: (2024)
CyberGym: Evaluating AI Agents' Real-World Cybersecurity Capabilities at Scale
por: Wang, Zhun, et al.
Publicado: (2025)
por: Wang, Zhun, et al.
Publicado: (2025)
ResearchGym: Evaluating Language Model Agents on Real-World AI Research
por: Garikaparthi, Aniketh, et al.
Publicado: (2026)
por: Garikaparthi, Aniketh, et al.
Publicado: (2026)
Effect of Activation Mode on the Use of Black Slag in Cementitious Materials for Ecological and Sustainable Construction
por: Hanane Zadri, et al.
Publicado: (2026)
por: Hanane Zadri, et al.
Publicado: (2026)
EO-Gym: A Multimodal, Interactive Environment for Earth Observation Agents
por: Ma, Sai, et al.
Publicado: (2026)
por: Ma, Sai, et al.
Publicado: (2026)
Data-Efficient Contrastive Language-Image Pretraining: Prioritizing Data Quality over Quantity
por: Joshi, Siddharth, et al.
Publicado: (2024)
por: Joshi, Siddharth, et al.
Publicado: (2024)
Agent-ToM: Learning to Monitor Autonomous LLM Agents via Theory-of-Mind Reasoning
por: Ahmed, Nesreen K., et al.
Publicado: (2026)
por: Ahmed, Nesreen K., et al.
Publicado: (2026)
Gym4ReaL: A Suite for Benchmarking Real-World Reinforcement Learning
por: Salaorni, Davide, et al.
Publicado: (2025)
por: Salaorni, Davide, et al.
Publicado: (2025)
Online Dynamic Goal Recognition in Gym Environments
por: Matan, Shamir, et al.
Publicado: (2025)
por: Matan, Shamir, et al.
Publicado: (2025)
pyRDDLGym: From RDDL to Gym Environments
por: Taitler, Ayal, et al.
Publicado: (2022)
por: Taitler, Ayal, et al.
Publicado: (2022)
AExGym: Benchmarks and Environments for Adaptive Experimentation
por: Wang, Jimmy, et al.
Publicado: (2024)
por: Wang, Jimmy, et al.
Publicado: (2024)
HistoGym: A Reinforcement Learning Environment for Histopathological Image Analysis
por: Liu, Zhi-Bo, et al.
Publicado: (2024)
por: Liu, Zhi-Bo, et al.
Publicado: (2024)
EntWorld: A Holistic Environment and Benchmark for Verifiable Enterprise GUI Agents
por: Mo, Ying, et al.
Publicado: (2026)
por: Mo, Ying, et al.
Publicado: (2026)
The Landscape of Causal Discovery Data: Grounding Causal Discovery in Real-World Applications
por: Brouillard, Philippe, et al.
Publicado: (2024)
por: Brouillard, Philippe, et al.
Publicado: (2024)
SciNav: A General Agent Framework for Scientific Coding Tasks
por: Zhang, Tianshu, et al.
Publicado: (2026)
por: Zhang, Tianshu, et al.
Publicado: (2026)
Gym-Anything: Turn any Software into an Agent Environment
por: Aggarwal, Pranjal, et al.
Publicado: (2026)
por: Aggarwal, Pranjal, et al.
Publicado: (2026)
Customizing Emotional Support: How Do Individuals Construct and Interact With LLM-Powered Chatbots
por: Zheng, Xi, et al.
Publicado: (2025)
por: Zheng, Xi, et al.
Publicado: (2025)
Design Challenges for Robots in Industrial Applications
por: Mufid, Nesreen
Publicado: (2024)
por: Mufid, Nesreen
Publicado: (2024)
A Novel Approach to Process Discovery with Enhanced Loop Handling
por: Eldin, Ali Nour, et al.
Publicado: (2024)
por: Eldin, Ali Nour, et al.
Publicado: (2024)
ConvergeWriter: Data-Driven Bottom-Up Article Construction
por: Ji, Binquan, et al.
Publicado: (2025)
por: Ji, Binquan, et al.
Publicado: (2025)
Ejemplares similares
-
AutoSDT: Scaling Data-Driven Discovery Tasks Toward Open Co-Scientists
por: Li, Yifei, et al.
Publicado: (2025) -
Toxicity and Tolerability of the OEPA/COPDAC Regimen in Children and Adolescents With Hodgkin Lymphoma: A Real‐World Experience
por: Hala Bekhit, et al.
Publicado: (2025) -
When is Tree Search Useful for LLM Planning? It Depends on the Discriminator
por: Chen, Ziru, et al.
Publicado: (2024) -
WorldGym: World Model as An Environment for Policy Evaluation
por: Quevedo, Julian, et al.
Publicado: (2025) -
CUA-Gym: Scaling Verifiable Training Environments and Tasks for Computer-Use Agents
por: Wang, Bowen, et al.
Publicado: (2026)