MedAgentGym: A Scalable Agentic Training Environment for Code-Centric Reasoning in Biomedical Data Science
Fuente:
arXiv
Guardado en:
| Autores principales: | Xu, Ran, Zhuang, Yuchen, Zhong, Yishan, Yu, Yue, Wang, Zifeng, Tang, Xiangru, Wu, Hang, Wang, May D., Ruan, Peifeng, Yang, Donghan, Wang, Tao, Xiao, Guanghua, Liu, Xin, Yang, Carl, Xie, Yang, Shi, Wenqi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MedAdapter: Efficient Test-Time Adaptation of Large Language Models towards Medical Reasoning
por: Shi, Wenqi, et al.
Publicado: (2024)
por: Shi, Wenqi, et al.
Publicado: (2024)
BMRetriever: Tuning Large Language Models as Better Biomedical Text Retrievers
por: Xu, Ran, et al.
Publicado: (2024)
por: Xu, Ran, et al.
Publicado: (2024)
MEDVISTAGYM: A Scalable Training Environment for Thinking with Medical Images via Tool-Integrated Reinforcement Learning
por: Lu, Meng, et al.
Publicado: (2026)
por: Lu, Meng, et al.
Publicado: (2026)
CLI-Gym: Scalable CLI Task Generation via Agentic Environment Inversion
por: Lin, Yusong, et al.
Publicado: (2026)
por: Lin, Yusong, et al.
Publicado: (2026)
RAG in the Wild: On the (In)effectiveness of LLMs with Mixture-of-Knowledge Retrieval Augmentation
por: Xu, Ran, et al.
Publicado: (2025)
por: Xu, Ran, et al.
Publicado: (2025)
Scaling Agentic Reinforcement Learning for Tool-Integrated Reasoning in VLMs
por: Lu, Meng, et al.
Publicado: (2025)
por: Lu, Meng, et al.
Publicado: (2025)
EHRAgent: Code Empowers Large Language Models for Few-shot Complex Tabular Reasoning on Electronic Health Records
por: Shi, Wenqi, et al.
Publicado: (2024)
por: Shi, Wenqi, et al.
Publicado: (2024)
RAM-EHR: Retrieval Augmentation Meets Clinical Predictions on Electronic Health Records
por: Xu, Ran, et al.
Publicado: (2024)
por: Xu, Ran, et al.
Publicado: (2024)
UserBench: An Interactive Gym Environment for User-Centric Agents
por: Qian, Cheng, et al.
Publicado: (2025)
por: Qian, Cheng, et al.
Publicado: (2025)
Collab-RAG: Boosting Retrieval-Augmented Generation for Complex Question Answering via White-Box and Black-Box LLM Collaboration
por: Xu, Ran, et al.
Publicado: (2025)
por: Xu, Ran, et al.
Publicado: (2025)
GEM: A Gym for Agentic LLMs
por: Liu, Zichen, et al.
Publicado: (2025)
por: Liu, Zichen, et al.
Publicado: (2025)
BioDSA-1K: Benchmarking Data Science Agents for Biomedical Research
por: Wang, Zifeng, et al.
Publicado: (2025)
por: Wang, Zifeng, et al.
Publicado: (2025)
VisGym: Diverse, Customizable, Scalable Environments for Multimodal Agents
por: Wang, Zirui, et al.
Publicado: (2026)
por: Wang, Zirui, et al.
Publicado: (2026)
BioMedJImpact: A Comprehensive Dataset and LLM Pipeline for AI Engagement and Scientific Impact Analysis of Biomedical Journals
por: Wang, Ruiyu, et al.
Publicado: (2025)
por: Wang, Ruiyu, et al.
Publicado: (2025)
Can Large Language Models Replace Data Scientists in Biomedical Research?
por: Wang, Zifeng, et al.
Publicado: (2024)
por: Wang, Zifeng, et al.
Publicado: (2024)
Verus-SpecGym: An Agentic Environment for Evaluating Specification Autoformalization
por: Agarwal, Anmol, et al.
Publicado: (2026)
por: Agarwal, Anmol, et al.
Publicado: (2026)
ClawGym: A Scalable Framework for Building Effective Claw Agents
por: Bai, Fei, et al.
Publicado: (2026)
por: Bai, Fei, et al.
Publicado: (2026)
MedTrust-RAG: Evidence Verification and Trust Alignment for Biomedical Question Answering
por: Ning, Yingpeng, et al.
Publicado: (2025)
por: Ning, Yingpeng, et al.
Publicado: (2025)
Med-V1: Small Language Models for Zero-shot and Scalable Biomedical Evidence Attribution
por: Jin, Qiao, et al.
Publicado: (2026)
por: Jin, Qiao, et al.
Publicado: (2026)
EconGym: A Scalable AI Testbed with Diverse Economic Tasks
por: Mi, Qirui, et al.
Publicado: (2025)
por: Mi, Qirui, et al.
Publicado: (2025)
AceSearcher: Bootstrapping Reasoning and Search for LLMs via Reinforced Self-Play
por: Xu, Ran, et al.
Publicado: (2025)
por: Xu, Ran, et al.
Publicado: (2025)
MedRAGChecker: Claim-Level Verification for Biomedical Retrieval-Augmented Generation
por: Ji, Yuelyu, et al.
Publicado: (2026)
por: Ji, Yuelyu, et al.
Publicado: (2026)
AExGym: Benchmarks and Environments for Adaptive Experimentation
por: Wang, Jimmy, et al.
Publicado: (2024)
por: Wang, Jimmy, et al.
Publicado: (2024)
WorldGym: World Model as An Environment for Policy Evaluation
por: Quevedo, Julian, et al.
Publicado: (2025)
por: Quevedo, Julian, et al.
Publicado: (2025)
Gym-V: A Unified Vision Environment System for Agentic Vision Research
por: Meng, Fanqing, et al.
Publicado: (2026)
por: Meng, Fanqing, et al.
Publicado: (2026)
6GAgentGym: Tool Use, Data Synthesis, and Agentic Learning for Network Management
por: Chen, Jiao, et al.
Publicado: (2026)
por: Chen, Jiao, et al.
Publicado: (2026)
DeepEvidence: Empowering Biomedical Discovery with Deep Knowledge Graph Research
por: Wang, Zifeng, et al.
Publicado: (2025)
por: Wang, Zifeng, et al.
Publicado: (2025)
Advancing Problem-Based Learning in Biomedical Engineering in the Era of Generative AI
por: Nnamdi, Micky C., et al.
Publicado: (2025)
por: Nnamdi, Micky C., et al.
Publicado: (2025)
Agentic-MME: What Agentic Capability Really Brings to Multimodal Intelligence?
por: Wei, Qianshan, et al.
Publicado: (2026)
por: Wei, Qianshan, et al.
Publicado: (2026)
CellForge: Agentic Design of Virtual Cell Models
por: Tang, Xiangru, et al.
Publicado: (2025)
por: Tang, Xiangru, et al.
Publicado: (2025)
Knowledge-Infused Prompting: Assessing and Advancing Clinical Text Data Generation with Large Language Models
por: Xu, Ran, et al.
Publicado: (2023)
por: Xu, Ran, et al.
Publicado: (2023)
ScholarGym: Benchmarking Large Language Model Capabilities in the Information-Gathering Stage of Deep Research
por: Shen, Hao, et al.
Publicado: (2026)
por: Shen, Hao, et al.
Publicado: (2026)
EnterpriseOps-Gym: Environments and Evaluations for Stateful Agentic Planning and Tool Use in Enterprise Settings
por: Malay, Shiva Krishna Reddy, et al.
Publicado: (2026)
por: Malay, Shiva Krishna Reddy, et al.
Publicado: (2026)
DEEPMED: Building a Medical DeepResearch Agent via Multi-hop Med-Search Data and Turn-Controlled Agentic Training & Inference
por: Wang, Zihan, et al.
Publicado: (2026)
por: Wang, Zihan, et al.
Publicado: (2026)
EO-Gym: A Multimodal, Interactive Environment for Earth Observation Agents
por: Ma, Sai, et al.
Publicado: (2026)
por: Ma, Sai, et al.
Publicado: (2026)
EduGym: An Environment and Notebook Suite for Reinforcement Learning Education
por: Moerland, Thomas M., et al.
Publicado: (2023)
por: Moerland, Thomas M., et al.
Publicado: (2023)
HeuriGym: An Agentic Benchmark for LLM-Crafted Heuristics in Combinatorial Optimization
por: Chen, Hongzheng, et al.
Publicado: (2025)
por: Chen, Hongzheng, et al.
Publicado: (2025)
GAS-MIL: Group-Aggregative Selection Multi-Instance Learning for Ensemble of Foundation Models in Digital Pathology Image Analysis
por: Quan, Peiran, et al.
Publicado: (2025)
por: Quan, Peiran, et al.
Publicado: (2025)
DevOps-Gym: Benchmarking AI Agents in Software DevOps Cycle
por: Tang, Yuheng, et al.
Publicado: (2026)
por: Tang, Yuheng, et al.
Publicado: (2026)
HistoGym: A Reinforcement Learning Environment for Histopathological Image Analysis
por: Liu, Zhi-Bo, et al.
Publicado: (2024)
por: Liu, Zhi-Bo, et al.
Publicado: (2024)
Ejemplares similares
-
MedAdapter: Efficient Test-Time Adaptation of Large Language Models towards Medical Reasoning
por: Shi, Wenqi, et al.
Publicado: (2024) -
BMRetriever: Tuning Large Language Models as Better Biomedical Text Retrievers
por: Xu, Ran, et al.
Publicado: (2024) -
MEDVISTAGYM: A Scalable Training Environment for Thinking with Medical Images via Tool-Integrated Reinforcement Learning
por: Lu, Meng, et al.
Publicado: (2026) -
CLI-Gym: Scalable CLI Task Generation via Agentic Environment Inversion
por: Lin, Yusong, et al.
Publicado: (2026) -
RAG in the Wild: On the (In)effectiveness of LLMs with Mixture-of-Knowledge Retrieval Augmentation
por: Xu, Ran, et al.
Publicado: (2025)