SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents
Fuente:
arXiv
Guardado en:
| Autores principales: | Shen, Yujiong, Yang, Yajie, Xi, Zhiheng, Hu, Binze, Sha, Huayu, Zhang, Jiazheng, Peng, Qiyuan, Shang, Junlin, Huang, Jixuan, Fan, Yutao, Tong, Jingqi, Dou, Shihan, Zhang, Ming, Bai, Lei, Yin, Zhenfei, Gui, Tao, Ma, Xingjun, Zhang, Qi, Huang, Xuanjing, Jiang, Yu-Gang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LLMEval-Med: A Real-world Clinical Benchmark for Medical LLMs with Physician Validation
por: Zhang, Ming, et al.
Publicado: (2025)
por: Zhang, Ming, et al.
Publicado: (2025)
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
por: Xi, Zhiheng, et al.
Publicado: (2025)
por: Xi, Zhiheng, et al.
Publicado: (2025)
Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy Optimization
por: Wang, Junzhe, et al.
Publicado: (2026)
por: Wang, Junzhe, et al.
Publicado: (2026)
OpenNovelty: An LLM-powered Agentic System for Verifiable Scholarly Novelty Assessment
por: Zhang, Ming, et al.
Publicado: (2026)
por: Zhang, Ming, et al.
Publicado: (2026)
LLMEval-Fair: A Large-Scale Longitudinal Study on Robust and Fair Evaluation of Large Language Models
por: Zhang, Ming, et al.
Publicado: (2025)
por: Zhang, Ming, et al.
Publicado: (2025)
Beyond Scaling: Measuring and Predicting the Upper Bound of Knowledge Retention in Language Model Pre-Training
por: Jiang, Changhao, et al.
Publicado: (2025)
por: Jiang, Changhao, et al.
Publicado: (2025)
Can RL Improve Generalization of LLM Agents? An Empirical Study
por: Xi, Zhiheng, et al.
Publicado: (2026)
por: Xi, Zhiheng, et al.
Publicado: (2026)
JFTA-Bench: Evaluate LLM's Ability of Tracking and Analyzing Malfunctions Using Fault Trees
por: Wang, Yuhui, et al.
Publicado: (2026)
por: Wang, Yuhui, et al.
Publicado: (2026)
AgentGym: Evolving Large Language Model-based Agents across Diverse Environments
por: Xi, Zhiheng, et al.
Publicado: (2024)
por: Xi, Zhiheng, et al.
Publicado: (2024)
LLMEval-Logic: A Solver-Verified Chinese Benchmark for Logical Reasoning of LLMs with Adversarial Hardening
por: Zhang, Ming, et al.
Publicado: (2026)
por: Zhang, Ming, et al.
Publicado: (2026)
Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses
por: Lin, Jiahang, et al.
Publicado: (2026)
por: Lin, Jiahang, et al.
Publicado: (2026)
Compression Hacking: A Supplementary Perspective on Informatics Properties of Language Models from Geometric Distortion
por: Zang, Jianxiang, et al.
Publicado: (2025)
por: Zang, Jianxiang, et al.
Publicado: (2025)
SpeechRole: A Large-Scale Dataset and Benchmark for Evaluating Speech Role-Playing Agents
por: Jiang, Changhao, et al.
Publicado: (2025)
por: Jiang, Changhao, et al.
Publicado: (2025)
Can Deep Research Agents Retrieve and Organize? Evaluating the Synthesis Gap with Expert Taxonomies
por: Zhang, Ming, et al.
Publicado: (2026)
por: Zhang, Ming, et al.
Publicado: (2026)
TransferTOD: A Generalizable Chinese Multi-Domain Task-Oriented Dialogue System with Transfer Capabilities
por: Zhang, Ming, et al.
Publicado: (2024)
por: Zhang, Ming, et al.
Publicado: (2024)
Improving RL Exploration for LLM Reasoning through Retrospective Replay
por: Dou, Shihan, et al.
Publicado: (2025)
por: Dou, Shihan, et al.
Publicado: (2025)
AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress
por: Xi, Zhiheng, et al.
Publicado: (2025)
por: Xi, Zhiheng, et al.
Publicado: (2025)
DVPO: Distributional Value Modeling-based Policy Optimization for LLM Post-Training
por: Zhu, Dingwei, et al.
Publicado: (2025)
por: Zhu, Dingwei, et al.
Publicado: (2025)
SciToolAgent: A Knowledge Graph-Driven Scientific Agent for Multi-Tool Integration
por: Ding, Keyan, et al.
Publicado: (2025)
por: Ding, Keyan, et al.
Publicado: (2025)
DFPO: Scaling Value Modeling via Distributional Flow towards Robust and Generalizable LLM Post-Training
por: Zhu, Dingwei, et al.
Publicado: (2026)
por: Zhu, Dingwei, et al.
Publicado: (2026)
CodeChameleon: Personalized Encryption Framework for Jailbreaking Large Language Models
por: Lv, Huijie, et al.
Publicado: (2024)
por: Lv, Huijie, et al.
Publicado: (2024)
AgentV-RL: Scaling Reward Modeling with Agentic Verifier
por: Zhang, Jiazheng, et al.
Publicado: (2026)
por: Zhang, Jiazheng, et al.
Publicado: (2026)
SciAgent: A Unified Multi-Agent System for Generalistic Scientific Reasoning
por: Li, Xuchen, et al.
Publicado: (2025)
por: Li, Xuchen, et al.
Publicado: (2025)
MM-Doc-R1: Training Agents for Long Document Visual Question Answering through Multi-turn Reinforcement Learning
por: Lin, Jiahang, et al.
Publicado: (2026)
por: Lin, Jiahang, et al.
Publicado: (2026)
FRoM-W1: Towards General Humanoid Whole-Body Control with Language Instructions
por: Li, Peng, et al.
Publicado: (2026)
por: Li, Peng, et al.
Publicado: (2026)
SciNav: A General Agent Framework for Scientific Coding Tasks
por: Zhang, Tianshu, et al.
Publicado: (2026)
por: Zhang, Tianshu, et al.
Publicado: (2026)
Steering LLMs via Scalable Interactive Oversight
por: Zhou, Enyu, et al.
Publicado: (2026)
por: Zhou, Enyu, et al.
Publicado: (2026)
Subspace Defense: Discarding Adversarial Perturbations by Learning a Subspace for Clean Signals
por: Zheng, Rui, et al.
Publicado: (2024)
por: Zheng, Rui, et al.
Publicado: (2024)
PFDial: A Structured Dialogue Instruction Fine-tuning Method Based on UML Flowcharts
por: Zhang, Ming, et al.
Publicado: (2025)
por: Zhang, Ming, et al.
Publicado: (2025)
VRPO: Rethinking Value Modeling for Robust RL Training under Noisy Supervision
por: Zhu, Dingwei, et al.
Publicado: (2025)
por: Zhu, Dingwei, et al.
Publicado: (2025)
RoCoIns: Enhancing Robustness of Large Language Models through Code-Style Instructions
por: Zhang, Yuansen, et al.
Publicado: (2024)
por: Zhang, Yuansen, et al.
Publicado: (2024)
LabUtopia: High-Fidelity Simulation and Hierarchical Benchmark for Scientific Embodied Agents
por: Li, Rui, et al.
Publicado: (2025)
por: Li, Rui, et al.
Publicado: (2025)
Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment
por: Zhang, Jiazheng, et al.
Publicado: (2025)
por: Zhang, Jiazheng, et al.
Publicado: (2025)
NARRA-Gym for Evaluating Interactive Narrative Agents
por: Huang, Yue, et al.
Publicado: (2026)
por: Huang, Yue, et al.
Publicado: (2026)
Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control
por: Zhang, Jiazheng, et al.
Publicado: (2026)
por: Zhang, Jiazheng, et al.
Publicado: (2026)
From Scores to Preferences: Redefining MOS Benchmarking for Speech Quality Reward Modeling
por: Cao, Yifei, et al.
Publicado: (2025)
por: Cao, Yifei, et al.
Publicado: (2025)
EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training
por: Pan, Chengjun, et al.
Publicado: (2026)
por: Pan, Chengjun, et al.
Publicado: (2026)
LongAgent: Scaling Language Models to 128k Context through Multi-Agent Collaboration
por: Zhao, Jun, et al.
Publicado: (2024)
por: Zhao, Jun, et al.
Publicado: (2024)
Unlocking the Essence of Beauty: Advanced Aesthetic Reasoning with Relative-Absolute Policy Optimization
por: Liu, Boyang, et al.
Publicado: (2025)
por: Liu, Boyang, et al.
Publicado: (2025)
InnoGym: Benchmarking the Innovation Potential of AI Agents
por: Zhang, Jintian, et al.
Publicado: (2025)
por: Zhang, Jintian, et al.
Publicado: (2025)
Ejemplares similares
-
LLMEval-Med: A Real-world Clinical Benchmark for Medical LLMs with Physician Validation
por: Zhang, Ming, et al.
Publicado: (2025) -
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
por: Xi, Zhiheng, et al.
Publicado: (2025) -
Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy Optimization
por: Wang, Junzhe, et al.
Publicado: (2026) -
OpenNovelty: An LLM-powered Agentic System for Verifiable Scholarly Novelty Assessment
por: Zhang, Ming, et al.
Publicado: (2026) -
LLMEval-Fair: A Large-Scale Longitudinal Study on Robust and Fair Evaluation of Large Language Models
por: Zhang, Ming, et al.
Publicado: (2025)