MDGYM: Benchmarking AI Agents on Molecular Simulations
Fuente:
arXiv
Salvato in:
| Autori principali: | Kumar, Vinay, Rajput, Satyendra, Mausam, Krishnan, N. M. Anoop |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Agentic AI Scientists Are Not Built For Autonomous Scientific Discovery
di: Bisht, Harshit, et al.
Pubblicazione: (2026)
di: Bisht, Harshit, et al.
Pubblicazione: (2026)
Leveraging Text Guidance for Enhancing Demographic Fairness in Gender Classification
di: Krishnan, Anoop
Pubblicazione: (2025)
di: Krishnan, Anoop
Pubblicazione: (2025)
Are LLMs Ready for Real-World Materials Discovery?
di: Miret, Santiago, et al.
Pubblicazione: (2024)
di: Miret, Santiago, et al.
Pubblicazione: (2024)
Beyond Context Sharing: A Unified Agent Communication Protocol (ACP) for Secure, Federated, and Autonomous Agent-to-Agent (A2A) Orchestration
di: Krishnan, Naveen Kumar
Pubblicazione: (2026)
di: Krishnan, Naveen Kumar
Pubblicazione: (2026)
A Benchmark for Procedural Memory Retrieval in Language Agents
di: Kohar, Ishant, et al.
Pubblicazione: (2025)
di: Kohar, Ishant, et al.
Pubblicazione: (2025)
MarketBench: Evaluating AI Agents as Market Participants
di: Fradkin, Andrey, et al.
Pubblicazione: (2026)
di: Fradkin, Andrey, et al.
Pubblicazione: (2026)
Failure Modes in LLM Systems: A System-Level Taxonomy for Reliable AI Applications
di: Vinay, Vaishali
Pubblicazione: (2025)
di: Vinay, Vaishali
Pubblicazione: (2025)
Efficient Benchmarking of AI Agents
di: Ndzomga, Franck
Pubblicazione: (2026)
di: Ndzomga, Franck
Pubblicazione: (2026)
AxOMaP: Designing FPGA-based Approximate Arithmetic Operators using Mathematical Programming
di: Sahoo, Siva Satyendra, et al.
Pubblicazione: (2023)
di: Sahoo, Siva Satyendra, et al.
Pubblicazione: (2023)
Geak: Introducing Triton Kernel AI Agent & Evaluation Benchmarks
di: Wang, Jianghui, et al.
Pubblicazione: (2025)
di: Wang, Jianghui, et al.
Pubblicazione: (2025)
BEAMS: Benchmarking and Evaluating AI for Modeling and Simulation
di: Metcalf, Sara, et al.
Pubblicazione: (2026)
di: Metcalf, Sara, et al.
Pubblicazione: (2026)
PLACO: A Multi-Stage Framework for Cost-Effective Performance in Human-AI Teams
di: Mallela, Pranavkumar, et al.
Pubblicazione: (2026)
di: Mallela, Pranavkumar, et al.
Pubblicazione: (2026)
CoNO: Complex Neural Operator for Continous Dynamical Physical Systems
di: Tiwari, Karn, et al.
Pubblicazione: (2024)
di: Tiwari, Karn, et al.
Pubblicazione: (2024)
CodeAssistBench (CAB): Dataset & Benchmarking for Multi-turn Chat-Based Code Assistance
di: Kim, Myeongsoo, et al.
Pubblicazione: (2025)
di: Kim, Myeongsoo, et al.
Pubblicazione: (2025)
Iterative Repair with Weak Verifiers for Few-shot Transfer in KBQA with Unanswerability
di: Sawhney, Riya, et al.
Pubblicazione: (2024)
di: Sawhney, Riya, et al.
Pubblicazione: (2024)
GTM: Simulating the World of Tools for AI Agents
di: Ren, Zhenzhen, et al.
Pubblicazione: (2025)
di: Ren, Zhenzhen, et al.
Pubblicazione: (2025)
REAL: Benchmarking Autonomous Agents on Deterministic Simulations of Real Websites
di: Garg, Divyansh, et al.
Pubblicazione: (2025)
di: Garg, Divyansh, et al.
Pubblicazione: (2025)
Tu(r)ning AI Green: Exploring Energy Efficiency Cascading with Orthogonal Optimizations
di: Rajput, Saurabhsingh, et al.
Pubblicazione: (2025)
di: Rajput, Saurabhsingh, et al.
Pubblicazione: (2025)
OSUniverse: Benchmark for Multimodal GUI-navigation AI Agents
di: Davydova, Mariya, et al.
Pubblicazione: (2025)
di: Davydova, Mariya, et al.
Pubblicazione: (2025)
Impatient Users Confuse AI Agents: High-fidelity Simulations of Human Traits for Testing Agents
di: He, Muyu, et al.
Pubblicazione: (2025)
di: He, Muyu, et al.
Pubblicazione: (2025)
Sustainable Materials Discovery in the Era of Artificial Intelligence
di: Mannan, Sajid, et al.
Pubblicazione: (2026)
di: Mannan, Sajid, et al.
Pubblicazione: (2026)
AI scientists produce results without reasoning scientifically
di: Ríos-García, Martiño, et al.
Pubblicazione: (2026)
di: Ríos-García, Martiño, et al.
Pubblicazione: (2026)
Autonomous Microscopy Experiments through Large Language Model Agents
di: Mandal, Indrajeet, et al.
Pubblicazione: (2024)
di: Mandal, Indrajeet, et al.
Pubblicazione: (2024)
MatSKRAFT: A framework for large-scale materials knowledge extraction from scientific tables
di: Hira, Kausik, et al.
Pubblicazione: (2025)
di: Hira, Kausik, et al.
Pubblicazione: (2025)
Advancing Multi-Agent Systems Through Model Context Protocol: Architecture, Implementation, and Applications
di: Krishnan, Naveen
Pubblicazione: (2025)
di: Krishnan, Naveen
Pubblicazione: (2025)
Beyond Component Strength: Synergistic Integration and Adaptive Calibration in Multi-Agent RAG Systems
di: Krishnan, Jithin
Pubblicazione: (2025)
di: Krishnan, Jithin
Pubblicazione: (2025)
Edit, But Verify: An Empirical Audit of Instructed Code-Editing Benchmarks
di: Ebrahimi, Amir M., et al.
Pubblicazione: (2026)
di: Ebrahimi, Amir M., et al.
Pubblicazione: (2026)
Taxonomy and Consistency Analysis of Safety Benchmarks for AI Agents
di: Li, Miles Q., et al.
Pubblicazione: (2026)
di: Li, Miles Q., et al.
Pubblicazione: (2026)
On the Equivalence of Regression and Classification
di: Jayadeva, et al.
Pubblicazione: (2025)
di: Jayadeva, et al.
Pubblicazione: (2025)
A Benchmark for Evaluating Outcome-Driven Constraint Violations in Autonomous AI Agents
di: Li, Miles Q., et al.
Pubblicazione: (2025)
di: Li, Miles Q., et al.
Pubblicazione: (2025)
Energy & Force Regression on DFT Trajectories is Not Enough for Universal Machine Learning Interatomic Potentials
di: Miret, Santiago, et al.
Pubblicazione: (2025)
di: Miret, Santiago, et al.
Pubblicazione: (2025)
Simple Augmentations of Logical Rules for Neuro-Symbolic Knowledge Graph Completion
di: Nandi, Ananjan, et al.
Pubblicazione: (2024)
di: Nandi, Ananjan, et al.
Pubblicazione: (2024)
FCoReBench: Can Large Language Models Solve Challenging First-Order Combinatorial Reasoning Problems?
di: Mittal, Chinmay, et al.
Pubblicazione: (2024)
di: Mittal, Chinmay, et al.
Pubblicazione: (2024)
Agent-based Simulation with Netlogo to Evaluate AmI Scenarios
di: Carbo, J., et al.
Pubblicazione: (2024)
di: Carbo, J., et al.
Pubblicazione: (2024)
AI Agents: Evolution, Architecture, and Real-World Applications
di: Krishnan, Naveen
Pubblicazione: (2025)
di: Krishnan, Naveen
Pubblicazione: (2025)
ART: Action-based Reasoning Task Benchmarking for Medical AI Agents
di: Mantravadi, Ananya, et al.
Pubblicazione: (2026)
di: Mantravadi, Ananya, et al.
Pubblicazione: (2026)
$\texttt{YC-Bench}$: Benchmarking AI Agents for Long-Term Planning and Consistent Execution
di: He, Muyu, et al.
Pubblicazione: (2026)
di: He, Muyu, et al.
Pubblicazione: (2026)
HumanStudy-Bench: Towards AI Agent Design for Participant Simulation
di: Liu, Xuan, et al.
Pubblicazione: (2026)
di: Liu, Xuan, et al.
Pubblicazione: (2026)
From Assistant to Double Agent: Formalizing and Benchmarking Attacks on OpenClaw for Personalized Local AI Agent
di: Wang, Yuhang, et al.
Pubblicazione: (2026)
di: Wang, Yuhang, et al.
Pubblicazione: (2026)
Position: Behavioural Assurance Cannot Verify the Safety Claims Governance Now Demands
di: Seth, Pratinav, et al.
Pubblicazione: (2026)
di: Seth, Pratinav, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Agentic AI Scientists Are Not Built For Autonomous Scientific Discovery
di: Bisht, Harshit, et al.
Pubblicazione: (2026) -
Leveraging Text Guidance for Enhancing Demographic Fairness in Gender Classification
di: Krishnan, Anoop
Pubblicazione: (2025) -
Are LLMs Ready for Real-World Materials Discovery?
di: Miret, Santiago, et al.
Pubblicazione: (2024) -
Beyond Context Sharing: A Unified Agent Communication Protocol (ACP) for Secure, Federated, and Autonomous Agent-to-Agent (A2A) Orchestration
di: Krishnan, Naveen Kumar
Pubblicazione: (2026) -
A Benchmark for Procedural Memory Retrieval in Language Agents
di: Kohar, Ishant, et al.
Pubblicazione: (2025)