InfiniteScienceGym: An Unbounded, Procedurally-Generated Benchmark for Scientific Analysis
Fuente:
arXiv
Salvato in:
| Autori principali: | Bentham, Oliver, Srikumar, Vivek |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Chain-of-Thought Unfaithfulness as Disguised Accuracy
di: Bentham, Oliver, et al.
Pubblicazione: (2024)
di: Bentham, Oliver, et al.
Pubblicazione: (2024)
Beyond Perplexity: Multi-dimensional Safety Evaluation of LLM Compression
di: Xu, Zhichao, et al.
Pubblicazione: (2024)
di: Xu, Zhichao, et al.
Pubblicazione: (2024)
PreScience: A Benchmark for Forecasting Scientific Contributions
di: Ajith, Anirudh, et al.
Pubblicazione: (2026)
di: Ajith, Anirudh, et al.
Pubblicazione: (2026)
AMemGym: Interactive Memory Benchmarking for Assistants in Long-Horizon Conversations
di: Jiayang, Cheng, et al.
Pubblicazione: (2026)
di: Jiayang, Cheng, et al.
Pubblicazione: (2026)
Unbounded: A Generative Infinite Game of Character Life Simulation
di: Li, Jialu, et al.
Pubblicazione: (2024)
di: Li, Jialu, et al.
Pubblicazione: (2024)
HQFS: Hybrid Quantum Classical Financial Security with VQC Forecasting, QUBO Annealing, and Audit-Ready Post-Quantum Signing
di: Nayak, Srikumar
Pubblicazione: (2026)
di: Nayak, Srikumar
Pubblicazione: (2026)
Named Entity Recognition for Payment Data Using NLP
di: Nayak, Srikumar
Pubblicazione: (2026)
di: Nayak, Srikumar
Pubblicazione: (2026)
Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests
di: Noever, David, et al.
Pubblicazione: (2025)
di: Noever, David, et al.
Pubblicazione: (2025)
MMAI Gym for Science: Training Liquid Foundation Models for Drug Discovery
di: Kuznetsov, Maksim, et al.
Pubblicazione: (2026)
di: Kuznetsov, Maksim, et al.
Pubblicazione: (2026)
HeuriGym: An Agentic Benchmark for LLM-Crafted Heuristics in Combinatorial Optimization
di: Chen, Hongzheng, et al.
Pubblicazione: (2025)
di: Chen, Hongzheng, et al.
Pubblicazione: (2025)
CausalGym: Benchmarking causal interpretability methods on linguistic tasks
di: Arora, Aryaman, et al.
Pubblicazione: (2024)
di: Arora, Aryaman, et al.
Pubblicazione: (2024)
VisScience: An Extensive Benchmark for Evaluating K12 Educational Multi-modal Scientific Reasoning
di: Jiang, Zhihuan, et al.
Pubblicazione: (2024)
di: Jiang, Zhihuan, et al.
Pubblicazione: (2024)
Can AI Validate Science? Benchmarking LLMs for Accurate Scientific Claim $\rightarrow$ Evidence Reasoning
di: Javaji, Shashidhar Reddy, et al.
Pubblicazione: (2025)
di: Javaji, Shashidhar Reddy, et al.
Pubblicazione: (2025)
RLShield: Practical Multi-Agent RL for Financial Cyber Defense with Attack-Surface MDPs and Real-Time Response Orchestration
di: Nayak, Srikumar
Pubblicazione: (2026)
di: Nayak, Srikumar
Pubblicazione: (2026)
Children's Intelligence Tests Pose Challenges for MLLMs? KidGym: A 2D Grid-Based Reasoning Benchmark for MLLMs
di: Ye, Hengwei, et al.
Pubblicazione: (2026)
di: Ye, Hengwei, et al.
Pubblicazione: (2026)
Pairing Analogy-Augmented Generation with Procedural Memory for Procedural Q&A
di: Roth, K, et al.
Pubblicazione: (2024)
di: Roth, K, et al.
Pubblicazione: (2024)
SciRerankBench: Benchmarking Rerankers Towards Scientific Retrieval-Augmented Generated LLMs
di: Chen, Haotian, et al.
Pubblicazione: (2025)
di: Chen, Haotian, et al.
Pubblicazione: (2025)
WebDS: An End-to-End Benchmark for Web-based Data Science
di: Hsu, Ethan, et al.
Pubblicazione: (2025)
di: Hsu, Ethan, et al.
Pubblicazione: (2025)
GEM: A Gym for Agentic LLMs
di: Liu, Zichen, et al.
Pubblicazione: (2025)
di: Liu, Zichen, et al.
Pubblicazione: (2025)
DataEnvGym: Data Generation Agents in Teacher Environments with Student Feedback
di: Khan, Zaid, et al.
Pubblicazione: (2024)
di: Khan, Zaid, et al.
Pubblicazione: (2024)
ELF-Gym: Evaluating Large Language Models Generated Features for Tabular Prediction
di: Zhang, Yanlin, et al.
Pubblicazione: (2024)
di: Zhang, Yanlin, et al.
Pubblicazione: (2024)
OceanGym: A Benchmark Environment for Underwater Embodied Agents
di: Xue, Yida, et al.
Pubblicazione: (2025)
di: Xue, Yida, et al.
Pubblicazione: (2025)
InnoGym: Benchmarking the Innovation Potential of AI Agents
di: Zhang, Jintian, et al.
Pubblicazione: (2025)
di: Zhang, Jintian, et al.
Pubblicazione: (2025)
EcoGym: Evaluating LLMs for Long-Horizon Plan-and-Execute in Interactive Economies
di: Hu, Xavier, et al.
Pubblicazione: (2026)
di: Hu, Xavier, et al.
Pubblicazione: (2026)
MedAgentGym: A Scalable Agentic Training Environment for Code-Centric Reasoning in Biomedical Data Science
di: Xu, Ran, et al.
Pubblicazione: (2025)
di: Xu, Ran, et al.
Pubblicazione: (2025)
PersonaGym: Evaluating Persona Agents and LLMs
di: Samuel, Vinay, et al.
Pubblicazione: (2024)
di: Samuel, Vinay, et al.
Pubblicazione: (2024)
Proof of Time: A Benchmark for Evaluating Scientific Idea Judgments
di: Ye, Bingyang, et al.
Pubblicazione: (2026)
di: Ye, Bingyang, et al.
Pubblicazione: (2026)
FML-bench: Benchmarking Machine Learning Agents for Scientific Research
di: Zou, Qiran, et al.
Pubblicazione: (2025)
di: Zou, Qiran, et al.
Pubblicazione: (2025)
Benchmarking Data Science Agents
di: Zhang, Yuge, et al.
Pubblicazione: (2024)
di: Zhang, Yuge, et al.
Pubblicazione: (2024)
AgentGym: Evolving Large Language Model-based Agents across Diverse Environments
di: Xi, Zhiheng, et al.
Pubblicazione: (2024)
di: Xi, Zhiheng, et al.
Pubblicazione: (2024)
TherapyGym: Evaluating and Aligning Clinical Fidelity and Safety in Therapy Chatbots
di: Huang, Fangrui, et al.
Pubblicazione: (2026)
di: Huang, Fangrui, et al.
Pubblicazione: (2026)
SurGE: A Benchmark and Evaluation Framework for Scientific Survey Generation
di: Su, Weihang, et al.
Pubblicazione: (2025)
di: Su, Weihang, et al.
Pubblicazione: (2025)
Science Across Languages: Assessing LLM Multilingual Translation of Scientific Papers
di: Kleidermacher, Hannah Calzi, et al.
Pubblicazione: (2025)
di: Kleidermacher, Hannah Calzi, et al.
Pubblicazione: (2025)
Mind the Gap Between Spatial Reasoning and Acting! Step-by-Step Evaluation of Agents With Spatial-Gym
di: Kaesberg, Lars Benedikt, et al.
Pubblicazione: (2026)
di: Kaesberg, Lars Benedikt, et al.
Pubblicazione: (2026)
Verus-SpecGym: An Agentic Environment for Evaluating Specification Autoformalization
di: Agarwal, Anmol, et al.
Pubblicazione: (2026)
di: Agarwal, Anmol, et al.
Pubblicazione: (2026)
InfiniSST: Simultaneous Translation of Unbounded Speech with Large Language Model
di: Ouyang, Siqi, et al.
Pubblicazione: (2025)
di: Ouyang, Siqi, et al.
Pubblicazione: (2025)
DA-Code: Agent Data Science Code Generation Benchmark for Large Language Models
di: Huang, Yiming, et al.
Pubblicazione: (2024)
di: Huang, Yiming, et al.
Pubblicazione: (2024)
A Benchmark for Procedural Memory Retrieval in Language Agents
di: Kohar, Ishant, et al.
Pubblicazione: (2025)
di: Kohar, Ishant, et al.
Pubblicazione: (2025)
MASSW: A New Dataset and Benchmark Tasks for AI-Assisted Scientific Workflows
di: Zhang, Xingjian, et al.
Pubblicazione: (2024)
di: Zhang, Xingjian, et al.
Pubblicazione: (2024)
EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs
di: Xu, Wanghan, et al.
Pubblicazione: (2025)
di: Xu, Wanghan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Chain-of-Thought Unfaithfulness as Disguised Accuracy
di: Bentham, Oliver, et al.
Pubblicazione: (2024) -
Beyond Perplexity: Multi-dimensional Safety Evaluation of LLM Compression
di: Xu, Zhichao, et al.
Pubblicazione: (2024) -
PreScience: A Benchmark for Forecasting Scientific Contributions
di: Ajith, Anirudh, et al.
Pubblicazione: (2026) -
AMemGym: Interactive Memory Benchmarking for Assistants in Long-Horizon Conversations
di: Jiayang, Cheng, et al.
Pubblicazione: (2026) -
Unbounded: A Generative Infinite Game of Character Life Simulation
di: Li, Jialu, et al.
Pubblicazione: (2024)