EnterpriseBench Corecraft: Training Generalizable Agents on High-Fidelity RL Environments
Fuente:
arXiv
Salvato in:
| Autori principali: | Mehta, Sushant, Ritchie, Logan, Garre, Suhaas, Niebres, Ian, Heiner, Nick, Chen, Edwin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
The Hierarchy of Agentic Capabilities: Evaluating Frontier Models on Realistic RL Environments
di: Ritchie, Logan, et al.
Pubblicazione: (2026)
di: Ritchie, Logan, et al.
Pubblicazione: (2026)
Riemann-Bench: A Benchmark for Moonshot Mathematics
di: Garre, Suhaas, et al.
Pubblicazione: (2026)
di: Garre, Suhaas, et al.
Pubblicazione: (2026)
Beyond Accuracy: A Multi-Dimensional Framework for Evaluating Enterprise Agentic AI Systems
di: Mehta, Sushant
Pubblicazione: (2025)
di: Mehta, Sushant
Pubblicazione: (2025)
MATRAG: Multi-Agent Transparent Retrieval-Augmented Generation for Explainable Recommendations
di: Mehta, Sushant
Pubblicazione: (2026)
di: Mehta, Sushant
Pubblicazione: (2026)
Beyond Surface-Level Similarity: Hierarchical Contamination Detection for Synthetic Training Data in Foundation Models
di: Mehta, Sushant
Pubblicazione: (2025)
di: Mehta, Sushant
Pubblicazione: (2025)
Agent^2 RL-Bench: Can LLM Agents Engineer Agentic RL Post-Training?
di: Chen, Wanyi, et al.
Pubblicazione: (2026)
di: Chen, Wanyi, et al.
Pubblicazione: (2026)
When Are Learning Biases Equivalent? A Unifying Framework for Fairness, Robustness, and Distribution Shift
di: Mehta, Sushant
Pubblicazione: (2025)
di: Mehta, Sushant
Pubblicazione: (2025)
HELM: A Human-Centered Evaluation Framework for LLM-Powered Recommender Systems
di: Mehta, Sushant
Pubblicazione: (2026)
di: Mehta, Sushant
Pubblicazione: (2026)
Scaling Laws and In-Context Learning: A Unified Theoretical Framework
di: Mehta, Sushant, et al.
Pubblicazione: (2025)
di: Mehta, Sushant, et al.
Pubblicazione: (2025)
SkyRL-Agent: Efficient RL Training for Multi-turn LLM Agent
di: Cao, Shiyi, et al.
Pubblicazione: (2025)
di: Cao, Shiyi, et al.
Pubblicazione: (2025)
Towards Generalizable Agents in Text-Based Educational Environments: A Study of Integrating RL with LLMs
di: Radmehr, Bahar, et al.
Pubblicazione: (2024)
di: Radmehr, Bahar, et al.
Pubblicazione: (2024)
TermiGen: High-Fidelity Environment and Robust Trajectory Synthesis for Terminal Agents
di: Zhu, Kaijie, et al.
Pubblicazione: (2026)
di: Zhu, Kaijie, et al.
Pubblicazione: (2026)
NewtonBench: Benchmarking Generalizable Scientific Law Discovery in LLM Agents
di: Zheng, Tianshi, et al.
Pubblicazione: (2025)
di: Zheng, Tianshi, et al.
Pubblicazione: (2025)
Scalable Environments Drive Generalizable Agents
di: Zhang, Jiayi, et al.
Pubblicazione: (2026)
di: Zhang, Jiayi, et al.
Pubblicazione: (2026)
EntWorld: A Holistic Environment and Benchmark for Verifiable Enterprise GUI Agents
di: Mo, Ying, et al.
Pubblicazione: (2026)
di: Mo, Ying, et al.
Pubblicazione: (2026)
ProRL Agent: Rollout-as-a-Service for RL Training of Multi-Turn LLM Agents
di: Zhang, Hao, et al.
Pubblicazione: (2026)
di: Zhang, Hao, et al.
Pubblicazione: (2026)
Thinking About Thinking: Evaluating Reasoning in Post-Trained Language Models
di: Singla, Pratham, et al.
Pubblicazione: (2025)
di: Singla, Pratham, et al.
Pubblicazione: (2025)
LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks
di: Chandwani, Abhishek, et al.
Pubblicazione: (2026)
di: Chandwani, Abhishek, et al.
Pubblicazione: (2026)
AgentDistill: Training-Free Agent Distillation with Generalizable MCP Boxes
di: Qiu, Jiahao, et al.
Pubblicazione: (2025)
di: Qiu, Jiahao, et al.
Pubblicazione: (2025)
Quantifying the Privacy Implications of High-Fidelity Synthetic Network Traffic
di: Tran, Van, et al.
Pubblicazione: (2025)
di: Tran, Van, et al.
Pubblicazione: (2025)
VS-Bench: Evaluating VLMs for Strategic Abilities in Multi-Agent Environments
di: Xu, Zelai, et al.
Pubblicazione: (2025)
di: Xu, Zelai, et al.
Pubblicazione: (2025)
AJ-Bench: Benchmarking Agent-as-a-Judge for Environment-Aware Evaluation
di: Shi, Wentao, et al.
Pubblicazione: (2026)
di: Shi, Wentao, et al.
Pubblicazione: (2026)
Unifying Mixture of Experts and Multi-Head Latent Attention for Efficient Language Models
di: Mehta, Sushant, et al.
Pubblicazione: (2025)
di: Mehta, Sushant, et al.
Pubblicazione: (2025)
PhysicianBench: Evaluating LLM Agents in Real-World EHR Environments
di: Liu, Ruoqi, et al.
Pubblicazione: (2026)
di: Liu, Ruoqi, et al.
Pubblicazione: (2026)
AvalancheBench: Evaluating Enterprise Data Agents Through Latent World Recovery
di: Kleczek, Darek, et al.
Pubblicazione: (2026)
di: Kleczek, Darek, et al.
Pubblicazione: (2026)
JaxMARL: Multi-Agent RL Environments and Algorithms in JAX
di: Rutherford, Alexander, et al.
Pubblicazione: (2023)
di: Rutherford, Alexander, et al.
Pubblicazione: (2023)
Can LLM Agents Be CFOs? Benchmarking Long-Horizon Resource Allocation in an Uncertain Enterprise Environment
di: Han, Yi, et al.
Pubblicazione: (2026)
di: Han, Yi, et al.
Pubblicazione: (2026)
Vista: A Generalizable Driving World Model with High Fidelity and Versatile Controllability
di: Gao, Shenyuan, et al.
Pubblicazione: (2024)
di: Gao, Shenyuan, et al.
Pubblicazione: (2024)
From Seeing to Simulating: Generative High-Fidelity Simulation with Digital Cousins for Generalizable Robot Learning and Evaluation
di: Lu, Jasper, et al.
Pubblicazione: (2026)
di: Lu, Jasper, et al.
Pubblicazione: (2026)
SMH-Bench: Benchmarking LLM Agents for Environment-Grounded Reasoning and Action in Smart Homes
di: Li, Kuan, et al.
Pubblicazione: (2026)
di: Li, Kuan, et al.
Pubblicazione: (2026)
Rubric-Grounded RL: Structured Judge Rewards for Generalizable Reasoning
di: Bhattarai, Manish, et al.
Pubblicazione: (2026)
di: Bhattarai, Manish, et al.
Pubblicazione: (2026)
Small Generalizable Prompt Predictive Models Can Steer Efficient RL Post-Training of Large Reasoning Models
di: Qu, Yun, et al.
Pubblicazione: (2026)
di: Qu, Yun, et al.
Pubblicazione: (2026)
LiteResearcher: A Scalable Agentic RL Training Framework for Deep Research Agent
di: Li, Wanli, et al.
Pubblicazione: (2026)
di: Li, Wanli, et al.
Pubblicazione: (2026)
CCrepairBench: A High-Fidelity Benchmark and Reinforcement Learning Framework for C++ Compilation Repair
di: Sun, Weixuan, et al.
Pubblicazione: (2025)
di: Sun, Weixuan, et al.
Pubblicazione: (2025)
ResearchEnvBench: Benchmarking Agents on Environment Synthesis for Research Code Execution
di: Wang, Yubang, et al.
Pubblicazione: (2026)
di: Wang, Yubang, et al.
Pubblicazione: (2026)
Latent Multi-Head Attention for Small Language Models
di: Mehta, Sushant, et al.
Pubblicazione: (2025)
di: Mehta, Sushant, et al.
Pubblicazione: (2025)
Dingtalk DeepResearch: A Unified Multi Agent Framework for Adaptive Intelligence in Enterprise Environments
di: Chen, Mengyuan, et al.
Pubblicazione: (2025)
di: Chen, Mengyuan, et al.
Pubblicazione: (2025)
When Agents Disagree With Themselves: Measuring Behavioral Consistency in LLM-Based Agents
di: Mehta, Aman
Pubblicazione: (2026)
di: Mehta, Aman
Pubblicazione: (2026)
CanaryBench: Stress Testing Privacy Leakage in Cluster-Level Conversation Summaries
di: Mehta, Deep
Pubblicazione: (2026)
di: Mehta, Deep
Pubblicazione: (2026)
TrafficClaw: A Generalizable LLM Agent in the Unified Physical Environment for Urban Traffic Control
di: Lai, Siqi, et al.
Pubblicazione: (2026)
di: Lai, Siqi, et al.
Pubblicazione: (2026)
Documenti analoghi
-
The Hierarchy of Agentic Capabilities: Evaluating Frontier Models on Realistic RL Environments
di: Ritchie, Logan, et al.
Pubblicazione: (2026) -
Riemann-Bench: A Benchmark for Moonshot Mathematics
di: Garre, Suhaas, et al.
Pubblicazione: (2026) -
Beyond Accuracy: A Multi-Dimensional Framework for Evaluating Enterprise Agentic AI Systems
di: Mehta, Sushant
Pubblicazione: (2025) -
MATRAG: Multi-Agent Transparent Retrieval-Augmented Generation for Explainable Recommendations
di: Mehta, Sushant
Pubblicazione: (2026) -
Beyond Surface-Level Similarity: Hierarchical Contamination Detection for Synthetic Training Data in Foundation Models
di: Mehta, Sushant
Pubblicazione: (2025)