AgentCE-Bench: Agent Configurable Evaluation with Scalable Horizons and Controllable Difficulty under Lightweight Environments
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Wang, Song, Chaoda, Li, Xinpeng, Ganguly, Debargha, Ma, Chuang, Wang, Shouren, Dou, Zhihao, Zhou, Yuli, Chaudhary, Vipin, Han, Xiaotian |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Mid-Think: Training-Free Intermediate-Budget Reasoning via Token-Level Triggers
par: Yang, Wang, et autres
Publié: (2026)
par: Yang, Wang, et autres
Publié: (2026)
Path-Lock Expert: Separating Reasoning Mode in Hybrid Thinking via Architecture-Level Separation
par: Wang, Shouren, et autres
Publié: (2026)
par: Wang, Shouren, et autres
Publié: (2026)
When Domains Interact: Asymmetric and Order-Sensitive Cross-Domain Effects in Reinforcement Learning for Reasoning
par: Yang, Wang, et autres
Publié: (2026)
par: Yang, Wang, et autres
Publié: (2026)
Visual Concept Networks: A Graph-Based Approach to Detecting Anomalous Data in Deep Neural Networks
par: Ganguly, Debargha, et autres
Publié: (2024)
par: Ganguly, Debargha, et autres
Publié: (2024)
CausalGuard: Conformal Inference under Graph Uncertainty
par: Singh, Vikash, et autres
Publié: (2026)
par: Singh, Vikash, et autres
Publié: (2026)
Forte : Finding Outliers with Representation Typicality Estimation
par: Ganguly, Debargha, et autres
Publié: (2024)
par: Ganguly, Debargha, et autres
Publié: (2024)
Proof of Thought : Neurosymbolic Program Synthesis allows Robust and Interpretable Reasoning
par: Ganguly, Debargha, et autres
Publié: (2024)
par: Ganguly, Debargha, et autres
Publié: (2024)
Demystifying Hybrid Thinking: Can LLMs Truly Switch Between Think and No-Think?
par: Wang, Shouren, et autres
Publié: (2025)
par: Wang, Shouren, et autres
Publié: (2025)
LABELING COPILOT: A Deep Research Agent for Automated Data Curation in Computer Vision
par: Ganguly, Debargha, et autres
Publié: (2025)
par: Ganguly, Debargha, et autres
Publié: (2025)
Reliability-Gated Source Anchoring for Continual Test-Time Adaptation
par: Singh, Vikash, et autres
Publié: (2026)
par: Singh, Vikash, et autres
Publié: (2026)
$K^4$: Online Log Anomaly Detection Via Unsupervised Typicality Learning
par: Chen, Weicong, et autres
Publié: (2025)
par: Chen, Weicong, et autres
Publié: (2025)
100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?
par: Yang, Wang, et autres
Publié: (2025)
par: Yang, Wang, et autres
Publié: (2025)
Efficient Fine-Grained GPU Performance Modeling for Distributed Deep Learning of LLM
par: Zhang, Biyao, et autres
Publié: (2025)
par: Zhang, Biyao, et autres
Publié: (2025)
Overcoming Dynamics-Blindness: Training-Free Pace-and-Path Correction for VLA Models
par: Zhang, Yanyan, et autres
Publié: (2026)
par: Zhang, Yanyan, et autres
Publié: (2026)
Grammars of Formal Uncertainty: When to Trust LLMs in Automated Reasoning Tasks
par: Ganguly, Debargha, et autres
Publié: (2025)
par: Ganguly, Debargha, et autres
Publié: (2025)
Speculative Thinking: Enhancing Small-Model Reasoning with Large Model Guidance at Inference Time
par: Yang, Wang, et autres
Publié: (2025)
par: Yang, Wang, et autres
Publié: (2025)
LRD-Net: A Lightweight Real-Centered Detection Network for Cross-Domain Face Forgery Detection
par: Zhang, Xuecen, et autres
Publié: (2026)
par: Zhang, Xuecen, et autres
Publié: (2026)
Privacy Policy Enforcement Guardrails for Data-Sensitive Retrieval-Augmented Generation
par: Zafar, Osama, et autres
Publié: (2026)
par: Zafar, Osama, et autres
Publié: (2026)
Context Determines Optimal Architecture in Materials Segmentation
par: Lu, Mingjian, et autres
Publié: (2026)
par: Lu, Mingjian, et autres
Publié: (2026)
Toward Guarantees for Clinical Reasoning in Vision Language Models via Formal Verification
par: Singh, Vikash, et autres
Publié: (2026)
par: Singh, Vikash, et autres
Publié: (2026)
Landscapes of realism: Rethinking literary realism in comparative perspectives. Volume II: Pathways through realism. Svend ErikLarsen, Steen BilleJørgensen and Margaret R.Higonnet (Eds.), Amsterdam/Philadelphia: John Benjamins Publishing Company, 2022. pp. 780. €190/$285 (hbk). ISBN: 978 90 272 1085 2
par: Shouren Wang
Publié: (2024)
par: Shouren Wang
Publié: (2024)
CausalRAG: Integrating Causal Graphs into Retrieval-Augmented Generation
par: Wang, Nengbo, et autres
Publié: (2025)
par: Wang, Nengbo, et autres
Publié: (2025)
Thinking Preference Optimization
par: Yang, Wang, et autres
Publié: (2025)
par: Yang, Wang, et autres
Publié: (2025)
HugRAG: Hierarchical Causal Knowledge Graph Design for RAG
par: Wang, Nengbo, et autres
Publié: (2026)
par: Wang, Nengbo, et autres
Publié: (2026)
HOPPS: Hardware-Aware Optimal Phase Polynomial Synthesis with Blockwise Optimization for Quantum Circuits
par: Li, Xinpeng, et autres
Publié: (2025)
par: Li, Xinpeng, et autres
Publié: (2025)
RetailBench: Evaluating Long-Horizon Autonomous Decision-Making and Strategy Stability of LLM Agents in Realistic Retail Environments
par: Zhang, Linghua, et autres
Publié: (2026)
par: Zhang, Linghua, et autres
Publié: (2026)
ColorBench: Benchmarking Mobile Agents with Graph-Structured Framework for Complex Long-Horizon Tasks
par: Song, Yuanyi, et autres
Publié: (2025)
par: Song, Yuanyi, et autres
Publié: (2025)
Scalable Environments Drive Generalizable Agents
par: Zhang, Jiayi, et autres
Publié: (2026)
par: Zhang, Jiayi, et autres
Publié: (2026)
AgentFugue: Agent Scaling for Long-Horizon Tasks through Collective Reasoning
par: Hu, Yuyang, et autres
Publié: (2026)
par: Hu, Yuyang, et autres
Publié: (2026)
GenEnv: Difficulty-Aligned Co-Evolution Between LLM Agents and Environment Simulators
par: Guo, Jiacheng, et autres
Publié: (2025)
par: Guo, Jiacheng, et autres
Publié: (2025)
Longer Context, Deeper Thinking: Uncovering the Role of Long-Context Ability in Reasoning
par: Yang, Wang, et autres
Publié: (2025)
par: Yang, Wang, et autres
Publié: (2025)
SELF: Self-Extend the Context Length With Logistic Growth Function
par: Dang, Phat Thanh, et autres
Publié: (2025)
par: Dang, Phat Thanh, et autres
Publié: (2025)
Enhancing Player Enjoyment with a Two-Tier DRL and LLM-Based Agent System for Fighting Games
par: Wang, Shouren, et autres
Publié: (2025)
par: Wang, Shouren, et autres
Publié: (2025)
LPS-Bench: Benchmarking Safety Awareness of Computer-Use Agents in Long-Horizon Planning under Benign and Adversarial Scenarios
par: Chen, Tianyu, et autres
Publié: (2026)
par: Chen, Tianyu, et autres
Publié: (2026)
Trust The Typical
par: Ganguly, Debargha, et autres
Publié: (2026)
par: Ganguly, Debargha, et autres
Publié: (2026)
Silo-Bench: A Scalable Environment for Evaluating Distributed Coordination in Multi-Agent LLM Systems
par: Zhang, Yuzhe, et autres
Publié: (2026)
par: Zhang, Yuzhe, et autres
Publié: (2026)
DeepAgent: A General Reasoning Agent with Scalable Toolsets
par: Li, Xiaoxi, et autres
Publié: (2025)
par: Li, Xiaoxi, et autres
Publié: (2025)
OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows
par: Wang, Weixuan, et autres
Publié: (2025)
par: Wang, Weixuan, et autres
Publié: (2025)
$π$-Bench: Evaluating Proactive Personal Assistant Agents in Long-Horizon Workflows
par: Zhang, Haoran, et autres
Publié: (2026)
par: Zhang, Haoran, et autres
Publié: (2026)
QuMod: Parallel Quantum Job Scheduling on Modular QPUs using Circuit Cutting
par: Kulkarni, Vinooth, et autres
Publié: (2026)
par: Kulkarni, Vinooth, et autres
Publié: (2026)
Documents similaires
-
Mid-Think: Training-Free Intermediate-Budget Reasoning via Token-Level Triggers
par: Yang, Wang, et autres
Publié: (2026) -
Path-Lock Expert: Separating Reasoning Mode in Hybrid Thinking via Architecture-Level Separation
par: Wang, Shouren, et autres
Publié: (2026) -
When Domains Interact: Asymmetric and Order-Sensitive Cross-Domain Effects in Reinforcement Learning for Reasoning
par: Yang, Wang, et autres
Publié: (2026) -
Visual Concept Networks: A Graph-Based Approach to Detecting Anomalous Data in Deep Neural Networks
par: Ganguly, Debargha, et autres
Publié: (2024) -
CausalGuard: Conformal Inference under Graph Uncertainty
par: Singh, Vikash, et autres
Publié: (2026)