SC2Arena and StarEvolve: Benchmark and Self-Improvement Framework for LLMs in Complex Decision-Making Tasks
Fuente:
arXiv
Saved in:
| Main Authors: | Shen, Pengbo, Wang, Yaqing, Mu, Ni, Luan, Yao, Xie, Runpeng, Yang, Senhao, Wang, Lexiang, Hu, Hao, Xu, Shuang, Yang, Yiqin, Xu, Bo |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MrCoM: A Meta-Regularized World-Model Generalizing Across Multi-Scenarios
by: Xiong, Xuantang, et al.
Published: (2025)
by: Xiong, Xuantang, et al.
Published: (2025)
DAIL: Beyond Task Ambiguity for Language-Conditioned Reinforcement Learning
by: Xie, Runpeng, et al.
Published: (2025)
by: Xie, Runpeng, et al.
Published: (2025)
S-EPOA: Overcoming the Indistinguishability of Segments with Skill-Driven Preference-Based Reinforcement Learning
by: Mu, Ni, et al.
Published: (2024)
by: Mu, Ni, et al.
Published: (2024)
STAIR: Addressing Stage Misalignment through Temporal-Aligned Preference Reinforcement Learning
by: Luan, Yao, et al.
Published: (2025)
by: Luan, Yao, et al.
Published: (2025)
DPMT: Dual Process Multi-scale Theory of Mind Framework for Real-time Human-AI Collaboration
by: Li, Xiyun, et al.
Published: (2025)
by: Li, Xiyun, et al.
Published: (2025)
COLLIE: Guiding Skill Discovery in Semantically Coherent Latent Space
by: Luan, Yao, et al.
Published: (2026)
by: Luan, Yao, et al.
Published: (2026)
GlobeDiff: State Diffusion Process for Partial Observability in Multi-Agent Systems
by: Yang, Yiqin, et al.
Published: (2026)
by: Yang, Yiqin, et al.
Published: (2026)
INSPIRIT: Optimizing Heterogeneous Task Scheduling through Adaptive Priority in Task-based Runtime Systems
by: Wang, Yiqing, et al.
Published: (2024)
by: Wang, Yiqing, et al.
Published: (2024)
The Consistency-Acceptability Divergence of LLMs in Judicial Decision-Making: Task and Stakeholder Dimensions
by: MingDa, Zhang, et al.
Published: (2025)
by: MingDa, Zhang, et al.
Published: (2025)
Point-Supervised Skeleton-Based Human Action Segmentation
by: Wang, Hongsong, et al.
Published: (2026)
by: Wang, Hongsong, et al.
Published: (2026)
WARBENCH: A Comprehensive Benchmark for Evaluating LLMs in Military Decision-Making
by: Li, Zongjie, et al.
Published: (2026)
by: Li, Zongjie, et al.
Published: (2026)
CLARIFY: Contrastive Preference Reinforcement Learning for Untangling Ambiguous Queries
by: Mu, Ni, et al.
Published: (2025)
by: Mu, Ni, et al.
Published: (2025)
Embodied Agent Interface: Benchmarking LLMs for Embodied Decision Making
by: Li, Manling, et al.
Published: (2024)
by: Li, Manling, et al.
Published: (2024)
Memory-Driven Self-Improvement for Decision Making with Large Language Models
by: Yan, Xue, et al.
Published: (2025)
by: Yan, Xue, et al.
Published: (2025)
Linarin Suppresses the Progression of Colorectal Cancer by Inhibiting the HIF‐1α/PD‐L1 Axis
by: Hao Wang, et al.
Published: (2025)
by: Hao Wang, et al.
Published: (2025)
Data-Enabled Policy and Value Iteration for Continuous-Time Linear Quadratic Output Feedback Control
by: Xie, Jun, et al.
Published: (2026)
by: Xie, Jun, et al.
Published: (2026)
An Efficient Data-Driven Framework for Linear Quadratic Output Feedback Control
by: Xie, Jun, et al.
Published: (2025)
by: Xie, Jun, et al.
Published: (2025)
Mobile-Agent-E: Self-Evolving Mobile Assistant for Complex Tasks
by: Wang, Zhenhailong, et al.
Published: (2025)
by: Wang, Zhenhailong, et al.
Published: (2025)
SC-Arena: A Natural Language Benchmark for Single-Cell Reasoning with Knowledge-Augmented Evaluation
by: Zhao, Jiahao, et al.
Published: (2026)
by: Zhao, Jiahao, et al.
Published: (2026)
Botfip-LLM: An Enhanced Multimodal Scientific Computing Framework Leveraging Knowledge Distillation from Large Language Models
by: Chen, Tianhao, et al.
Published: (2024)
by: Chen, Tianhao, et al.
Published: (2024)
One for All: A General Framework of LLMs-based Multi-Criteria Decision Making on Human Expert Level
by: Wang, Hui, et al.
Published: (2025)
by: Wang, Hui, et al.
Published: (2025)
ClawArena: Benchmarking AI Agents in Evolving Information Environments
by: Ji, Haonian, et al.
Published: (2026)
by: Ji, Haonian, et al.
Published: (2026)
RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios
by: Zhou, Ruiwen, et al.
Published: (2024)
by: Zhou, Ruiwen, et al.
Published: (2024)
Exploring Spatial-Temporal Representation via Star Graph for mmWave Radar-based Human Activity Recognition
by: Gao, Senhao, et al.
Published: (2025)
by: Gao, Senhao, et al.
Published: (2025)
Fast and Robust: Task Sampling with Posterior and Diversity Synergies for Adaptive Decision-Makers in Randomized Environments
by: Qu, Yun, et al.
Published: (2025)
by: Qu, Yun, et al.
Published: (2025)
UNO Arena for Evaluating Sequential Decision-Making Capability of Large Language Models
by: Qin, Zhanyue, et al.
Published: (2024)
by: Qin, Zhanyue, et al.
Published: (2024)
ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making
by: Dai, Liu, et al.
Published: (2025)
by: Dai, Liu, et al.
Published: (2025)
The Sample Complexity of Online Strategic Decision Making with Information Asymmetry and Knowledge Transportability
by: Hu, Jiachen, et al.
Published: (2025)
by: Hu, Jiachen, et al.
Published: (2025)
Flat Standing Sphere Blow-up Solutions for the Nonlinear Heat Equation
by: Duan, Senhao
Published: (2025)
by: Duan, Senhao
Published: (2025)
Every Step Counts: Decoding Trajectories as Authorship Fingerprints of dLLMs
by: Li, Qi, et al.
Published: (2025)
by: Li, Qi, et al.
Published: (2025)
TracLLM: A Generic Framework for Attributing Long Context LLMs
by: Wang, Yanting, et al.
Published: (2025)
by: Wang, Yanting, et al.
Published: (2025)
Evolving Nursing Decision‐Making—From Theories to Smart Care Decisions
by: Sanna Salanterä
Published: (2026)
by: Sanna Salanterä
Published: (2026)
DM-Bench: Benchmarking LLMs for Personalized Decision Making in Diabetes Management
by: Cardei, Maria Ana, et al.
Published: (2025)
by: Cardei, Maria Ana, et al.
Published: (2025)
DSGBench: A Diverse Strategic Game Benchmark for Evaluating LLM-based Agents in Complex Decision-Making Environments
by: Tang, Wenjie, et al.
Published: (2025)
by: Tang, Wenjie, et al.
Published: (2025)
A Review of Causal Decision Making
by: Ge, Lin, et al.
Published: (2025)
by: Ge, Lin, et al.
Published: (2025)
Predicting Electric Vehicle Charging Demand in Residential Areas Using POI Data and Decision‐Making Model
by: Huahao Zhou, et al.
Published: (2024)
by: Huahao Zhou, et al.
Published: (2024)
Neural Lineage
by: Yu, Runpeng, et al.
Published: (2024)
by: Yu, Runpeng, et al.
Published: (2024)
MemoryArena: Benchmarking Agent Memory in Interdependent Multi-Session Agentic Tasks
by: He, Zexue, et al.
Published: (2026)
by: He, Zexue, et al.
Published: (2026)
DeepResearch Arena: The First Exam of LLMs' Research Abilities via Seminar-Grounded Tasks
by: Wan, Haiyuan, et al.
Published: (2025)
by: Wan, Haiyuan, et al.
Published: (2025)
Distributed Log-driven Anomaly Detection System based on Evolving Decision Making
by: Tan, Zhuoran, et al.
Published: (2025)
by: Tan, Zhuoran, et al.
Published: (2025)
Similar Items
-
MrCoM: A Meta-Regularized World-Model Generalizing Across Multi-Scenarios
by: Xiong, Xuantang, et al.
Published: (2025) -
DAIL: Beyond Task Ambiguity for Language-Conditioned Reinforcement Learning
by: Xie, Runpeng, et al.
Published: (2025) -
S-EPOA: Overcoming the Indistinguishability of Segments with Skill-Driven Preference-Based Reinforcement Learning
by: Mu, Ni, et al.
Published: (2024) -
STAIR: Addressing Stage Misalignment through Temporal-Aligned Preference Reinforcement Learning
by: Luan, Yao, et al.
Published: (2025) -
DPMT: Dual Process Multi-scale Theory of Mind Framework for Real-time Human-AI Collaboration
by: Li, Xiyun, et al.
Published: (2025)