General Modular Harness for LLM Agents in Multi-Turn Gaming Environments
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Yuxuan, Yu, Haoyang, Hu, Lanxiang, Jin, Haojian, Zhang, Hao |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
lmgame-Bench: How Good are LLMs at Playing Games?
by: Hu, Lanxiang, et al.
Published: (2025)
by: Hu, Lanxiang, et al.
Published: (2025)
GameArena: Evaluating LLM Reasoning through Live Computer Games
by: Hu, Lanxiang, et al.
Published: (2024)
by: Hu, Lanxiang, et al.
Published: (2024)
ProRL Agent: Rollout-as-a-Service for RL Training of Multi-Turn LLM Agents
by: Zhang, Hao, et al.
Published: (2026)
by: Zhang, Hao, et al.
Published: (2026)
TrimLLM: Progressive Layer Dropping for Domain-Specific LLMs
by: Hu, Lanxiang, et al.
Published: (2024)
by: Hu, Lanxiang, et al.
Published: (2024)
CoBRA: Programming Cognitive Bias in Social Agents Using Classic Social Science Experiments
by: Liu, Xuan, et al.
Published: (2025)
by: Liu, Xuan, et al.
Published: (2025)
Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions
by: Hu, Yuanzhe, et al.
Published: (2025)
by: Hu, Yuanzhe, et al.
Published: (2025)
d3LLM: Ultra-Fast Diffusion LLM using Pseudo-Trajectory Distillation
by: Qian, Yu-Yang, et al.
Published: (2026)
by: Qian, Yu-Yang, et al.
Published: (2026)
MEMO: Memory-Augmented Model Context Optimization for Robust Multi-Turn Multi-Agent LLM Games
by: Xie, Yunfei, et al.
Published: (2026)
by: Xie, Yunfei, et al.
Published: (2026)
Towards Interpretable and Inference-Optimal COT Reasoning with Sparse Autoencoder-Guided Generation
by: Zhao, Daniel, et al.
Published: (2025)
by: Zhao, Daniel, et al.
Published: (2025)
HumanStudy-Bench: Towards AI Agent Design for Participant Simulation
by: Liu, Xuan, et al.
Published: (2026)
by: Liu, Xuan, et al.
Published: (2026)
Beyond the Strongest LLM: Multi-Turn Multi-Agent Orchestration vs. Single LLMs on Benchmarks
by: Tian, Aaron Xuxiang, et al.
Published: (2025)
by: Tian, Aaron Xuxiang, et al.
Published: (2025)
GameGPT: Multi-agent Collaborative Framework for Game Development
by: Chen, Dake, et al.
Published: (2023)
by: Chen, Dake, et al.
Published: (2023)
Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows
by: Yao, Yilun, et al.
Published: (2026)
by: Yao, Yilun, et al.
Published: (2026)
Benchmarking Scientific Understanding and Reasoning for Video Generation using VideoScience-Bench
by: Hu, Lanxiang, et al.
Published: (2025)
by: Hu, Lanxiang, et al.
Published: (2025)
MMUEChange: A Generalized LLM Agent Framework for Intelligent Multi-Modal Urban Environment Change Analysis
by: Xiao, Zixuan, et al.
Published: (2026)
by: Xiao, Zixuan, et al.
Published: (2026)
Experience Transfer for Multimodal LLM Agents in Minecraft Game
by: Li, Chenghao, et al.
Published: (2026)
by: Li, Chenghao, et al.
Published: (2026)
Harness Updating Is Not Harness Benefit: Disentangling Evolution Capabilities in Self-Evolving LLM Agents
by: Lin, Minhua, et al.
Published: (2026)
by: Lin, Minhua, et al.
Published: (2026)
PrivacyReasoner: Can LLM Emulate a Human-like Privacy Mind?
by: Tu, Yiwen, et al.
Published: (2026)
by: Tu, Yiwen, et al.
Published: (2026)
DVM: Towards Controllable LLM Agents in Social Deduction Games
by: Zhang, Zheng, et al.
Published: (2025)
by: Zhang, Zheng, et al.
Published: (2025)
MTRouter: Cost-Aware Multi-Turn LLM Routing with History-Model Joint Embeddings
by: Zhang, Yiqun, et al.
Published: (2026)
by: Zhang, Yiqun, et al.
Published: (2026)
Evaluating Multi-Turn Bargain Skills in LLM-Based Seller Agent
by: Wang, Issue Yishu, et al.
Published: (2025)
by: Wang, Issue Yishu, et al.
Published: (2025)
Towards Trustworthy Multi-Turn LLM Agents via Behavioral Guidance
by: Gürsun, Gonca
Published: (2025)
by: Gürsun, Gonca
Published: (2025)
CLLMs: Consistency Large Language Models
by: Kou, Siqi, et al.
Published: (2024)
by: Kou, Siqi, et al.
Published: (2024)
Harnessing LLM Agents with Skill Programs
by: Liu, Hongjun, et al.
Published: (2026)
by: Liu, Hongjun, et al.
Published: (2026)
Single-Agent Scaling Fails Multi-Agent Intelligence: Towards Foundation Models with Native Multi-Agent Intelligence
by: Hu, Shuyue, et al.
Published: (2025)
by: Hu, Shuyue, et al.
Published: (2025)
MT-JailBench: A Modular Benchmark for Understanding Multi-Turn Jailbreak Attacks
by: Zhang, Xinkai, et al.
Published: (2026)
by: Zhang, Xinkai, et al.
Published: (2026)
CostBench: Evaluating Multi-Turn Cost-Optimal Planning and Adaptation in Dynamic Environments for LLM Tool-Use Agents
by: Liu, Jiayu, et al.
Published: (2025)
by: Liu, Jiayu, et al.
Published: (2025)
RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning
by: Wang, Zihan, et al.
Published: (2025)
by: Wang, Zihan, et al.
Published: (2025)
Stop Comparing LLM Agents Without Disclosing the Harness
by: Zhang, Yunbei, et al.
Published: (2026)
by: Zhang, Yunbei, et al.
Published: (2026)
Mitigating Conversational Inertia in Multi-Turn Agents
by: Wan, Yang, et al.
Published: (2026)
by: Wan, Yang, et al.
Published: (2026)
Proximity-Based Multi-Turn Optimization: Practical Credit Assignment for LLM Agent Training
by: Fang, Yangyi, et al.
Published: (2026)
by: Fang, Yangyi, et al.
Published: (2026)
Evaluating LLM-based Agents for Multi-Turn Conversations: A Survey
by: Guan, Shengyue, et al.
Published: (2025)
by: Guan, Shengyue, et al.
Published: (2025)
Adaptive Stopping for Multi-Turn LLM Reasoning
by: Zhou, Xiaofan, et al.
Published: (2026)
by: Zhou, Xiaofan, et al.
Published: (2026)
TowerMind: A Tower Defence Game Learning Environment and Benchmark for LLM as Agents
by: Wang, Dawei, et al.
Published: (2026)
by: Wang, Dawei, et al.
Published: (2026)
WebGraphEval: Multi-Turn Trajectory Evaluation for Web Agents using Graph Representation
by: Qian, Yaoyao, et al.
Published: (2025)
by: Qian, Yaoyao, et al.
Published: (2025)
Harnessing Language for Coordination: A Framework and Benchmark for LLM-Driven Multi-Agent Control
by: Anne, Timothée, et al.
Published: (2024)
by: Anne, Timothée, et al.
Published: (2024)
CrimeMind: Simulating Urban Crime with Multi-Modal LLM Agents
by: Zeng, Qingbin, et al.
Published: (2025)
by: Zeng, Qingbin, et al.
Published: (2025)
OxyGent: Making Multi-Agent Systems Modular, Observable, and Evolvable via Oxy Abstraction
by: Hu, Junxing, et al.
Published: (2026)
by: Hu, Junxing, et al.
Published: (2026)
Architectural Design Decisions in AI Agent Harnesses
by: Wei, Hu
Published: (2026)
by: Wei, Hu
Published: (2026)
Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning
by: Ning, Yansong, et al.
Published: (2025)
by: Ning, Yansong, et al.
Published: (2025)
Similar Items
-
lmgame-Bench: How Good are LLMs at Playing Games?
by: Hu, Lanxiang, et al.
Published: (2025) -
GameArena: Evaluating LLM Reasoning through Live Computer Games
by: Hu, Lanxiang, et al.
Published: (2024) -
ProRL Agent: Rollout-as-a-Service for RL Training of Multi-Turn LLM Agents
by: Zhang, Hao, et al.
Published: (2026) -
TrimLLM: Progressive Layer Dropping for Domain-Specific LLMs
by: Hu, Lanxiang, et al.
Published: (2024) -
CoBRA: Programming Cognitive Bias in Social Agents Using Classic Social Science Experiments
by: Liu, Xuan, et al.
Published: (2025)