WiS Platform: Enhancing Evaluation of LLM-Based Multi-Agent Systems Through Game-Based Analysis
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Hu, Chengwei, Zheng, Jianhui, He, Yancheng, Guo, Hangyu, Jiang, Junguang, Zhu, Han, Sun, Kai, Jiang, Yuning, Su, Wenbo, Zheng, Bo |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
GraphReader: Building Graph-based Agent to Enhance Long-Context Abilities of Large Language Models
von: Li, Shilong, et al.
Veröffentlicht: (2024)
von: Li, Shilong, et al.
Veröffentlicht: (2024)
AIR: Complex Instruction Generation via Automatic Iterative Refinement
von: Liu, Wei, et al.
Veröffentlicht: (2025)
von: Liu, Wei, et al.
Veröffentlicht: (2025)
Chinese SimpleQA: A Chinese Factuality Evaluation for Large Language Models
von: He, Yancheng, et al.
Veröffentlicht: (2024)
von: He, Yancheng, et al.
Veröffentlicht: (2024)
2D-DPO: Scaling Direct Preference Optimization with 2-Dimensional Supervision
von: Li, Shilong, et al.
Veröffentlicht: (2024)
von: Li, Shilong, et al.
Veröffentlicht: (2024)
ChineseEcomQA: A Scalable E-commerce Concept Evaluation Benchmark for Large Language Models
von: Chen, Haibin, et al.
Veröffentlicht: (2025)
von: Chen, Haibin, et al.
Veröffentlicht: (2025)
QAgent: A modular Search Agent with Interactive Query Understanding
von: Jiang, Yi, et al.
Veröffentlicht: (2025)
von: Jiang, Yi, et al.
Veröffentlicht: (2025)
LLM-Augmented Digital Twin for Policy Evaluation in Short-Video Platforms
von: Zhang, Haoting, et al.
Veröffentlicht: (2026)
von: Zhang, Haoting, et al.
Veröffentlicht: (2026)
SiriusHelper: An LLM Agent-Based Operations Assistant for Big Data Platforms
von: Shen, Yu, et al.
Veröffentlicht: (2026)
von: Shen, Yu, et al.
Veröffentlicht: (2026)
Enhancing Player Enjoyment with a Two-Tier DRL and LLM-Based Agent System for Fighting Games
von: Wang, Shouren, et al.
Veröffentlicht: (2025)
von: Wang, Shouren, et al.
Veröffentlicht: (2025)
KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation
von: Shi, Jiajun, et al.
Veröffentlicht: (2025)
von: Shi, Jiajun, et al.
Veröffentlicht: (2025)
Asymmetric Proximal Policy Optimization: mini-critics boost LLM reasoning
von: Liu, Jiashun, et al.
Veröffentlicht: (2025)
von: Liu, Jiashun, et al.
Veröffentlicht: (2025)
LAMBDA: A Large Model Based Data Agent
von: Sun, Maojun, et al.
Veröffentlicht: (2024)
von: Sun, Maojun, et al.
Veröffentlicht: (2024)
MCU: An Evaluation Framework for Open-Ended Game Agents
von: Zheng, Xinyue, et al.
Veröffentlicht: (2023)
von: Zheng, Xinyue, et al.
Veröffentlicht: (2023)
VulnLLM-R: Specialized Reasoning LLM with Agent Scaffold for Vulnerability Detection
von: Nie, Yuzhou, et al.
Veröffentlicht: (2025)
von: Nie, Yuzhou, et al.
Veröffentlicht: (2025)
SEAR: Schema-Based Evaluation and Routing for LLM Gateways
von: Zhang, Zecheng, et al.
Veröffentlicht: (2026)
von: Zhang, Zecheng, et al.
Veröffentlicht: (2026)
WiLoc: Massive Measured Dataset of Wi-Fi Channel State Information with Application to Machine-Learning Based Localization
von: Zhang, Yuning, et al.
Veröffentlicht: (2026)
von: Zhang, Yuning, et al.
Veröffentlicht: (2026)
LLM-Based Multi-Hop Question Answering with Knowledge Graph Integration in Evolving Environments
von: Chen, Ruirui, et al.
Veröffentlicht: (2024)
von: Chen, Ruirui, et al.
Veröffentlicht: (2024)
On the Importance of Task Complexity in Evaluating LLM-Based Multi-Agent Systems
von: Tang, Bohan, et al.
Veröffentlicht: (2025)
von: Tang, Bohan, et al.
Veröffentlicht: (2025)
SecAgent: Efficient Mobile GUI Agent with Semantic Context
von: Xie, Yiping, et al.
Veröffentlicht: (2026)
von: Xie, Yiping, et al.
Veröffentlicht: (2026)
Mobile-R1: Towards Interactive Capability for VLM-Based Mobile Agent via Systematic Training
von: Gu, Jihao, et al.
Veröffentlicht: (2025)
von: Gu, Jihao, et al.
Veröffentlicht: (2025)
DiscoUQ: Structured Disagreement Analysis for Uncertainty Quantification in LLM Agent Ensembles
von: Jiang, Bo
Veröffentlicht: (2026)
von: Jiang, Bo
Veröffentlicht: (2026)
DistillGuard: Evaluating Defenses Against LLM Knowledge Distillation
von: Jiang, Bo
Veröffentlicht: (2026)
von: Jiang, Bo
Veröffentlicht: (2026)
MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues
von: Bai, Ge, et al.
Veröffentlicht: (2024)
von: Bai, Ge, et al.
Veröffentlicht: (2024)
Think before Recommendation: Autonomous Reasoning-enhanced Recommender
von: Kong, Xiaoyu, et al.
Veröffentlicht: (2025)
von: Kong, Xiaoyu, et al.
Veröffentlicht: (2025)
Large Language Model as Universal Retriever in Industrial-Scale Recommender System
von: Jiang, Junguang, et al.
Veröffentlicht: (2025)
von: Jiang, Junguang, et al.
Veröffentlicht: (2025)
EDRF: Enhanced Driving Risk Field Based on Multimodal Trajectory Prediction and Its Applications
von: Jiang, Junkai, et al.
Veröffentlicht: (2024)
von: Jiang, Junkai, et al.
Veröffentlicht: (2024)
CE-RM: A Pointwise Generative Reward Model Optimized via Two-Stage Rollout and Unified Criteria
von: Hu, Xinyu, et al.
Veröffentlicht: (2026)
von: Hu, Xinyu, et al.
Veröffentlicht: (2026)
One Model Is Enough: Native Retrieval Embeddings from LLM Agent Hidden States
von: Jiang, Bo
Veröffentlicht: (2026)
von: Jiang, Bo
Veröffentlicht: (2026)
Flow-of-Action: SOP Enhanced LLM-Based Multi-Agent System for Root Cause Analysis
von: Pei, Changhua, et al.
Veröffentlicht: (2025)
von: Pei, Changhua, et al.
Veröffentlicht: (2025)
The Necessity of a Unified Framework for LLM-Based Agent Evaluation
von: Zhu, Pengyu, et al.
Veröffentlicht: (2026)
von: Zhu, Pengyu, et al.
Veröffentlicht: (2026)
Evolutionary Perspectives on the Evaluation of LLM-Based AI Agents: A Comprehensive Survey
von: Zhu, Jiachen, et al.
Veröffentlicht: (2025)
von: Zhu, Jiachen, et al.
Veröffentlicht: (2025)
AgentVista: Evaluating Multimodal Agents in Ultra-Challenging Realistic Visual Scenarios
von: Su, Zhaochen, et al.
Veröffentlicht: (2026)
von: Su, Zhaochen, et al.
Veröffentlicht: (2026)
AndroidLens: Long-latency Evaluation with Nested Sub-targets for Android GUI Agents
von: Cao, Yue, et al.
Veröffentlicht: (2025)
von: Cao, Yue, et al.
Veröffentlicht: (2025)
HindSight: Evaluating LLM-Generated Research Ideas via Future Impact
von: Jiang, Bo
Veröffentlicht: (2026)
von: Jiang, Bo
Veröffentlicht: (2026)
When AI Agents Collude Online: Financial Fraud Risks by Collaborative LLM Agents on Social Platforms
von: Ren, Qibing, et al.
Veröffentlicht: (2025)
von: Ren, Qibing, et al.
Veröffentlicht: (2025)
NeuroLip: An Event-driven Spatiotemporal Learning Framework for Cross-Scene Lip-Motion-based Visual Speaker Recognition
von: Yao, Junguang, et al.
Veröffentlicht: (2026)
von: Yao, Junguang, et al.
Veröffentlicht: (2026)
Chinese SafetyQA: A Safety Short-form Factuality Benchmark for Large Language Models
von: Tan, Yingshui, et al.
Veröffentlicht: (2024)
von: Tan, Yingshui, et al.
Veröffentlicht: (2024)
Enhancing Interpretable Image Classification Through LLM Agents and Conditional Concept Bottleneck Models
von: Jiang, Yiwen, et al.
Veröffentlicht: (2025)
von: Jiang, Yiwen, et al.
Veröffentlicht: (2025)
Reinforced Preference Optimization for Recommendation
von: Tan, Junfei, et al.
Veröffentlicht: (2025)
von: Tan, Junfei, et al.
Veröffentlicht: (2025)
Solving the Content Gap in Roblox Game Recommendations: LLM-Based Profile Generation and Reranking
von: Wang, Chen, et al.
Veröffentlicht: (2025)
von: Wang, Chen, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
GraphReader: Building Graph-based Agent to Enhance Long-Context Abilities of Large Language Models
von: Li, Shilong, et al.
Veröffentlicht: (2024) -
AIR: Complex Instruction Generation via Automatic Iterative Refinement
von: Liu, Wei, et al.
Veröffentlicht: (2025) -
Chinese SimpleQA: A Chinese Factuality Evaluation for Large Language Models
von: He, Yancheng, et al.
Veröffentlicht: (2024) -
2D-DPO: Scaling Direct Preference Optimization with 2-Dimensional Supervision
von: Li, Shilong, et al.
Veröffentlicht: (2024) -
ChineseEcomQA: A Scalable E-commerce Concept Evaluation Benchmark for Large Language Models
von: Chen, Haibin, et al.
Veröffentlicht: (2025)