PTCG-Bench: Can LLM Agents Master Pokémon Trading Card Game?
Fuente:
arXiv
Salvato in:
| Autori principali: | Hua, Dongdong, Sun, Yifei, Huang, Renhong, Gao, Feng, Wang, Chunping, Yang, Yang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
RAT: RunAnyThing via Fully Automated Environment Configuration
di: Huang, Renhong, et al.
Pubblicazione: (2026)
di: Huang, Renhong, et al.
Pubblicazione: (2026)
From LLM-Driven Trading Card Generation to Procedural Relatedness: A Pokémon Case Study
di: Pfau, Johannes, et al.
Pubblicazione: (2026)
di: Pfau, Johannes, et al.
Pubblicazione: (2026)
POLAR-Bench: A Diagnostic Benchmark for Privacy-Utility Trade-offs in LLM Agents
di: Zheng, Qiaoyuan, et al.
Pubblicazione: (2026)
di: Zheng, Qiaoyuan, et al.
Pubblicazione: (2026)
Agent^2 RL-Bench: Can LLM Agents Engineer Agentic RL Post-Training?
di: Chen, Wanyi, et al.
Pubblicazione: (2026)
di: Chen, Wanyi, et al.
Pubblicazione: (2026)
VGC-Bench: Towards Mastering Diverse Team Strategies in Competitive Pokémon
di: Angliss, Cameron, et al.
Pubblicazione: (2025)
di: Angliss, Cameron, et al.
Pubblicazione: (2025)
Agent Security Bench (ASB): Formalizing and Benchmarking Attacks and Defenses in LLM-based Agents
di: Zhang, Hanrong, et al.
Pubblicazione: (2024)
di: Zhang, Hanrong, et al.
Pubblicazione: (2024)
$C^3$-Bench: The Things Real Disturbing LLM based Agent in Multi-Tasking
di: Yu, Peijie, et al.
Pubblicazione: (2025)
di: Yu, Peijie, et al.
Pubblicazione: (2025)
GameBench: Evaluating Strategic Reasoning Abilities of LLM Agents
di: Costarelli, Anthony, et al.
Pubblicazione: (2024)
di: Costarelli, Anthony, et al.
Pubblicazione: (2024)
PokeLLMon: A Human-Parity Agent for Pokemon Battles with Large Language Models
di: Hu, Sihao, et al.
Pubblicazione: (2024)
di: Hu, Sihao, et al.
Pubblicazione: (2024)
Multi-Mission Tool Bench: Assessing the Robustness of LLM based Agents through Related and Dynamic Missions
di: Yu, Peijie, et al.
Pubblicazione: (2025)
di: Yu, Peijie, et al.
Pubblicazione: (2025)
Learning to Beat ByteRL: Exploitability of Collectible Card Game Agents
di: Haluska, Radovan, et al.
Pubblicazione: (2024)
di: Haluska, Radovan, et al.
Pubblicazione: (2024)
RAPO: Expanding Exploration for LLM Agents via Retrieval-Augmented Policy Optimization
di: Zhang, Siwei, et al.
Pubblicazione: (2026)
di: Zhang, Siwei, et al.
Pubblicazione: (2026)
MIRAGE-Bench: LLM Agent is Hallucinating and Where to Find Them
di: Zhang, Weichen, et al.
Pubblicazione: (2025)
di: Zhang, Weichen, et al.
Pubblicazione: (2025)
PolicySim: An LLM-Based Agent Social Simulation Sandbox for Proactive Policy Optimization
di: Huang, Renhong, et al.
Pubblicazione: (2026)
di: Huang, Renhong, et al.
Pubblicazione: (2026)
Experience Transfer for Multimodal LLM Agents in Minecraft Game
di: Li, Chenghao, et al.
Pubblicazione: (2026)
di: Li, Chenghao, et al.
Pubblicazione: (2026)
A Multi-Agent Pokemon Tournament for Evaluating Strategic Reasoning of Large Language Models
di: Yashwanth, Tadisetty Sai, et al.
Pubblicazione: (2025)
di: Yashwanth, Tadisetty Sai, et al.
Pubblicazione: (2025)
InnovatorBench: Evaluating Agents' Ability to Conduct Innovative LLM Research
di: Wu, Yunze, et al.
Pubblicazione: (2025)
di: Wu, Yunze, et al.
Pubblicazione: (2025)
TradeTrap: Are LLM-based Trading Agents Truly Reliable and Faithful?
di: Yan, Lewen, et al.
Pubblicazione: (2025)
di: Yan, Lewen, et al.
Pubblicazione: (2025)
FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use
di: Lu, Jiaxuan, et al.
Pubblicazione: (2026)
di: Lu, Jiaxuan, et al.
Pubblicazione: (2026)
PostTrainBench: Can LLM Agents Automate LLM Post-Training?
di: Rank, Ben, et al.
Pubblicazione: (2026)
di: Rank, Ben, et al.
Pubblicazione: (2026)
LLMs May Not Be Human-Level Players, But They Can Be Testers: Measuring Game Difficulty with LLM Agents
di: Xiao, Chang, et al.
Pubblicazione: (2024)
di: Xiao, Chang, et al.
Pubblicazione: (2024)
Large Language Models as Pokémon Battle Agents: Strategic Play and Content Generation
di: Jain, Daksh, et al.
Pubblicazione: (2025)
di: Jain, Daksh, et al.
Pubblicazione: (2025)
CO-Bench: Benchmarking Language Model Agents in Algorithm Search for Combinatorial Optimization
di: Sun, Weiwei, et al.
Pubblicazione: (2025)
di: Sun, Weiwei, et al.
Pubblicazione: (2025)
ContractBench: Can LLM Agents Preserve Observation Contracts?
di: Wang, Jicheng, et al.
Pubblicazione: (2026)
di: Wang, Jicheng, et al.
Pubblicazione: (2026)
SkillMaster: Toward Autonomous Skill Mastery in LLM Agents
di: Yang, Min, et al.
Pubblicazione: (2026)
di: Yang, Min, et al.
Pubblicazione: (2026)
SkillGenBench: Benchmarking Skill Generation Pipelines for LLM Agents
di: Zhou, Yifan, et al.
Pubblicazione: (2026)
di: Zhou, Yifan, et al.
Pubblicazione: (2026)
MCPAgentBench: A Real-world Task Benchmark for Evaluating LLM Agent MCP Tool Use
di: Liu, Wenrui, et al.
Pubblicazione: (2025)
di: Liu, Wenrui, et al.
Pubblicazione: (2025)
TradingAgents: Multi-Agents LLM Financial Trading Framework
di: Xiao, Yijia, et al.
Pubblicazione: (2024)
di: Xiao, Yijia, et al.
Pubblicazione: (2024)
UrzaGPT: LoRA-Tuned Large Language Models for Card Selection in Collectible Card Games
di: Bertram, Timo
Pubblicazione: (2025)
di: Bertram, Timo
Pubblicazione: (2025)
InteractWeb-Bench: Can Multimodal Agent Escape Blind Execution in Interactive Website Generation?
di: Wang, Qiyao, et al.
Pubblicazione: (2026)
di: Wang, Qiyao, et al.
Pubblicazione: (2026)
CrochetBench: Can Vision-Language Models Move from Describing to Doing in Crochet Domain?
di: Li, Peiyu, et al.
Pubblicazione: (2025)
di: Li, Peiyu, et al.
Pubblicazione: (2025)
REI-Bench: Can Embodied Agents Understand Vague Human Instructions in Task Planning?
di: Jiang, Chenxi, et al.
Pubblicazione: (2025)
di: Jiang, Chenxi, et al.
Pubblicazione: (2025)
DeliveryBench: Can Agents Earn Profit in Real World?
di: Mao, Lingjun, et al.
Pubblicazione: (2025)
di: Mao, Lingjun, et al.
Pubblicazione: (2025)
LifelongAgentBench: Evaluating LLM Agents as Lifelong Learners
di: Zheng, Junhao, et al.
Pubblicazione: (2025)
di: Zheng, Junhao, et al.
Pubblicazione: (2025)
Can LLM Agents Sustain Long-Horizon Organizational Dynamics?
di: Zhu, Xuancheng, et al.
Pubblicazione: (2026)
di: Zhu, Xuancheng, et al.
Pubblicazione: (2026)
A Taxonomy of Collectible Card Games from a Game-Playing AI Perspective
di: Vieira, Ronaldo e Silva, et al.
Pubblicazione: (2024)
di: Vieira, Ronaldo e Silva, et al.
Pubblicazione: (2024)
ProcCtrlBench: Evaluating Process-Level Defects and Control Preservation in LLM Coding Agents
di: He, Jiawei, et al.
Pubblicazione: (2026)
di: He, Jiawei, et al.
Pubblicazione: (2026)
FT-Dojo: Towards Autonomous LLM Fine-Tuning with Language Agents
di: Li, Qizheng, et al.
Pubblicazione: (2026)
di: Li, Qizheng, et al.
Pubblicazione: (2026)
A Survey on LLM-powered Agents for Recommender Systems
di: Peng, Qiyao, et al.
Pubblicazione: (2025)
di: Peng, Qiyao, et al.
Pubblicazione: (2025)
MLRC-Bench: Can Language Agents Solve Machine Learning Research Challenges?
di: Zhang, Yunxiang, et al.
Pubblicazione: (2025)
di: Zhang, Yunxiang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
RAT: RunAnyThing via Fully Automated Environment Configuration
di: Huang, Renhong, et al.
Pubblicazione: (2026) -
From LLM-Driven Trading Card Generation to Procedural Relatedness: A Pokémon Case Study
di: Pfau, Johannes, et al.
Pubblicazione: (2026) -
POLAR-Bench: A Diagnostic Benchmark for Privacy-Utility Trade-offs in LLM Agents
di: Zheng, Qiaoyuan, et al.
Pubblicazione: (2026) -
Agent^2 RL-Bench: Can LLM Agents Engineer Agentic RL Post-Training?
di: Chen, Wanyi, et al.
Pubblicazione: (2026) -
VGC-Bench: Towards Mastering Diverse Team Strategies in Competitive Pokémon
di: Angliss, Cameron, et al.
Pubblicazione: (2025)