Playing With AI: How Do State-Of-The-Art Large Language Models Perform in the 1977 Text-Based Adventure Game Zork?
Fuente:
arXiv
Salvato in:
| Autore principale: | Gerrits, Berry |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Can Large Language Models Play Text Games Well? Current State-of-the-Art and Open Questions
di: Tsai, Chen Feng, et al.
Pubblicazione: (2023)
di: Tsai, Chen Feng, et al.
Pubblicazione: (2023)
GenQuest: An LLM-based Text Adventure Game for Language Learners
di: Wang, Qiao, et al.
Pubblicazione: (2025)
di: Wang, Qiao, et al.
Pubblicazione: (2025)
TextGames: Learning to Self-Play Text-Based Puzzle Games via Language Model Reasoning
di: Hudi, Frederikus, et al.
Pubblicazione: (2025)
di: Hudi, Frederikus, et al.
Pubblicazione: (2025)
RPGBENCH: Evaluating Large Language Models as Role-Playing Game Engines
di: Yu, Pengfei, et al.
Pubblicazione: (2025)
di: Yu, Pengfei, et al.
Pubblicazione: (2025)
Credence Calibration Game? Calibrating Large Language Models through Structured Play
di: Fang, Ke, et al.
Pubblicazione: (2025)
di: Fang, Ke, et al.
Pubblicazione: (2025)
TALES: Text Adventure Learning Environment Suite
di: Cui, Christopher Zhang, et al.
Pubblicazione: (2025)
di: Cui, Christopher Zhang, et al.
Pubblicazione: (2025)
A Text-to-Game Engine for UGC-Based Role-Playing Games
di: Zhang, Lei, et al.
Pubblicazione: (2024)
di: Zhang, Lei, et al.
Pubblicazione: (2024)
How Different AI Chatbots Behave? Benchmarking Large Language Models in Behavioral Economics Games
di: Xie, Yutong, et al.
Pubblicazione: (2024)
di: Xie, Yutong, et al.
Pubblicazione: (2024)
LASP: Surveying the State-of-the-Art in Large Language Model-Assisted AI Planning
di: Li, Haoming, et al.
Pubblicazione: (2024)
di: Li, Haoming, et al.
Pubblicazione: (2024)
TextQuests: How Good are LLMs at Text-Based Video Games?
di: Phan, Long, et al.
Pubblicazione: (2025)
di: Phan, Long, et al.
Pubblicazione: (2025)
TextAtari: 100K Frames Game Playing with Language Agents
di: Li, Wenhao, et al.
Pubblicazione: (2025)
di: Li, Wenhao, et al.
Pubblicazione: (2025)
How Well Do Large Language Models Truly Ground?
di: Lee, Hyunji, et al.
Pubblicazione: (2023)
di: Lee, Hyunji, et al.
Pubblicazione: (2023)
Playing Language Game with LLMs Leads to Jailbreaking
di: Peng, Yu, et al.
Pubblicazione: (2024)
di: Peng, Yu, et al.
Pubblicazione: (2024)
Can AI Master Construction Management (CM)? Benchmarking State-of-the-Art Large Language Models on CM Certification Exams
di: Xiong, Ruoxin, et al.
Pubblicazione: (2025)
di: Xiong, Ruoxin, et al.
Pubblicazione: (2025)
(How) Do Language Models Track State?
di: Li, Belinda Z., et al.
Pubblicazione: (2025)
di: Li, Belinda Z., et al.
Pubblicazione: (2025)
Efficient Language Adaptive Pre-training: Extending State-of-the-Art Large Language Models for Polish
di: Ruciński, Szymon
Pubblicazione: (2024)
di: Ruciński, Szymon
Pubblicazione: (2024)
Using Game Play to Investigate Multimodal and Conversational Grounding in Large Multimodal Models
di: Hakimov, Sherzod, et al.
Pubblicazione: (2024)
di: Hakimov, Sherzod, et al.
Pubblicazione: (2024)
FlashAdventure: A Benchmark for GUI Agents Solving Full Story Arcs in Diverse Adventure Games
di: Ahn, Jaewoo, et al.
Pubblicazione: (2025)
di: Ahn, Jaewoo, et al.
Pubblicazione: (2025)
Reasoning Capabilities of Large Language Models. Lessons Learned from General Game Playing
di: Świechowski, Maciej, et al.
Pubblicazione: (2026)
di: Świechowski, Maciej, et al.
Pubblicazione: (2026)
Role-Playing Evaluation for Large Language Models
di: Boudouri, Yassine El, et al.
Pubblicazione: (2025)
di: Boudouri, Yassine El, et al.
Pubblicazione: (2025)
State of the Art in Text Classification for South Slavic Languages: Fine-Tuning or Prompting?
di: Pungeršek, Taja Kuzman, et al.
Pubblicazione: (2025)
di: Pungeršek, Taja Kuzman, et al.
Pubblicazione: (2025)
SPFT-SQL: Enhancing Large Language Model for Text-to-SQL Parsing by Self-Play Fine-Tuning
di: Zhang, Yuhao, et al.
Pubblicazione: (2025)
di: Zhang, Yuhao, et al.
Pubblicazione: (2025)
Large Language Models in Cybersecurity: State-of-the-Art
di: Motlagh, Farzad Nourmohammadzadeh, et al.
Pubblicazione: (2024)
di: Motlagh, Farzad Nourmohammadzadeh, et al.
Pubblicazione: (2024)
How Many Parameters Does it Take to Change a Light Bulb? Evaluating Performance in Self-Play of Conversational Games as a Function of Model Characteristics
di: Bhavsar, Nidhir, et al.
Pubblicazione: (2024)
di: Bhavsar, Nidhir, et al.
Pubblicazione: (2024)
Lost in the Pipeline: How Well Do Large Language Models Handle Data Preparation?
di: Spreafico, Matteo, et al.
Pubblicazione: (2025)
di: Spreafico, Matteo, et al.
Pubblicazione: (2025)
How Do Language Models Compose Functions?
di: Khandelwal, Apoorv, et al.
Pubblicazione: (2025)
di: Khandelwal, Apoorv, et al.
Pubblicazione: (2025)
AI Generated Text Detection Using Instruction Fine-tuned Large Language and Transformer-Based Models
di: Guggilla, Chinnappa, et al.
Pubblicazione: (2025)
di: Guggilla, Chinnappa, et al.
Pubblicazione: (2025)
Eliciting and Analyzing Emergent Misalignment in State-of-the-Art Large Language Models
di: Panpatil, Siddhant, et al.
Pubblicazione: (2025)
di: Panpatil, Siddhant, et al.
Pubblicazione: (2025)
Do Large Language Models Know How Much They Know?
di: Prato, Gabriele, et al.
Pubblicazione: (2025)
di: Prato, Gabriele, et al.
Pubblicazione: (2025)
The Oscars of AI Theater: A Survey on Role-Playing with Language Models
di: Chen, Nuo, et al.
Pubblicazione: (2024)
di: Chen, Nuo, et al.
Pubblicazione: (2024)
Persona-Based Conversational AI: State of the Art and Challenges
di: Liu, Junfeng, et al.
Pubblicazione: (2022)
di: Liu, Junfeng, et al.
Pubblicazione: (2022)
A Practical Examination of AI-Generated Text Detectors for Large Language Models
di: Tufts, Brian, et al.
Pubblicazione: (2024)
di: Tufts, Brian, et al.
Pubblicazione: (2024)
The Arabic AI Fingerprint: Stylometric Analysis and Detection of Large Language Models Text
di: Al-Shaibani, Maged S., et al.
Pubblicazione: (2025)
di: Al-Shaibani, Maged S., et al.
Pubblicazione: (2025)
Large Language Models can be Guided to Evade AI-Generated Text Detection
di: Lu, Ning, et al.
Pubblicazione: (2023)
di: Lu, Ning, et al.
Pubblicazione: (2023)
LogicGame: Benchmarking Rule-Based Reasoning Abilities of Large Language Models
di: Gui, Jiayi, et al.
Pubblicazione: (2024)
di: Gui, Jiayi, et al.
Pubblicazione: (2024)
How Do Humans Write Code? Large Models Do It the Same Way Too
di: Li, Long, et al.
Pubblicazione: (2024)
di: Li, Long, et al.
Pubblicazione: (2024)
Persuasion Games using Large Language Models
di: Ramani, Ganesh Prasath, et al.
Pubblicazione: (2024)
di: Ramani, Ganesh Prasath, et al.
Pubblicazione: (2024)
On the Decision-Making Abilities in Role-Playing using Large Language Models
di: Shen, Chenglei, et al.
Pubblicazione: (2024)
di: Shen, Chenglei, et al.
Pubblicazione: (2024)
AyurParam: A State-of-the-Art Bilingual Language Model for Ayurveda
di: Nauman, Mohd, et al.
Pubblicazione: (2025)
di: Nauman, Mohd, et al.
Pubblicazione: (2025)
Do Large Language Models Perform the Way People Expect? Measuring the Human Generalization Function
di: Vafa, Keyon, et al.
Pubblicazione: (2024)
di: Vafa, Keyon, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Can Large Language Models Play Text Games Well? Current State-of-the-Art and Open Questions
di: Tsai, Chen Feng, et al.
Pubblicazione: (2023) -
GenQuest: An LLM-based Text Adventure Game for Language Learners
di: Wang, Qiao, et al.
Pubblicazione: (2025) -
TextGames: Learning to Self-Play Text-Based Puzzle Games via Language Model Reasoning
di: Hudi, Frederikus, et al.
Pubblicazione: (2025) -
RPGBENCH: Evaluating Large Language Models as Role-Playing Game Engines
di: Yu, Pengfei, et al.
Pubblicazione: (2025) -
Credence Calibration Game? Calibrating Large Language Models through Structured Play
di: Fang, Ke, et al.
Pubblicazione: (2025)