ByteSized32Refactored: Towards an Extensible Interactive Text Games Corpus for LLM World Modeling and Evaluation
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Haonan, Sun, Junfeng, Yuan, Xingdi, Wang, Ruoyao, Xiao, Ziang |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Can Language Models Serve as Text-Based World Simulators?
by: Wang, Ruoyao, et al.
Published: (2024)
by: Wang, Ruoyao, et al.
Published: (2024)
Design and Optimization of Reinforcement Learning-Based Agents in Text-Based Games
by: Wang, Haonan, et al.
Published: (2025)
by: Wang, Haonan, et al.
Published: (2025)
TALES: Text Adventure Learning Environment Suite
by: Cui, Christopher Zhang, et al.
Published: (2025)
by: Cui, Christopher Zhang, et al.
Published: (2025)
Enhancing Agent Learning through World Dynamics Modeling
by: Sun, Zhiyuan, et al.
Published: (2024)
by: Sun, Zhiyuan, et al.
Published: (2024)
Evaluating Large Language Models with Grid-Based Game Competitions: An Extensible LLM Benchmark and Leaderboard
by: Topsakal, Oguzhan, et al.
Published: (2024)
by: Topsakal, Oguzhan, et al.
Published: (2024)
Skill-as-Pseudocode: Refactoring Skill Libraries to Pseudocode for LLM Agents
by: Li, Xinze, et al.
Published: (2026)
by: Li, Xinze, et al.
Published: (2026)
Determinants of Training Corpus Size for Clinical Text Classification
by: Chaturvedi, Jaya, et al.
Published: (2026)
by: Chaturvedi, Jaya, et al.
Published: (2026)
Research on the Integration of Embodied Intelligence and Reinforcement Learning in Textual Domains
by: Wang, Haonan, et al.
Published: (2025)
by: Wang, Haonan, et al.
Published: (2025)
Extensible Embedding: A Flexible Multipler For LLM's Context Length
by: Shao, Ninglu, et al.
Published: (2024)
by: Shao, Ninglu, et al.
Published: (2024)
Toward Corpus Size Requirements for Training and Evaluating Depression Risk Models Using Spoken Language
by: Rutowski, Tomek, et al.
Published: (2024)
by: Rutowski, Tomek, et al.
Published: (2024)
ZeroSumEval: An Extensible Framework For Scaling LLM Evaluation with Inter-Model Competition
by: Alyahya, Hisham A., et al.
Published: (2025)
by: Alyahya, Hisham A., et al.
Published: (2025)
Towards Algebraic Subtyping for Extensible Records
by: Marques, Rodrigo, et al.
Published: (2024)
by: Marques, Rodrigo, et al.
Published: (2024)
debug-gym: A Text-Based Environment for Interactive Debugging
by: Yuan, Xingdi, et al.
Published: (2025)
by: Yuan, Xingdi, et al.
Published: (2025)
GenQuest: An LLM-based Text Adventure Game for Language Learners
by: Wang, Qiao, et al.
Published: (2025)
by: Wang, Qiao, et al.
Published: (2025)
AMONGAGENTS: Evaluating Large Language Models in the Interactive Text-Based Social Deduction Game
by: Chi, Yizhou, et al.
Published: (2024)
by: Chi, Yizhou, et al.
Published: (2024)
Matter-of-Fact: A Benchmark for Verifying the Feasibility of Literature-Supported Claims in Materials Science
by: Jansen, Peter, et al.
Published: (2025)
by: Jansen, Peter, et al.
Published: (2025)
BatchEval: Towards Human-like Text Evaluation
by: Yuan, Peiwen, et al.
Published: (2023)
by: Yuan, Peiwen, et al.
Published: (2023)
Guiding Language Model Reasoning with Planning Tokens
by: Wang, Xinyi, et al.
Published: (2023)
by: Wang, Xinyi, et al.
Published: (2023)
Llama See, Llama Do: A Mechanistic Perspective on Contextual Entrainment and Distraction in LLMs
by: Niu, Jingcheng, et al.
Published: (2025)
by: Niu, Jingcheng, et al.
Published: (2025)
From Text to Trust: Empowering AI-assisted Decision Making with Adaptive LLM-powered Analysis
by: Li, Zhuoyan, et al.
Published: (2025)
by: Li, Zhuoyan, et al.
Published: (2025)
Policy Improvement using Language Feedback Models
by: Zhong, Victor, et al.
Published: (2024)
by: Zhong, Victor, et al.
Published: (2024)
Towards Better Text-to-Image Generation Alignment via Attention Modulation
by: Wu, Yihang, et al.
Published: (2024)
by: Wu, Yihang, et al.
Published: (2024)
Flexibly Scaling Large Language Models Contexts Through Extensible Tokenization
by: Shao, Ninglu, et al.
Published: (2024)
by: Shao, Ninglu, et al.
Published: (2024)
ACR: Adaptive Context Refactoring via Context Refactoring Operators for Multi-Turn Dialogue
by: Shen, Jiawei, et al.
Published: (2026)
by: Shen, Jiawei, et al.
Published: (2026)
DetectRL-X: Towards Reliable Multilingual and Real-World LLM-Generated Text Detection
by: Wu, Junchao, et al.
Published: (2026)
by: Wu, Junchao, et al.
Published: (2026)
Hybrid Human-LLM Corpus Construction and LLM Evaluation for Rare Linguistic Phenomena
by: Weissweiler, Leonie, et al.
Published: (2024)
by: Weissweiler, Leonie, et al.
Published: (2024)
TinyScientist: An Interactive, Extensible, and Controllable Framework for Building Research Agents
by: Yu, Haofei, et al.
Published: (2025)
by: Yu, Haofei, et al.
Published: (2025)
NLP Workbench: Efficient and Extensible Integration of State-of-the-art Text Mining Tools
by: Yao, Peiran, et al.
Published: (2023)
by: Yao, Peiran, et al.
Published: (2023)
Distilling Token-Trained Models into Byte-Level Models
by: Bao, Zishuo, et al.
Published: (2026)
by: Bao, Zishuo, et al.
Published: (2026)
Scratchpad Patching: Decoupling Compute from Patch Size in Byte-Level Language Models
by: Zheng, Lin, et al.
Published: (2026)
by: Zheng, Lin, et al.
Published: (2026)
Learning to Rewrite: Generalized LLM-Generated Text Detection
by: Li, Ran, et al.
Published: (2024)
by: Li, Ran, et al.
Published: (2024)
Sticking to the Mean: Detecting Sticky Tokens in Text Embedding Models
by: Chen, Kexin, et al.
Published: (2025)
by: Chen, Kexin, et al.
Published: (2025)
Creating an Aligned Corpus of Sound and Text: The Multimodal Corpus of Shakespeare and Milton
by: Agirrezabal, Manex
Published: (2024)
by: Agirrezabal, Manex
Published: (2024)
RAVEL: Reasoning Agents for Validating and Evaluating LLM Text Synthesis
by: Feng, Andrew Zhuoer, et al.
Published: (2026)
by: Feng, Andrew Zhuoer, et al.
Published: (2026)
The SAMER Arabic Text Simplification Corpus
by: Alhafni, Bashar, et al.
Published: (2024)
by: Alhafni, Bashar, et al.
Published: (2024)
From Text to CQL: Bridging Natural Language and Corpus Search Engine
by: Lu, Luming, et al.
Published: (2024)
by: Lu, Luming, et al.
Published: (2024)
PRISM: Parametrically Refactoring Inference for Speculative Sampling Draft Models
by: Wang, Xuliang, et al.
Published: (2026)
by: Wang, Xuliang, et al.
Published: (2026)
Growing Pains: Extensible and Efficient LLM Benchmarking Via Fixed Parameter Calibration
by: Habba, Eliya, et al.
Published: (2026)
by: Habba, Eliya, et al.
Published: (2026)
Easy Dataset: A Unified and Extensible Framework for Synthesizing LLM Fine-Tuning Data from Unstructured Documents
by: Miao, Ziyang, et al.
Published: (2025)
by: Miao, Ziyang, et al.
Published: (2025)
CritiqueLLM: Towards an Informative Critique Generation Model for Evaluation of Large Language Model Generation
by: Ke, Pei, et al.
Published: (2023)
by: Ke, Pei, et al.
Published: (2023)
Similar Items
-
Can Language Models Serve as Text-Based World Simulators?
by: Wang, Ruoyao, et al.
Published: (2024) -
Design and Optimization of Reinforcement Learning-Based Agents in Text-Based Games
by: Wang, Haonan, et al.
Published: (2025) -
TALES: Text Adventure Learning Environment Suite
by: Cui, Christopher Zhang, et al.
Published: (2025) -
Enhancing Agent Learning through World Dynamics Modeling
by: Sun, Zhiyuan, et al.
Published: (2024) -
Evaluating Large Language Models with Grid-Based Game Competitions: An Extensible LLM Benchmark and Leaderboard
by: Topsakal, Oguzhan, et al.
Published: (2024)