ChronoPlay: A Framework for Modeling Dual Dynamics and Authenticity in Game RAG Benchmarks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | He, Liyang, Zhang, Yuren, Zhu, Ziwei, Li, Zhenghui, Tong, Shiwei |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
YpathRAG:A Retrieval-Augmented Generation Framework and Benchmark for Pathology
par: Yu, Deshui, et autres
Publié: (2025)
par: Yu, Deshui, et autres
Publié: (2025)
Chronos: Learning Temporal Dynamics of Reasoning Chains for Test-Time Scaling
par: Zhang, Kai, et autres
Publié: (2026)
par: Zhang, Kai, et autres
Publié: (2026)
FIT-RAG: Black-Box RAG with Factual Information and Token Reduction
par: Mao, Yuren, et autres
Publié: (2024)
par: Mao, Yuren, et autres
Publié: (2024)
ChronoMagic-Bench: A Benchmark for Metamorphic Evaluation of Text-to-Time-lapse Video Generation
par: Yuan, Shenghai, et autres
Publié: (2024)
par: Yuan, Shenghai, et autres
Publié: (2024)
Ethical Considerations of Large Language Models in Game Playing
par: Zhang, Qingquan, et autres
Publié: (2025)
par: Zhang, Qingquan, et autres
Publié: (2025)
Learning to Play Like Humans: A Framework for LLM Adaptation in Interactive Fiction Games
par: Zhang, Jinming, et autres
Publié: (2025)
par: Zhang, Jinming, et autres
Publié: (2025)
SUBQRAG: Sub-Question Driven Dynamic Graph RAG
par: Li, Jiaoyang, et autres
Publié: (2025)
par: Li, Jiaoyang, et autres
Publié: (2025)
FAB-Bench: A Framework for Adaptive RAG Benchmarking in Semiconductor Manufacturing
par: Qian, Jingbin, et autres
Publié: (2026)
par: Qian, Jingbin, et autres
Publié: (2026)
Benchmarking Large Language Models for Conversational Question Answering in Multi-instructional Documents
par: Wu, Shiwei, et autres
Publié: (2024)
par: Wu, Shiwei, et autres
Publié: (2024)
Context-Guided Dynamic Retrieval for Improving Generation Quality in RAG Models
par: He, Jacky, et autres
Publié: (2025)
par: He, Jacky, et autres
Publié: (2025)
CRUD-RAG: A Comprehensive Chinese Benchmark for Retrieval-Augmented Generation of Large Language Models
par: Lyu, Yuanjie, et autres
Publié: (2024)
par: Lyu, Yuanjie, et autres
Publié: (2024)
Detecting RAG Extraction Attack via Dual-Path Runtime Integrity Game
par: Xie, Yuanbo, et autres
Publié: (2026)
par: Xie, Yuanbo, et autres
Publié: (2026)
ChronoFact: Timeline-based Temporal Fact Verification
par: Barik, Anab Maulana, et autres
Publié: (2024)
par: Barik, Anab Maulana, et autres
Publié: (2024)
TurnaboutLLM: A Deductive Reasoning Benchmark from Detective Games
par: Yuan, Yuan, et autres
Publié: (2025)
par: Yuan, Yuan, et autres
Publié: (2025)
Modeling Uncertainty Trends for Timely Retrieval in Dynamic RAG
par: Li, Bo, et autres
Publié: (2025)
par: Li, Bo, et autres
Publié: (2025)
RPGBENCH: Evaluating Large Language Models as Role-Playing Game Engines
par: Yu, Pengfei, et autres
Publié: (2025)
par: Yu, Pengfei, et autres
Publié: (2025)
Global-Recent Semantic Reasoning on Dynamic Text-Attributed Graphs with Large Language Models
par: Wang, Yunan, et autres
Publié: (2025)
par: Wang, Yunan, et autres
Publié: (2025)
Less Is More: Elevating RAG via Performance-Driven Context Compression
par: Cui, Ziqiang, et autres
Publié: (2025)
par: Cui, Ziqiang, et autres
Publié: (2025)
Play to Generalize: Learning to Reason Through Game Play
par: Xie, Yunfei, et autres
Publié: (2025)
par: Xie, Yunfei, et autres
Publié: (2025)
DaPT: A Dual-Path Framework for Multilingual Multi-hop Question Answering
par: Wang, Yilin, et autres
Publié: (2026)
par: Wang, Yilin, et autres
Publié: (2026)
Enhance Reasoning for Large Language Models in the Game Werewolf
par: Wu, Shuang, et autres
Publié: (2024)
par: Wu, Shuang, et autres
Publié: (2024)
DEBATE: A Large-Scale Benchmark for Evaluating Opinion Dynamics in Role-Playing LLM Agents
par: Chuang, Yun-Shiuan, et autres
Publié: (2025)
par: Chuang, Yun-Shiuan, et autres
Publié: (2025)
Efficacy of Language Model Self-Play in Non-Zero-Sum Games
par: Liao, Austen, et autres
Publié: (2024)
par: Liao, Austen, et autres
Publié: (2024)
A Survey on Large Language Model Benchmarks
par: Ni, Shiwen, et autres
Publié: (2025)
par: Ni, Shiwen, et autres
Publié: (2025)
WildGraphBench: Benchmarking GraphRAG with Wild-Source Corpora
par: Wang, Pengyu, et autres
Publié: (2026)
par: Wang, Pengyu, et autres
Publié: (2026)
CRAG -- Comprehensive RAG Benchmark
par: Yang, Xiao, et autres
Publié: (2024)
par: Yang, Xiao, et autres
Publié: (2024)
LexChronos: An Agentic Framework for Structured Event Timeline Extraction in Indian Jurisprudence
par: Tummepalli, Anka Chandrahas, et autres
Publié: (2026)
par: Tummepalli, Anka Chandrahas, et autres
Publié: (2026)
RoleMRC: A Fine-Grained Composite Benchmark for Role-Playing and Instruction-Following
par: Lu, Junru, et autres
Publié: (2025)
par: Lu, Junru, et autres
Publié: (2025)
TextGames: Learning to Self-Play Text-Based Puzzle Games via Language Model Reasoning
par: Hudi, Frederikus, et autres
Publié: (2025)
par: Hudi, Frederikus, et autres
Publié: (2025)
A Text-to-Game Engine for UGC-Based Role-Playing Games
par: Zhang, Lei, et autres
Publié: (2024)
par: Zhang, Lei, et autres
Publié: (2024)
RAG over Tables: Hierarchical Memory Index, Multi-Stage Retrieval, and Benchmarking
par: Zou, Jiaru, et autres
Publié: (2025)
par: Zou, Jiaru, et autres
Publié: (2025)
SpeechRole: A Large-Scale Dataset and Benchmark for Evaluating Speech Role-Playing Agents
par: Jiang, Changhao, et autres
Publié: (2025)
par: Jiang, Changhao, et autres
Publié: (2025)
MTRAG-UN: A Benchmark for Open Challenges in Multi-Turn RAG Conversations
par: Rosenthal, Sara, et autres
Publié: (2026)
par: Rosenthal, Sara, et autres
Publié: (2026)
Playing Language Game with LLMs Leads to Jailbreaking
par: Peng, Yu, et autres
Publié: (2024)
par: Peng, Yu, et autres
Publié: (2024)
SeCon-RAG: A Two-Stage Semantic Filtering and Conflict-Free Framework for Trustworthy RAG
par: Si, Xiaonan, et autres
Publié: (2025)
par: Si, Xiaonan, et autres
Publié: (2025)
LLM-KT: Aligning Large Language Models with Knowledge Tracing using a Plug-and-Play Instruction
par: Wang, Ziwei, et autres
Publié: (2025)
par: Wang, Ziwei, et autres
Publié: (2025)
CFMS: A Coarse-to-Fine Multimodal Synthesis Framework for Enhanced Tabular Reasoning
par: Huang, Qixian, et autres
Publié: (2026)
par: Huang, Qixian, et autres
Publié: (2026)
Words at Play: Benchmarking Audio Pun Understanding in Large Audio-Language Models
par: Su, Yuchen, et autres
Publié: (2026)
par: Su, Yuchen, et autres
Publié: (2026)
ING-VP: MLLMs cannot Play Easy Vision-based Games Yet
par: Zhang, Haoran, et autres
Publié: (2024)
par: Zhang, Haoran, et autres
Publié: (2024)
Bias Association Discovery Framework for Open-Ended LLM Generations
par: Pan, Jinhao, et autres
Publié: (2025)
par: Pan, Jinhao, et autres
Publié: (2025)
Documents similaires
-
YpathRAG:A Retrieval-Augmented Generation Framework and Benchmark for Pathology
par: Yu, Deshui, et autres
Publié: (2025) -
Chronos: Learning Temporal Dynamics of Reasoning Chains for Test-Time Scaling
par: Zhang, Kai, et autres
Publié: (2026) -
FIT-RAG: Black-Box RAG with Factual Information and Token Reduction
par: Mao, Yuren, et autres
Publié: (2024) -
ChronoMagic-Bench: A Benchmark for Metamorphic Evaluation of Text-to-Time-lapse Video Generation
par: Yuan, Shenghai, et autres
Publié: (2024) -
Ethical Considerations of Large Language Models in Game Playing
par: Zhang, Qingquan, et autres
Publié: (2025)