TurtleBench: Evaluating Top Language Models via Real-World Yes/No Puzzles
Fuente:
arXiv
Saved in:
| Main Authors: | Yu, Qingchen, Song, Shichao, Fang, Ke, Shi, Yunfeng, Zheng, Zifan, Wang, Hanyu, Niu, Simin, Li, Zhiyu |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
TurtleBench: A Visual Programming Benchmark in Turtle Geometry
by: Rismanchian, Sina, et al.
Published: (2024)
by: Rismanchian, Sina, et al.
Published: (2024)
xFinder: Large Language Models as Automated Evaluators for Reliable Evaluation
by: Yu, Qingchen, et al.
Published: (2024)
by: Yu, Qingchen, et al.
Published: (2024)
GuessArena: Guess Who I Am? A Self-Adaptive Framework for Evaluating LLMs in Domain-Specific Knowledge and Reasoning
by: Yu, Qingchen, et al.
Published: (2025)
by: Yu, Qingchen, et al.
Published: (2025)
Internal Consistency and Self-Feedback in Large Language Models: A Survey
by: Liang, Xun, et al.
Published: (2024)
by: Liang, Xun, et al.
Published: (2024)
HRDE: Retrieval-Augmented Large Language Models for Chinese Health Rumor Detection and Explainability
by: Chen, Yanfang, et al.
Published: (2024)
by: Chen, Yanfang, et al.
Published: (2024)
SurveyX: Academic Survey Automation via Large Language Models
by: Liang, Xun, et al.
Published: (2025)
by: Liang, Xun, et al.
Published: (2025)
Empowering Large Language Models to Set up a Knowledge Retrieval Indexer via Self-Learning
by: Liang, Xun, et al.
Published: (2024)
by: Liang, Xun, et al.
Published: (2024)
Grimoire is All You Need for Enhancing Large Language Models
by: Chen, Ding, et al.
Published: (2024)
by: Chen, Ding, et al.
Published: (2024)
SEAP: Training-free Sparse Expert Activation Pruning Unlock the Brainpower of Large Language Models
by: Liang, Xun, et al.
Published: (2025)
by: Liang, Xun, et al.
Published: (2025)
Controllable Text Generation for Large Language Models: A Survey
by: Liang, Xun, et al.
Published: (2024)
by: Liang, Xun, et al.
Published: (2024)
SafeRAG: Benchmarking Security in Retrieval-Augmented Generation of Large Language Model
by: Liang, Xun, et al.
Published: (2025)
by: Liang, Xun, et al.
Published: (2025)
Attention Heads of Large Language Models: A Survey
by: Zheng, Zifan, et al.
Published: (2024)
by: Zheng, Zifan, et al.
Published: (2024)
Fake Artificial Intelligence Generated Contents (FAIGC): A Survey of Theories, Detection Methods, and Opportunities
by: Yu, Xiaomin, et al.
Published: (2024)
by: Yu, Xiaomin, et al.
Published: (2024)
MoM: Mixtures of Scenario-Aware Document Memories for Retrieval-Augmented Generation Systems
by: Zhao, Jihao, et al.
Published: (2025)
by: Zhao, Jihao, et al.
Published: (2025)
UHGEval: Benchmarking the Hallucination of Chinese Large Language Models via Unconstrained Generation
by: Liang, Xun, et al.
Published: (2023)
by: Liang, Xun, et al.
Published: (2023)
RoleCDE:Benchmarking and Mitigating Role-Alignment Trade-offs in Role-Playing Agents
by: Lai, Huayi, et al.
Published: (2026)
by: Lai, Huayi, et al.
Published: (2026)
WXImpactBench: A Disruptive Weather Impact Understanding Benchmark for Evaluating Large Language Models
by: Yu, Yongan, et al.
Published: (2025)
by: Yu, Yongan, et al.
Published: (2025)
Controlled Text Generation for Large Language Model with Dynamic Attribute Graphs
by: Liang, Xun, et al.
Published: (2024)
by: Liang, Xun, et al.
Published: (2024)
RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking
by: Yang, Shuo, et al.
Published: (2025)
by: Yang, Shuo, et al.
Published: (2025)
Should the Internet Be Censored? Yes! Yes! Yes! Yes!
by: Taylor, Bruce
Published: (1998)
by: Taylor, Bruce
Published: (1998)
PuzzleBench: A Fully Dynamic Evaluation Framework for Large Multimodal Models on Puzzle Solving
by: Zhang, Zeyu, et al.
Published: (2025)
by: Zhang, Zeyu, et al.
Published: (2025)
MemOS: An Operating System for Memory-Augmented Generation (MAG) in Large Language Models
by: Li, Zhiyu, et al.
Published: (2025)
by: Li, Zhiyu, et al.
Published: (2025)
ConsintBench: Evaluating Language Models on Real-World Consumer Intent Understanding
by: Li, Xiaozhe, et al.
Published: (2025)
by: Li, Xiaozhe, et al.
Published: (2025)
OccuBench: Evaluating AI Agents on Real-World Professional Tasks via Language Environment Simulation
by: Hu, Xiaomeng, et al.
Published: (2026)
by: Hu, Xiaomeng, et al.
Published: (2026)
What to Ask Next? Probing the Imaginative Reasoning of LLMs with TurtleSoup Puzzles
by: Zhou, Mengtao, et al.
Published: (2025)
by: Zhou, Mengtao, et al.
Published: (2025)
MoC: Mixtures of Text Chunking Learners for Retrieval-Augmented Generation System
by: Zhao, Jihao, et al.
Published: (2025)
by: Zhao, Jihao, et al.
Published: (2025)
Top General Performance = Top Domain Performance? DomainCodeBench: A Multi-domain Code Generation Benchmark
by: Zheng, Dewu, et al.
Published: (2024)
by: Zheng, Dewu, et al.
Published: (2024)
LiveTradeBench: Seeking Real-World Alpha with Large Language Models
by: Yu, Haofei, et al.
Published: (2025)
by: Yu, Haofei, et al.
Published: (2025)
QuarkMedBench: A Real-World Scenario Driven Benchmark for Evaluating Large Language Models
by: Wu, Yao, et al.
Published: (2026)
by: Wu, Yao, et al.
Published: (2026)
PLawBench: A Rubric-Based Benchmark for Evaluating LLMs in Real-World Legal Practice
by: Shi, Yuzhen, et al.
Published: (2026)
by: Shi, Yuzhen, et al.
Published: (2026)
MCP-AgentBench: Evaluating Real-World Language Agent Performance with MCP-Mediated Tools
by: Guo, Zikang, et al.
Published: (2025)
by: Guo, Zikang, et al.
Published: (2025)
HaluMem: Evaluating Hallucinations in Memory Systems of Agents
by: Chen, Ding, et al.
Published: (2025)
by: Chen, Ding, et al.
Published: (2025)
WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation
by: Ding, Shuangrui, et al.
Published: (2026)
by: Ding, Shuangrui, et al.
Published: (2026)
KeDuSR: Real-World Dual-Lens Super-Resolution via Kernel-Free Matching
by: Yue, Huanjing, et al.
Published: (2023)
by: Yue, Huanjing, et al.
Published: (2023)
PhysicianBench: Evaluating LLM Agents in Real-World EHR Environments
by: Liu, Ruoqi, et al.
Published: (2026)
by: Liu, Ruoqi, et al.
Published: (2026)
SWE-Skills-Bench: Do Agent Skills Actually Help in Real-World Software Engineering?
by: Han, Tingxu, et al.
Published: (2026)
by: Han, Tingxu, et al.
Published: (2026)
MobilityBench: A Benchmark for Evaluating Route-Planning Agents in Real-World Mobility Scenarios
by: Song, Zhiheng, et al.
Published: (2026)
by: Song, Zhiheng, et al.
Published: (2026)
T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation
by: Chen, Yubin, et al.
Published: (2025)
by: Chen, Yubin, et al.
Published: (2025)
IDE-Bench: Evaluating Large Language Models as IDE Agents on Real-World Software Engineering Tasks
by: Mateega, Spencer, et al.
Published: (2026)
by: Mateega, Spencer, et al.
Published: (2026)
SysMoBench: Evaluating AI on Formally Modeling Complex Real-World Systems
by: Cheng, Qian, et al.
Published: (2025)
by: Cheng, Qian, et al.
Published: (2025)
Similar Items
-
TurtleBench: A Visual Programming Benchmark in Turtle Geometry
by: Rismanchian, Sina, et al.
Published: (2024) -
xFinder: Large Language Models as Automated Evaluators for Reliable Evaluation
by: Yu, Qingchen, et al.
Published: (2024) -
GuessArena: Guess Who I Am? A Self-Adaptive Framework for Evaluating LLMs in Domain-Specific Knowledge and Reasoning
by: Yu, Qingchen, et al.
Published: (2025) -
Internal Consistency and Self-Feedback in Large Language Models: A Survey
by: Liang, Xun, et al.
Published: (2024) -
HRDE: Retrieval-Augmented Large Language Models for Chinese Health Rumor Detection and Explainability
by: Chen, Yanfang, et al.
Published: (2024)