LitBench: A Benchmark and Dataset for Reliable Evaluation of Creative Writing
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Fein, Daniel, Russo, Sebastian, Xiang, Violet, Jolly, Kabir, Rafailov, Rafael, Haber, Nick |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
One Bias After Another: Mechanistic Reward Shaping and Persistent Biases in Language Reward Models
par: Fein, Daniel, et autres
Publié: (2026)
par: Fein, Daniel, et autres
Publié: (2026)
ResearchCodeBench: Benchmarking LLMs on Implementing Novel Machine Learning Research Code
par: Hua, Tianyu, et autres
Publié: (2025)
par: Hua, Tianyu, et autres
Publié: (2025)
Big-Math: A Large-Scale, High-Quality Math Dataset for Reinforcement Learning in Language Models
par: Albalak, Alon, et autres
Publié: (2025)
par: Albalak, Alon, et autres
Publié: (2025)
LitBench: A Graph-Centric Large Language Model Benchmarking Tool For Literature Tasks
par: Varvarigos, Andreas, et autres
Publié: (2026)
par: Varvarigos, Andreas, et autres
Publié: (2026)
Towards System 2 Reasoning in LLMs: Learning How to Think With Meta Chain-of-Thought
par: Xiang, Violet, et autres
Publié: (2025)
par: Xiang, Violet, et autres
Publié: (2025)
WritingBench: A Comprehensive Benchmark for Generative Writing
par: Wu, Yuning, et autres
Publié: (2025)
par: Wu, Yuning, et autres
Publié: (2025)
CreativeBench: Benchmarking and Enhancing Machine Creativity via Self-Evolving Challenges
par: Wang, Zi-Han, et autres
Publié: (2026)
par: Wang, Zi-Han, et autres
Publié: (2026)
LitVISTA: A Benchmark for Narrative Orchestration in Literary Text
par: Lu, Mingzhe, et autres
Publié: (2026)
par: Lu, Mingzhe, et autres
Publié: (2026)
Just Enough Thinking: Efficient Reasoning with Adaptive Length Penalties Reinforcement Learning
par: Xiang, Violet, et autres
Publié: (2025)
par: Xiang, Violet, et autres
Publié: (2025)
XCR-Bench: A Multi-Task Benchmark for Evaluating Cultural Reasoning in LLMs
par: Kabir, Mohsinul, et autres
Publié: (2026)
par: Kabir, Mohsinul, et autres
Publié: (2026)
COIG-Writer: A High-Quality Dataset for Chinese Creative Writing with Thought Processes
par: Li, Yunwen, et autres
Publié: (2025)
par: Li, Yunwen, et autres
Publié: (2025)
TruthEval: A Dataset to Evaluate LLM Truthfulness and Reliability
par: Khatun, Aisha, et autres
Publié: (2024)
par: Khatun, Aisha, et autres
Publié: (2024)
MedBench: A Comprehensive, Standardized, and Reliable Benchmarking System for Evaluating Chinese Medical Large Language Models
par: Liu, Mianxin, et autres
Publié: (2024)
par: Liu, Mianxin, et autres
Publié: (2024)
CreativityBench: Evaluating Agent Creative Reasoning via Affordance-Based Tool Repurposing
par: Qian, Cheng, et autres
Publié: (2026)
par: Qian, Cheng, et autres
Publié: (2026)
LegalCiteBench: Evaluating Citation Reliability in Legal Language Models
par: Chen, Sijia, et autres
Publié: (2026)
par: Chen, Sijia, et autres
Publié: (2026)
RLMR: Reinforcement Learning with Mixed Rewards for Creative Writing
par: Liao, Jianxing, et autres
Publié: (2025)
par: Liao, Jianxing, et autres
Publié: (2025)
CreativityPrism: A Holistic Evaluation Framework for Large Language Model Creativity
par: Hou, Zhaoyi Joey, et autres
Publié: (2025)
par: Hou, Zhaoyi Joey, et autres
Publié: (2025)
Weaver: Foundation Models for Creative Writing
par: Wang, Tiannan, et autres
Publié: (2024)
par: Wang, Tiannan, et autres
Publié: (2024)
LongGenBench: Long-context Generation Benchmark
par: Liu, Xiang, et autres
Publié: (2024)
par: Liu, Xiang, et autres
Publié: (2024)
EssayBench: Evaluating Large Language Models in Multi-Genre Chinese Essay Writing
par: Gao, Fan, et autres
Publié: (2025)
par: Gao, Fan, et autres
Publié: (2025)
On Robustness and Reliability of Benchmark-Based Evaluation of LLMs
par: Lunardi, Riccardo, et autres
Publié: (2025)
par: Lunardi, Riccardo, et autres
Publié: (2025)
NC-Bench: An LLM Benchmark for Evaluating Conversational Competence
par: Moore, Robert J., et autres
Publié: (2026)
par: Moore, Robert J., et autres
Publié: (2026)
DPWriter: Reinforcement Learning with Diverse Planning Branching for Creative Writing
par: Cao, Qian, et autres
Publié: (2026)
par: Cao, Qian, et autres
Publié: (2026)
Breaking the Silence: A Dataset and Benchmark for Bangla Text-to-Gloss Translation
par: Abdullah, Sharif Mohammad, et autres
Publié: (2025)
par: Abdullah, Sharif Mohammad, et autres
Publié: (2025)
Mobile-Bench: An Evaluation Benchmark for LLM-based Mobile Agents
par: Deng, Shihan, et autres
Publié: (2024)
par: Deng, Shihan, et autres
Publié: (2024)
BLUCK: A Benchmark Dataset for Bengali Linguistic Understanding and Cultural Knowledge
par: Kabir, Daeen, et autres
Publié: (2025)
par: Kabir, Daeen, et autres
Publié: (2025)
Persona-Augmented Benchmarking: Evaluating LLMs Across Diverse Writing Styles
par: Truong, Kimberly Le, et autres
Publié: (2025)
par: Truong, Kimberly Le, et autres
Publié: (2025)
EVADE-Bench: Multimodal Benchmark for Evaluating and Enhancing Evasive Content Detection
par: Xu, Ancheng, et autres
Publié: (2025)
par: Xu, Ancheng, et autres
Publié: (2025)
TurkBench: A Benchmark for Evaluating Turkish Large Language Models
par: Toraman, Çağrı, et autres
Publié: (2026)
par: Toraman, Çağrı, et autres
Publié: (2026)
CricBench: A Multilingual Benchmark for Evaluating LLMs in Cricket Analytics
par: Agarwal, Parth, et autres
Publié: (2025)
par: Agarwal, Parth, et autres
Publié: (2025)
Writing in Symbiosis: Mapping Human Creative Agency in the AI Era
par: Doshi, Vivan, et autres
Publié: (2025)
par: Doshi, Vivan, et autres
Publié: (2025)
KVoiceBench, KOpenAudioBench, and KMMAU: Agent-Driven Korean Speech Benchmarks for Evaluating SpeechLMs
par: Kim, Haechan, et autres
Publié: (2026)
par: Kim, Haechan, et autres
Publié: (2026)
CaseReportBench: An LLM Benchmark Dataset for Dense Information Extraction in Clinical Case Reports
par: Zhang, Xiao Yu Cindy, et autres
Publié: (2025)
par: Zhang, Xiao Yu Cindy, et autres
Publié: (2025)
Reliable Evaluation and Benchmarks for Statement Autoformalization
par: Poiroux, Auguste, et autres
Publié: (2024)
par: Poiroux, Auguste, et autres
Publié: (2024)
What Shapes a Creative Machine Mind? Comprehensively Benchmarking Creativity in Foundation Models
par: He, Zicong, et autres
Publié: (2025)
par: He, Zicong, et autres
Publié: (2025)
MedAgentsBench: Benchmarking Thinking Models and Agent Frameworks for Complex Medical Reasoning
par: Tang, Xiangru, et autres
Publié: (2025)
par: Tang, Xiangru, et autres
Publié: (2025)
GlobalDentBench: A Multinational Benchmark for Evaluating LLM Clinical Reasoning in Dentistry with Expert Calibration
par: Zhao, Junjie, et autres
Publié: (2026)
par: Zhao, Junjie, et autres
Publié: (2026)
DeepScholar-Bench: A Live Benchmark and Automated Evaluation for Generative Research Synthesis
par: Patel, Liana, et autres
Publié: (2025)
par: Patel, Liana, et autres
Publié: (2025)
OphthBench: A Comprehensive Benchmark for Evaluating Large Language Models in Chinese Ophthalmology
par: Zhou, Chengfeng, et autres
Publié: (2025)
par: Zhou, Chengfeng, et autres
Publié: (2025)
StoryBench: A Dynamic Benchmark for Evaluating Long-Term Memory with Multi Turns
par: Wan, Luanbo, et autres
Publié: (2025)
par: Wan, Luanbo, et autres
Publié: (2025)
Documents similaires
-
One Bias After Another: Mechanistic Reward Shaping and Persistent Biases in Language Reward Models
par: Fein, Daniel, et autres
Publié: (2026) -
ResearchCodeBench: Benchmarking LLMs on Implementing Novel Machine Learning Research Code
par: Hua, Tianyu, et autres
Publié: (2025) -
Big-Math: A Large-Scale, High-Quality Math Dataset for Reinforcement Learning in Language Models
par: Albalak, Alon, et autres
Publié: (2025) -
LitBench: A Graph-Centric Large Language Model Benchmarking Tool For Literature Tasks
par: Varvarigos, Andreas, et autres
Publié: (2026) -
Towards System 2 Reasoning in LLMs: Learning How to Think With Meta Chain-of-Thought
par: Xiang, Violet, et autres
Publié: (2025)