Evaluating Text Creativity across Diverse Domains: A Dataset and Large Language Model Evaluator
Fuente:
arXiv
Guardado en:
| Autores principales: | Cao, Qian, Wang, Xiting, Yuan, Yuzhuo, Liu, Yahui, Luo, Fang, Song, Ruihua |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DPWriter: Reinforcement Learning with Diverse Planning Branching for Creative Writing
por: Cao, Qian, et al.
Publicado: (2026)
por: Cao, Qian, et al.
Publicado: (2026)
BSharedRAG: Backbone Shared Retrieval-Augmented Generation for the E-commerce Domain
por: Guan, Kaisi, et al.
Publicado: (2024)
por: Guan, Kaisi, et al.
Publicado: (2024)
Select, Read, and Write: A Multi-Agent Framework of Full-Text-based Related Work Generation
por: Liu, Xiaochuan, et al.
Publicado: (2025)
por: Liu, Xiaochuan, et al.
Publicado: (2025)
See or Guess: Counterfactually Regularized Image Captioning
por: Cao, Qian, et al.
Publicado: (2024)
por: Cao, Qian, et al.
Publicado: (2024)
Beyond Divergent Creativity: A Human-Based Evaluation of Creativity in Large Language Models
por: Nakajima, Kumiko, et al.
Publicado: (2026)
por: Nakajima, Kumiko, et al.
Publicado: (2026)
Evaluating Fairness in Large Vision-Language Models Across Diverse Demographic Attributes and Prompts
por: Wu, Xuyang, et al.
Publicado: (2024)
por: Wu, Xuyang, et al.
Publicado: (2024)
Inducing Sustained Creativity and Diversity in Large Language Models
por: Luo, Queenie, et al.
Publicado: (2026)
por: Luo, Queenie, et al.
Publicado: (2026)
CreativityPrism: A Holistic Evaluation Framework for Large Language Model Creativity
por: Hou, Zhaoyi Joey, et al.
Publicado: (2025)
por: Hou, Zhaoyi Joey, et al.
Publicado: (2025)
AdaptEval: Evaluating Large Language Models on Domain Adaptation for Text Summarization
por: Afzal, Anum, et al.
Publicado: (2024)
por: Afzal, Anum, et al.
Publicado: (2024)
CHBench: A Chinese Dataset for Evaluating Health in Large Language Models
por: Guo, Chenlu, et al.
Publicado: (2024)
por: Guo, Chenlu, et al.
Publicado: (2024)
Steering Large Language Models to Evaluate and Amplify Creativity
por: Olson, Matthew Lyle, et al.
Publicado: (2024)
por: Olson, Matthew Lyle, et al.
Publicado: (2024)
EduBench: A Comprehensive Benchmarking Dataset for Evaluating Large Language Models in Diverse Educational Scenarios
por: Xu, Bin, et al.
Publicado: (2025)
por: Xu, Bin, et al.
Publicado: (2025)
Evaluating LLMs and Pre-trained Models for Text Summarization Across Diverse Datasets
por: Rehman, Tohida, et al.
Publicado: (2025)
por: Rehman, Tohida, et al.
Publicado: (2025)
Automated Creativity Evaluation for Large Language Models: A Reference-Based Approach
por: Li, Ruizhe, et al.
Publicado: (2025)
por: Li, Ruizhe, et al.
Publicado: (2025)
Enhancing Safety of Large Language Models via Embedding Space Separation
por: Zhao, Xu, et al.
Publicado: (2026)
por: Zhao, Xu, et al.
Publicado: (2026)
FinEval: A Chinese Financial Domain Knowledge Evaluation Benchmark for Large Language Models
por: Guo, Xin, et al.
Publicado: (2023)
por: Guo, Xin, et al.
Publicado: (2023)
A Chinese Dataset for Evaluating the Safeguards in Large Language Models
por: Wang, Yuxia, et al.
Publicado: (2024)
por: Wang, Yuxia, et al.
Publicado: (2024)
XFacta: Contemporary, Real-World Dataset and Evaluation for Multimodal Misinformation Detection with Multimodal LLMs
por: Xiao, Yuzhuo, et al.
Publicado: (2025)
por: Xiao, Yuzhuo, et al.
Publicado: (2025)
Automating Dataset Updates Towards Reliable and Timely Evaluation of Large Language Models
por: Ying, Jiahao, et al.
Publicado: (2024)
por: Ying, Jiahao, et al.
Publicado: (2024)
TCMD: A Traditional Chinese Medicine QA Dataset for Evaluating Large Language Models
por: Yu, Ping, et al.
Publicado: (2024)
por: Yu, Ping, et al.
Publicado: (2024)
How Creative Are Large Language Models in Generating Molecules?
por: Tao, Wen, et al.
Publicado: (2026)
por: Tao, Wen, et al.
Publicado: (2026)
Uncovering Safety Risks of Large Language Models through Concept Activation Vector
por: Xu, Zhihao, et al.
Publicado: (2024)
por: Xu, Zhihao, et al.
Publicado: (2024)
Rethinking Creativity Evaluation: A Critical Analysis of Existing Creativity Evaluations
por: Lu, Li-Chun, et al.
Publicado: (2025)
por: Lu, Li-Chun, et al.
Publicado: (2025)
LFED: A Literary Fiction Evaluation Dataset for Large Language Models
por: Yu, Linhao, et al.
Publicado: (2024)
por: Yu, Linhao, et al.
Publicado: (2024)
Evaluating Metalinguistic Knowledge in Large Language Models across the World's Languages
por: Arčon, Tjaša, et al.
Publicado: (2026)
por: Arčon, Tjaša, et al.
Publicado: (2026)
Evaluating Creative Short Story Generation in Humans and Large Language Models
por: Ismayilzada, Mete, et al.
Publicado: (2024)
por: Ismayilzada, Mete, et al.
Publicado: (2024)
Evaluating the Creativity of LLMs in Persian Literary Text Generation
por: Tourajmehr, Armin, et al.
Publicado: (2025)
por: Tourajmehr, Armin, et al.
Publicado: (2025)
Controlling Large Language Models Through Concept Activation Vectors
por: Zhang, Hanyu, et al.
Publicado: (2025)
por: Zhang, Hanyu, et al.
Publicado: (2025)
NoveltyBench: Evaluating Language Models for Humanlike Diversity
por: Zhang, Yiming, et al.
Publicado: (2025)
por: Zhang, Yiming, et al.
Publicado: (2025)
Evaluating Large Language Models with Psychometrics
por: Li, Yuan, et al.
Publicado: (2024)
por: Li, Yuan, et al.
Publicado: (2024)
Towards Multi-dimensional Evaluation of LLM Summarization across Domains and Languages
por: Min, Hyangsuk, et al.
Publicado: (2025)
por: Min, Hyangsuk, et al.
Publicado: (2025)
PROXYQA: An Alternative Framework for Evaluating Long-Form Text Generation with Large Language Models
por: Tan, Haochen, et al.
Publicado: (2024)
por: Tan, Haochen, et al.
Publicado: (2024)
BaziQA-Benchmark: Evaluating Symbolic and Temporally Compositional Reasoning in Large Language Models
por: Chen, Jiangxi, et al.
Publicado: (2026)
por: Chen, Jiangxi, et al.
Publicado: (2026)
Evaluating and Improving Graph to Text Generation with Large Language Models
por: He, Jie, et al.
Publicado: (2025)
por: He, Jie, et al.
Publicado: (2025)
SimulBench: Evaluating Language Models with Creative Simulation Tasks
por: Jia, Qi, et al.
Publicado: (2024)
por: Jia, Qi, et al.
Publicado: (2024)
GPT-4 as Evaluator: Evaluating Large Language Models on Pest Management in Agriculture
por: Yang, Shanglong, et al.
Publicado: (2024)
por: Yang, Shanglong, et al.
Publicado: (2024)
NovBench: Evaluating Large Language Models on Academic Paper Novelty Assessment
por: Wu, Wenqing, et al.
Publicado: (2026)
por: Wu, Wenqing, et al.
Publicado: (2026)
MARS: Benchmarking the Metaphysical Reasoning Abilities of Language Models with a Multi-task Evaluation Dataset
por: Wang, Weiqi, et al.
Publicado: (2024)
por: Wang, Weiqi, et al.
Publicado: (2024)
HelloBench: Evaluating Long Text Generation Capabilities of Large Language Models
por: Que, Haoran, et al.
Publicado: (2024)
por: Que, Haoran, et al.
Publicado: (2024)
Modifying Large Language Model Post-Training for Diverse Creative Writing
por: Chung, John Joon Young, et al.
Publicado: (2025)
por: Chung, John Joon Young, et al.
Publicado: (2025)
Ejemplares similares
-
DPWriter: Reinforcement Learning with Diverse Planning Branching for Creative Writing
por: Cao, Qian, et al.
Publicado: (2026) -
BSharedRAG: Backbone Shared Retrieval-Augmented Generation for the E-commerce Domain
por: Guan, Kaisi, et al.
Publicado: (2024) -
Select, Read, and Write: A Multi-Agent Framework of Full-Text-based Related Work Generation
por: Liu, Xiaochuan, et al.
Publicado: (2025) -
See or Guess: Counterfactually Regularized Image Captioning
por: Cao, Qian, et al.
Publicado: (2024) -
Beyond Divergent Creativity: A Human-Based Evaluation of Creativity in Large Language Models
por: Nakajima, Kumiko, et al.
Publicado: (2026)