Automated Creativity Evaluation for Large Language Models: A Reference-Based Approach
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Ruizhe, Zhu, Chiwei, Xu, Benfeng, Wang, Xiaorui, Mao, Zhendong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MCP-AgentBench: Evaluating Real-World Language Agent Performance with MCP-Mediated Tools
por: Guo, Zikang, et al.
Publicado: (2025)
por: Guo, Zikang, et al.
Publicado: (2025)
From Real to Synthetic: Synthesizing Millions of Diversified and Complicated User Instructions with Attributed Grounding
por: Zhu, Chiwei, et al.
Publicado: (2025)
por: Zhu, Chiwei, et al.
Publicado: (2025)
DeepResearch Bench II: Diagnosing Deep Research Agents via Rubrics from Expert Report
por: Li, Ruizhe, et al.
Publicado: (2026)
por: Li, Ruizhe, et al.
Publicado: (2026)
DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents
por: Du, Mingxuan, et al.
Publicado: (2025)
por: Du, Mingxuan, et al.
Publicado: (2025)
ExpertPrompting: Instructing Large Language Models to be Distinguished Experts
por: Xu, Benfeng, et al.
Publicado: (2023)
por: Xu, Benfeng, et al.
Publicado: (2023)
FS-Researcher: Test-Time Scaling for Long-Horizon Research Tasks with File-System-Based Agents
por: Zhu, Chiwei, et al.
Publicado: (2026)
por: Zhu, Chiwei, et al.
Publicado: (2026)
A-RAG: Scaling Agentic Retrieval-Augmented Generation via Hierarchical Retrieval Interfaces
por: Du, Mingxuan, et al.
Publicado: (2026)
por: Du, Mingxuan, et al.
Publicado: (2026)
An Index-based Approach for Efficient and Effective Web Content Extraction
por: Chen, Yihan, et al.
Publicado: (2025)
por: Chen, Yihan, et al.
Publicado: (2025)
Wiki Live Challenge: Challenging Deep Research Agents with Expert-Level Wikipedia Articles
por: Wang, Shaohan, et al.
Publicado: (2026)
por: Wang, Shaohan, et al.
Publicado: (2026)
MIRROR: Multi-agent Intra- and Inter-Reflection for Optimized Reasoning in Tool Learning
por: Guo, Zikang, et al.
Publicado: (2025)
por: Guo, Zikang, et al.
Publicado: (2025)
Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability
por: Zhu, Chiwei, et al.
Publicado: (2025)
por: Zhu, Chiwei, et al.
Publicado: (2025)
Standardizing Longitudinal Radiology Report Evaluation via Large Language Model Annotation
por: Wang, Xinyi, et al.
Publicado: (2026)
por: Wang, Xinyi, et al.
Publicado: (2026)
CreativityPrism: A Holistic Evaluation Framework for Large Language Model Creativity
por: Hou, Zhaoyi Joey, et al.
Publicado: (2025)
por: Hou, Zhaoyi Joey, et al.
Publicado: (2025)
Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking
por: Chen, Yihan, et al.
Publicado: (2025)
por: Chen, Yihan, et al.
Publicado: (2025)
Steering Large Language Models to Evaluate and Amplify Creativity
por: Olson, Matthew Lyle, et al.
Publicado: (2024)
por: Olson, Matthew Lyle, et al.
Publicado: (2024)
Leveraging Importance Sampling to Detach Alignment Modules from Large Language Models
por: Liu, Yi, et al.
Publicado: (2025)
por: Liu, Yi, et al.
Publicado: (2025)
WildGraphBench: Benchmarking GraphRAG with Wild-Source Corpora
por: Wang, Pengyu, et al.
Publicado: (2026)
por: Wang, Pengyu, et al.
Publicado: (2026)
Large Language Models for Automated Literature Review: An Evaluation of Reference Generation, Abstract Writing, and Review Composition
por: Tang, Xuemei, et al.
Publicado: (2024)
por: Tang, Xuemei, et al.
Publicado: (2024)
Evaluating Creative Short Story Generation in Humans and Large Language Models
por: Ismayilzada, Mete, et al.
Publicado: (2024)
por: Ismayilzada, Mete, et al.
Publicado: (2024)
Assessing and Understanding Creativity in Large Language Models
por: Zhao, Yunpu, et al.
Publicado: (2024)
por: Zhao, Yunpu, et al.
Publicado: (2024)
Benchmarking Large Language Models on Controllable Generation under Diversified Instructions
por: Chen, Yihan, et al.
Publicado: (2024)
por: Chen, Yihan, et al.
Publicado: (2024)
Large Language Model Bias Mitigation from the Perspective of Knowledge Editing
por: Chen, Ruizhe, et al.
Publicado: (2024)
por: Chen, Ruizhe, et al.
Publicado: (2024)
On the Creativity of Large Language Models
por: Franceschelli, Giorgio, et al.
Publicado: (2023)
por: Franceschelli, Giorgio, et al.
Publicado: (2023)
Is Temperature the Creativity Parameter of Large Language Models?
por: Peeperkorn, Max, et al.
Publicado: (2024)
por: Peeperkorn, Max, et al.
Publicado: (2024)
Divergent Creativity in Humans and Large Language Models
por: Bellemare-Pepin, Antoine, et al.
Publicado: (2024)
por: Bellemare-Pepin, Antoine, et al.
Publicado: (2024)
Reference-free Hallucination Detection for Large Vision-Language Models
por: Li, Qing, et al.
Publicado: (2024)
por: Li, Qing, et al.
Publicado: (2024)
DLP-LoRA: Efficient Task-Specific LoRA Fusion with a Dynamic, Lightweight Plugin for Large Language Models
por: Zhang, Yuxuan, et al.
Publicado: (2024)
por: Zhang, Yuxuan, et al.
Publicado: (2024)
Deep Associations, High Creativity: A Simple yet Effective Metric for Evaluating Large Language Models
por: Qiu, Ziliang, et al.
Publicado: (2025)
por: Qiu, Ziliang, et al.
Publicado: (2025)
TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models
por: Li, Ce, et al.
Publicado: (2025)
por: Li, Ce, et al.
Publicado: (2025)
A Survey on Evaluation of Large Language Models
por: Chang, Yupeng, et al.
Publicado: (2023)
por: Chang, Yupeng, et al.
Publicado: (2023)
Talking to Yourself: Defying Forgetting in Large Language Models
por: Sun, Yutao, et al.
Publicado: (2026)
por: Sun, Yutao, et al.
Publicado: (2026)
CriticEval: Evaluating Large Language Model as Critic
por: Lan, Tian, et al.
Publicado: (2024)
por: Lan, Tian, et al.
Publicado: (2024)
Persona-judge: Personalized Alignment of Large Language Models via Token-level Self-judgment
por: Zhang, Xiaotian, et al.
Publicado: (2025)
por: Zhang, Xiaotian, et al.
Publicado: (2025)
MacGyver: Are Large Language Models Creative Problem Solvers?
por: Tian, Yufei, et al.
Publicado: (2023)
por: Tian, Yufei, et al.
Publicado: (2023)
SQLBench: A Comprehensive Evaluation for Text-to-SQL Capabilities of Large Language Models
por: Zhang, Bin, et al.
Publicado: (2024)
por: Zhang, Bin, et al.
Publicado: (2024)
BILLY: Steering Large Language Models via Merging Persona Vectors for Creative Generation
por: Pai, Tsung-Min, et al.
Publicado: (2025)
por: Pai, Tsung-Min, et al.
Publicado: (2025)
Auto-Search and Refinement: An Automated Framework for Gender Bias Mitigation in Large Language Models
por: Xu, Yue, et al.
Publicado: (2025)
por: Xu, Yue, et al.
Publicado: (2025)
A Survey on Large Language Models from General Purpose to Medical Applications: Datasets, Methodologies, and Evaluations
por: Wang, Jinqiang, et al.
Publicado: (2024)
por: Wang, Jinqiang, et al.
Publicado: (2024)
SCALM: Towards Semantic Caching for Automated Chat Services with Large Language Models
por: Li, Jiaxing, et al.
Publicado: (2024)
por: Li, Jiaxing, et al.
Publicado: (2024)
Creativity or Brute Force? Using Brainteasers as a Window into the Problem-Solving Abilities of Large Language Models
por: Han, Simeng, et al.
Publicado: (2025)
por: Han, Simeng, et al.
Publicado: (2025)
Ejemplares similares
-
MCP-AgentBench: Evaluating Real-World Language Agent Performance with MCP-Mediated Tools
por: Guo, Zikang, et al.
Publicado: (2025) -
From Real to Synthetic: Synthesizing Millions of Diversified and Complicated User Instructions with Attributed Grounding
por: Zhu, Chiwei, et al.
Publicado: (2025) -
DeepResearch Bench II: Diagnosing Deep Research Agents via Rubrics from Expert Report
por: Li, Ruizhe, et al.
Publicado: (2026) -
DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents
por: Du, Mingxuan, et al.
Publicado: (2025) -
ExpertPrompting: Instructing Large Language Models to be Distinguished Experts
por: Xu, Benfeng, et al.
Publicado: (2023)