NoveltyBench: Evaluating Language Models for Humanlike Diversity
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Yiming, Diddee, Harshita, Holm, Susan, Liu, Hanchen, Liu, Xinyue, Samuel, Vinay, Wang, Barry, Ippolito, Daphne |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
CIE: Controlling Language Model Text Generations Using Continuous Signals
by: Samuel, Vinay, et al.
Published: (2025)
by: Samuel, Vinay, et al.
Published: (2025)
Customizing Large Language Model Generation Style using Parameter-Efficient Finetuning
by: Liu, Xinyue, et al.
Published: (2024)
by: Liu, Xinyue, et al.
Published: (2024)
Chasing Random: Instruction Selection Strategies Fail to Generalize
by: Diddee, Harshita, et al.
Published: (2024)
by: Diddee, Harshita, et al.
Published: (2024)
BenchBrowser: Retrieving Evidence for Evaluating Benchmark Validity
by: Diddee, Harshita, et al.
Published: (2026)
by: Diddee, Harshita, et al.
Published: (2026)
Effective Prompt Extraction from Language Models
by: Zhang, Yiming, et al.
Published: (2023)
by: Zhang, Yiming, et al.
Published: (2023)
No Single Best Model for Diversity: Learning a Router for Sample Diversity
by: Liu, Yuhan, et al.
Published: (2026)
by: Liu, Yuhan, et al.
Published: (2026)
Forcing Diffuse Distributions out of Language Models
by: Zhang, Yiming, et al.
Published: (2024)
by: Zhang, Yiming, et al.
Published: (2024)
Are Large Language Model-based Evaluators the Solution to Scaling Up Multilingual Evaluation?
by: Hada, Rishav, et al.
Published: (2023)
by: Hada, Rishav, et al.
Published: (2023)
Multi-Novelty: Improve the Diversity and Novelty of Contents Generated by Large Language Models via inference-time Multi-Views Brainstorming
by: Lagzian, Arash, et al.
Published: (2025)
by: Lagzian, Arash, et al.
Published: (2025)
NovBench: Evaluating Large Language Models on Academic Paper Novelty Assessment
by: Wu, Wenqing, et al.
Published: (2026)
by: Wu, Wenqing, et al.
Published: (2026)
PhonologyBench: Evaluating Phonological Skills of Large Language Models
by: Suvarna, Ashima, et al.
Published: (2024)
by: Suvarna, Ashima, et al.
Published: (2024)
Language Models Grow Less Humanlike beyond Phase Transition
by: Aoyama, Tatsuya, et al.
Published: (2025)
by: Aoyama, Tatsuya, et al.
Published: (2025)
HLB: Benchmarking LLMs' Humanlikeness in Language Use
by: Duan, Xufeng, et al.
Published: (2024)
by: Duan, Xufeng, et al.
Published: (2024)
EduBench: A Comprehensive Benchmarking Dataset for Evaluating Large Language Models in Diverse Educational Scenarios
by: Xu, Bin, et al.
Published: (2025)
by: Xu, Bin, et al.
Published: (2025)
Humanlike Cognitive Patterns as Emergent Phenomena in Large Language Models
by: Tang, Zhisheng, et al.
Published: (2024)
by: Tang, Zhisheng, et al.
Published: (2024)
Lil-Bevo: Explorations of Strategies for Training Language Models in More Humanlike Ways
by: Govindarajan, Venkata S, et al.
Published: (2023)
by: Govindarajan, Venkata S, et al.
Published: (2023)
On Code-Induced Reasoning in LLMs
by: Waheed, Abdul, et al.
Published: (2025)
by: Waheed, Abdul, et al.
Published: (2025)
Measuring Reasoning Trace Legibility: Can Those Who Understand Teach?
by: Roytburg, Dani, et al.
Published: (2026)
by: Roytburg, Dani, et al.
Published: (2026)
Measuring Non-Adversarial Reproduction of Training Data in Large Language Models
by: Aerni, Michael, et al.
Published: (2024)
by: Aerni, Michael, et al.
Published: (2024)
Akal Badi ya Bias: An Exploratory Study of Gender Bias in Hindi Language Technology
by: Hada, Rishav, et al.
Published: (2024)
by: Hada, Rishav, et al.
Published: (2024)
SafetyBench: Evaluating the Safety of Large Language Models
by: Zhang, Zhexin, et al.
Published: (2023)
by: Zhang, Zhexin, et al.
Published: (2023)
Liars' Bench: Evaluating Lie Detectors for Language Models
by: Kretschmar, Kieron, et al.
Published: (2025)
by: Kretschmar, Kieron, et al.
Published: (2025)
From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning
by: Li, Haoyu, et al.
Published: (2025)
by: Li, Haoyu, et al.
Published: (2025)
Recovering Diversity Without Losing Alignment: A DPO Recipe for Post-Trained LLMs
by: Samuel, Vinay, et al.
Published: (2026)
by: Samuel, Vinay, et al.
Published: (2026)
Harnessing Large Language Models for Scientific Novelty Detection
by: Liu, Yan, et al.
Published: (2025)
by: Liu, Yan, et al.
Published: (2025)
Evaluating $n$-Gram Novelty of Language Models Using Rusty-DAWG
by: Merrill, William, et al.
Published: (2024)
by: Merrill, William, et al.
Published: (2024)
LMD3: Language Model Data Density Dependence
by: Kirchenbauer, John, et al.
Published: (2024)
by: Kirchenbauer, John, et al.
Published: (2024)
HelloBench: Evaluating Long Text Generation Capabilities of Large Language Models
by: Que, Haoran, et al.
Published: (2024)
by: Que, Haoran, et al.
Published: (2024)
OmniBench: Towards The Future of Universal Omni-Language Models
by: Li, Yizhi, et al.
Published: (2024)
by: Li, Yizhi, et al.
Published: (2024)
The Frequency Confound in Language-Model Surprisal and Metaphor Novelty
by: Momen, Omar, et al.
Published: (2026)
by: Momen, Omar, et al.
Published: (2026)
PALM-Bench: A Comprehensive Benchmark for Personalized Audio-Language Models
by: Wang, Yuwen, et al.
Published: (2026)
by: Wang, Yuwen, et al.
Published: (2026)
EmoBench: Evaluating the Emotional Intelligence of Large Language Models
by: Sabour, Sahand, et al.
Published: (2024)
by: Sabour, Sahand, et al.
Published: (2024)
FictionalQA: A Dataset for Studying Memorization and Knowledge Acquisition
by: Kirchenbauer, John, et al.
Published: (2025)
by: Kirchenbauer, John, et al.
Published: (2025)
AuditBench: Evaluating Alignment Auditing Techniques on Models with Hidden Behaviors
by: Sheshadri, Abhay, et al.
Published: (2026)
by: Sheshadri, Abhay, et al.
Published: (2026)
FactBench: A Dynamic Benchmark for In-the-Wild Language Model Factuality Evaluation
by: Bayat, Farima Fatahi, et al.
Published: (2024)
by: Bayat, Farima Fatahi, et al.
Published: (2024)
Evaluating Text Creativity across Diverse Domains: A Dataset and Large Language Model Evaluator
by: Cao, Qian, et al.
Published: (2025)
by: Cao, Qian, et al.
Published: (2025)
InFoBench: Evaluating Instruction Following Ability in Large Language Models
by: Qin, Yiwei, et al.
Published: (2024)
by: Qin, Yiwei, et al.
Published: (2024)
E-Bench: Towards Evaluating the Ease-of-Use of Large Language Models
by: Zhang, Zhenyu, et al.
Published: (2024)
by: Zhang, Zhenyu, et al.
Published: (2024)
Evolving Language Models without Labels: Majority Drives Selection, Novelty Promotes Variation
by: Zhou, Yujun, et al.
Published: (2025)
by: Zhou, Yujun, et al.
Published: (2025)
V2P-Bench: Evaluating Video-Language Understanding with Visual Prompts for Better Human-Model Interaction
by: Zhao, Yiming, et al.
Published: (2025)
by: Zhao, Yiming, et al.
Published: (2025)
Similar Items
-
CIE: Controlling Language Model Text Generations Using Continuous Signals
by: Samuel, Vinay, et al.
Published: (2025) -
Customizing Large Language Model Generation Style using Parameter-Efficient Finetuning
by: Liu, Xinyue, et al.
Published: (2024) -
Chasing Random: Instruction Selection Strategies Fail to Generalize
by: Diddee, Harshita, et al.
Published: (2024) -
BenchBrowser: Retrieving Evidence for Evaluating Benchmark Validity
by: Diddee, Harshita, et al.
Published: (2026) -
Effective Prompt Extraction from Language Models
by: Zhang, Yiming, et al.
Published: (2023)