Benchmarking Language Model Creativity: A Case Study on Code Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lu, Yining, Wang, Dixuan, Li, Tianjian, Jiang, Dongwei, Khudanpur, Sanjeev, Jiang, Meng, Khashabi, Daniel |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SIMPLEMIX: Frustratingly Simple Mixing of Off- and On-policy Data in Language Model Preference Learning
par: Li, Tianjian, et autres
Publié: (2025)
par: Li, Tianjian, et autres
Publié: (2025)
The Flaw of Averages: Quantifying Uniformity of Performance on Benchmarks
par: Uzunoglu, Arda, et autres
Publié: (2025)
par: Uzunoglu, Arda, et autres
Publié: (2025)
CreativityPrism: A Holistic Evaluation Framework for Large Language Model Creativity
par: Hou, Zhaoyi Joey, et autres
Publié: (2025)
par: Hou, Zhaoyi Joey, et autres
Publié: (2025)
Error Norm Truncation: Robust Training in the Presence of Data Noise for Text Generation Models
par: Li, Tianjian, et autres
Publié: (2023)
par: Li, Tianjian, et autres
Publié: (2023)
Feedback Friction: LLMs Struggle to Fully Incorporate External Feedback
par: Jiang, Dongwei, et autres
Publié: (2025)
par: Jiang, Dongwei, et autres
Publié: (2025)
Verifiable by Design: Aligning Language Models to Quote from Pre-Training Data
par: Zhang, Jingyu, et autres
Publié: (2024)
par: Zhang, Jingyu, et autres
Publié: (2024)
RATIONALYST: Mining Implicit Rationales for Process Supervision of Reasoning
par: Jiang, Dongwei, et autres
Publié: (2024)
par: Jiang, Dongwei, et autres
Publié: (2024)
Jointly Reinforcing Diversity and Quality in Language Model Generations
par: Li, Tianjian, et autres
Publié: (2025)
par: Li, Tianjian, et autres
Publié: (2025)
The Translation Barrier Hypothesis: Multilingual Generation with Large Language Models Suffers from Implicit Translation Failure
par: Bafna, Niyati, et autres
Publié: (2025)
par: Bafna, Niyati, et autres
Publié: (2025)
SELF-[IN]CORRECT: LLMs Struggle with Discriminating Self-Generated Responses
par: Jiang, Dongwei, et autres
Publié: (2024)
par: Jiang, Dongwei, et autres
Publié: (2024)
RORA: Robust Free-Text Rationale Evaluation
par: Jiang, Zhengping, et autres
Publié: (2024)
par: Jiang, Zhengping, et autres
Publié: (2024)
Upsample or Upweight? Balanced Training on Heavily Imbalanced Datasets
par: Li, Tianjian, et autres
Publié: (2024)
par: Li, Tianjian, et autres
Publié: (2024)
ToNER: Type-oriented Named Entity Recognition with Generative Language Model
par: Jiang, Guochao, et autres
Publié: (2024)
par: Jiang, Guochao, et autres
Publié: (2024)
Uncovering Cross-Objective Interference in Multi-Objective Alignment
par: Lu, Yining, et autres
Publié: (2026)
par: Lu, Yining, et autres
Publié: (2026)
Improving Neural Biasing for Contextual Speech Recognition by Early Context Injection and Text Perturbation
par: Huang, Ruizhe, et autres
Publié: (2024)
par: Huang, Ruizhe, et autres
Publié: (2024)
Tokenization Matters! Degrading Large Language Models through Challenging Their Tokenization
par: Wang, Dixuan, et autres
Publié: (2024)
par: Wang, Dixuan, et autres
Publié: (2024)
Many-Tier Instruction Hierarchy in LLM Agents
par: Zhang, Jingyu, et autres
Publié: (2026)
par: Zhang, Jingyu, et autres
Publié: (2026)
AnaloBench: Benchmarking the Identification of Abstract and Long-context Analogies
par: Ye, Xiao, et autres
Publié: (2024)
par: Ye, Xiao, et autres
Publié: (2024)
Reason from Fallacy: Enhancing Large Language Models' Logical Reasoning through Logical Fallacy Understanding
par: Li, Yanda, et autres
Publié: (2024)
par: Li, Yanda, et autres
Publié: (2024)
arXiv2Table: Toward Realistic Benchmarking and Evaluation for LLM-Based Literature-Review Table Generation
par: Wang, Weiqi, et autres
Publié: (2025)
par: Wang, Weiqi, et autres
Publié: (2025)
Self-Consistency Falls Short! The Adverse Effects of Positional Bias on Long-Context Problems
par: Byerly, Adam, et autres
Publié: (2024)
par: Byerly, Adam, et autres
Publié: (2024)
GOLD PANNING: Strategic Context Shuffling for Needle-in-Haystack Reasoning
par: Byerly, Adam, et autres
Publié: (2025)
par: Byerly, Adam, et autres
Publié: (2025)
Challenging the Evaluator: LLM Sycophancy Under User Rebuttal
par: Kim, Sungwon, et autres
Publié: (2025)
par: Kim, Sungwon, et autres
Publié: (2025)
Collu-Bench: A Benchmark for Predicting Language Model Hallucinations in Code
par: Jiang, Nan, et autres
Publié: (2024)
par: Jiang, Nan, et autres
Publié: (2024)
Escape the Language Prior: Mitigating Late-Stage Modality Collapse in Audio Reasoning via Modality-Aware Policy Optimization
par: Xiao, Cihan, et autres
Publié: (2026)
par: Xiao, Cihan, et autres
Publié: (2026)
A Decentralized Retrieval Augmented Generation System with Source Reliabilities Secured on Blockchain
par: Lu, Yining, et autres
Publié: (2025)
par: Lu, Yining, et autres
Publié: (2025)
Enabling Language Models to Implicitly Learn Self-Improvement
par: Wang, Ziqi, et autres
Publié: (2023)
par: Wang, Ziqi, et autres
Publié: (2023)
Building Corpora for Single-Channel Speech Separation Across Multiple Domains
par: Maciejewski, Matthew, et autres
Publié: (2018)
par: Maciejewski, Matthew, et autres
Publié: (2018)
Optimizing Decomposition for Optimal Claim Verification
par: Lu, Yining, et autres
Publié: (2025)
par: Lu, Yining, et autres
Publié: (2025)
Are Finer Citations Always Better? Rethinking Granularity for Attributed Generation
par: Wang, Hexuan, et autres
Publié: (2026)
par: Wang, Hexuan, et autres
Publié: (2026)
Investigating Large Language Models for Code Vulnerability Detection: An Experimental Study
par: Jiang, Xuefeng, et autres
Publié: (2024)
par: Jiang, Xuefeng, et autres
Publié: (2024)
CreativEval: Evaluating Creativity of LLM-Based Hardware Code Generation
par: DeLorenzo, Matthew, et autres
Publié: (2024)
par: DeLorenzo, Matthew, et autres
Publié: (2024)
Trust Functions: Near-Lossless Weak-to-Strong Generalization by Learning When to Trust the Weak Teacher
par: Uzunoglu, Arda, et autres
Publié: (2026)
par: Uzunoglu, Arda, et autres
Publié: (2026)
RLAP: A Reinforcement Learning Enhanced Adaptive Planning Framework for Multi-step NLP Task Solving
par: Ding, Zepeng, et autres
Publié: (2025)
par: Ding, Zepeng, et autres
Publié: (2025)
A Survey on Large Language Models for Code Generation
par: Jiang, Juyong, et autres
Publié: (2024)
par: Jiang, Juyong, et autres
Publié: (2024)
Code Comparison Tuning for Code Large Language Models
par: Jiang, Yufan, et autres
Publié: (2024)
par: Jiang, Yufan, et autres
Publié: (2024)
Evaluation Framework for AI Creativity: A Case Study Based on Story Generation
par: Sathya, Pharath, et autres
Publié: (2026)
par: Sathya, Pharath, et autres
Publié: (2026)
Certified Mitigation of Worst-Case LLM Copyright Infringement
par: Zhang, Jingyu, et autres
Publié: (2025)
par: Zhang, Jingyu, et autres
Publié: (2025)
LeanReasoner: Boosting Complex Logical Reasoning with Lean
par: Jiang, Dongwei, et autres
Publié: (2024)
par: Jiang, Dongwei, et autres
Publié: (2024)
MultiChartQA: Benchmarking Vision-Language Models on Multi-Chart Problems
par: Zhu, Zifeng, et autres
Publié: (2024)
par: Zhu, Zifeng, et autres
Publié: (2024)
Documents similaires
-
SIMPLEMIX: Frustratingly Simple Mixing of Off- and On-policy Data in Language Model Preference Learning
par: Li, Tianjian, et autres
Publié: (2025) -
The Flaw of Averages: Quantifying Uniformity of Performance on Benchmarks
par: Uzunoglu, Arda, et autres
Publié: (2025) -
CreativityPrism: A Holistic Evaluation Framework for Large Language Model Creativity
par: Hou, Zhaoyi Joey, et autres
Publié: (2025) -
Error Norm Truncation: Robust Training in the Presence of Data Noise for Text Generation Models
par: Li, Tianjian, et autres
Publié: (2023) -
Feedback Friction: LLMs Struggle to Fully Incorporate External Feedback
par: Jiang, Dongwei, et autres
Publié: (2025)