Evaluating the Evaluation of Diversity in Commonsense Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Tianhui, Peng, Bei, Bollegala, Danushka |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Improving Diversity of Commonsense Generation by Large Language Models via In-Context Learning
por: Zhang, Tianhui, et al.
Publicado: (2024)
por: Zhang, Tianhui, et al.
Publicado: (2024)
Synthetic Data Generation for Training Diversified Commonsense Reasoning Models
por: Zhang, Tianhui, et al.
Publicado: (2026)
por: Zhang, Tianhui, et al.
Publicado: (2026)
Evaluating the Effect of Retrieval Augmentation on Social Biases
por: Zhang, Tianhui, et al.
Publicado: (2025)
por: Zhang, Tianhui, et al.
Publicado: (2025)
Bias Mitigation or Cultural Commonsense? Evaluating LLMs with a Japanese Dataset
por: Yamamoto, Taisei, et al.
Publicado: (2025)
por: Yamamoto, Taisei, et al.
Publicado: (2025)
Evaluating Unsupervised Dimensionality Reduction Methods for Pretrained Sentence Embeddings
por: Zhang, Gaifan, et al.
Publicado: (2024)
por: Zhang, Gaifan, et al.
Publicado: (2024)
The Gaps between Pre-train and Downstream Settings in Bias Evaluation and Debiasing
por: Kaneko, Masahiro, et al.
Publicado: (2024)
por: Kaneko, Masahiro, et al.
Publicado: (2024)
Map of Encoders -- Mapping Sentence Encoders using Quantum Relative Entropy
por: Zhang, Gaifan, et al.
Publicado: (2026)
por: Zhang, Gaifan, et al.
Publicado: (2026)
SCDTour: Embedding Axis Ordering and Merging for Interpretable Semantic Change Detection
por: Aida, Taichi, et al.
Publicado: (2025)
por: Aida, Taichi, et al.
Publicado: (2025)
A Semantic Distance Metric Learning approach for Lexical Semantic Change Detection
por: Aida, Taichi, et al.
Publicado: (2024)
por: Aida, Taichi, et al.
Publicado: (2024)
Investigating the Contextualised Word Embedding Dimensions Specified for Contextual and Temporal Semantic Changes
por: Aida, Taichi, et al.
Publicado: (2024)
por: Aida, Taichi, et al.
Publicado: (2024)
Evaluating Short-Term Temporal Fluctuations of Social Biases in Social Media Data and Masked Language Models
por: Zhou, Yi, et al.
Publicado: (2024)
por: Zhou, Yi, et al.
Publicado: (2024)
Evaluating Gender Bias in Large Language Models via Chain-of-Thought Prompting
por: Kaneko, Masahiro, et al.
Publicado: (2024)
por: Kaneko, Masahiro, et al.
Publicado: (2024)
Annotating Training Data for Conditional Semantic Textual Similarity Measurement using Large Language Models
por: Zhang, Gaifan, et al.
Publicado: (2025)
por: Zhang, Gaifan, et al.
Publicado: (2025)
CASE -- Condition-Aware Sentence Embeddings for Conditional Semantic Textual Similarity Measurement
por: Zhang, Gaifan, et al.
Publicado: (2025)
por: Zhang, Gaifan, et al.
Publicado: (2025)
In-Contextual Gender Bias Suppression for Large Language Models
por: Oba, Daisuke, et al.
Publicado: (2023)
por: Oba, Daisuke, et al.
Publicado: (2023)
Eagle: Ethical Dataset Given from Real Interactions
por: Kaneko, Masahiro, et al.
Publicado: (2024)
por: Kaneko, Masahiro, et al.
Publicado: (2024)
Neuron-Level Analysis of Cultural Understanding in Large Language Models
por: Yamamoto, Taisei, et al.
Publicado: (2025)
por: Yamamoto, Taisei, et al.
Publicado: (2025)
Improving Unsupervised Constituency Parsing via Maximizing Semantic Information
por: Chen, Junjie, et al.
Publicado: (2024)
por: Chen, Junjie, et al.
Publicado: (2024)
Unsupervised Parsing by Searching for Frequent Word Sequences among Sentences with Equivalent Predicate-Argument Structures
por: Chen, Junjie, et al.
Publicado: (2024)
por: Chen, Junjie, et al.
Publicado: (2024)
Stopping Computation for Converged Tokens in Masked Diffusion-LM Decoding
por: Oba, Daisuke, et al.
Publicado: (2026)
por: Oba, Daisuke, et al.
Publicado: (2026)
Commonsense Generation and Evaluation for Dialogue Systems using Large Language Models
por: Estecha-Garitagoitia, Marcos, et al.
Publicado: (2025)
por: Estecha-Garitagoitia, Marcos, et al.
Publicado: (2025)
Improving Pre-trained Language Model Sensitivity via Mask Specific losses: A case study on Biomedical NER
por: Abaho, Micheal, et al.
Publicado: (2024)
por: Abaho, Micheal, et al.
Publicado: (2024)
ACORN: Aspect-wise Commonsense Reasoning Explanation Evaluation
por: Brassard, Ana, et al.
Publicado: (2024)
por: Brassard, Ana, et al.
Publicado: (2024)
The Box is in the Pen: Evaluating Commonsense Reasoning in Neural Machine Translation
por: He, Jie, et al.
Publicado: (2025)
por: He, Jie, et al.
Publicado: (2025)
Every Answer Matters: Evaluating Commonsense with Probabilistic Measures
por: Cheng, Qi, et al.
Publicado: (2024)
por: Cheng, Qi, et al.
Publicado: (2024)
Global PIQA: Evaluating Commonsense Reasoning Across 100+ Languages and Cultures
por: Chang, Tyler A., et al.
Publicado: (2025)
por: Chang, Tyler A., et al.
Publicado: (2025)
Gradable ChatGPT Translation Evaluation
por: Jiao, Hui, et al.
Publicado: (2024)
por: Jiao, Hui, et al.
Publicado: (2024)
Evaluating Diversity in Automatic Poetry Generation
por: Chen, Yanran, et al.
Publicado: (2024)
por: Chen, Yanran, et al.
Publicado: (2024)
GRASP: A Grid-Based Benchmark for Evaluating Commonsense Spatial Reasoning
por: Tang, Zhisheng, et al.
Publicado: (2024)
por: Tang, Zhisheng, et al.
Publicado: (2024)
HellaSwag-Pro: A Large-Scale Bilingual Benchmark for Evaluating the Robustness of LLMs in Commonsense Reasoning
por: Li, Xiaoyuan, et al.
Publicado: (2025)
por: Li, Xiaoyuan, et al.
Publicado: (2025)
ReTraceQA: Evaluating Reasoning Traces of Small Language Models in Commonsense Question Answering
por: Molfese, Francesco Maria, et al.
Publicado: (2025)
por: Molfese, Francesco Maria, et al.
Publicado: (2025)
Evaluating the Diversity and Quality of LLM Generated Content
por: Shypula, Alexander, et al.
Publicado: (2025)
por: Shypula, Alexander, et al.
Publicado: (2025)
CommonWhy: A Dataset for Evaluating Entity-Based Causal Commonsense Reasoning in Large Language Models
por: Toroghi, Armin, et al.
Publicado: (2026)
por: Toroghi, Armin, et al.
Publicado: (2026)
The Mystery of Compositional Generalization in Graph-based Generative Commonsense Reasoning
por: Fu, Xiyan, et al.
Publicado: (2024)
por: Fu, Xiyan, et al.
Publicado: (2024)
Commonsense-T2I Challenge: Can Text-to-Image Generation Models Understand Commonsense?
por: Fu, Xingyu, et al.
Publicado: (2024)
por: Fu, Xingyu, et al.
Publicado: (2024)
SG-Bench: Evaluating LLM Safety Generalization Across Diverse Tasks and Prompt Types
por: Mou, Yutao, et al.
Publicado: (2024)
por: Mou, Yutao, et al.
Publicado: (2024)
Commonsense Reasoning in Arab Culture
por: Sadallah, Abdelrahman, et al.
Publicado: (2025)
por: Sadallah, Abdelrahman, et al.
Publicado: (2025)
Sentiment-guided Commonsense-aware Response Generation for Mental Health Counseling
por: Srivastava, Aseem, et al.
Publicado: (2025)
por: Srivastava, Aseem, et al.
Publicado: (2025)
MORE: Multi-mOdal REtrieval Augmented Generative Commonsense Reasoning
por: Cui, Wanqing, et al.
Publicado: (2024)
por: Cui, Wanqing, et al.
Publicado: (2024)
S-GRADES -- Studying Generalization of Student Response Assessments in Diverse Evaluative Settings
por: Seuti, Tasfia, et al.
Publicado: (2026)
por: Seuti, Tasfia, et al.
Publicado: (2026)
Ejemplares similares
-
Improving Diversity of Commonsense Generation by Large Language Models via In-Context Learning
por: Zhang, Tianhui, et al.
Publicado: (2024) -
Synthetic Data Generation for Training Diversified Commonsense Reasoning Models
por: Zhang, Tianhui, et al.
Publicado: (2026) -
Evaluating the Effect of Retrieval Augmentation on Social Biases
por: Zhang, Tianhui, et al.
Publicado: (2025) -
Bias Mitigation or Cultural Commonsense? Evaluating LLMs with a Japanese Dataset
por: Yamamoto, Taisei, et al.
Publicado: (2025) -
Evaluating Unsupervised Dimensionality Reduction Methods for Pretrained Sentence Embeddings
por: Zhang, Gaifan, et al.
Publicado: (2024)