Neural Models and Language Model Prompting for the Multidimensional Evaluation of Open-Ended Conversations
Fuente:
arXiv
Salvato in:
| Autori principali: | Elizabeth, Michelle, Kasicka, Alicja, Krawczyk, Natalia, Ochs, Magalie, Lecorvé, Gwénolé, Gromada, Justyna, Rojas-Barahona, Lina M. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Question Generation in Knowledge-Driven Dialog: Explainability and Evaluation
di: Faille, Juliette, et al.
Pubblicazione: (2024)
di: Faille, Juliette, et al.
Pubblicazione: (2024)
WEBDial, a Multi-domain, Multitask Statistical Dialogue Framework with RDF
di: Veyret, Morgan, et al.
Pubblicazione: (2024)
di: Veyret, Morgan, et al.
Pubblicazione: (2024)
Emotion Identification for French in Written Texts: Considering their Modes of Expression as a Step Towards Text Complexity Analysis
di: Étienne, Aline, et al.
Pubblicazione: (2024)
di: Étienne, Aline, et al.
Pubblicazione: (2024)
Factual Knowledge in Language Models: Robustness and Anomalies under Simple Temporal Context Variations
di: Khodja, Hichem Ammar, et al.
Pubblicazione: (2025)
di: Khodja, Hichem Ammar, et al.
Pubblicazione: (2025)
WikiFactDiff: A Large, Realistic, and Temporally Adaptable Dataset for Atomic Factual Knowledge Update in Causal Language Models
di: Khodja, Hichem Ammar, et al.
Pubblicazione: (2024)
di: Khodja, Hichem Ammar, et al.
Pubblicazione: (2024)
Towards Trust Calibration in Socially Interactive Agents: Investigating Gendered Multimodal Behaviors Generation with LLMs
di: Galland, Lucie, et al.
Pubblicazione: (2026)
di: Galland, Lucie, et al.
Pubblicazione: (2026)
Exploring ReAct Prompting for Task-Oriented Dialogue: Insights and Shortcomings
di: Elizabeth, Michelle, et al.
Pubblicazione: (2024)
di: Elizabeth, Michelle, et al.
Pubblicazione: (2024)
Open-Ended Wargames with Large Language Models
di: Hogan, Daniel P., et al.
Pubblicazione: (2024)
di: Hogan, Daniel P., et al.
Pubblicazione: (2024)
TelcoLM: collecting data, adapting, and benchmarking language models for the telecommunication domain
di: Barboule, Camille, et al.
Pubblicazione: (2024)
di: Barboule, Camille, et al.
Pubblicazione: (2024)
Artificial Hivemind: The Open-Ended Homogeneity of Language Models (and Beyond)
di: Jiang, Liwei, et al.
Pubblicazione: (2025)
di: Jiang, Liwei, et al.
Pubblicazione: (2025)
Too Open for Opinion? Embracing Open-Endedness in Large Language Models for Social Simulation
di: Ma, Bolei, et al.
Pubblicazione: (2025)
di: Ma, Bolei, et al.
Pubblicazione: (2025)
Prompt-Level Reward Specifications for Open-Ended Post-Training
di: Weng, Zijun, et al.
Pubblicazione: (2026)
di: Weng, Zijun, et al.
Pubblicazione: (2026)
Talking to Machines: do you read me?
di: Rojas-Barahona, Lina M.
Pubblicazione: (2024)
di: Rojas-Barahona, Lina M.
Pubblicazione: (2024)
InfoQuest: Evaluating Multi-Turn Dialogue Agents for Open-Ended Conversations with Hidden Context
di: de Oliveira, Bryan L. M., et al.
Pubblicazione: (2025)
di: de Oliveira, Bryan L. M., et al.
Pubblicazione: (2025)
O_FT@EvalLLM2025 : étude comparative de choix de données et de stratégies d'apprentissage pour l'adaptation de modèles de langue à un domaine
di: Rousseau, Ismaël, et al.
Pubblicazione: (2025)
di: Rousseau, Ismaël, et al.
Pubblicazione: (2025)
Can Large Language Models Replicate ITS Feedback on Open-Ended Math Questions?
di: McNichols, Hunter, et al.
Pubblicazione: (2024)
di: McNichols, Hunter, et al.
Pubblicazione: (2024)
GuessingGame: Measuring the Informativeness of Open-Ended Questions in Large Language Models
di: Hutson, Dylan, et al.
Pubblicazione: (2025)
di: Hutson, Dylan, et al.
Pubblicazione: (2025)
Rainbow Teaming: Open-Ended Generation of Diverse Adversarial Prompts
di: Samvelyan, Mikayel, et al.
Pubblicazione: (2024)
di: Samvelyan, Mikayel, et al.
Pubblicazione: (2024)
Marco-o1: Towards Open Reasoning Models for Open-Ended Solutions
di: Zhao, Yu, et al.
Pubblicazione: (2024)
di: Zhao, Yu, et al.
Pubblicazione: (2024)
Private Synthetic Text Generation with Diffusion Models
di: Ochs, Sebastian, et al.
Pubblicazione: (2024)
di: Ochs, Sebastian, et al.
Pubblicazione: (2024)
A Comparative Evaluation of Structural Topic Models and BERTopic for Short, Open-Ended Survey Responses
di: Jiang, Yan, et al.
Pubblicazione: (2026)
di: Jiang, Yan, et al.
Pubblicazione: (2026)
Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models
di: Zhang, Zhicheng, et al.
Pubblicazione: (2025)
di: Zhang, Zhicheng, et al.
Pubblicazione: (2025)
An Overview and Discussion on Using Large Language Models for Implementation Generation of Solutions to Open-Ended Problems
di: Shaik, Hashmath, et al.
Pubblicazione: (2024)
di: Shaik, Hashmath, et al.
Pubblicazione: (2024)
DivMerge: A divergence-based model merging method for multi-tasking
di: Touayouch, Brahim, et al.
Pubblicazione: (2025)
di: Touayouch, Brahim, et al.
Pubblicazione: (2025)
OpenEP: Open-Ended Future Event Prediction
di: Guan, Yong, et al.
Pubblicazione: (2024)
di: Guan, Yong, et al.
Pubblicazione: (2024)
OpenSIR: Open-Ended Self-Improving Reasoner
di: Kwan, Wai-Chung, et al.
Pubblicazione: (2025)
di: Kwan, Wai-Chung, et al.
Pubblicazione: (2025)
In Search of the Ingredients of Open-Endedness: Replicating Picbreeder with Large Vision-Language Models
di: Earle, Sam, et al.
Pubblicazione: (2026)
di: Earle, Sam, et al.
Pubblicazione: (2026)
Language Models Guidance with Multi-Aspect-Cueing: A Case Study for Competitor Analysis
di: Hadifar, Amir, et al.
Pubblicazione: (2025)
di: Hadifar, Amir, et al.
Pubblicazione: (2025)
Evaluating the Prompt Steerability of Large Language Models
di: Miehling, Erik, et al.
Pubblicazione: (2024)
di: Miehling, Erik, et al.
Pubblicazione: (2024)
Assessing Bias in Metric Models for LLM Open-Ended Generation Bias Benchmarks
di: Demchak, Nathaniel, et al.
Pubblicazione: (2024)
di: Demchak, Nathaniel, et al.
Pubblicazione: (2024)
PolygloToxicityPrompts: Multilingual Evaluation of Neural Toxic Degeneration in Large Language Models
di: Jain, Devansh, et al.
Pubblicazione: (2024)
di: Jain, Devansh, et al.
Pubblicazione: (2024)
Beyond Prompts: Dynamic Conversational Benchmarking of Large Language Models
di: Castillo-Bolado, David, et al.
Pubblicazione: (2024)
di: Castillo-Bolado, David, et al.
Pubblicazione: (2024)
Seeing Through Their Eyes: Evaluating Visual Perspective Taking in Vision Language Models
di: Góral, Gracjan, et al.
Pubblicazione: (2024)
di: Góral, Gracjan, et al.
Pubblicazione: (2024)
MCU: An Evaluation Framework for Open-Ended Game Agents
di: Zheng, Xinyue, et al.
Pubblicazione: (2023)
di: Zheng, Xinyue, et al.
Pubblicazione: (2023)
Role-Play Zero-Shot Prompting with Large Language Models for Open-Domain Human-Machine Conversation
di: Njifenjou, Ahmed, et al.
Pubblicazione: (2024)
di: Njifenjou, Ahmed, et al.
Pubblicazione: (2024)
OpenGenAlign: A Preference Dataset and Benchmark for Trustworthy Reward Modeling in Open-Ended, Long-Context Generation
di: Zhang, Hanning, et al.
Pubblicazione: (2025)
di: Zhang, Hanning, et al.
Pubblicazione: (2025)
Towards Better Open-Ended Text Generation: A Multicriteria Evaluation Framework
di: Arias, Esteban Garces, et al.
Pubblicazione: (2024)
di: Arias, Esteban Garces, et al.
Pubblicazione: (2024)
MIRROR: A Novel Approach for the Automated Evaluation of Open-Ended Question Generation
di: Deroy, Aniket, et al.
Pubblicazione: (2024)
di: Deroy, Aniket, et al.
Pubblicazione: (2024)
Transparent Reference-free Automated Evaluation of Open-Ended User Survey Responses
di: An, Subin, et al.
Pubblicazione: (2025)
di: An, Subin, et al.
Pubblicazione: (2025)
AHP-Powered LLM Reasoning for Multi-Criteria Evaluation of Open-Ended Responses
di: Lu, Xiaotian, et al.
Pubblicazione: (2024)
di: Lu, Xiaotian, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Question Generation in Knowledge-Driven Dialog: Explainability and Evaluation
di: Faille, Juliette, et al.
Pubblicazione: (2024) -
WEBDial, a Multi-domain, Multitask Statistical Dialogue Framework with RDF
di: Veyret, Morgan, et al.
Pubblicazione: (2024) -
Emotion Identification for French in Written Texts: Considering their Modes of Expression as a Step Towards Text Complexity Analysis
di: Étienne, Aline, et al.
Pubblicazione: (2024) -
Factual Knowledge in Language Models: Robustness and Anomalies under Simple Temporal Context Variations
di: Khodja, Hichem Ammar, et al.
Pubblicazione: (2025) -
WikiFactDiff: A Large, Realistic, and Temporally Adaptable Dataset for Atomic Factual Knowledge Update in Causal Language Models
di: Khodja, Hichem Ammar, et al.
Pubblicazione: (2024)