Designing and Evaluating Dialogue LLMs for Co-Creative Improvised Theatre
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Branch, Boyd, Mirowski, Piotr, Mathewson, Kory, Ppali, Sophia, Covaci, Alexandra |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
The Theater Stage as Laboratory: Review of Real-Time Comedy LLM Systems for Live Performance
par: Mirowski, Piotr Wojciech, et autres
Publié: (2025)
par: Mirowski, Piotr Wojciech, et autres
Publié: (2025)
A Robot Walks into a Bar: Can Language Models Serve as Creativity Support Tools for Comedy? An Evaluation of LLMs' Humour Alignment with Comedians
par: Mirowski, Piotr Wojciech, et autres
Publié: (2024)
par: Mirowski, Piotr Wojciech, et autres
Publié: (2024)
Divergent Creativity in Humans and Large Language Models
par: Bellemare-Pepin, Antoine, et autres
Publié: (2024)
par: Bellemare-Pepin, Antoine, et autres
Publié: (2024)
Dialogue with the Machine and Dialogue with the Art World: Evaluating Generative AI for Culturally-Situated Creativity
par: Qadri, Rida, et autres
Publié: (2024)
par: Qadri, Rida, et autres
Publié: (2024)
Universal Conceptual Structure in Neural Translation: Probing NLLB-200's Multilingual Geometry
par: Mathewson, Kyle Elliott
Publié: (2026)
par: Mathewson, Kyle Elliott
Publié: (2026)
Exploring Safety Alignment Evaluation of LLMs in Chinese Mental Health Dialogues via LLM-as-Judge
par: Cai, Yunna, et autres
Publié: (2025)
par: Cai, Yunna, et autres
Publié: (2025)
On the Benchmarking of LLMs for Open-Domain Dialogue Evaluation
par: Mendonça, John, et autres
Publié: (2024)
par: Mendonça, John, et autres
Publié: (2024)
Evaluating the Creativity of LLMs in Persian Literary Text Generation
par: Tourajmehr, Armin, et autres
Publié: (2025)
par: Tourajmehr, Armin, et autres
Publié: (2025)
IDEAFix: Evaluation Framework for Creative Defixation Prompting in LLMs
par: Carichon, F., et autres
Publié: (2026)
par: Carichon, F., et autres
Publié: (2026)
Evaluation of Code LLMs on Geospatial Code Generation
par: Gramacki, Piotr, et autres
Publié: (2024)
par: Gramacki, Piotr, et autres
Publié: (2024)
Lighting Up or Dimming Down? Exploring Dark Patterns of LLMs in Co-Creativity
par: Li, Zhu, et autres
Publié: (2026)
par: Li, Zhu, et autres
Publié: (2026)
Soda-Eval: Open-Domain Dialogue Evaluation in the age of LLMs
par: Mendonça, John, et autres
Publié: (2024)
par: Mendonça, John, et autres
Publié: (2024)
Do LLMs Agree on the Creativity Evaluation of Alternative Uses?
par: Rabeyah, Abdullah Al, et autres
Publié: (2024)
par: Rabeyah, Abdullah Al, et autres
Publié: (2024)
Multi-Turn Puzzles: Evaluating Interactive Reasoning and Strategic Dialogue in LLMs
par: Badola, Kartikeya, et autres
Publié: (2025)
par: Badola, Kartikeya, et autres
Publié: (2025)
Are they lovers or friends? Evaluating LLMs' Social Reasoning in English and Korean Dialogues
par: Kim, Eunsu, et autres
Publié: (2025)
par: Kim, Eunsu, et autres
Publié: (2025)
Dynamic Evaluation for Oversensitivity in LLMs
par: Pu, Sophia Xiao, et autres
Publié: (2025)
par: Pu, Sophia Xiao, et autres
Publié: (2025)
Are LLMs Robust for Spoken Dialogues?
par: Mousavi, Seyed Mahed, et autres
Publié: (2024)
par: Mousavi, Seyed Mahed, et autres
Publié: (2024)
Are LLMs Effective Negotiators? Systematic Evaluation of the Multifaceted Capabilities of LLMs in Negotiation Dialogues
par: Kwon, Deuksin, et autres
Publié: (2024)
par: Kwon, Deuksin, et autres
Publié: (2024)
An Evaluation of LLMs for Detecting Harmful Computing Terms
par: Jacas, Joshua, et autres
Publié: (2025)
par: Jacas, Joshua, et autres
Publié: (2025)
MEDAL: A Framework for Benchmarking LLMs as Multilingual Open-Domain Dialogue Evaluators
par: Mendonça, John, et autres
Publié: (2025)
par: Mendonça, John, et autres
Publié: (2025)
LLMs and their Limited Theory of Mind: Evaluating Mental State Annotations in Situated Dialogue
par: Kowalyshyn, Katharine, et autres
Publié: (2025)
par: Kowalyshyn, Katharine, et autres
Publié: (2025)
Rethinking Creativity Evaluation: A Critical Analysis of Existing Creativity Evaluations
par: Lu, Li-Chun, et autres
Publié: (2025)
par: Lu, Li-Chun, et autres
Publié: (2025)
CREATE: Testing LLMs for Associative Creativity
par: Wadhwa, Manya, et autres
Publié: (2026)
par: Wadhwa, Manya, et autres
Publié: (2026)
DialogBench: Evaluating LLMs as Human-like Dialogue Systems
par: Ou, Jiao, et autres
Publié: (2023)
par: Ou, Jiao, et autres
Publié: (2023)
Reasoning or Not? A Comprehensive Evaluation of Reasoning LLMs for Dialogue Summarization
par: Jin, Keyan, et autres
Publié: (2025)
par: Jin, Keyan, et autres
Publié: (2025)
Leveraging LLMs for Dialogue Quality Measurement
par: Jia, Jinghan, et autres
Publié: (2024)
par: Jia, Jinghan, et autres
Publié: (2024)
Rethinking the Evaluation of Dialogue Systems: Effects of User Feedback on Crowdworkers and LLMs
par: Siro, Clemencia, et autres
Publié: (2024)
par: Siro, Clemencia, et autres
Publié: (2024)
TofuEval: Evaluating Hallucinations of LLMs on Topic-Focused Dialogue Summarization
par: Tang, Liyan, et autres
Publié: (2024)
par: Tang, Liyan, et autres
Publié: (2024)
Evaluating Bias in Spoken Dialogue LLMs for Real-World Decisions and Recommendations
par: Wu, Yihao, et autres
Publié: (2025)
par: Wu, Yihao, et autres
Publié: (2025)
CoCo-CoLa: Evaluating and Improving Language Adherence in Multilingual LLMs
par: Rahmati, Elnaz, et autres
Publié: (2025)
par: Rahmati, Elnaz, et autres
Publié: (2025)
CreativEval: Evaluating Creativity of LLM-Based Hardware Code Generation
par: DeLorenzo, Matthew, et autres
Publié: (2024)
par: DeLorenzo, Matthew, et autres
Publié: (2024)
Creativity Bias: How Machine Evaluation Struggles with Creativity in Literary Translations
par: Gerrits, Kyo, et autres
Publié: (2026)
par: Gerrits, Kyo, et autres
Publié: (2026)
Break the Checkbox: Challenging Closed-Style Evaluations of Cultural Alignment in LLMs
par: Kabir, Mohsinul, et autres
Publié: (2025)
par: Kabir, Mohsinul, et autres
Publié: (2025)
CoDial: Interpretable Task-Oriented Dialogue Systems Through Dialogue Flow Alignment
par: Shayanfar, Radin, et autres
Publié: (2025)
par: Shayanfar, Radin, et autres
Publié: (2025)
Which of These Best Describes Multiple Choice Evaluation with LLMs? A) Forced B) Flawed C) Fixable D) All of the Above
par: Balepur, Nishant, et autres
Publié: (2025)
par: Balepur, Nishant, et autres
Publié: (2025)
A Bolu: A Structured Dataset for the Computational Analysis of Sardinian Improvisational Poetry
par: Calderaro, Silvio, et autres
Publié: (2026)
par: Calderaro, Silvio, et autres
Publié: (2026)
Compass-v3: Scaling Domain-Specific LLMs for Multilingual E-Commerce in Southeast Asia
par: Maria, Sophia
Publié: (2025)
par: Maria, Sophia
Publié: (2025)
Emphasising Structured Information: Integrating Abstract Meaning Representation into LLMs for Enhanced Open-Domain Dialogue Evaluation
par: Yang, Bohao, et autres
Publié: (2024)
par: Yang, Bohao, et autres
Publié: (2024)
Kahaani: A Multimodal Co-Creative Storytelling System
par: Arif, Samee, et autres
Publié: (2024)
par: Arif, Samee, et autres
Publié: (2024)
Can LLMs Understand the Implication of Emphasized Sentences in Dialogue?
par: Lin, Guan-Ting, et autres
Publié: (2024)
par: Lin, Guan-Ting, et autres
Publié: (2024)
Documents similaires
-
The Theater Stage as Laboratory: Review of Real-Time Comedy LLM Systems for Live Performance
par: Mirowski, Piotr Wojciech, et autres
Publié: (2025) -
A Robot Walks into a Bar: Can Language Models Serve as Creativity Support Tools for Comedy? An Evaluation of LLMs' Humour Alignment with Comedians
par: Mirowski, Piotr Wojciech, et autres
Publié: (2024) -
Divergent Creativity in Humans and Large Language Models
par: Bellemare-Pepin, Antoine, et autres
Publié: (2024) -
Dialogue with the Machine and Dialogue with the Art World: Evaluating Generative AI for Culturally-Situated Creativity
par: Qadri, Rida, et autres
Publié: (2024) -
Universal Conceptual Structure in Neural Translation: Probing NLLB-200's Multilingual Geometry
par: Mathewson, Kyle Elliott
Publié: (2026)