Robots in the Middle: Evaluating LLMs in Dispute Resolution
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tan, Jinzhe, Westermann, Hannes, Pottanigari, Nikhil Reddy, Šavelka, Jaromír, Meeùs, Sébastien, Godet, Mia, Benyekhlef, Karim |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LegalWebAgent: Empowering Access to Justice via LLM-Based Web Agents
par: Tan, Jinzhe, et autres
Publié: (2025)
par: Tan, Jinzhe, et autres
Publié: (2025)
Analyzing Images of Legal Documents: Toward Multi-Modal LLMs for Access to Justice
par: Westermann, Hannes, et autres
Publié: (2024)
par: Westermann, Hannes, et autres
Publié: (2024)
It Cannot Be Right If It Was Written by AI: On Lawyers' Preferences of Documents Perceived as Authored by an LLM vs a Human
par: Harasta, Jakub, et autres
Publié: (2024)
par: Harasta, Jakub, et autres
Publié: (2024)
Getting in the Door: Streamlining Intake in Civil Legal Services with Large Language Models
par: Steenhuis, Quinten, et autres
Publié: (2024)
par: Steenhuis, Quinten, et autres
Publié: (2024)
Desirable Characteristics for AI Teaching Assistants in Programming Education
par: Denny, Paul, et autres
Publié: (2024)
par: Denny, Paul, et autres
Publié: (2024)
CURE: Cultural Understanding and Reasoning Evaluation - A Framework for "Thick" Culture Alignment Evaluation in LLMs
par: Vo, Truong, et autres
Publié: (2025)
par: Vo, Truong, et autres
Publié: (2025)
Toward Automated Qualitative Analysis: Leveraging Large Language Models for Tutoring Dialogue Evaluation
par: Gu, Megan, et autres
Publié: (2025)
par: Gu, Megan, et autres
Publié: (2025)
Deceptive Patterns of Intelligent and Interactive Writing Assistants
par: Benharrak, Karim, et autres
Publié: (2024)
par: Benharrak, Karim, et autres
Publié: (2024)
VoicePilot: Harnessing LLMs as Speech Interfaces for Physically Assistive Robots
par: Padmanabha, Akhil, et autres
Publié: (2024)
par: Padmanabha, Akhil, et autres
Publié: (2024)
OPeRA: A Dataset of Observation, Persona, Rationale, and Action for Evaluating LLMs on Human Online Shopping Behavior Simulation
par: Wang, Ziyi, et autres
Publié: (2025)
par: Wang, Ziyi, et autres
Publié: (2025)
Real or Robotic? Assessing Whether LLMs Accurately Simulate Qualities of Human Responses in Dialogue
par: Ivey, Jonathan, et autres
Publié: (2024)
par: Ivey, Jonathan, et autres
Publié: (2024)
LLMs as Workers in Human-Computational Algorithms? Replicating Crowdsourcing Pipelines with LLMs
par: Wu, Tongshuang, et autres
Publié: (2023)
par: Wu, Tongshuang, et autres
Publié: (2023)
Assessing LLMs in Art Contexts: Critique Generation and Theory of Mind Evaluation
par: Arita, Takaya, et autres
Publié: (2025)
par: Arita, Takaya, et autres
Publié: (2025)
RoboPlayground: Democratizing Robotic Evaluation through Structured Physical Domains
par: Wang, Yi Ru, et autres
Publié: (2026)
par: Wang, Yi Ru, et autres
Publié: (2026)
CALYPSO: LLMs as Dungeon Masters' Assistants
par: Zhu, Andrew, et autres
Publié: (2023)
par: Zhu, Andrew, et autres
Publié: (2023)
Evaluating LLMs as Human Surrogates in Controlled Experiments
par: Hoq, Adnan, et autres
Publié: (2026)
par: Hoq, Adnan, et autres
Publié: (2026)
LLMs Get Lost In Multi-Turn Conversation
par: Laban, Philippe, et autres
Publié: (2025)
par: Laban, Philippe, et autres
Publié: (2025)
Pragmatics beyond humans: meaning, communication, and LLMs
par: Gvoždiak, Vít
Publié: (2025)
par: Gvoždiak, Vít
Publié: (2025)
LLMs Corrupt Your Documents When You Delegate
par: Laban, Philippe, et autres
Publié: (2026)
par: Laban, Philippe, et autres
Publié: (2026)
LLMs in Qualitative Research: Opportunities, Limitations, and Practical Considerations
par: Salgado, Henry, et autres
Publié: (2026)
par: Salgado, Henry, et autres
Publié: (2026)
Revisiting OPRO: The Limitations of Small-Scale LLMs as Optimizers
par: Zhang, Tuo, et autres
Publié: (2024)
par: Zhang, Tuo, et autres
Publié: (2024)
Personas with Attitudes: Controlling LLMs for Diverse Data Annotation
par: Fröhling, Leon, et autres
Publié: (2024)
par: Fröhling, Leon, et autres
Publié: (2024)
A Framework for Evaluating LLMs Under Task Indeterminacy
par: Guerdan, Luke, et autres
Publié: (2024)
par: Guerdan, Luke, et autres
Publié: (2024)
Generating Educational Materials with Different Levels of Readability using LLMs
par: Huang, Chieh-Yang, et autres
Publié: (2024)
par: Huang, Chieh-Yang, et autres
Publié: (2024)
Are Today's LLMs Ready to Explain Well-Being Concepts?
par: Jiang, Bohan, et autres
Publié: (2025)
par: Jiang, Bohan, et autres
Publié: (2025)
Chart-to-Experience: Benchmarking Multimodal LLMs for Predicting Experiential Impact of Charts
par: Kim, Seon Gyeom, et autres
Publié: (2025)
par: Kim, Seon Gyeom, et autres
Publié: (2025)
Characterizing Similarities and Divergences in Conversational Tones in Humans and LLMs by Sampling with People
par: Huang, Dun-Ming, et autres
Publié: (2024)
par: Huang, Dun-Ming, et autres
Publié: (2024)
CUPID: Evaluating Personalized and Contextualized Alignment of LLMs from Interactions
par: Kim, Tae Soo, et autres
Publié: (2025)
par: Kim, Tae Soo, et autres
Publié: (2025)
When Can We Trust LLMs in Mental Health? Large-Scale Benchmarks for Reliable LLM Evaluation
par: Badawi, Abeer, et autres
Publié: (2025)
par: Badawi, Abeer, et autres
Publié: (2025)
Do LLMs Truly Benefit from Longer Context in Automatic Post-Editing?
par: Kim, Ahrii, et autres
Publié: (2026)
par: Kim, Ahrii, et autres
Publié: (2026)
Translation Analytics for Freelancers II: Benchmarking Local LLMs for Confidential Translation Workflows
par: Balashov, Yuri, et autres
Publié: (2026)
par: Balashov, Yuri, et autres
Publié: (2026)
The LLM Effect: Are Humans Truly Using LLMs, or Are They Being Influenced By Them Instead?
par: Choi, Alexander S., et autres
Publié: (2024)
par: Choi, Alexander S., et autres
Publié: (2024)
Meta-Evaluating Local LLMs: Rethinking Performance Metrics for Serious Games
par: Isaza-Giraldo, Andrés, et autres
Publié: (2025)
par: Isaza-Giraldo, Andrés, et autres
Publié: (2025)
Unpacking Human Preference for LLMs: Demographically Aware Evaluation with the HUMAINE Framework
par: Petrova, Nora, et autres
Publié: (2026)
par: Petrova, Nora, et autres
Publié: (2026)
Leveraging Small LLMs for Argument Mining in Education: Argument Component Identification, Classification, and Assessment
par: Favero, Lucile, et autres
Publié: (2025)
par: Favero, Lucile, et autres
Publié: (2025)
WordCraft: Scaffolding the Keyword Method for L2 Vocabulary Learning with Multimodal LLMs
par: Shao, Yuheng, et autres
Publié: (2026)
par: Shao, Yuheng, et autres
Publié: (2026)
ReSpark: Leveraging Previous Data Reports as References to Generate New Reports with LLMs
par: Tian, Yuan, et autres
Publié: (2025)
par: Tian, Yuan, et autres
Publié: (2025)
AudioInsight: Detecting Social Contexts Relevant to Social Anxiety from Speech
par: Reddy, Varun, et autres
Publié: (2024)
par: Reddy, Varun, et autres
Publié: (2024)
Marked Pedagogies: Examining Linguistic Biases in Personalized Automated Writing Feedback
par: Tan, Mei, et autres
Publié: (2026)
par: Tan, Mei, et autres
Publié: (2026)
The Impossibility of Fair LLMs
par: Anthis, Jacy, et autres
Publié: (2024)
par: Anthis, Jacy, et autres
Publié: (2024)
Documents similaires
-
LegalWebAgent: Empowering Access to Justice via LLM-Based Web Agents
par: Tan, Jinzhe, et autres
Publié: (2025) -
Analyzing Images of Legal Documents: Toward Multi-Modal LLMs for Access to Justice
par: Westermann, Hannes, et autres
Publié: (2024) -
It Cannot Be Right If It Was Written by AI: On Lawyers' Preferences of Documents Perceived as Authored by an LLM vs a Human
par: Harasta, Jakub, et autres
Publié: (2024) -
Getting in the Door: Streamlining Intake in Civil Legal Services with Large Language Models
par: Steenhuis, Quinten, et autres
Publié: (2024) -
Desirable Characteristics for AI Teaching Assistants in Programming Education
par: Denny, Paul, et autres
Publié: (2024)