Can They Dixit? Yes they Can! Dixit as a Playground for Multimodal Language Model Capabilities
Fuente:
arXiv
Salvato in:
| Autori principali: | Balepur, Nishant, Nguyen, Dang, Ki, Dayeon |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DixitWorld: Evaluating Multimodal Abductive Reasoning in Vision-Language Models with Multi-Agent Dixit Gameplay
di: Mo, Yunxiang, et al.
Pubblicazione: (2025)
di: Mo, Yunxiang, et al.
Pubblicazione: (2025)
Automatic Input Rewriting Improves Translation with Large Language Models
di: Ki, Dayeon, et al.
Pubblicazione: (2025)
di: Ki, Dayeon, et al.
Pubblicazione: (2025)
Guiding Large Language Models to Post-Edit Machine Translation with Error Annotations
di: Ki, Dayeon, et al.
Pubblicazione: (2024)
di: Ki, Dayeon, et al.
Pubblicazione: (2024)
Should I Share this Translation? Evaluating Quality Feedback for User Reliance on Machine Translation
di: Ki, Dayeon, et al.
Pubblicazione: (2025)
di: Ki, Dayeon, et al.
Pubblicazione: (2025)
Mitigating Semantic Leakage in Cross-lingual Embeddings via Orthogonality Constraint
di: Ki, Dayeon, et al.
Pubblicazione: (2024)
di: Ki, Dayeon, et al.
Pubblicazione: (2024)
What Makes Good Multilingual Reasoning? Disentangling Reasoning Traces with Measurable Features
di: Ki, Dayeon, et al.
Pubblicazione: (2026)
di: Ki, Dayeon, et al.
Pubblicazione: (2026)
Can Reinforcement Learning Unlock the Hidden Dangers in Aligned Large Language Models?
di: Karkevandi, Mohammad Bahrami, et al.
Pubblicazione: (2024)
di: Karkevandi, Mohammad Bahrami, et al.
Pubblicazione: (2024)
Multiple LLM Agents Debate for Equitable Cultural Alignment
di: Ki, Dayeon, et al.
Pubblicazione: (2025)
di: Ki, Dayeon, et al.
Pubblicazione: (2025)
Cross-lingual QA: A Key to Unlocking In-context Cross-lingual Performance
di: Kim, Sunkyoung, et al.
Pubblicazione: (2023)
di: Kim, Sunkyoung, et al.
Pubblicazione: (2023)
Plausibly Problematic Questions in Multiple-Choice Benchmarks for Commonsense Reasoning
di: Palta, Shramay, et al.
Pubblicazione: (2024)
di: Palta, Shramay, et al.
Pubblicazione: (2024)
Is Your Large Language Model Knowledgeable or a Choices-Only Cheater?
di: Balepur, Nishant, et al.
Pubblicazione: (2024)
di: Balepur, Nishant, et al.
Pubblicazione: (2024)
GraphicBench: A Planning Benchmark for Graphic Design with Language Agents
di: Ki, Dayeon, et al.
Pubblicazione: (2025)
di: Ki, Dayeon, et al.
Pubblicazione: (2025)
The Self-Improvement Paradox: Can Language Models Bootstrap Reasoning Capabilities without External Scaffolding?
di: Sun, Yutao, et al.
Pubblicazione: (2025)
di: Sun, Yutao, et al.
Pubblicazione: (2025)
Position: Multimodal Large Language Models Can Significantly Advance Scientific Reasoning
di: Yan, Yibo, et al.
Pubblicazione: (2025)
di: Yan, Yibo, et al.
Pubblicazione: (2025)
Dixit
Pubblicazione: (2019)
Pubblicazione: (2019)
Leveraging Large Language Models for Active Merchant Non-player Characters
di: Kim, Byungjun, et al.
Pubblicazione: (2024)
di: Kim, Byungjun, et al.
Pubblicazione: (2024)
adaptMLLM: Fine-Tuning Multilingual Language Models on Low-Resource Languages with Integrated LLM Playgrounds
di: Lankford, Séamus, et al.
Pubblicazione: (2024)
di: Lankford, Séamus, et al.
Pubblicazione: (2024)
Difficult Task Yes but Simple Task No: Unveiling the Laziness in Multimodal LLMs
di: Zhao, Sihang, et al.
Pubblicazione: (2024)
di: Zhao, Sihang, et al.
Pubblicazione: (2024)
BLINK: Multimodal Large Language Models Can See but Not Perceive
di: Fu, Xingyu, et al.
Pubblicazione: (2024)
di: Fu, Xingyu, et al.
Pubblicazione: (2024)
Deanthropomorphising NLP: Can a Language Model Be Conscious?
di: Shardlow, Matthew, et al.
Pubblicazione: (2022)
di: Shardlow, Matthew, et al.
Pubblicazione: (2022)
Pragmatics Meets Culture: Culturally-adapted Artwork Description Generation and Evaluation
di: Zhao, Lingjun, et al.
Pubblicazione: (2026)
di: Zhao, Lingjun, et al.
Pubblicazione: (2026)
Can Large Language Models Help Multimodal Language Analysis? MMLA: A Comprehensive Benchmark
di: Zhang, Hanlei, et al.
Pubblicazione: (2025)
di: Zhang, Hanlei, et al.
Pubblicazione: (2025)
Can Language Models Solve Olympiad Programming?
di: Shi, Quan, et al.
Pubblicazione: (2024)
di: Shi, Quan, et al.
Pubblicazione: (2024)
Small Language Model Can Self-correct
di: Han, Haixia, et al.
Pubblicazione: (2024)
di: Han, Haixia, et al.
Pubblicazione: (2024)
Traj-MLLM: Can Multimodal Large Language Models Reform Trajectory Data Mining?
di: Liu, Shuo, et al.
Pubblicazione: (2025)
di: Liu, Shuo, et al.
Pubblicazione: (2025)
"I See What You Did There": Can Large Vision-Language Models Understand Multimodal Puns?
di: Xu, Naen, et al.
Pubblicazione: (2026)
di: Xu, Naen, et al.
Pubblicazione: (2026)
Can Language Models Solve Graph Problems in Natural Language?
di: Wang, Heng, et al.
Pubblicazione: (2023)
di: Wang, Heng, et al.
Pubblicazione: (2023)
Can Large Language Models do Analytical Reasoning?
di: Hu, Yebowen, et al.
Pubblicazione: (2024)
di: Hu, Yebowen, et al.
Pubblicazione: (2024)
Reheat Nachos for Dinner? Evaluating AI Support for Cross-Cultural Communication of Neologisms
di: Ki, Dayeon, et al.
Pubblicazione: (2026)
di: Ki, Dayeon, et al.
Pubblicazione: (2026)
Reverse Question Answering: Can an LLM Write a Question so Hard (or Bad) that it Can't Answer?
di: Balepur, Nishant, et al.
Pubblicazione: (2024)
di: Balepur, Nishant, et al.
Pubblicazione: (2024)
Can Large Language Models Predict the Outcome of Judicial Decisions?
di: Kmainasi, Mohamed Bayan, et al.
Pubblicazione: (2025)
di: Kmainasi, Mohamed Bayan, et al.
Pubblicazione: (2025)
THiNK: Can Large Language Models Think-aloud?
di: Yu, Yongan, et al.
Pubblicazione: (2025)
di: Yu, Yongan, et al.
Pubblicazione: (2025)
Can Large Language Models Express Uncertainty Like Human?
di: Tao, Linwei, et al.
Pubblicazione: (2025)
di: Tao, Linwei, et al.
Pubblicazione: (2025)
Can Language Models Follow Multiple Turns of Entangled Instructions?
di: Han, Chi, et al.
Pubblicazione: (2025)
di: Han, Chi, et al.
Pubblicazione: (2025)
Can Pre-trained Language Models Understand Chinese Humor?
di: Chen, Yuyan, et al.
Pubblicazione: (2024)
di: Chen, Yuyan, et al.
Pubblicazione: (2024)
Can Language Model Moderators Improve the Health of Online Discourse?
di: Cho, Hyundong, et al.
Pubblicazione: (2023)
di: Cho, Hyundong, et al.
Pubblicazione: (2023)
Can Language Models Serve as Text-Based World Simulators?
di: Wang, Ruoyao, et al.
Pubblicazione: (2024)
di: Wang, Ruoyao, et al.
Pubblicazione: (2024)
Break the Chain: Large Language Models Can be Shortcut Reasoners
di: Ding, Mengru, et al.
Pubblicazione: (2024)
di: Ding, Mengru, et al.
Pubblicazione: (2024)
Can We Edit Multimodal Large Language Models?
di: Cheng, Siyuan, et al.
Pubblicazione: (2023)
di: Cheng, Siyuan, et al.
Pubblicazione: (2023)
LightReasoner: Can Small Language Models Teach Large Language Models Reasoning?
di: Wang, Jingyuan, et al.
Pubblicazione: (2025)
di: Wang, Jingyuan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
DixitWorld: Evaluating Multimodal Abductive Reasoning in Vision-Language Models with Multi-Agent Dixit Gameplay
di: Mo, Yunxiang, et al.
Pubblicazione: (2025) -
Automatic Input Rewriting Improves Translation with Large Language Models
di: Ki, Dayeon, et al.
Pubblicazione: (2025) -
Guiding Large Language Models to Post-Edit Machine Translation with Error Annotations
di: Ki, Dayeon, et al.
Pubblicazione: (2024) -
Should I Share this Translation? Evaluating Quality Feedback for User Reliance on Machine Translation
di: Ki, Dayeon, et al.
Pubblicazione: (2025) -
Mitigating Semantic Leakage in Cross-lingual Embeddings via Orthogonality Constraint
di: Ki, Dayeon, et al.
Pubblicazione: (2024)