World in a Frame: Understanding Culture Mixing as a New Challenge for Vision-Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kim, Eunsu, Park, Junyeong, An, Na Min, Kim, Junseong, Patel, Hitesh Laxmichand, Jin, Jiho, Kruk, Julia, Agarwal, Amit, Panda, Srikant, Ilasariya, Fenal Ashokbhai, Shim, Hyunjung, Oh, Alice |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AccessEval: Benchmarking Disability Bias in Large Language Models
par: Panda, Srikant, et autres
Publié: (2025)
par: Panda, Srikant, et autres
Publié: (2025)
Who's Asking? Investigating Bias Through the Lens of Disability Framed Queries in LLMs
par: Hari, Vishnu, et autres
Publié: (2025)
par: Hari, Vishnu, et autres
Publié: (2025)
Hybrid AI for Responsive Multi-Turn Online Conversations with Novel Dynamic Routing and Feedback Adaptation
par: Pattnayak, Priyaranjan, et autres
Publié: (2025)
par: Pattnayak, Priyaranjan, et autres
Publié: (2025)
Hard Negative Mining for Domain-Specific Retrieval in Enterprise Systems
par: Meghwani, Hansa, et autres
Publié: (2025)
par: Meghwani, Hansa, et autres
Publié: (2025)
Clinical QA 2.0: Multi-Task Learning for Answer Extraction and Categorization
par: Pattnayak, Priyaranjan, et autres
Publié: (2025)
par: Pattnayak, Priyaranjan, et autres
Publié: (2025)
BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation
par: Kim, Eunsu, et autres
Publié: (2025)
par: Kim, Eunsu, et autres
Publié: (2025)
Survey of Large Multimodal Model Datasets, Application Categories and Taxonomy
par: Pattnayak, Priyaranjan, et autres
Publié: (2024)
par: Pattnayak, Priyaranjan, et autres
Publié: (2024)
Tokenization Matters: Improving Zero-Shot NER for Indic Languages
par: Pattnayak, Priyaranjan, et autres
Publié: (2025)
par: Pattnayak, Priyaranjan, et autres
Publié: (2025)
DAIQ: Auditing Demographic Attribute Inference from Question in LLMs
par: Panda, Srikant, et autres
Publié: (2025)
par: Panda, Srikant, et autres
Publié: (2025)
FlexDoc: Parameterized Sampling for Diverse Multilingual Synthetic Documents for Training Document Understanding Models
par: Dua, Karan, et autres
Publié: (2025)
par: Dua, Karan, et autres
Publié: (2025)
FS-DAG: Few Shot Domain Adapting Graph Networks for Visually Rich Document Understanding
par: Agarwal, Amit, et autres
Publié: (2025)
par: Agarwal, Amit, et autres
Publié: (2025)
Pushing on Multilingual Reasoning Models with Language-Mixed Chain-of-Thought
par: Son, Guijin, et autres
Publié: (2025)
par: Son, Guijin, et autres
Publié: (2025)
LLM-Guided Lifecycle-Aware Clustering of Multi-Turn Customer Support Conversations
par: Pattnayak, Priyaranjan, et autres
Publié: (2026)
par: Pattnayak, Priyaranjan, et autres
Publié: (2026)
Diffusion Models Through a Global Lens: Are They Culturally Inclusive?
par: Bayramli, Zahra, et autres
Publié: (2025)
par: Bayramli, Zahra, et autres
Publié: (2025)
Enhancing Document AI Data Generation Through Graph-Based Synthetic Layouts
par: Agarwal, Amit, et autres
Publié: (2024)
par: Agarwal, Amit, et autres
Publié: (2024)
PCRI: Measuring Context Robustness in Multimodal Models for Enterprise Applications
par: Patel, Hitesh Laxmichand, et autres
Publié: (2025)
par: Patel, Hitesh Laxmichand, et autres
Publié: (2025)
When Tom Eats Kimchi: Evaluating Cultural Bias of Multimodal Large Language Models in Cultural Mixture Contexts
par: Kim, Jun Seong, et autres
Publié: (2025)
par: Kim, Jun Seong, et autres
Publié: (2025)
RCI: A Score for Evaluating Global and Local Reasoning in Multimodal Benchmarks
par: Agarwal, Amit, et autres
Publié: (2025)
par: Agarwal, Amit, et autres
Publié: (2025)
SweEval: Do LLMs Really Swear? A Safety Benchmark for Testing Limits for Enterprise Use
par: Patel, Hitesh Laxmichand, et autres
Publié: (2025)
par: Patel, Hitesh Laxmichand, et autres
Publié: (2025)
Flex-TravelPlanner: A Benchmark for Flexible Planning with Language Agents
par: Oh, Juhyun, et autres
Publié: (2025)
par: Oh, Juhyun, et autres
Publié: (2025)
MomentMix Augmentation with Length-Aware DETR for Temporally Robust Moment Retrieval
par: Park, Seojeong, et autres
Publié: (2024)
par: Park, Seojeong, et autres
Publié: (2024)
LLM for Barcodes: Generating Diverse Synthetic Data for Identity Documents
par: Patel, Hitesh Laxmichand, et autres
Publié: (2024)
par: Patel, Hitesh Laxmichand, et autres
Publié: (2024)
RECOR: Reasoning-focused Multi-turn Conversational Retrieval Benchmark
par: Ali, Mohammed, et autres
Publié: (2026)
par: Ali, Mohammed, et autres
Publié: (2026)
Are they lovers or friends? Evaluating LLMs' Social Reasoning in English and Korean Dialogues
par: Kim, Eunsu, et autres
Publié: (2025)
par: Kim, Eunsu, et autres
Publié: (2025)
TextBoost: Boosting Text Encoder for Personalized Text-to-Image Generation
par: Park, NaHyeon, et autres
Publié: (2024)
par: Park, NaHyeon, et autres
Publié: (2024)
MUG-Eval: A Proxy Evaluation Framework for Multilingual Generation Capabilities in Any Language
par: Song, Seyoung, et autres
Publié: (2025)
par: Song, Seyoung, et autres
Publié: (2025)
Aligning LLMs for Multilingual Consistency in Enterprise Applications
par: Agarwal, Amit, et autres
Publié: (2025)
par: Agarwal, Amit, et autres
Publié: (2025)
Classifier-guided CLIP Distillation for Unsupervised Multi-label Classification
par: Kim, Dongseob, et autres
Publié: (2025)
par: Kim, Dongseob, et autres
Publié: (2025)
Scribble-Guided Diffusion for Training-free Text-to-Image Generation
par: Lee, Seonho, et autres
Publié: (2024)
par: Lee, Seonho, et autres
Publié: (2024)
DreamCatalyst: Fast and High-Quality 3D Editing via Controlling Editability and Identity Preservation
par: Kim, Jiwook, et autres
Publié: (2024)
par: Kim, Jiwook, et autres
Publié: (2024)
Understanding Multi-Granularity for Open-Vocabulary Part Segmentation
par: Choi, Jiho, et autres
Publié: (2024)
par: Choi, Jiho, et autres
Publié: (2024)
Multi-FAct: Assessing Factuality of Multilingual LLMs using FActScore
par: Shafayat, Sheikh, et autres
Publié: (2024)
par: Shafayat, Sheikh, et autres
Publié: (2024)
The Generative AI Paradox on Evaluation: What It Can Solve, It May Not Evaluate
par: Oh, Juhyun, et autres
Publié: (2024)
par: Oh, Juhyun, et autres
Publié: (2024)
CLIcK: A Benchmark Dataset of Cultural and Linguistic Intelligence in Korean
par: Kim, Eunsu, et autres
Publié: (2024)
par: Kim, Eunsu, et autres
Publié: (2024)
I0T: Embedding Standardization Method Towards Zero Modality Gap
par: An, Na Min, et autres
Publié: (2024)
par: An, Na Min, et autres
Publié: (2024)
BLUCK: A Benchmark Dataset for Bengali Linguistic Understanding and Cultural Knowledge
par: Kabir, Daeen, et autres
Publié: (2025)
par: Kabir, Daeen, et autres
Publié: (2025)
PosterForest: Hierarchical Multi-Agent Collaboration for Scientific Poster Generation
par: Choi, Jiho, et autres
Publié: (2025)
par: Choi, Jiho, et autres
Publié: (2025)
R2-KG: General-Purpose Dual-Agent Framework for Reliable Reasoning on Knowledge Graphs
par: Jo, Sumin, et autres
Publié: (2025)
par: Jo, Sumin, et autres
Publié: (2025)
JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors
par: Jin, Jiho, et autres
Publié: (2026)
par: Jin, Jiho, et autres
Publié: (2026)
3D-Aware Vision-Language Models Fine-Tuning with Geometric Distillation
par: Lee, Seonho, et autres
Publié: (2025)
par: Lee, Seonho, et autres
Publié: (2025)
Documents similaires
-
AccessEval: Benchmarking Disability Bias in Large Language Models
par: Panda, Srikant, et autres
Publié: (2025) -
Who's Asking? Investigating Bias Through the Lens of Disability Framed Queries in LLMs
par: Hari, Vishnu, et autres
Publié: (2025) -
Hybrid AI for Responsive Multi-Turn Online Conversations with Novel Dynamic Routing and Feedback Adaptation
par: Pattnayak, Priyaranjan, et autres
Publié: (2025) -
Hard Negative Mining for Domain-Specific Retrieval in Enterprise Systems
par: Meghwani, Hansa, et autres
Publié: (2025) -
Clinical QA 2.0: Multi-Task Learning for Answer Extraction and Categorization
par: Pattnayak, Priyaranjan, et autres
Publié: (2025)