FoodieQA: A Multimodal Dataset for Fine-Grained Understanding of Chinese Food Culture
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Wenyan, Zhang, Xinyu, Li, Jiaang, Peng, Qiwei, Tang, Raphael, Zhou, Li, Zhang, Weijia, Hu, Guimin, Yuan, Yifei, Søgaard, Anders, Hershcovich, Daniel, Elliott, Desmond |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Understanding Retrieval Robustness for Retrieval-Augmented Image Captioning
di: Li, Wenyan, et al.
Pubblicazione: (2024)
di: Li, Wenyan, et al.
Pubblicazione: (2024)
RAVENEA: A Benchmark for Multimodal Retrieval-Augmented Visual Culture Understanding
di: Li, Jiaang, et al.
Pubblicazione: (2025)
di: Li, Jiaang, et al.
Pubblicazione: (2025)
Exploring Visual Culture Awareness in GPT-4V: A Comprehensive Probing
di: Cao, Yong, et al.
Pubblicazione: (2024)
di: Cao, Yong, et al.
Pubblicazione: (2024)
Does Instruction Tuning Make LLMs More Consistent?
di: Fierro, Constanza, et al.
Pubblicazione: (2024)
di: Fierro, Constanza, et al.
Pubblicazione: (2024)
HapticCap: A Multimodal Dataset and Task for Understanding User Experience of Vibration Haptic Signals
di: Hu, Guimin, et al.
Pubblicazione: (2025)
di: Hu, Guimin, et al.
Pubblicazione: (2025)
Debiasing Multilingual LLMs in Cross-lingual Latent Space
di: Peng, Qiwei, et al.
Pubblicazione: (2025)
di: Peng, Qiwei, et al.
Pubblicazione: (2025)
Do Vision and Language Models Share Concepts? A Vector Space Alignment Study
di: Li, Jiaang, et al.
Pubblicazione: (2023)
di: Li, Jiaang, et al.
Pubblicazione: (2023)
Understanding Subword Compositionality of Large Language Models
di: Peng, Qiwei, et al.
Pubblicazione: (2025)
di: Peng, Qiwei, et al.
Pubblicazione: (2025)
EvalCards: A Framework for Standardized Evaluation Reporting
di: Dhar, Ruchira, et al.
Pubblicazione: (2025)
di: Dhar, Ruchira, et al.
Pubblicazione: (2025)
Concept Space Alignment in Multilingual LLMs
di: Peng, Qiwei, et al.
Pubblicazione: (2024)
di: Peng, Qiwei, et al.
Pubblicazione: (2024)
How Do Multilingual Language Models Remember Facts?
di: Fierro, Constanza, et al.
Pubblicazione: (2024)
di: Fierro, Constanza, et al.
Pubblicazione: (2024)
Lost in Embeddings: Information Loss in Vision-Language Models
di: Li, Wenyan, et al.
Pubblicazione: (2025)
di: Li, Wenyan, et al.
Pubblicazione: (2025)
What if Othello-Playing Language Models Could See?
di: Chen, Xinyi, et al.
Pubblicazione: (2025)
di: Chen, Xinyi, et al.
Pubblicazione: (2025)
Vision-Language Models under Cultural and Inclusive Considerations
di: Karamolegkou, Antonia, et al.
Pubblicazione: (2024)
di: Karamolegkou, Antonia, et al.
Pubblicazione: (2024)
HapticLLaMA: A Multimodal Sensory Language Model for Haptic Captioning
di: Hu, Guimin, et al.
Pubblicazione: (2025)
di: Hu, Guimin, et al.
Pubblicazione: (2025)
Revisiting the Othello World Model Hypothesis
di: Yuan, Yifei, et al.
Pubblicazione: (2025)
di: Yuan, Yifei, et al.
Pubblicazione: (2025)
Evaluating Adjective-Noun Compositionality in LLMs: Functional vs Representational Perspectives
di: Dhar, Ruchira, et al.
Pubblicazione: (2026)
di: Dhar, Ruchira, et al.
Pubblicazione: (2026)
The Role of Data Curation in Image Captioning
di: Li, Wenyan, et al.
Pubblicazione: (2023)
di: Li, Wenyan, et al.
Pubblicazione: (2023)
Tracking Universal Features Through Fine-Tuning and Model Merging
di: Horn, Niels, et al.
Pubblicazione: (2024)
di: Horn, Niels, et al.
Pubblicazione: (2024)
Cultural Compass: Predicting Transfer Learning Success in Offensive Language Detection with Cultural Features
di: Zhou, Li, et al.
Pubblicazione: (2023)
di: Zhou, Li, et al.
Pubblicazione: (2023)
SketchVL: Policy Optimization via Fine-Grained Credit Assignment for Chart Understanding and More
di: Huang, Muye, et al.
Pubblicazione: (2026)
di: Huang, Muye, et al.
Pubblicazione: (2026)
Does Mapo Tofu Contain Coffee? Probing LLMs for Food-related Cultural Knowledge
di: Zhou, Li, et al.
Pubblicazione: (2024)
di: Zhou, Li, et al.
Pubblicazione: (2024)
Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding
di: Li, Zhimin, et al.
Pubblicazione: (2024)
di: Li, Zhimin, et al.
Pubblicazione: (2024)
Beyond Binary Classification: Detecting Fine-Grained Sexism in Social Media Videos
di: De Grazia, Laura, et al.
Pubblicazione: (2026)
di: De Grazia, Laura, et al.
Pubblicazione: (2026)
Bridging Cultural Nuances in Dialogue Agents through Cultural Value Surveys
di: Cao, Yong, et al.
Pubblicazione: (2024)
di: Cao, Yong, et al.
Pubblicazione: (2024)
Dataset Distillation with ControlNet for Fine‐Grained Classification
di: Minhao Li, et al.
Pubblicazione: (2026)
di: Minhao Li, et al.
Pubblicazione: (2026)
Towards Fine-Grained Citation Evaluation in Generated Text: A Comparative Analysis of Faithfulness Metrics
di: Zhang, Weijia, et al.
Pubblicazione: (2024)
di: Zhang, Weijia, et al.
Pubblicazione: (2024)
UniMEEC: Towards Unified Multimodal Emotion Recognition and Emotion Cause
di: Hu, Guimin, et al.
Pubblicazione: (2024)
di: Hu, Guimin, et al.
Pubblicazione: (2024)
ChiMDQA: Towards Comprehensive Chinese Document QA with Fine-grained Evaluation
di: Gao, Jing, et al.
Pubblicazione: (2025)
di: Gao, Jing, et al.
Pubblicazione: (2025)
Unlocking Markets: A Multilingual Benchmark to Cross-Market Question Answering
di: Yuan, Yifei, et al.
Pubblicazione: (2024)
di: Yuan, Yifei, et al.
Pubblicazione: (2024)
Do LLMs Understand Wine Descriptors Across Cultures? A Benchmark for Cultural Adaptations of Wine Reviews
di: Zou, Chenye, et al.
Pubblicazione: (2025)
di: Zou, Chenye, et al.
Pubblicazione: (2025)
Evaluation of Cultural Competence of Vision-Language Models
di: Yadav, Srishti, et al.
Pubblicazione: (2025)
di: Yadav, Srishti, et al.
Pubblicazione: (2025)
Beyond Words: Exploring Cultural Value Sensitivity in Multimodal Models
di: Yadav, Srishti, et al.
Pubblicazione: (2025)
di: Yadav, Srishti, et al.
Pubblicazione: (2025)
Words Worth a Thousand Pictures: Measuring and Understanding Perceptual Variability in Text-to-Image Generation
di: Tang, Raphael, et al.
Pubblicazione: (2024)
di: Tang, Raphael, et al.
Pubblicazione: (2024)
Long Story Short: Disentangling Compositionality and Long-Caption Understanding in Contrastive VLMs
di: Salazar, Israfel, et al.
Pubblicazione: (2025)
di: Salazar, Israfel, et al.
Pubblicazione: (2025)
FastV-RAG: Towards Fast and Fine-Grained Video QA with Retrieval-Augmented Generation
di: Li, Gen, et al.
Pubblicazione: (2026)
di: Li, Gen, et al.
Pubblicazione: (2026)
Hanfu-Bench: A Multimodal Benchmark on Cross-Temporal Cultural Understanding and Transcreation
di: Zhou, Li, et al.
Pubblicazione: (2025)
di: Zhou, Li, et al.
Pubblicazione: (2025)
Creating a Lens of Chinese Culture: A Multimodal Dataset for Chinese Pun Rebus Art Understanding
di: Zhang, Tuo, et al.
Pubblicazione: (2024)
di: Zhang, Tuo, et al.
Pubblicazione: (2024)
CRAFT Your Dataset: Task-Specific Synthetic Dataset Generation Through Corpus Retrieval and Augmentation
di: Ziegler, Ingo, et al.
Pubblicazione: (2024)
di: Ziegler, Ingo, et al.
Pubblicazione: (2024)
MedXpertQA: Benchmarking Expert-Level Medical Reasoning and Understanding
di: Zuo, Yuxin, et al.
Pubblicazione: (2025)
di: Zuo, Yuxin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Understanding Retrieval Robustness for Retrieval-Augmented Image Captioning
di: Li, Wenyan, et al.
Pubblicazione: (2024) -
RAVENEA: A Benchmark for Multimodal Retrieval-Augmented Visual Culture Understanding
di: Li, Jiaang, et al.
Pubblicazione: (2025) -
Exploring Visual Culture Awareness in GPT-4V: A Comprehensive Probing
di: Cao, Yong, et al.
Pubblicazione: (2024) -
Does Instruction Tuning Make LLMs More Consistent?
di: Fierro, Constanza, et al.
Pubblicazione: (2024) -
HapticCap: A Multimodal Dataset and Task for Understanding User Experience of Vibration Haptic Signals
di: Hu, Guimin, et al.
Pubblicazione: (2025)