MimeQA: Towards Socially-Intelligent Nonverbal Foundation Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Hengzhi, Tjandrasuwita, Megan, Fung, Yi R., Solar-Lezama, Armando, Liang, Paul Pu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
PuzzleWorld: A Benchmark for Multimodal, Open-Ended Reasoning in Puzzlehunts
di: Li, Hengzhi, et al.
Pubblicazione: (2025)
di: Li, Hengzhi, et al.
Pubblicazione: (2025)
Foundations of Multisensory Artificial Intelligence
di: Liang, Paul Pu
Pubblicazione: (2024)
di: Liang, Paul Pu
Pubblicazione: (2024)
Can Vision Language Models Understand Mimed Actions?
di: Cho, Hyundong, et al.
Pubblicazione: (2025)
di: Cho, Hyundong, et al.
Pubblicazione: (2025)
A Vision for Multisensory Intelligence: Sensing, Science, and Synergy
di: Liang, Paul Pu
Pubblicazione: (2026)
di: Liang, Paul Pu
Pubblicazione: (2026)
Vision-Language Models Mistake Head Orientation for Gaze Direction: Nonverbal Conversation Cues
di: Zhang, Zory, et al.
Pubblicazione: (2025)
di: Zhang, Zory, et al.
Pubblicazione: (2025)
Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers
di: Zhao, Yilun, et al.
Pubblicazione: (2025)
di: Zhao, Yilun, et al.
Pubblicazione: (2025)
ReasVQA: Advancing VideoQA with Imperfect Reasoning Process
di: Liang, Jianxin, et al.
Pubblicazione: (2025)
di: Liang, Jianxin, et al.
Pubblicazione: (2025)
Let the Target Select for Itself: Data Selection via Target-Aligned Paths
di: Yang, Huitao, et al.
Pubblicazione: (2026)
di: Yang, Huitao, et al.
Pubblicazione: (2026)
Beyond Isolated Facts: Synthesizing Narrative and Grounded Supervision for VideoQA
di: Liang, Jianxin, et al.
Pubblicazione: (2025)
di: Liang, Jianxin, et al.
Pubblicazione: (2025)
VLMaterial: Procedural Material Generation with Large Vision-Language Models
di: Li, Beichen, et al.
Pubblicazione: (2025)
di: Li, Beichen, et al.
Pubblicazione: (2025)
OS-ATLAS: A Foundation Action Model for Generalist GUI Agents
di: Wu, Zhiyong, et al.
Pubblicazione: (2024)
di: Wu, Zhiyong, et al.
Pubblicazione: (2024)
HEMM: Holistic Evaluation of Multimodal Foundation Models
di: Liang, Paul Pu, et al.
Pubblicazione: (2024)
di: Liang, Paul Pu, et al.
Pubblicazione: (2024)
MultiChartQA: Benchmarking Vision-Language Models on Multi-Chart Problems
di: Zhu, Zifeng, et al.
Pubblicazione: (2024)
di: Zhu, Zifeng, et al.
Pubblicazione: (2024)
FunQA: Towards Surprising Video Comprehension
di: Xie, Binzhu, et al.
Pubblicazione: (2023)
di: Xie, Binzhu, et al.
Pubblicazione: (2023)
Survey of Video Diffusion Models: Foundations, Implementations, and Applications
di: Wang, Yimu, et al.
Pubblicazione: (2025)
di: Wang, Yimu, et al.
Pubblicazione: (2025)
From Pixels to Insights: A Survey on Automatic Chart Understanding in the Era of Large Foundation Models
di: Huang, Kung-Hsiang, et al.
Pubblicazione: (2024)
di: Huang, Kung-Hsiang, et al.
Pubblicazione: (2024)
MSG-Chart: Multimodal Scene Graph for ChartQA
di: Dai, Yue, et al.
Pubblicazione: (2024)
di: Dai, Yue, et al.
Pubblicazione: (2024)
VisOnlyQA: Large Vision Language Models Still Struggle with Visual Perception of Geometric Information
di: Kamoi, Ryo, et al.
Pubblicazione: (2024)
di: Kamoi, Ryo, et al.
Pubblicazione: (2024)
ProMQA-Assembly: Multimodal Procedural QA Dataset on Assembly
di: Hasegawa, Kimihiro, et al.
Pubblicazione: (2025)
di: Hasegawa, Kimihiro, et al.
Pubblicazione: (2025)
CartoMapQA: A Fundamental Benchmark Dataset Evaluating Vision-Language Models on Cartographic Map Understanding
di: Ung, Huy Quang, et al.
Pubblicazione: (2025)
di: Ung, Huy Quang, et al.
Pubblicazione: (2025)
EPEE: Towards Efficient and Effective Foundation Models in Biomedicine
di: Zhan, Zaifu, et al.
Pubblicazione: (2025)
di: Zhan, Zaifu, et al.
Pubblicazione: (2025)
Negative Object Presence Evaluation (NOPE) to Measure Object Hallucination in Vision-Language Models
di: Lovenia, Holy, et al.
Pubblicazione: (2023)
di: Lovenia, Holy, et al.
Pubblicazione: (2023)
VisualSimpleQA: A Benchmark for Decoupled Evaluation of Large Vision-Language Models in Fact-Seeking Question Answering
di: Wang, Yanling, et al.
Pubblicazione: (2025)
di: Wang, Yanling, et al.
Pubblicazione: (2025)
Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues
di: Kim, Youngmin, et al.
Pubblicazione: (2025)
di: Kim, Youngmin, et al.
Pubblicazione: (2025)
Nonverbal Interaction Detection
di: Wei, Jianan, et al.
Pubblicazione: (2024)
di: Wei, Jianan, et al.
Pubblicazione: (2024)
Visual-TableQA: Open-Domain Benchmark for Reasoning over Table Images
di: Lompo, Boammani Aser, et al.
Pubblicazione: (2025)
di: Lompo, Boammani Aser, et al.
Pubblicazione: (2025)
TAMP: Token-Adaptive Layerwise Pruning in Multimodal Large Language Models
di: Lee, Jaewoo, et al.
Pubblicazione: (2025)
di: Lee, Jaewoo, et al.
Pubblicazione: (2025)
CultureCLIP: Empowering CLIP with Cultural Awareness through Synthetic Images and Contextualized Captions
di: Huang, Yuchen, et al.
Pubblicazione: (2025)
di: Huang, Yuchen, et al.
Pubblicazione: (2025)
Toward Robust Multimodal Learning using Multimodal Foundational Models
di: Zhao, Xianbing, et al.
Pubblicazione: (2024)
di: Zhao, Xianbing, et al.
Pubblicazione: (2024)
UltraCUA: A Foundation Model for Computer Use Agents with Hybrid Action
di: Yang, Yuhao, et al.
Pubblicazione: (2025)
di: Yang, Yuhao, et al.
Pubblicazione: (2025)
MedFrameQA: A Multi-Image Medical VQA Benchmark for Clinical Reasoning
di: Yu, Suhao, et al.
Pubblicazione: (2025)
di: Yu, Suhao, et al.
Pubblicazione: (2025)
Generalizing Visual Question Answering from Synthetic to Human-Written Questions via a Chain of QA with a Large Language Model
di: Kim, Taehee, et al.
Pubblicazione: (2024)
di: Kim, Taehee, et al.
Pubblicazione: (2024)
MiniMax-01: Scaling Foundation Models with Lightning Attention
di: MiniMax, et al.
Pubblicazione: (2025)
di: MiniMax, et al.
Pubblicazione: (2025)
Salsa as a Nonverbal Embodied Language -- The CoMPAS3D Dataset and Benchmarks
di: Burkanova, Bermet, et al.
Pubblicazione: (2025)
di: Burkanova, Bermet, et al.
Pubblicazione: (2025)
JanusCoder: Towards a Foundational Visual-Programmatic Interface for Code Intelligence
di: Sun, Qiushi, et al.
Pubblicazione: (2025)
di: Sun, Qiushi, et al.
Pubblicazione: (2025)
VisualAgentBench: Towards Large Multimodal Models as Visual Foundation Agents
di: Liu, Xiao, et al.
Pubblicazione: (2024)
di: Liu, Xiao, et al.
Pubblicazione: (2024)
A Vision-Language Foundation Model to Enhance Efficiency of Chest X-ray Interpretation
di: Chen, Zhihong, et al.
Pubblicazione: (2024)
di: Chen, Zhihong, et al.
Pubblicazione: (2024)
DoraemonGPT: Toward Understanding Dynamic Scenes with Large Language Models (Exemplified as A Video Agent)
di: Yang, Zongxin, et al.
Pubblicazione: (2024)
di: Yang, Zongxin, et al.
Pubblicazione: (2024)
Teaching Vision-Language Models to Ask: Resolving Ambiguity in Visual Questions
di: Jian, Pu, et al.
Pubblicazione: (2025)
di: Jian, Pu, et al.
Pubblicazione: (2025)
Subobject-level Image Tokenization
di: Chen, Delong, et al.
Pubblicazione: (2024)
di: Chen, Delong, et al.
Pubblicazione: (2024)
Documenti analoghi
-
PuzzleWorld: A Benchmark for Multimodal, Open-Ended Reasoning in Puzzlehunts
di: Li, Hengzhi, et al.
Pubblicazione: (2025) -
Foundations of Multisensory Artificial Intelligence
di: Liang, Paul Pu
Pubblicazione: (2024) -
Can Vision Language Models Understand Mimed Actions?
di: Cho, Hyundong, et al.
Pubblicazione: (2025) -
A Vision for Multisensory Intelligence: Sensing, Science, and Synergy
di: Liang, Paul Pu
Pubblicazione: (2026) -
Vision-Language Models Mistake Head Orientation for Gaze Direction: Nonverbal Conversation Cues
di: Zhang, Zory, et al.
Pubblicazione: (2025)