CLEVRER-Humans: Describing Physical and Causal Events the Human Way
Fuente:
arXiv
Guardado en:
| Autores principales: | Mao, Jiayuan, Yang, Xuelin, Zhang, Xikun, Goodman, Noah D., Wu, Jiajun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
What Makes a Maze Look Like a Maze?
por: Hsu, Joy, et al.
Publicado: (2024)
por: Hsu, Joy, et al.
Publicado: (2024)
Learning Compositional Behaviors from Demonstration and Language
por: Liu, Weiyu, et al.
Publicado: (2025)
por: Liu, Weiyu, et al.
Publicado: (2025)
Neuro-Symbolic Concepts
por: Mao, Jiayuan, et al.
Publicado: (2025)
por: Mao, Jiayuan, et al.
Publicado: (2025)
Describing Images $\textit{Fast and Slow}$: Quantifying and Predicting the Variation in Human Signals during Visuo-Linguistic Processes
por: Takmaz, Ece, et al.
Publicado: (2024)
por: Takmaz, Ece, et al.
Publicado: (2024)
V2P-Bench: Evaluating Video-Language Understanding with Visual Prompts for Better Human-Model Interaction
por: Zhao, Yiming, et al.
Publicado: (2025)
por: Zhao, Yiming, et al.
Publicado: (2025)
Pixels, Patterns, but No Poetry: To See The World like Humans
por: Gao, Hongcheng, et al.
Publicado: (2025)
por: Gao, Hongcheng, et al.
Publicado: (2025)
Learning Human-Perceived Fakeness in AI-Generated Videos via Multimodal LLMs
por: Fu, Xingyu, et al.
Publicado: (2025)
por: Fu, Xingyu, et al.
Publicado: (2025)
Face-Human-Bench: A Comprehensive Benchmark of Face and Human Understanding for Multi-modal Assistants
por: Qin, Lixiong, et al.
Publicado: (2025)
por: Qin, Lixiong, et al.
Publicado: (2025)
Mind the Uncertainty in Human Disagreement: Evaluating Discrepancies between Model Predictions and Human Responses in VQA
por: Lan, Jian, et al.
Publicado: (2024)
por: Lan, Jian, et al.
Publicado: (2024)
DWE+: Dual-Way Matching Enhanced Framework for Multimodal Entity Linking
por: Song, Shezheng, et al.
Publicado: (2024)
por: Song, Shezheng, et al.
Publicado: (2024)
Catch Me If You Can Describe Me: Open-Vocabulary Camouflaged Instance Segmentation with Diffusion
por: Vu, Tuan-Anh, et al.
Publicado: (2023)
por: Vu, Tuan-Anh, et al.
Publicado: (2023)
Agent S: An Open Agentic Framework that Uses Computers Like a Human
por: Agashe, Saaket, et al.
Publicado: (2024)
por: Agashe, Saaket, et al.
Publicado: (2024)
WildVision: Evaluating Vision-Language Models in the Wild with Human Preferences
por: Lu, Yujie, et al.
Publicado: (2024)
por: Lu, Yujie, et al.
Publicado: (2024)
Enhancing Human-Computer Interaction in Chest X-ray Analysis using Vision and Language Model with Eye Gaze Patterns
por: Kim, Yunsoo, et al.
Publicado: (2024)
por: Kim, Yunsoo, et al.
Publicado: (2024)
EditReward: A Human-Aligned Reward Model for Instruction-Guided Image Editing
por: Wu, Keming, et al.
Publicado: (2025)
por: Wu, Keming, et al.
Publicado: (2025)
ZeroGUI: Automating Online GUI Learning at Zero Human Cost
por: Yang, Chenyu, et al.
Publicado: (2025)
por: Yang, Chenyu, et al.
Publicado: (2025)
Learning from Massive Human Videos for Universal Humanoid Pose Control
por: Mao, Jiageng, et al.
Publicado: (2024)
por: Mao, Jiageng, et al.
Publicado: (2024)
SIMS: Simulating Stylized Human-Scene Interactions with Retrieval-Augmented Script Generation
por: Wang, Wenjia, et al.
Publicado: (2024)
por: Wang, Wenjia, et al.
Publicado: (2024)
FlexCap: Describe Anything in Images in Controllable Detail
por: Dwibedi, Debidatta, et al.
Publicado: (2024)
por: Dwibedi, Debidatta, et al.
Publicado: (2024)
Polos: Multimodal Metric Learning from Human Feedback for Image Captioning
por: Wada, Yuiga, et al.
Publicado: (2024)
por: Wada, Yuiga, et al.
Publicado: (2024)
Why Only Text: Empowering Vision-and-Language Navigation with Multi-modal Prompts
por: Hong, Haodong, et al.
Publicado: (2024)
por: Hong, Haodong, et al.
Publicado: (2024)
General Scene Adaptation for Vision-and-Language Navigation
por: Hong, Haodong, et al.
Publicado: (2025)
por: Hong, Haodong, et al.
Publicado: (2025)
MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI
por: Yao, Huanjin, et al.
Publicado: (2025)
por: Yao, Huanjin, et al.
Publicado: (2025)
HSSBench: Benchmarking Humanities and Social Sciences Ability for Multimodal Large Language Models
por: Kang, Zhaolu, et al.
Publicado: (2025)
por: Kang, Zhaolu, et al.
Publicado: (2025)
On the Interplay of Human-AI Alignment,Fairness, and Performance Trade-offs in Medical Imaging
por: Luo, Haozhe, et al.
Publicado: (2025)
por: Luo, Haozhe, et al.
Publicado: (2025)
Navigating the Digital World as Humans Do: Universal Visual Grounding for GUI Agents
por: Gou, Boyu, et al.
Publicado: (2024)
por: Gou, Boyu, et al.
Publicado: (2024)
GAOKAO-MM: A Chinese Human-Level Benchmark for Multimodal Models Evaluation
por: Zong, Yi, et al.
Publicado: (2024)
por: Zong, Yi, et al.
Publicado: (2024)
VCR-Bench: A Comprehensive Evaluation Framework for Video Chain-of-Thought Reasoning
por: Qi, Yukun, et al.
Publicado: (2025)
por: Qi, Yukun, et al.
Publicado: (2025)
Causal-SAM-LLM: Large Language Models as Causal Reasoners for Robust Medical Segmentation
por: Tang, Tao, et al.
Publicado: (2025)
por: Tang, Tao, et al.
Publicado: (2025)
Towards Predicting Any Human Trajectory In Context
por: Fujii, Ryo, et al.
Publicado: (2025)
por: Fujii, Ryo, et al.
Publicado: (2025)
Making Avatars Interact: Towards Text-Driven Human-Object Interaction for Controllable Talking Avatars
por: Zhang, Youliang, et al.
Publicado: (2026)
por: Zhang, Youliang, et al.
Publicado: (2026)
FineBench: Benchmarking and Enhancing Vision-Language Models for Fine-grained Human Activity Understanding
por: Faure, Gueter Josmy, et al.
Publicado: (2026)
por: Faure, Gueter Josmy, et al.
Publicado: (2026)
IE-Critic-R1: Advancing the Explanatory Measurement of Text-Driven Image Editing for Human Perception Alignment
por: Qu, Bowen, et al.
Publicado: (2025)
por: Qu, Bowen, et al.
Publicado: (2025)
Learning to Correction: Explainable Feedback Generation for Visual Commonsense Reasoning Distractor
por: Chen, Jiali, et al.
Publicado: (2024)
por: Chen, Jiali, et al.
Publicado: (2024)
OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model
por: Chen, Qiguang, et al.
Publicado: (2026)
por: Chen, Qiguang, et al.
Publicado: (2026)
Visually Descriptive Language Model for Vector Graphics Reasoning
por: Wang, Zhenhailong, et al.
Publicado: (2024)
por: Wang, Zhenhailong, et al.
Publicado: (2024)
A Review of Mechanistic Models of Event Comprehension
por: Nguyen, Tan T.
Publicado: (2024)
por: Nguyen, Tan T.
Publicado: (2024)
ADAM: An Embodied Causal Agent in Open-World Environments
por: Yu, Shu, et al.
Publicado: (2024)
por: Yu, Shu, et al.
Publicado: (2024)
Fostering Video Reasoning via Next-Event Prediction
por: Wang, Haonan, et al.
Publicado: (2025)
por: Wang, Haonan, et al.
Publicado: (2025)
R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization
por: Zhang, Jingyi, et al.
Publicado: (2025)
por: Zhang, Jingyi, et al.
Publicado: (2025)
Ejemplares similares
-
What Makes a Maze Look Like a Maze?
por: Hsu, Joy, et al.
Publicado: (2024) -
Learning Compositional Behaviors from Demonstration and Language
por: Liu, Weiyu, et al.
Publicado: (2025) -
Neuro-Symbolic Concepts
por: Mao, Jiayuan, et al.
Publicado: (2025) -
Describing Images $\textit{Fast and Slow}$: Quantifying and Predicting the Variation in Human Signals during Visuo-Linguistic Processes
por: Takmaz, Ece, et al.
Publicado: (2024) -
V2P-Bench: Evaluating Video-Language Understanding with Visual Prompts for Better Human-Model Interaction
por: Zhao, Yiming, et al.
Publicado: (2025)