Video Models Start to Solve Chess, Maze, Sudoku, Mental Rotation, and Raven' Matrices
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Deng, Hokin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Reasoning via Video: The First Evaluation of Video Models' Reasoning Abilities through Maze-Solving Tasks
par: Yang, Cheng, et autres
Publié: (2025)
par: Yang, Cheng, et autres
Publié: (2025)
Large Vision Models Can Solve Mental Rotation Problems
par: Mason, Sebastian Ray, et autres
Publié: (2025)
par: Mason, Sebastian Ray, et autres
Publié: (2025)
Demystifying Video Reasoning
par: Wang, Ruisi, et autres
Publié: (2026)
par: Wang, Ruisi, et autres
Publié: (2026)
Egocentric Bias in Vision-Language Models
par: Wang, Maijunxian, et autres
Publié: (2026)
par: Wang, Maijunxian, et autres
Publié: (2026)
What Makes a Maze Look Like a Maze?
par: Hsu, Joy, et autres
Publié: (2024)
par: Hsu, Joy, et autres
Publié: (2024)
Identifying and Solving Conditional Image Leakage in Image-to-Video Diffusion Model
par: Zhao, Min, et autres
Publié: (2024)
par: Zhao, Min, et autres
Publié: (2024)
Video Models Reason Early: Exploiting Plan Commitment for Maze Solving
par: Newman, Kaleb, et autres
Publié: (2026)
par: Newman, Kaleb, et autres
Publié: (2026)
Core Knowledge Deficits in Multi-Modal Language Models
par: Li, Yijiang, et autres
Publié: (2024)
par: Li, Yijiang, et autres
Publié: (2024)
An Ordinary Differential Equation Sampler with Stochastic Start for Diffusion Bridge Models
par: Wang, Yuang, et autres
Publié: (2024)
par: Wang, Yuang, et autres
Publié: (2024)
Probing Perceptual Constancy in Large Vision-Language Models
par: Sun, Haoran, et autres
Publié: (2025)
par: Sun, Haoran, et autres
Publié: (2025)
VideoPDE: Unified Generative PDE Solving via Video Inpainting Diffusion Models
par: Li, Edward, et autres
Publié: (2025)
par: Li, Edward, et autres
Publié: (2025)
Solving Video Inverse Problems Using Image Diffusion Models
par: Kwon, Taesung, et autres
Publié: (2024)
par: Kwon, Taesung, et autres
Publié: (2024)
Any-to-Bokeh: Arbitrary-Subject Video Refocusing with Video Diffusion Model
par: Yang, Yang, et autres
Publié: (2025)
par: Yang, Yang, et autres
Publié: (2025)
SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
par: Deng, Andong, et autres
Publié: (2025)
par: Deng, Andong, et autres
Publié: (2025)
The Labyrinth of Links: Navigating the Associative Maze of Multi-modal LLMs
par: Li, Hong, et autres
Publié: (2024)
par: Li, Hong, et autres
Publié: (2024)
Warped Diffusion: Solving Video Inverse Problems with Image Diffusion Models
par: Daras, Giannis, et autres
Publié: (2024)
par: Daras, Giannis, et autres
Publié: (2024)
Video-CCAM: Enhancing Video-Language Understanding with Causal Cross-Attention Masks for Short and Long Videos
par: Fei, Jiajun, et autres
Publié: (2024)
par: Fei, Jiajun, et autres
Publié: (2024)
Bias Detection and Rotation-Robustness Mitigation in Vision-Language Models and Generative Image Models
par: Mithila, Tarannum
Publié: (2026)
par: Mithila, Tarannum
Publié: (2026)
Deep Learning Methods for Abstract Visual Reasoning: A Survey on Raven's Progressive Matrices
par: Małkiński, Mikołaj, et autres
Publié: (2022)
par: Małkiński, Mikołaj, et autres
Publié: (2022)
Rotation-Aligned Key Channel Pruning for Efficient Vision-Language Model Inference
par: Kang, Beomseok, et autres
Publié: (2026)
par: Kang, Beomseok, et autres
Publié: (2026)
Semi-Supervised Coupled Thin-Plate Spline Model for Rotation Correction and Beyond
par: Nie, Lang, et autres
Publié: (2024)
par: Nie, Lang, et autres
Publié: (2024)
Towards Robust Probabilistic Modeling on SO(3) via Rotation Laplace Distribution
par: Yin, Yingda, et autres
Publié: (2023)
par: Yin, Yingda, et autres
Publié: (2023)
From Narrow to Panoramic Vision: Attention-Guided Cold-Start Reshapes Multimodal Reasoning
par: Luo, Ruilin, et autres
Publié: (2026)
par: Luo, Ruilin, et autres
Publié: (2026)
Video Occupancy Models
par: Tomar, Manan, et autres
Publié: (2024)
par: Tomar, Manan, et autres
Publié: (2024)
Beyond Cropping and Rotation: Automated Evolution of Powerful Task-Specific Augmentations with Generative Models
par: Goldfeder, Judah, et autres
Publié: (2026)
par: Goldfeder, Judah, et autres
Publié: (2026)
GVD: Guiding Video Diffusion Model for Scalable Video Distillation
par: Li, Kunyang, et autres
Publié: (2025)
par: Li, Kunyang, et autres
Publié: (2025)
DeVAn: Dense Video Annotation for Video-Language Models
par: Liu, Tingkai, et autres
Publié: (2023)
par: Liu, Tingkai, et autres
Publié: (2023)
Learning Image Priors through Patch-based Diffusion Models for Solving Inverse Problems
par: Hu, Jason, et autres
Publié: (2024)
par: Hu, Jason, et autres
Publié: (2024)
Rethinking Video Generation Model for the Embodied World
par: Deng, Yufan, et autres
Publié: (2026)
par: Deng, Yufan, et autres
Publié: (2026)
PuzzleBench: A Fully Dynamic Evaluation Framework for Large Multimodal Models on Puzzle Solving
par: Zhang, Zeyu, et autres
Publié: (2025)
par: Zhang, Zeyu, et autres
Publié: (2025)
An Organism Starts with a Single Pix-Cell: A Neural Cellular Diffusion for High-Resolution Image Synthesis
par: Elbatel, Marawan, et autres
Publié: (2024)
par: Elbatel, Marawan, et autres
Publié: (2024)
VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding
par: Zhang, Zhihong, et autres
Publié: (2025)
par: Zhang, Zhihong, et autres
Publié: (2025)
MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models
par: Yang, Garry, et autres
Publié: (2025)
par: Yang, Garry, et autres
Publié: (2025)
VideoPoet: A Large Language Model for Zero-Shot Video Generation
par: Kondratyuk, Dan, et autres
Publié: (2023)
par: Kondratyuk, Dan, et autres
Publié: (2023)
Relaxed Rotational Equivariance via $G$-Biases in Vision
par: Wu, Zhiqiang, et autres
Publié: (2024)
par: Wu, Zhiqiang, et autres
Publié: (2024)
Causality Model for Semantic Understanding on Videos
par: Yicong, Li
Publié: (2025)
par: Yicong, Li
Publié: (2025)
Lightweight Models for Emotional Analysis in Video
par: Nguyen, Quoc-Tien, et autres
Publié: (2025)
par: Nguyen, Quoc-Tien, et autres
Publié: (2025)
Interpreting Physics in Video World Models
par: Joseph, Sonia, et autres
Publié: (2026)
par: Joseph, Sonia, et autres
Publié: (2026)
Latent Intuitive Physics: Learning to Transfer Hidden Physics from A 3D Video
par: Zhu, Xiangming, et autres
Publié: (2024)
par: Zhu, Xiangming, et autres
Publié: (2024)
HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting
par: Lee, Jeongeun, et autres
Publié: (2025)
par: Lee, Jeongeun, et autres
Publié: (2025)
Documents similaires
-
Reasoning via Video: The First Evaluation of Video Models' Reasoning Abilities through Maze-Solving Tasks
par: Yang, Cheng, et autres
Publié: (2025) -
Large Vision Models Can Solve Mental Rotation Problems
par: Mason, Sebastian Ray, et autres
Publié: (2025) -
Demystifying Video Reasoning
par: Wang, Ruisi, et autres
Publié: (2026) -
Egocentric Bias in Vision-Language Models
par: Wang, Maijunxian, et autres
Publié: (2026) -
What Makes a Maze Look Like a Maze?
par: Hsu, Joy, et autres
Publié: (2024)