Enregistré dans:
| Auteurs principaux: | Bordes, Florian, Garrido, Quentin, Kao, Justine T, Williams, Adina, Rabbat, Michael, Dupoux, Emmanuel |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2506.09849 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Intuitive physics understanding emerges from self-supervised pretraining on natural videos
par: Garrido, Quentin, et autres
Publié: (2025)
par: Garrido, Quentin, et autres
Publié: (2025)
What's in Common? Multimodal Models Hallucinate When Reasoning Across Scenes
par: Ross, Candace, et autres
Publié: (2025)
par: Ross, Candace, et autres
Publié: (2025)
LikePhys: Evaluating Intuitive Physics Understanding in Video Diffusion Models via Likelihood Preference
par: Yuan, Jianhao, et autres
Publié: (2025)
par: Yuan, Jianhao, et autres
Publié: (2025)
Learning Latent Action World Models In The Wild
par: Garrido, Quentin, et autres
Publié: (2026)
par: Garrido, Quentin, et autres
Publié: (2026)
Interpreting Physics in Video World Models
par: Joseph, Sonia, et autres
Publié: (2026)
par: Joseph, Sonia, et autres
Publié: (2026)
PhysToolBench: Benchmarking Physical Tool Understanding for MLLMs
par: Zhang, Zixin, et autres
Publié: (2025)
par: Zhang, Zixin, et autres
Publié: (2025)
A Shortcut-aware Video-QA Benchmark for Physical Understanding via Minimal Video Pairs
par: Krojer, Benno, et autres
Publié: (2025)
par: Krojer, Benno, et autres
Publié: (2025)
Revisiting Feature Prediction for Learning Visual Representations from Video
par: Bardes, Adrien, et autres
Publié: (2024)
par: Bardes, Adrien, et autres
Publié: (2024)
Eval Factsheets: A Structured Framework for Documenting AI Evaluations
par: Bordes, Florian, et autres
Publié: (2025)
par: Bordes, Florian, et autres
Publié: (2025)
PhysDepth: Plug-and-Play Physical Refinement for Monocular Depth Estimation in Challenging Environments
par: Peng, Kebin, et autres
Publié: (2024)
par: Peng, Kebin, et autres
Publié: (2024)
PhysBench: Benchmarking and Enhancing Vision-Language Models for Physical World Understanding
par: Chow, Wei, et autres
Publié: (2025)
par: Chow, Wei, et autres
Publié: (2025)
CausalVQA: A Physically Grounded Causal Reasoning Benchmark for Video Models
par: Foss, Aaron, et autres
Publié: (2025)
par: Foss, Aaron, et autres
Publié: (2025)
PhysLab: A Benchmark Dataset for Multi-Granularity Visual Parsing of Physics Experiments
par: Zou, Minghao, et autres
Publié: (2025)
par: Zou, Minghao, et autres
Publié: (2025)
PhysVLM: Enabling Visual Language Models to Understand Robotic Physical Reachability
par: Zhou, Weijie, et autres
Publié: (2025)
par: Zhou, Weijie, et autres
Publié: (2025)
PhysVLM-AVR: Active Visual Reasoning for Multimodal Large Language Models in Physical Environments
par: Zhou, Weijie, et autres
Publié: (2025)
par: Zhou, Weijie, et autres
Publié: (2025)
Measuring Déjà vu Memorization Efficiently
par: Kokhlikyan, Narine, et autres
Publié: (2025)
par: Kokhlikyan, Narine, et autres
Publié: (2025)
A Picture is Worth More Than 77 Text Tokens: Evaluating CLIP-Style Models on Dense Captions
par: Urbanek, Jack, et autres
Publié: (2023)
par: Urbanek, Jack, et autres
Publié: (2023)
MetaMorph: Multimodal Understanding and Generation via Instruction Tuning
par: Tong, Shengbang, et autres
Publié: (2024)
par: Tong, Shengbang, et autres
Publié: (2024)
A Lightweight Library for Energy-Based Joint-Embedding Predictive Architectures
par: Terver, Basile, et autres
Publié: (2026)
par: Terver, Basile, et autres
Publié: (2026)
Object-centric Binding in Contrastive Language-Image Pretraining
par: Assouel, Rim, et autres
Publié: (2025)
par: Assouel, Rim, et autres
Publié: (2025)
Diffusion-based 3D Hand Motion Recovery with Intuitive Physics
par: Zhang, Yufei, et autres
Publié: (2025)
par: Zhang, Yufei, et autres
Publié: (2025)
PhysEditBench: A Protocol-Conditioned Benchmark for Dense Physical-Map Prediction with Image Editors
par: Yang, Jiaxin, et autres
Publié: (2026)
par: Yang, Jiaxin, et autres
Publié: (2026)
Grounding Social Perception in Intuitive Physics
par: Ying, Lance, et autres
Publié: (2026)
par: Ying, Lance, et autres
Publié: (2026)
Understanding Contrastive Representation Learning from Positive Unlabeled (PU) Data
par: Acharya, Anish, et autres
Publié: (2024)
par: Acharya, Anish, et autres
Publié: (2024)
Beyond Static Vision: Scene Dynamic Field Unlocks Intuitive Physics Understanding in Multi-modal Large Language Models
par: Li, Nanxi, et autres
Publié: (2026)
par: Li, Nanxi, et autres
Publié: (2026)
ForestSim: A Synthetic Benchmark for Intelligent Vehicle Perception in Unstructured Forest Environments
par: Wagle, Pragat, et autres
Publié: (2026)
par: Wagle, Pragat, et autres
Publié: (2026)
PhysAvatar: Learning the Physics of Dressed 3D Avatars from Visual Observations
par: Zheng, Yang, et autres
Publié: (2024)
par: Zheng, Yang, et autres
Publié: (2024)
Evaluation of Conversational Agents: Understanding Culture, Context and Environment in Emotion Detection
par: Teye, Martha Teiko, et autres
Publié: (2026)
par: Teye, Martha Teiko, et autres
Publié: (2026)
PhysCtrl: Generative Physics for Controllable and Physics-Grounded Video Generation
par: Wang, Chen, et autres
Publié: (2025)
par: Wang, Chen, et autres
Publié: (2025)
Embracing Diversity: Interpretable Zero-shot classification beyond one vector per class
par: Moayeri, Mazda, et autres
Publié: (2024)
par: Moayeri, Mazda, et autres
Publié: (2024)
PhysGame: Uncovering Physical Commonsense Violations in Gameplay Videos
par: Cao, Meng, et autres
Publié: (2024)
par: Cao, Meng, et autres
Publié: (2024)
Learning to Play Video Games with Intuitive Physics Priors
par: Jaiswal, Abhishek, et autres
Publié: (2024)
par: Jaiswal, Abhishek, et autres
Publié: (2024)
PhysAnimator: Physics-Guided Generative Cartoon Animation
par: Xie, Tianyi, et autres
Publié: (2025)
par: Xie, Tianyi, et autres
Publié: (2025)
Feedback-guided Data Synthesis for Imbalanced Classification
par: Hemmat, Reyhane Askari, et autres
Publié: (2023)
par: Hemmat, Reyhane Askari, et autres
Publié: (2023)
PhysMotion: Physics-Grounded Dynamics From a Single Image
par: Tan, Xiyang, et autres
Publié: (2024)
par: Tan, Xiyang, et autres
Publié: (2024)
PhysLayer: Language-Guided Layered Animation with Depth-Aware Physics
par: Xie, Tianyidan, et autres
Publié: (2026)
par: Xie, Tianyidan, et autres
Publié: (2026)
ReconPhys: Reconstruct Appearance and Physical Attributes from Single Video
par: Wang, Boyuan, et autres
Publié: (2026)
par: Wang, Boyuan, et autres
Publié: (2026)
Opinion: Learning Intuitive Physics May Require More than Visual Data
par: Su, Ellen, et autres
Publié: (2025)
par: Su, Ellen, et autres
Publié: (2025)
Benchmarking Vision-Based Object Tracking for USVs in Complex Maritime Environments
par: Din, Muhayy Ud, et autres
Publié: (2024)
par: Din, Muhayy Ud, et autres
Publié: (2024)
LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding
par: Shen, Xiaoqian, et autres
Publié: (2024)
par: Shen, Xiaoqian, et autres
Publié: (2024)
Documents similaires
-
Intuitive physics understanding emerges from self-supervised pretraining on natural videos
par: Garrido, Quentin, et autres
Publié: (2025) -
What's in Common? Multimodal Models Hallucinate When Reasoning Across Scenes
par: Ross, Candace, et autres
Publié: (2025) -
LikePhys: Evaluating Intuitive Physics Understanding in Video Diffusion Models via Likelihood Preference
par: Yuan, Jianhao, et autres
Publié: (2025) -
Learning Latent Action World Models In The Wild
par: Garrido, Quentin, et autres
Publié: (2026) -
Interpreting Physics in Video World Models
par: Joseph, Sonia, et autres
Publié: (2026)