Learning and Leveraging World Models in Visual Representation Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Garrido, Quentin, Assran, Mahmoud, Ballas, Nicolas, Bardes, Adrien, Najman, Laurent, LeCun, Yann |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Intuitive physics understanding emerges from self-supervised pretraining on natural videos
di: Garrido, Quentin, et al.
Pubblicazione: (2025)
di: Garrido, Quentin, et al.
Pubblicazione: (2025)
Revisiting Feature Prediction for Learning Visual Representations from Video
di: Bardes, Adrien, et al.
Pubblicazione: (2024)
di: Bardes, Adrien, et al.
Pubblicazione: (2024)
Learning Latent Action World Models In The Wild
di: Garrido, Quentin, et al.
Pubblicazione: (2026)
di: Garrido, Quentin, et al.
Pubblicazione: (2026)
Gaussian Embeddings: How JEPAs Secretly Learn Your Data Density
di: Balestriero, Randall, et al.
Pubblicazione: (2025)
di: Balestriero, Randall, et al.
Pubblicazione: (2025)
V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learning
di: Mur-Labadia, Lorenzo, et al.
Pubblicazione: (2026)
di: Mur-Labadia, Lorenzo, et al.
Pubblicazione: (2026)
Stochastic positional embeddings improve masked image modeling
di: Bar, Amir, et al.
Pubblicazione: (2023)
di: Bar, Amir, et al.
Pubblicazione: (2023)
Video Representation Learning with Joint-Embedding Predictive Architectures
di: Drozdov, Katrina, et al.
Pubblicazione: (2024)
di: Drozdov, Katrina, et al.
Pubblicazione: (2024)
Learning by Reconstruction Produces Uninformative Features For Perception
di: Balestriero, Randall, et al.
Pubblicazione: (2024)
di: Balestriero, Randall, et al.
Pubblicazione: (2024)
LeJEPA: Provable and Scalable Self-Supervised Learning Without the Heuristics
di: Balestriero, Randall, et al.
Pubblicazione: (2025)
di: Balestriero, Randall, et al.
Pubblicazione: (2025)
Variance-Covariance Regularization Improves Representation Learning
di: Zhu, Jiachen, et al.
Pubblicazione: (2023)
di: Zhu, Jiachen, et al.
Pubblicazione: (2023)
Navigation World Models
di: Bar, Amir, et al.
Pubblicazione: (2024)
di: Bar, Amir, et al.
Pubblicazione: (2024)
Blockwise Self-Supervised Learning at Scale
di: Siddiqui, Shoaib Ahmed, et al.
Pubblicazione: (2023)
di: Siddiqui, Shoaib Ahmed, et al.
Pubblicazione: (2023)
Scaling Language-Free Visual Representation Learning
di: Fan, David, et al.
Pubblicazione: (2025)
di: Fan, David, et al.
Pubblicazione: (2025)
World Models for Learning Dexterous Hand-Object Interactions from Human Videos
di: Goswami, Raktim Gautam, et al.
Pubblicazione: (2025)
di: Goswami, Raktim Gautam, et al.
Pubblicazione: (2025)
Modeling Caption Diversity in Contrastive Vision-Language Pretraining
di: Lavoie, Samuel, et al.
Pubblicazione: (2024)
di: Lavoie, Samuel, et al.
Pubblicazione: (2024)
What Drives Success in Physical Planning with Joint-Embedding Predictive World Models?
di: Terver, Basile, et al.
Pubblicazione: (2025)
di: Terver, Basile, et al.
Pubblicazione: (2025)
A Lightweight Library for Energy-Based Joint-Embedding Predictive Architectures
di: Terver, Basile, et al.
Pubblicazione: (2026)
di: Terver, Basile, et al.
Pubblicazione: (2026)
V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning
di: Assran, Mido, et al.
Pubblicazione: (2025)
di: Assran, Mido, et al.
Pubblicazione: (2025)
URLOST: Unsupervised Representation Learning without Stationarity or Topology
di: Yun, Zeyu, et al.
Pubblicazione: (2023)
di: Yun, Zeyu, et al.
Pubblicazione: (2023)
A Shortcut-aware Video-QA Benchmark for Physical Understanding via Minimal Video Pairs
di: Krojer, Benno, et al.
Pubblicazione: (2025)
di: Krojer, Benno, et al.
Pubblicazione: (2025)
Forgotten Polygons: Multimodal Large Language Models are Shape-Blind
di: Rudman, William, et al.
Pubblicazione: (2025)
di: Rudman, William, et al.
Pubblicazione: (2025)
Transformers without Normalization
di: Zhu, Jiachen, et al.
Pubblicazione: (2025)
di: Zhu, Jiachen, et al.
Pubblicazione: (2025)
Whole-Body Conditioned Egocentric Video Prediction
di: Bai, Yutong, et al.
Pubblicazione: (2025)
di: Bai, Yutong, et al.
Pubblicazione: (2025)
Transforming gradient-based techniques into interpretable methods
di: Rodrigues, Caroline Mazini, et al.
Pubblicazione: (2024)
di: Rodrigues, Caroline Mazini, et al.
Pubblicazione: (2024)
Explaning with trees: interpreting CNNs using hierarchies
di: Rodrigues, Caroline Mazini, et al.
Pubblicazione: (2024)
di: Rodrigues, Caroline Mazini, et al.
Pubblicazione: (2024)
Hierarchical World Models as Visual Whole-Body Humanoid Controllers
di: Hansen, Nicklas, et al.
Pubblicazione: (2024)
di: Hansen, Nicklas, et al.
Pubblicazione: (2024)
VEDIT: Latent Prediction Architecture For Procedural Video Representation Learning
di: Lin, Han, et al.
Pubblicazione: (2024)
di: Lin, Han, et al.
Pubblicazione: (2024)
Causal-JEPA: Learning World Models through Object-Level Latent Masking
di: Nam, Heejeong, et al.
Pubblicazione: (2026)
di: Nam, Heejeong, et al.
Pubblicazione: (2026)
Advancing human-centric AI for robust X-ray analysis through holistic self-supervised learning
di: Moutakanni, Théo, et al.
Pubblicazione: (2024)
di: Moutakanni, Théo, et al.
Pubblicazione: (2024)
Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning
di: Zhai, Yuexiang, et al.
Pubblicazione: (2024)
di: Zhai, Yuexiang, et al.
Pubblicazione: (2024)
Representation Learning with Adaptive Superpixel Coding
di: Khalil, Mahmoud, et al.
Pubblicazione: (2025)
di: Khalil, Mahmoud, et al.
Pubblicazione: (2025)
A hierarchical loss and its problems when classifying non-hierarchically
di: Wu, Cinna, et al.
Pubblicazione: (2017)
di: Wu, Cinna, et al.
Pubblicazione: (2017)
Interpreting Physics in Video World Models
di: Joseph, Sonia, et al.
Pubblicazione: (2026)
di: Joseph, Sonia, et al.
Pubblicazione: (2026)
Representation Learning for Spatiotemporal Physical Systems
di: Qu, Helen, et al.
Pubblicazione: (2026)
di: Qu, Helen, et al.
Pubblicazione: (2026)
UNO: Unifying One-stage Video Scene Graph Generation via Object-Centric Visual Representation Learning
di: Le, Huy, et al.
Pubblicazione: (2025)
di: Le, Huy, et al.
Pubblicazione: (2025)
A World Model of Radiologist Reading for Medical Image Representation Learning
di: Li, Yiwei, et al.
Pubblicazione: (2026)
di: Li, Yiwei, et al.
Pubblicazione: (2026)
Leveraging Unsupervised Learning for Cost-Effective Visual Anomaly Detection
di: Long, Yunbo, et al.
Pubblicazione: (2024)
di: Long, Yunbo, et al.
Pubblicazione: (2024)
Cluster Contrast for Unsupervised Visual Representation Learning
di: Giakoumoglou, Nikolaos, et al.
Pubblicazione: (2025)
di: Giakoumoglou, Nikolaos, et al.
Pubblicazione: (2025)
DuoFormer: Leveraging Hierarchical Visual Representations by Local and Global Attention
di: Tang, Xiaoya, et al.
Pubblicazione: (2024)
di: Tang, Xiaoya, et al.
Pubblicazione: (2024)
Eyes Wide Shut? Exploring the Visual Shortcomings of Multimodal LLMs
di: Tong, Shengbang, et al.
Pubblicazione: (2024)
di: Tong, Shengbang, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Intuitive physics understanding emerges from self-supervised pretraining on natural videos
di: Garrido, Quentin, et al.
Pubblicazione: (2025) -
Revisiting Feature Prediction for Learning Visual Representations from Video
di: Bardes, Adrien, et al.
Pubblicazione: (2024) -
Learning Latent Action World Models In The Wild
di: Garrido, Quentin, et al.
Pubblicazione: (2026) -
Gaussian Embeddings: How JEPAs Secretly Learn Your Data Density
di: Balestriero, Randall, et al.
Pubblicazione: (2025) -
V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learning
di: Mur-Labadia, Lorenzo, et al.
Pubblicazione: (2026)