Stochastic positional embeddings improve masked image modeling
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Bar, Amir, Bordes, Florian, Shocher, Assaf, Assran, Mahmoud, Vincent, Pascal, Ballas, Nicolas, Darrell, Trevor, Globerson, Amir, LeCun, Yann |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
EgoPet: Egomotion and Interaction Data from an Animal's Perspective
par: Bar, Amir, et autres
Publié: (2024)
par: Bar, Amir, et autres
Publié: (2024)
Navigation World Models
par: Bar, Amir, et autres
Publié: (2024)
par: Bar, Amir, et autres
Publié: (2024)
Learning and Leveraging World Models in Visual Representation Learning
par: Garrido, Quentin, et autres
Publié: (2024)
par: Garrido, Quentin, et autres
Publié: (2024)
Whole-Body Conditioned Egocentric Video Prediction
par: Bai, Yutong, et autres
Publié: (2025)
par: Bai, Yutong, et autres
Publié: (2025)
V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learning
par: Mur-Labadia, Lorenzo, et autres
Publié: (2026)
par: Mur-Labadia, Lorenzo, et autres
Publié: (2026)
Parallel Stochastic Gradient-Based Planning for World Models
par: Psenka, Michael, et autres
Publié: (2026)
par: Psenka, Michael, et autres
Publié: (2026)
Revisiting Feature Prediction for Learning Visual Representations from Video
par: Bardes, Adrien, et autres
Publié: (2024)
par: Bardes, Adrien, et autres
Publié: (2024)
Intuitive physics understanding emerges from self-supervised pretraining on natural videos
par: Garrido, Quentin, et autres
Publié: (2025)
par: Garrido, Quentin, et autres
Publié: (2025)
Finding Visual Task Vectors
par: Hojel, Alberto, et autres
Publié: (2024)
par: Hojel, Alberto, et autres
Publié: (2024)
Gaussian Embeddings: How JEPAs Secretly Learn Your Data Density
par: Balestriero, Randall, et autres
Publié: (2025)
par: Balestriero, Randall, et autres
Publié: (2025)
Hierarchical Planning with Latent World Models
par: Zhang, Wancong, et autres
Publié: (2026)
par: Zhang, Wancong, et autres
Publié: (2026)
From Generated Human Videos to Physically Plausible Robot Trajectories
par: Ni, James, et autres
Publié: (2025)
par: Ni, James, et autres
Publié: (2025)
Learning Latent Action World Models In The Wild
par: Garrido, Quentin, et autres
Publié: (2026)
par: Garrido, Quentin, et autres
Publié: (2026)
Vision-Language Models Create Cross-Modal Task Representations
par: Luo, Grace, et autres
Publié: (2024)
par: Luo, Grace, et autres
Publié: (2024)
Fast and Exact Enumeration of Deep Networks Partitions Regions
par: Balestriero, Randall, et autres
Publié: (2024)
par: Balestriero, Randall, et autres
Publié: (2024)
Introduction to Latent Variable Energy-Based Models: A Path Towards Autonomous Machine Intelligence
par: Dawid, Anna, et autres
Publié: (2023)
par: Dawid, Anna, et autres
Publié: (2023)
LeJEPA: Provable and Scalable Self-Supervised Learning Without the Heuristics
par: Balestriero, Randall, et autres
Publié: (2025)
par: Balestriero, Randall, et autres
Publié: (2025)
Learning by Reconstruction Produces Uninformative Features For Perception
par: Balestriero, Randall, et autres
Publié: (2024)
par: Balestriero, Randall, et autres
Publié: (2024)
Scaling Language-Free Visual Representation Learning
par: Fan, David, et autres
Publié: (2025)
par: Fan, David, et autres
Publié: (2025)
Forgotten Polygons: Multimodal Large Language Models are Shape-Blind
par: Rudman, William, et autres
Publié: (2025)
par: Rudman, William, et autres
Publié: (2025)
Who Said Neural Networks Aren't Linear?
par: Berman, Nimrod, et autres
Publié: (2025)
par: Berman, Nimrod, et autres
Publié: (2025)
LLM-JEPA: Large Language Models Meet Joint Embedding Predictive Architectures
par: Huang, Hai, et autres
Publié: (2025)
par: Huang, Hai, et autres
Publié: (2025)
Semantic Tube Prediction: Beating LLM Data Efficiency with JEPA
par: Huang, Hai, et autres
Publié: (2026)
par: Huang, Hai, et autres
Publié: (2026)
Why AI systems don't learn and what to do about it: Lessons on autonomous learning from cognitive science
par: Dupoux, Emmanuel, et autres
Publié: (2026)
par: Dupoux, Emmanuel, et autres
Publié: (2026)
Variance Covariance Regularization Enforces Pairwise Independence in Self-Supervised Representations
par: Mialon, Grégoire, et autres
Publié: (2022)
par: Mialon, Grégoire, et autres
Publié: (2022)
A hierarchical loss and its problems when classifying non-hierarchically
par: Wu, Cinna, et autres
Publié: (2017)
par: Wu, Cinna, et autres
Publié: (2017)
Video Representation Learning with Joint-Embedding Predictive Architectures
par: Drozdov, Katrina, et autres
Publié: (2024)
par: Drozdov, Katrina, et autres
Publié: (2024)
Pseudo-Invertible Neural Networks
par: Ehrlich, Yamit, et autres
Publié: (2026)
par: Ehrlich, Yamit, et autres
Publié: (2026)
A Shortcut-aware Video-QA Benchmark for Physical Understanding via Minimal Video Pairs
par: Krojer, Benno, et autres
Publié: (2025)
par: Krojer, Benno, et autres
Publié: (2025)
URLOST: Unsupervised Representation Learning without Stationarity or Topology
par: Yun, Zeyu, et autres
Publié: (2023)
par: Yun, Zeyu, et autres
Publié: (2023)
DINO-WM: World Models on Pre-trained Visual Features enable Zero-shot Planning
par: Zhou, Gaoyue, et autres
Publié: (2024)
par: Zhou, Gaoyue, et autres
Publié: (2024)
The Spike, the Sparse and the Sink: Anatomy of Massive Activations and Attention Sinks
par: Sun, Shangwen, et autres
Publié: (2026)
par: Sun, Shangwen, et autres
Publié: (2026)
Lifting Embodied World Models for Planning and Control
par: Wang, Alex N., et autres
Publié: (2026)
par: Wang, Alex N., et autres
Publié: (2026)
World Models for Learning Dexterous Hand-Object Interactions from Human Videos
par: Goswami, Raktim Gautam, et autres
Publié: (2025)
par: Goswami, Raktim Gautam, et autres
Publié: (2025)
Light-weight probing of unsupervised representations for Reinforcement Learning
par: Zhang, Wancong, et autres
Publié: (2022)
par: Zhang, Wancong, et autres
Publié: (2022)
Modeling Caption Diversity in Contrastive Vision-Language Pretraining
par: Lavoie, Samuel, et autres
Publié: (2024)
par: Lavoie, Samuel, et autres
Publié: (2024)
AI Must Embrace Specialization via Superhuman Adaptable Intelligence
par: Goldfeder, Judah, et autres
Publié: (2026)
par: Goldfeder, Judah, et autres
Publié: (2026)
The Entropy Enigma: Success and Failure of Entropy Minimization
par: Press, Ori, et autres
Publié: (2024)
par: Press, Ori, et autres
Publié: (2024)
RoboPEPP: Vision-Based Robot Pose and Joint Angle Estimation through Embedding Predictive Pre-Training
par: Goswami, Raktim Gautam, et autres
Publié: (2024)
par: Goswami, Raktim Gautam, et autres
Publié: (2024)
OSVI-WM: One-Shot Visual Imitation for Unseen Tasks using World-Model-Guided Trajectory Generation
par: Goswami, Raktim Gautam, et autres
Publié: (2025)
par: Goswami, Raktim Gautam, et autres
Publié: (2025)
Documents similaires
-
EgoPet: Egomotion and Interaction Data from an Animal's Perspective
par: Bar, Amir, et autres
Publié: (2024) -
Navigation World Models
par: Bar, Amir, et autres
Publié: (2024) -
Learning and Leveraging World Models in Visual Representation Learning
par: Garrido, Quentin, et autres
Publié: (2024) -
Whole-Body Conditioned Egocentric Video Prediction
par: Bai, Yutong, et autres
Publié: (2025) -
V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learning
par: Mur-Labadia, Lorenzo, et autres
Publié: (2026)