Cambrian-S: Towards Spatial Supersensing in Video
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Shusheng, Yang, Jihan, Huang, Pinzhi, Brown, Ellis, Yang, Zihao, Yu, Yue, Tong, Shengbang, Zheng, Zihan, Xu, Yifan, Wang, Muhan, Lu, Daohan, Fergus, Rob, LeCun, Yann, Fei-Fei, Li, Xie, Saining |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs
por: Tong, Shengbang, et al.
Publicado: (2024)
por: Tong, Shengbang, et al.
Publicado: (2024)
Benchmark Designers Should "Train on the Test Set" to Expose Exploitable Non-Visual Shortcuts
por: Brown, Ellis, et al.
Publicado: (2025)
por: Brown, Ellis, et al.
Publicado: (2025)
Scaling Text-to-Image Diffusion Transformers with Representation Autoencoders
por: Tong, Shengbang, et al.
Publicado: (2026)
por: Tong, Shengbang, et al.
Publicado: (2026)
Cambrian-P: Pose-Grounded Video Understanding
por: Yang, Jihan, et al.
Publicado: (2026)
por: Yang, Jihan, et al.
Publicado: (2026)
Eyes Wide Shut? Exploring the Visual Shortcomings of Multimodal LLMs
por: Tong, Shengbang, et al.
Publicado: (2024)
por: Tong, Shengbang, et al.
Publicado: (2024)
SIMS-V: Simulated Instruction-Tuning for Spatial Video Understanding
por: Brown, Ellis, et al.
Publicado: (2025)
por: Brown, Ellis, et al.
Publicado: (2025)
Traveling Across Languages: Benchmarking Cross-Lingual Consistency in Multimodal LLMs
por: Wang, Hao, et al.
Publicado: (2025)
por: Wang, Hao, et al.
Publicado: (2025)
Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces
por: Yang, Jihan, et al.
Publicado: (2024)
por: Yang, Jihan, et al.
Publicado: (2024)
Exploiting Linear Structure Within Convolutional Networks for Efficient Evaluation
por: Denton, Remi, et al.
Publicado: (2014)
por: Denton, Remi, et al.
Publicado: (2014)
V-IRL: Grounding Virtual Intelligence in Real Life
por: Yang, Jihan, et al.
Publicado: (2024)
por: Yang, Jihan, et al.
Publicado: (2024)
Fast and Exact Enumeration of Deep Networks Partitions Regions
por: Balestriero, Randall, et al.
Publicado: (2024)
por: Balestriero, Randall, et al.
Publicado: (2024)
Introduction to Latent Variable Energy-Based Models: A Path Towards Autonomous Machine Intelligence
por: Dawid, Anna, et al.
Publicado: (2023)
por: Dawid, Anna, et al.
Publicado: (2023)
LeJEPA: Provable and Scalable Self-Supervised Learning Without the Heuristics
por: Balestriero, Randall, et al.
Publicado: (2025)
por: Balestriero, Randall, et al.
Publicado: (2025)
Learning by Reconstruction Produces Uninformative Features For Perception
por: Balestriero, Randall, et al.
Publicado: (2024)
por: Balestriero, Randall, et al.
Publicado: (2024)
Solving Spatial Supersensing Without Spatial Supersensing
por: Udandarao, Vishaal, et al.
Publicado: (2025)
por: Udandarao, Vishaal, et al.
Publicado: (2025)
MetaMorph: Multimodal Understanding and Generation via Instruction Tuning
por: Tong, Shengbang, et al.
Publicado: (2024)
por: Tong, Shengbang, et al.
Publicado: (2024)
Video Representation Learning with Joint-Embedding Predictive Architectures
por: Drozdov, Katrina, et al.
Publicado: (2024)
por: Drozdov, Katrina, et al.
Publicado: (2024)
PaintBench: Deterministic Evaluation of Precise Visual Editing
por: Xu, Kai, et al.
Publicado: (2026)
por: Xu, Kai, et al.
Publicado: (2026)
Scaling Language-Free Visual Representation Learning
por: Fan, David, et al.
Publicado: (2025)
por: Fan, David, et al.
Publicado: (2025)
Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning
por: Zhai, Yuexiang, et al.
Publicado: (2024)
por: Zhai, Yuexiang, et al.
Publicado: (2024)
LLM-JEPA: Large Language Models Meet Joint Embedding Predictive Architectures
por: Huang, Hai, et al.
Publicado: (2025)
por: Huang, Hai, et al.
Publicado: (2025)
Semantic Tube Prediction: Beating LLM Data Efficiency with JEPA
por: Huang, Hai, et al.
Publicado: (2026)
por: Huang, Hai, et al.
Publicado: (2026)
Why AI systems don't learn and what to do about it: Lessons on autonomous learning from cognitive science
por: Dupoux, Emmanuel, et al.
Publicado: (2026)
por: Dupoux, Emmanuel, et al.
Publicado: (2026)
Variance Covariance Regularization Enforces Pairwise Independence in Self-Supervised Representations
por: Mialon, Grégoire, et al.
Publicado: (2022)
por: Mialon, Grégoire, et al.
Publicado: (2022)
A hierarchical loss and its problems when classifying non-hierarchically
por: Wu, Cinna, et al.
Publicado: (2017)
por: Wu, Cinna, et al.
Publicado: (2017)
Beyond Language Modeling: An Exploration of Multimodal Pretraining
por: Tong, Shengbang, et al.
Publicado: (2026)
por: Tong, Shengbang, et al.
Publicado: (2026)
SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training
por: Chu, Tianzhe, et al.
Publicado: (2025)
por: Chu, Tianzhe, et al.
Publicado: (2025)
Diffusion Transformers with Representation Autoencoders
por: Zheng, Boyang, et al.
Publicado: (2025)
por: Zheng, Boyang, et al.
Publicado: (2025)
What Drives Success in Physical Planning with Joint-Embedding Predictive World Models?
por: Terver, Basile, et al.
Publicado: (2025)
por: Terver, Basile, et al.
Publicado: (2025)
URLOST: Unsupervised Representation Learning without Stationarity or Topology
por: Yun, Zeyu, et al.
Publicado: (2023)
por: Yun, Zeyu, et al.
Publicado: (2023)
DINO-WM: World Models on Pre-trained Visual Features enable Zero-shot Planning
por: Zhou, Gaoyue, et al.
Publicado: (2024)
por: Zhou, Gaoyue, et al.
Publicado: (2024)
Gaussian Embeddings: How JEPAs Secretly Learn Your Data Density
por: Balestriero, Randall, et al.
Publicado: (2025)
por: Balestriero, Randall, et al.
Publicado: (2025)
The Spike, the Sparse and the Sink: Anatomy of Massive Activations and Attention Sinks
por: Sun, Shangwen, et al.
Publicado: (2026)
por: Sun, Shangwen, et al.
Publicado: (2026)
Whole-Body Conditioned Egocentric Video Prediction
por: Bai, Yutong, et al.
Publicado: (2025)
por: Bai, Yutong, et al.
Publicado: (2025)
AI Must Embrace Specialization via Superhuman Adaptable Intelligence
por: Goldfeder, Judah, et al.
Publicado: (2026)
por: Goldfeder, Judah, et al.
Publicado: (2026)
The Entropy Enigma: Success and Failure of Entropy Minimization
por: Press, Ori, et al.
Publicado: (2024)
por: Press, Ori, et al.
Publicado: (2024)
RoboPEPP: Vision-Based Robot Pose and Joint Angle Estimation through Embedding Predictive Pre-Training
por: Goswami, Raktim Gautam, et al.
Publicado: (2024)
por: Goswami, Raktim Gautam, et al.
Publicado: (2024)
OSVI-WM: One-Shot Visual Imitation for Unseen Tasks using World-Model-Guided Trajectory Generation
por: Goswami, Raktim Gautam, et al.
Publicado: (2025)
por: Goswami, Raktim Gautam, et al.
Publicado: (2025)
Blockwise Self-Supervised Learning at Scale
por: Siddiqui, Shoaib Ahmed, et al.
Publicado: (2023)
por: Siddiqui, Shoaib Ahmed, et al.
Publicado: (2023)
Causal-JEPA: Learning World Models through Object-Level Latent Masking
por: Nam, Heejeong, et al.
Publicado: (2026)
por: Nam, Heejeong, et al.
Publicado: (2026)
Ejemplares similares
-
Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs
por: Tong, Shengbang, et al.
Publicado: (2024) -
Benchmark Designers Should "Train on the Test Set" to Expose Exploitable Non-Visual Shortcuts
por: Brown, Ellis, et al.
Publicado: (2025) -
Scaling Text-to-Image Diffusion Transformers with Representation Autoencoders
por: Tong, Shengbang, et al.
Publicado: (2026) -
Cambrian-P: Pose-Grounded Video Understanding
por: Yang, Jihan, et al.
Publicado: (2026) -
Eyes Wide Shut? Exploring the Visual Shortcomings of Multimodal LLMs
por: Tong, Shengbang, et al.
Publicado: (2024)