Should VLMs be Pre-trained with Image Data?
Fuente:
arXiv
Salvato in:
| Autori principali: | Keh, Sedrick, Mercat, Jean, Gadre, Samir Yitzhak, Arora, Kushal, Vasiljevic, Igor, Burchfiel, Benjamin, Song, Shuran, Tedrake, Russ, Kollar, Thomas, Schmidt, Ludwig, Dave, Achal |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Linearizing Large Language Models
di: Mercat, Jean, et al.
Pubblicazione: (2024)
di: Mercat, Jean, et al.
Pubblicazione: (2024)
Language models scale reliably with over-training and on downstream tasks
di: Gadre, Samir Yitzhak, et al.
Pubblicazione: (2024)
di: Gadre, Samir Yitzhak, et al.
Pubblicazione: (2024)
A Critical Evaluation of AI Feedback for Aligning Large Language Models
di: Sharma, Archit, et al.
Pubblicazione: (2024)
di: Sharma, Archit, et al.
Pubblicazione: (2024)
VLA Foundry: A Unified Framework for Training Vision-Language-Action Models
di: Mercat, Jean, et al.
Pubblicazione: (2026)
di: Mercat, Jean, et al.
Pubblicazione: (2026)
Espresso: High Compression For Rich Extraction From Videos for Your Vision-Language Model
di: Yu, Keunwoo Peter, et al.
Pubblicazione: (2024)
di: Yu, Keunwoo Peter, et al.
Pubblicazione: (2024)
Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
di: Chi, Cheng, et al.
Pubblicazione: (2023)
di: Chi, Cheng, et al.
Pubblicazione: (2023)
Universal Manipulation Interface: In-The-Wild Robot Teaching Without In-The-Wild Robots
di: Chi, Cheng, et al.
Pubblicazione: (2024)
di: Chi, Cheng, et al.
Pubblicazione: (2024)
Understanding Complexity in VideoQA via Visual Program Generation
di: Eyzaguirre, Cristobal, et al.
Pubblicazione: (2025)
di: Eyzaguirre, Cristobal, et al.
Pubblicazione: (2025)
SPAFIT: Stratified Progressive Adaptation Fine-tuning for Pre-trained Large Language Models
di: Arora, Samir, et al.
Pubblicazione: (2024)
di: Arora, Samir, et al.
Pubblicazione: (2024)
DataComp-LM: In search of the next generation of training sets for language models
di: Li, Jeffrey, et al.
Pubblicazione: (2024)
di: Li, Jeffrey, et al.
Pubblicazione: (2024)
Geometry-aware 4D Video Generation for Robot Manipulation
di: Liu, Zeyi, et al.
Pubblicazione: (2025)
di: Liu, Zeyi, et al.
Pubblicazione: (2025)
ManiWAV: Learning Robot Manipulation from In-the-Wild Audio-Visual Data
di: Liu, Zeyi, et al.
Pubblicazione: (2024)
di: Liu, Zeyi, et al.
Pubblicazione: (2024)
Sampling-Based Motion Planning with Discrete Configuration-Space Symmetries
di: Cohn, Thomas, et al.
Pubblicazione: (2025)
di: Cohn, Thomas, et al.
Pubblicazione: (2025)
A Systematic Study of Data Modalities and Strategies for Co-training Large Behavior Models for Robot Manipulation
di: Lin, Fanqi, et al.
Pubblicazione: (2026)
di: Lin, Fanqi, et al.
Pubblicazione: (2026)
SkillFactory: Self-Distillation For Learning Cognitive Behaviors
di: Sprague, Zayne, et al.
Pubblicazione: (2025)
di: Sprague, Zayne, et al.
Pubblicazione: (2025)
Coboundaries and eigenvalues of morphic subshifts
di: Mercat, Paul
Pubblicazione: (2024)
di: Mercat, Paul
Pubblicazione: (2024)
Geometrical representation of subshifts for primitive substitutions
di: Mercat, Paul
Pubblicazione: (2022)
di: Mercat, Paul
Pubblicazione: (2022)
Historia de los judíos en la España cristiana / Yitzhak Baer ; traducida del hebreo por José Luis Lacave
di: Baer, Yitzhak
Pubblicazione: (1981)
di: Baer, Yitzhak
Pubblicazione: (1981)
The Shi'Ites and the future of Iraq / Yitzhak Nakash
di: Nakash, Yitzhak
Pubblicazione: (2003)
di: Nakash, Yitzhak
Pubblicazione: (2003)
Vasijas conectadas: Asia Occidental y Asia Oriental en la Geopolítica de China
di: Yitzhak Shichor
Pubblicazione: (2016)
di: Yitzhak Shichor
Pubblicazione: (2016)
Knowledge Transfer in Social Work: The Role of Grey Documentation.
di: Berman, Yitzhak
Pubblicazione: (1995)
di: Berman, Yitzhak
Pubblicazione: (1995)
Out of Proportion: Israel's Paradox In China's Middle Eastern Policy
di: Yitzhak Shichor
Pubblicazione: (2025)
di: Yitzhak Shichor
Pubblicazione: (2025)
Educación y construcción nacional en Israel
di: Yitzhak Kashti
Pubblicazione: (2000)
di: Yitzhak Kashti
Pubblicazione: (2000)
Smoothed Online Learning for Prediction in Piecewise Affine Systems
di: Block, Adam, et al.
Pubblicazione: (2023)
di: Block, Adam, et al.
Pubblicazione: (2023)
Certifying Bimanual RRT Motion Plans in a Second
di: Amice, Alexandre, et al.
Pubblicazione: (2023)
di: Amice, Alexandre, et al.
Pubblicazione: (2023)
Planning Shorter Paths in Graphs of Convex Sets by Undistorting Parametrized Configuration Spaces
di: Garg, Shruti, et al.
Pubblicazione: (2024)
di: Garg, Shruti, et al.
Pubblicazione: (2024)
Adaptive Compliance Policy: Learning Approximate Compliance for Diffusion Guided Control
di: Hou, Yifan, et al.
Pubblicazione: (2024)
di: Hou, Yifan, et al.
Pubblicazione: (2024)
Dreamitate: Real-World Visuomotor Policy Learning via Video Generation
di: Liang, Junbang, et al.
Pubblicazione: (2024)
di: Liang, Junbang, et al.
Pubblicazione: (2024)
Discrimination at Work
di: Mercat-Bruns, Marie
Pubblicazione: (2020)
di: Mercat-Bruns, Marie
Pubblicazione: (2020)
Discrimination at Work: Comparing European, French, and American Law
di: Mercat-Bruns, Marie
Pubblicazione: (2016)
di: Mercat-Bruns, Marie
Pubblicazione: (2016)
Exploiting the Asymmetric Uncertainty Structure of Pre-trained VLMs on the Unit Hypersphere
di: Ju, Li, et al.
Pubblicazione: (2025)
di: Ju, Li, et al.
Pubblicazione: (2025)
OpenVLA: An Open-Source Vision-Language-Action Model
di: Kim, Moo Jin, et al.
Pubblicazione: (2024)
di: Kim, Moo Jin, et al.
Pubblicazione: (2024)
Epistemic Uncertainty Quantification for Pre-trained VLMs via Riemannian Flow Matching
di: Ju, Li, et al.
Pubblicazione: (2026)
di: Ju, Li, et al.
Pubblicazione: (2026)
Zero-Shot Open-Vocabulary Tracking with Large Pre-Trained Models
di: Chu, Wen-Hsuan, et al.
Pubblicazione: (2023)
di: Chu, Wen-Hsuan, et al.
Pubblicazione: (2023)
Fast Path Planning Through Large Collections of Safe Boxes
di: Marcucci, Tobia, et al.
Pubblicazione: (2023)
di: Marcucci, Tobia, et al.
Pubblicazione: (2023)
Cost-Driven Representation Learning for Linear Quadratic Gaussian Control: Part I
di: Tian, Yi, et al.
Pubblicazione: (2022)
di: Tian, Yi, et al.
Pubblicazione: (2022)
Constrained Bimanual Planning with Analytic Inverse Kinematics
di: Cohn, Thomas, et al.
Pubblicazione: (2023)
di: Cohn, Thomas, et al.
Pubblicazione: (2023)
A Framework for Combining Optimization-Based and Analytic Inverse Kinematics
di: Cohn, Thomas, et al.
Pubblicazione: (2026)
di: Cohn, Thomas, et al.
Pubblicazione: (2026)
Cost-Driven Representation Learning for Linear Quadratic Gaussian Control: Part II
di: Tian, Yi, et al.
Pubblicazione: (2026)
di: Tian, Yi, et al.
Pubblicazione: (2026)
Prismatic VLMs: Investigating the Design Space of Visually-Conditioned Language Models
di: Karamcheti, Siddharth, et al.
Pubblicazione: (2024)
di: Karamcheti, Siddharth, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Linearizing Large Language Models
di: Mercat, Jean, et al.
Pubblicazione: (2024) -
Language models scale reliably with over-training and on downstream tasks
di: Gadre, Samir Yitzhak, et al.
Pubblicazione: (2024) -
A Critical Evaluation of AI Feedback for Aligning Large Language Models
di: Sharma, Archit, et al.
Pubblicazione: (2024) -
VLA Foundry: A Unified Framework for Training Vision-Language-Action Models
di: Mercat, Jean, et al.
Pubblicazione: (2026) -
Espresso: High Compression For Rich Extraction From Videos for Your Vision-Language Model
di: Yu, Keunwoo Peter, et al.
Pubblicazione: (2024)