Benchmarking the Generality of Vision-Language-Action Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Guruprasad, Pranav, Chowdhury, Sudipta, Sikka, Harsh, Sharma, Mridul, Lu, Helen, Rivera, Sean, Khurana, Aryan, Ren, Hangliang, Wang, Yangyue |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Benchmarking Vision, Language, & Action Models in Procedurally Generated, Open Ended Action Environments
par: Guruprasad, Pranav, et autres
Publié: (2025)
par: Guruprasad, Pranav, et autres
Publié: (2025)
An Open-Source Software Toolkit & Benchmark Suite for the Evaluation and Adaptation of Multimodal Action Models
par: Guruprasad, Pranav, et autres
Publié: (2025)
par: Guruprasad, Pranav, et autres
Publié: (2025)
Benchmarking Vision, Language, & Action Models on Robotic Learning Tasks
par: Guruprasad, Pranav, et autres
Publié: (2024)
par: Guruprasad, Pranav, et autres
Publié: (2024)
GUI-Perturbed: Domain Randomization Reveals Systematic Brittleness in GUI Grounding Models
par: Wang, Yangyue, et autres
Publié: (2026)
par: Wang, Yangyue, et autres
Publié: (2026)
Beyond Loss Guidance: Using PDE Residuals as Spectral Attention in Diffusion Neural Operators
par: Sawhney, Medha, et autres
Publié: (2025)
par: Sawhney, Medha, et autres
Publié: (2025)
MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache
par: Sharma, Akshat, et autres
Publié: (2024)
par: Sharma, Akshat, et autres
Publié: (2024)
Development of Pre-Trained Transformer-based Models for the Nepali Language
par: Thapa, Prajwal, et autres
Publié: (2024)
par: Thapa, Prajwal, et autres
Publié: (2024)
Grounding Multimodal Large Language Models in Actions
par: Szot, Andrew, et autres
Publié: (2024)
par: Szot, Andrew, et autres
Publié: (2024)
Measuring and Improving Chain-of-Thought Reasoning in Vision-Language Models
par: Chen, Yangyi, et autres
Publié: (2023)
par: Chen, Yangyi, et autres
Publié: (2023)
TextAge: A Curated and Diverse Text Dataset for Age Classification
par: Cheekati, Shravan, et autres
Publié: (2024)
par: Cheekati, Shravan, et autres
Publié: (2024)
TaxaDiffusion: Progressively Trained Diffusion Model for Fine-Grained Species Generation
par: Monsefi, Amin Karimi, et autres
Publié: (2025)
par: Monsefi, Amin Karimi, et autres
Publié: (2025)
DRESS: Instructing Large Vision-Language Models to Align and Interact with Humans via Natural Language Feedback
par: Chen, Yangyi, et autres
Publié: (2023)
par: Chen, Yangyi, et autres
Publié: (2023)
KULCQ: An Unsupervised Keyword-based Utterance Level Clustering Quality Metric
par: Guruprasad, Pranav, et autres
Publié: (2024)
par: Guruprasad, Pranav, et autres
Publié: (2024)
Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better
par: Driess, Danny, et autres
Publié: (2025)
par: Driess, Danny, et autres
Publié: (2025)
FAST: Efficient Action Tokenization for Vision-Language-Action Models
par: Pertsch, Karl, et autres
Publié: (2025)
par: Pertsch, Karl, et autres
Publié: (2025)
Run-time Observation Interventions Make Vision-Language-Action Models More Visually Robust
par: Hancock, Asher J., et autres
Publié: (2024)
par: Hancock, Asher J., et autres
Publié: (2024)
$π_{0.5}$: a Vision-Language-Action Model with Open-World Generalization
par: Intelligence, Physical, et autres
Publié: (2025)
par: Intelligence, Physical, et autres
Publié: (2025)
Confidence Calibration in Vision-Language-Action Models
par: Zollo, Thomas P, et autres
Publié: (2025)
par: Zollo, Thomas P, et autres
Publié: (2025)
Towards Practical World Model-based Reinforcement Learning for Vision-Language-Action Models
par: Zhang, Zhilong, et autres
Publié: (2026)
par: Zhang, Zhilong, et autres
Publié: (2026)
Uncertainty Quantification of Large Language Models using Approximate Bayesian Computation
par: Sharma, Mridul, et autres
Publié: (2025)
par: Sharma, Mridul, et autres
Publié: (2025)
Causal Reflection with Language Models
par: Aryan, Abi, et autres
Publié: (2025)
par: Aryan, Abi, et autres
Publié: (2025)
APPLV: Adaptive Planner Parameter Learning from Vision-Language-Action Model
par: Lu, Yuanjie, et autres
Publié: (2026)
par: Lu, Yuanjie, et autres
Publié: (2026)
MEM: Multi-Scale Embodied Memory for Vision Language Action Models
par: Torne, Marcel, et autres
Publié: (2026)
par: Torne, Marcel, et autres
Publié: (2026)
$π_0$: A Vision-Language-Action Flow Model for General Robot Control
par: Black, Kevin, et autres
Publié: (2024)
par: Black, Kevin, et autres
Publié: (2024)
Tactile-VLA: Unlocking Vision-Language-Action Model's Physical Knowledge for Tactile Generalization
par: Huang, Jialei, et autres
Publié: (2025)
par: Huang, Jialei, et autres
Publié: (2025)
World-Value-Action Model: Implicit Planning for Vision-Language-Action Systems
par: Li, Runze, et autres
Publié: (2026)
par: Li, Runze, et autres
Publié: (2026)
Advancing Vision-based Human Action Recognition: Exploring Vision-Language CLIP Model for Generalisation in Domain-Independent Tasks
par: Shandilya, Utkarsh, et autres
Publié: (2025)
par: Shandilya, Utkarsh, et autres
Publié: (2025)
RE-RFME: Real-Estate RFME Model for customer segmentation
par: Pandey, Anurag Kumar, et autres
Publié: (2024)
par: Pandey, Anurag Kumar, et autres
Publié: (2024)
villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
par: Chen, Xiaoyu, et autres
Publié: (2025)
par: Chen, Xiaoyu, et autres
Publié: (2025)
DebateBench: A Challenging Long Context Reasoning Benchmark For Large Language Models
par: Tiwari, Utkarsh, et autres
Publié: (2025)
par: Tiwari, Utkarsh, et autres
Publié: (2025)
Learning POMDP World Models from Observations with Language-Model Priors
par: Six, Valentin, et autres
Publié: (2026)
par: Six, Valentin, et autres
Publié: (2026)
AcceRL: A Distributed Asynchronous Reinforcement Learning and World Model Framework for Vision-Language-Action Models
par: Lu, Chengxuan, et autres
Publié: (2026)
par: Lu, Chengxuan, et autres
Publié: (2026)
OpenVLA: An Open-Source Vision-Language-Action Model
par: Kim, Moo Jin, et autres
Publié: (2024)
par: Kim, Moo Jin, et autres
Publié: (2024)
Characterizing Paraphrase-Induced Failures in Lean 4 Autoformalization
par: Feng, William, et autres
Publié: (2026)
par: Feng, William, et autres
Publié: (2026)
H-Probes: Extracting Hierarchical Structures From Latent Representations of Language Models
par: Dawes, Cutter, et autres
Publié: (2026)
par: Dawes, Cutter, et autres
Publié: (2026)
Benchmarking Attribute Discrimination in Infant-Scale Vision-Language Models
par: Batsell, Patrick, et autres
Publié: (2025)
par: Batsell, Patrick, et autres
Publié: (2025)
Curriculum-Guided Reinforcement Learning for Synthesizing Gas-Efficient Financial Derivatives Contracts
par: Mridul, Maruf Ahmed, et autres
Publié: (2025)
par: Mridul, Maruf Ahmed, et autres
Publié: (2025)
A Hierarchical Language Model For Interpretable Graph Reasoning
par: Khurana, Sambhav, et autres
Publié: (2024)
par: Khurana, Sambhav, et autres
Publié: (2024)
Surveying Facial Recognition Models for Diverse Indian Demographics: A Comparative Analysis on LFW and Custom Dataset
par: Pant, Pranav, et autres
Publié: (2024)
par: Pant, Pranav, et autres
Publié: (2024)
Generative Kaleidoscopic Networks
par: Shrivastava, Harsh
Publié: (2024)
par: Shrivastava, Harsh
Publié: (2024)
Documents similaires
-
Benchmarking Vision, Language, & Action Models in Procedurally Generated, Open Ended Action Environments
par: Guruprasad, Pranav, et autres
Publié: (2025) -
An Open-Source Software Toolkit & Benchmark Suite for the Evaluation and Adaptation of Multimodal Action Models
par: Guruprasad, Pranav, et autres
Publié: (2025) -
Benchmarking Vision, Language, & Action Models on Robotic Learning Tasks
par: Guruprasad, Pranav, et autres
Publié: (2024) -
GUI-Perturbed: Domain Randomization Reveals Systematic Brittleness in GUI Grounding Models
par: Wang, Yangyue, et autres
Publié: (2026) -
Beyond Loss Guidance: Using PDE Residuals as Spectral Attention in Diffusion Neural Operators
par: Sawhney, Medha, et autres
Publié: (2025)