Adapting Vision-Language Models for Evaluating World Models
Fuente:
arXiv
Saved in:
| Main Authors: | Hendriksen, Mariya, Rashid, Tabish, Bignell, David, Georgescu, Raluca, Lemkhenter, Abdelhak, Hofmann, Katja, Devlin, Sam, Parisot, Sarah |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Adapting a World Model for Trajectory Following in a 3D Game
by: Tot, Marko, et al.
Published: (2025)
by: Tot, Marko, et al.
Published: (2025)
Scaling Laws for Pre-training Agents and World Models
by: Pearce, Tim, et al.
Published: (2024)
by: Pearce, Tim, et al.
Published: (2024)
Visual Encoders for Data-Efficient Imitation Learning in Modern Video Games
by: Schäfer, Lukas, et al.
Published: (2023)
by: Schäfer, Lukas, et al.
Published: (2023)
Blind Image Restoration via Fast Diffusion Inversion
by: Chihaoui, Hamadi, et al.
Published: (2024)
by: Chihaoui, Hamadi, et al.
Published: (2024)
Demonstrating and Reducing Shortcuts in Vision-Language Representation Learning
by: Bleeker, Maurits, et al.
Published: (2024)
by: Bleeker, Maurits, et al.
Published: (2024)
An Extended Evaluation Split for DeepSpaceYoloDataset
by: Parisot, Olivier
Published: (2026)
by: Parisot, Olivier
Published: (2026)
Multimodal Learned Sparse Retrieval with Probabilistic Expansion Control
by: Nguyen, Thong, et al.
Published: (2024)
by: Nguyen, Thong, et al.
Published: (2024)
Benchmark Granularity and Model Robustness for Image-Text Retrieval
by: Hendriksen, Mariya, et al.
Published: (2024)
by: Hendriksen, Mariya, et al.
Published: (2024)
Fast Autoregressive Video Generation with Diagonal Decoding
by: Ye, Yang, et al.
Published: (2025)
by: Ye, Yang, et al.
Published: (2025)
Aligning Agents like Large Language Models
by: Jelley, Adam, et al.
Published: (2024)
by: Jelley, Adam, et al.
Published: (2024)
Adapting the Segment Anything Model During Usage in Novel Situations
by: Schön, Robin, et al.
Published: (2024)
by: Schön, Robin, et al.
Published: (2024)
CLIPping the Deception: Adapting Vision-Language Models for Universal Deepfake Detection
by: Khan, Sohail Ahmed, et al.
Published: (2024)
by: Khan, Sohail Ahmed, et al.
Published: (2024)
Anomaly Detection by Adapting a pre-trained Vision Language Model
by: Cai, Yuxuan, et al.
Published: (2024)
by: Cai, Yuxuan, et al.
Published: (2024)
Do Vision-Language Models See Urban Scenes as People Do? An Urban Perception Benchmark
by: Mushkani, Rashid
Published: (2025)
by: Mushkani, Rashid
Published: (2025)
Improving Object Detection via Local-global Contrastive Learning
by: Triantafyllidou, Danai, et al.
Published: (2024)
by: Triantafyllidou, Danai, et al.
Published: (2024)
Adapting Vision-Language Model with Fine-grained Semantics for Open-Vocabulary Segmentation
by: Chng, Yong Xien, et al.
Published: (2024)
by: Chng, Yong Xien, et al.
Published: (2024)
Adapting Vision-Language Models for E-commerce Understanding at Scale
by: Nulli, Matteo, et al.
Published: (2026)
by: Nulli, Matteo, et al.
Published: (2026)
Advancing Vision-based Human Action Recognition: Exploring Vision-Language CLIP Model for Generalisation in Domain-Independent Tasks
by: Shandilya, Utkarsh, et al.
Published: (2025)
by: Shandilya, Utkarsh, et al.
Published: (2025)
GeoArena: Evaluating Open-World Geographic Reasoning in Large Vision-Language Models
by: Jia, Pengyue, et al.
Published: (2025)
by: Jia, Pengyue, et al.
Published: (2025)
Adapting Vision-Language Foundation Model for Next Generation Medical Ultrasound Image Analysis
by: Qu, Jingguo, et al.
Published: (2025)
by: Qu, Jingguo, et al.
Published: (2025)
Adapting Vision-Language Models to Open Classes via Test-Time Prompt Tuning
by: Gao, Zhengqing, et al.
Published: (2024)
by: Gao, Zhengqing, et al.
Published: (2024)
Industrial Language-Image Dataset (ILID): Adapting Vision Foundation Models for Industrial Settings
by: Moenck, Keno, et al.
Published: (2024)
by: Moenck, Keno, et al.
Published: (2024)
Detecting streaks in smart telescopes images with Deep Learning
by: Parisot, Olivier, et al.
Published: (2025)
by: Parisot, Olivier, et al.
Published: (2025)
AdaptSplat: Adapting Vision Foundation Models for Feed-Forward 3D Gaussian Splatting
by: Xing, Mingwei, et al.
Published: (2026)
by: Xing, Mingwei, et al.
Published: (2026)
A Benchmark and Evaluation for Real-World Out-of-Distribution Detection Using Vision-Language Models
by: Noda, Shiho, et al.
Published: (2025)
by: Noda, Shiho, et al.
Published: (2025)
CropVLM: A Domain-Adapted Vision-Language Model for Open-Set Crop Analysis
by: Boudiaf, Abderrahmene, et al.
Published: (2026)
by: Boudiaf, Abderrahmene, et al.
Published: (2026)
AdaptInfer: Adaptive Token Pruning for Vision-Language Model Inference with Dynamical Text Guidance
by: Zhang, Weichen, et al.
Published: (2025)
by: Zhang, Weichen, et al.
Published: (2025)
Adapting Foundation Vision-Language Models to Medical Diagnosis via Query-Driven Expert Bridging
by: Li, Yitong, et al.
Published: (2025)
by: Li, Yitong, et al.
Published: (2025)
Adapting Lightweight Vision Language Models for Radiological Visual Question Answering
by: Shourya, Aditya, et al.
Published: (2025)
by: Shourya, Aditya, et al.
Published: (2025)
A Practical Investigation of Spatially-Controlled Image Generation with Transformers
by: Xia, Guoxuan, et al.
Published: (2025)
by: Xia, Guoxuan, et al.
Published: (2025)
AVID: Adapting Video Diffusion Models to World Models
by: Rigter, Marc, et al.
Published: (2024)
by: Rigter, Marc, et al.
Published: (2024)
Adapting Dual-encoder Vision-language Models for Paraphrased Retrieval
by: Cheng, Jiacheng, et al.
Published: (2024)
by: Cheng, Jiacheng, et al.
Published: (2024)
Parameters as Experts: Adapting Vision Models with Dynamic Parameter Routing
by: Lou, Meng, et al.
Published: (2026)
by: Lou, Meng, et al.
Published: (2026)
Adapting Human Mesh Recovery with Vision-Language Feedback
by: Xu, Chongyang, et al.
Published: (2025)
by: Xu, Chongyang, et al.
Published: (2025)
From Generalist to Specialist: Adapting Vision Language Models via Task-Specific Visual Instruction Tuning
by: Bai, Yang, et al.
Published: (2024)
by: Bai, Yang, et al.
Published: (2024)
Taxonomy-Aware Evaluation of Vision-Language Models
by: Snæbjarnarson, Vésteinn, et al.
Published: (2025)
by: Snæbjarnarson, Vésteinn, et al.
Published: (2025)
Fusion of Domain-Adapted Vision and Language Models for Medical Visual Question Answering
by: Ha, Cuong Nhat, et al.
Published: (2024)
by: Ha, Cuong Nhat, et al.
Published: (2024)
WorldVLM: Combining World Model Forecasting and Vision-Language Reasoning
by: Englmeier, Stefan, et al.
Published: (2026)
by: Englmeier, Stefan, et al.
Published: (2026)
Adapting Vision Foundation Models for Real-time Ultrasound Image Segmentation
by: Zhang, Xiaoran, et al.
Published: (2025)
by: Zhang, Xiaoran, et al.
Published: (2025)
Robustness analysis of Deep Sky Objects detection models on HPC
by: Parisot, Olivier, et al.
Published: (2025)
by: Parisot, Olivier, et al.
Published: (2025)
Similar Items
-
Adapting a World Model for Trajectory Following in a 3D Game
by: Tot, Marko, et al.
Published: (2025) -
Scaling Laws for Pre-training Agents and World Models
by: Pearce, Tim, et al.
Published: (2024) -
Visual Encoders for Data-Efficient Imitation Learning in Modern Video Games
by: Schäfer, Lukas, et al.
Published: (2023) -
Blind Image Restoration via Fast Diffusion Inversion
by: Chihaoui, Hamadi, et al.
Published: (2024) -
Demonstrating and Reducing Shortcuts in Vision-Language Representation Learning
by: Bleeker, Maurits, et al.
Published: (2024)