A Vision Check-up for Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Sharma, Pratyusha, Shaham, Tamar Rott, Baradad, Manel, Fu, Stephanie, Rodriguez-Munoz, Adrian, Duggal, Shivam, Isola, Phillip, Torralba, Antonio |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Separating Knowledge and Perception with Procedural Data
por: Rodríguez-Muñoz, Adrián, et al.
Publicado: (2025)
por: Rodríguez-Muñoz, Adrián, et al.
Publicado: (2025)
Vision-Language Binding in In-Context Image Generation
por: Ge, Chris, et al.
Publicado: (2026)
por: Ge, Chris, et al.
Publicado: (2026)
Adaptive Length Image Tokenization via Recurrent Allocation
por: Duggal, Shivam, et al.
Publicado: (2024)
por: Duggal, Shivam, et al.
Publicado: (2024)
Single-pass Adaptive Image Tokenization for Minimum Program Search
por: Duggal, Shivam, et al.
Publicado: (2025)
por: Duggal, Shivam, et al.
Publicado: (2025)
A Multimodal Automated Interpretability Agent
por: Shaham, Tamar Rott, et al.
Publicado: (2024)
por: Shaham, Tamar Rott, et al.
Publicado: (2024)
The Dual Mechanisms of Spatial Reasoning in Vision-Language Models
por: Cui, Kelly, et al.
Publicado: (2026)
por: Cui, Kelly, et al.
Publicado: (2026)
SketchAgent: Language-Driven Sequential Sketch Generation
por: Vinker, Yael, et al.
Publicado: (2024)
por: Vinker, Yael, et al.
Publicado: (2024)
Deep Augmentation: Dropout as Augmentation for Self-Supervised Learning
por: Brüel-Gabrielsson, Rickard, et al.
Publicado: (2023)
por: Brüel-Gabrielsson, Rickard, et al.
Publicado: (2023)
End-to-End Training for Unified Tokenization and Latent Denoising
por: Duggal, Shivam, et al.
Publicado: (2026)
por: Duggal, Shivam, et al.
Publicado: (2026)
BrainExplore: Large-Scale Discovery of Interpretable Visual Representations in the Human Brain
por: Wasserman, Navve, et al.
Publicado: (2025)
por: Wasserman, Navve, et al.
Publicado: (2025)
LoRA vs Full Fine-tuning: An Illusion of Equivalence
por: Shuttleworth, Reece, et al.
Publicado: (2024)
por: Shuttleworth, Reece, et al.
Publicado: (2024)
Words That Make Language Models Perceive
por: Wang, Sophie L., et al.
Publicado: (2025)
por: Wang, Sophie L., et al.
Publicado: (2025)
From Activation to Causality: Discovery of Causal Visual Representations in the Human Brain
por: Golbari, Yuval, et al.
Publicado: (2026)
por: Golbari, Yuval, et al.
Publicado: (2026)
Automated Detection of Visual Attribute Reliance with a Self-Reflective Agent
por: Li, Christy, et al.
Publicado: (2025)
por: Li, Christy, et al.
Publicado: (2025)
Seeing Through the PRISM: Compound & Controllable Restoration of Scientific Images
por: Kurinchi-Vendhan, Rupa, et al.
Publicado: (2026)
por: Kurinchi-Vendhan, Rupa, et al.
Publicado: (2026)
Language Models use Lookbacks to Track Beliefs
por: Prakash, Nikhil, et al.
Publicado: (2025)
por: Prakash, Nikhil, et al.
Publicado: (2025)
Fine-Tuning Enhances Existing Mechanisms: A Case Study on Entity Tracking
por: Prakash, Nikhil, et al.
Publicado: (2024)
por: Prakash, Nikhil, et al.
Publicado: (2024)
MFC-Bench: Benchmarking Multimodal Fact-Checking with Large Vision-Language Models
por: Wang, Shengkang, et al.
Publicado: (2024)
por: Wang, Shengkang, et al.
Publicado: (2024)
Compress to Impress: Efficient LLM Adaptation Using a Single Gradient Step on 100 Samples
por: Sreeram, Shiva, et al.
Publicado: (2025)
por: Sreeram, Shiva, et al.
Publicado: (2025)
LangNav: Language as a Perceptual Representation for Navigation
por: Pan, Bowen, et al.
Publicado: (2023)
por: Pan, Bowen, et al.
Publicado: (2023)
Distilled Feature Fields Enable Few-Shot Language-Guided Manipulation
por: Shen, William, et al.
Publicado: (2023)
por: Shen, William, et al.
Publicado: (2023)
Cross-Cultural Value Awareness in Large Vision-Language Models
por: Howard, Phillip, et al.
Publicado: (2026)
por: Howard, Phillip, et al.
Publicado: (2026)
Cultural Awareness in Vision-Language Models: A Cross-Country Exploration
por: Madasu, Avinash, et al.
Publicado: (2025)
por: Madasu, Avinash, et al.
Publicado: (2025)
PLACID: Identity-Preserving Multi-Object Compositing via Video Diffusion with Synthetic Trajectories
por: Tarrés, Gemma Canet, et al.
Publicado: (2026)
por: Tarrés, Gemma Canet, et al.
Publicado: (2026)
Vision-Language Models under Cultural and Inclusive Considerations
por: Karamolegkou, Antonia, et al.
Publicado: (2024)
por: Karamolegkou, Antonia, et al.
Publicado: (2024)
LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models
por: Zhang, Kaichen, et al.
Publicado: (2024)
por: Zhang, Kaichen, et al.
Publicado: (2024)
Learning to Exploit Temporal Structure for Biomedical Vision-Language Processing
por: Bannur, Shruthi, et al.
Publicado: (2023)
por: Bannur, Shruthi, et al.
Publicado: (2023)
Checkup2Action: A Multimodal Clinical Check-up Report Dataset for Patient-Oriented Action Card Generation
por: Xiang, Sike, et al.
Publicado: (2026)
por: Xiang, Sike, et al.
Publicado: (2026)
ChartCheck: Explainable Fact-Checking over Real-World Chart Images
por: Akhtar, Mubashara, et al.
Publicado: (2023)
por: Akhtar, Mubashara, et al.
Publicado: (2023)
Characterizing Model Robustness via Natural Input Gradients
por: Rodríguez-Muñoz, Adrián, et al.
Publicado: (2024)
por: Rodríguez-Muñoz, Adrián, et al.
Publicado: (2024)
Debiasing Large Vision-Language Models by Ablating Protected Attribute Representations
por: Ratzlaff, Neale, et al.
Publicado: (2024)
por: Ratzlaff, Neale, et al.
Publicado: (2024)
Navigating Text-to-Image Generative Bias across Indic Languages
por: Mittal, Surbhi, et al.
Publicado: (2024)
por: Mittal, Surbhi, et al.
Publicado: (2024)
Mitigating Hallucinations in Large Vision-Language Models with Internal Fact-based Contrastive Decoding
por: Wang, Chao, et al.
Publicado: (2025)
por: Wang, Chao, et al.
Publicado: (2025)
GeoCoder: Solving Geometry Problems by Generating Modular Code through Vision-Language Models
por: Sharma, Aditya, et al.
Publicado: (2024)
por: Sharma, Aditya, et al.
Publicado: (2024)
IdealGPT: Iteratively Decomposing Vision and Language Reasoning via Large Language Models
por: You, Haoxuan, et al.
Publicado: (2023)
por: You, Haoxuan, et al.
Publicado: (2023)
When Does Perceptual Alignment Benefit Vision Representations?
por: Sundaram, Shobhita, et al.
Publicado: (2024)
por: Sundaram, Shobhita, et al.
Publicado: (2024)
MoPD: Mixture-of-Prompts Distillation for Vision-Language Models
por: Chen, Yang, et al.
Publicado: (2024)
por: Chen, Yang, et al.
Publicado: (2024)
Understanding Museum Exhibits using Vision-Language Reasoning
por: Balauca, Ada-Astrid, et al.
Publicado: (2024)
por: Balauca, Ada-Astrid, et al.
Publicado: (2024)
Learning Vision from Models Rivals Learning Vision from Data
por: Tian, Yonglong, et al.
Publicado: (2023)
por: Tian, Yonglong, et al.
Publicado: (2023)
How Does Vision-Language Adaptation Impact the Safety of Vision Language Models?
por: Lee, Seongyun, et al.
Publicado: (2024)
por: Lee, Seongyun, et al.
Publicado: (2024)
Ejemplares similares
-
Separating Knowledge and Perception with Procedural Data
por: Rodríguez-Muñoz, Adrián, et al.
Publicado: (2025) -
Vision-Language Binding in In-Context Image Generation
por: Ge, Chris, et al.
Publicado: (2026) -
Adaptive Length Image Tokenization via Recurrent Allocation
por: Duggal, Shivam, et al.
Publicado: (2024) -
Single-pass Adaptive Image Tokenization for Minimum Program Search
por: Duggal, Shivam, et al.
Publicado: (2025) -
A Multimodal Automated Interpretability Agent
por: Shaham, Tamar Rott, et al.
Publicado: (2024)