UniBench: Visual Reasoning Requires Rethinking Vision-Language Beyond Scaling
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Al-Tahan, Haider, Garrido, Quentin, Balestriero, Randall, Bouchacourt, Diane, Hazirbas, Caner, Ibrahim, Mark |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
The Bias of Harmful Label Associations in Vision-Language Models
par: Hazirbas, Caner, et autres
Publié: (2024)
par: Hazirbas, Caner, et autres
Publié: (2024)
Understanding the Detrimental Class-level Effects of Data Augmentation
par: Kirichenko, Polina, et autres
Publié: (2023)
par: Kirichenko, Polina, et autres
Publié: (2023)
$\mathbb{X}$-Sample Contrastive Loss: Improving Contrastive Learning with Sample Similarity Graphs
par: Sobal, Vlad, et autres
Publié: (2024)
par: Sobal, Vlad, et autres
Publié: (2024)
Embracing Diversity: Interpretable Zero-shot classification beyond one vector per class
par: Moayeri, Mazda, et autres
Publié: (2024)
par: Moayeri, Mazda, et autres
Publié: (2024)
Beyond and Free from Diffusion: Invertible Guided Consistency Training
par: Hsu, Chia-Hong, et autres
Publié: (2025)
par: Hsu, Chia-Hong, et autres
Publié: (2025)
Joint Embedding vs Reconstruction: Provable Benefits of Latent Space Prediction for Self Supervised Learning
par: Van Assel, Hugues, et autres
Publié: (2025)
par: Van Assel, Hugues, et autres
Publié: (2025)
Post-Hoc Guidance for Consistency Models by Joint Flow Distribution Learning
par: Hsu, Chia-Hong, et autres
Publié: (2026)
par: Hsu, Chia-Hong, et autres
Publié: (2026)
BabyVision: Visual Reasoning Beyond Language
par: Chen, Liang, et autres
Publié: (2026)
par: Chen, Liang, et autres
Publié: (2026)
LeJEPA: Provable and Scalable Self-Supervised Learning Without the Heuristics
par: Balestriero, Randall, et autres
Publié: (2025)
par: Balestriero, Randall, et autres
Publié: (2025)
Learning by Reconstruction Produces Uninformative Features For Perception
par: Balestriero, Randall, et autres
Publié: (2024)
par: Balestriero, Randall, et autres
Publié: (2024)
Self-Supervised Disentanglement by Leveraging Structure in Data Augmentations
par: Eastwood, Cian, et autres
Publié: (2023)
par: Eastwood, Cian, et autres
Publié: (2023)
VISReg: Variance-Invariance-Sketching Regularization for JEPA training
par: Wu, Haiyu, et autres
Publié: (2026)
par: Wu, Haiyu, et autres
Publié: (2026)
SplineCam: Exact Visualization and Characterization of Deep Network Geometry and Decision Boundaries
par: Humayun, Ahmed Imtiaz, et autres
Publié: (2023)
par: Humayun, Ahmed Imtiaz, et autres
Publié: (2023)
Beyond [cls]: Exploring the true potential of Masked Image Modeling representations
par: Przewięźlikowski, Marcin, et autres
Publié: (2024)
par: Przewięźlikowski, Marcin, et autres
Publié: (2024)
Occam's Razor for Self Supervised Learning: What is Sufficient to Learn Good Representations?
par: Ibrahim, Mark, et autres
Publié: (2024)
par: Ibrahim, Mark, et autres
Publié: (2024)
Interpreting Physics in Video World Models
par: Joseph, Sonia, et autres
Publié: (2026)
par: Joseph, Sonia, et autres
Publié: (2026)
Self-Supervised Anomaly Detection in the Wild: Favor Joint Embeddings Methods
par: Otero, Daniel, et autres
Publié: (2024)
par: Otero, Daniel, et autres
Publié: (2024)
CompareBench: A Benchmark for Visual Comparison Reasoning in Vision-Language Models
par: Cai, Jie, et autres
Publié: (2025)
par: Cai, Jie, et autres
Publié: (2025)
Rethinking Visual Dependency in Long-Context Reasoning for Large Vision-Language Models
par: Zhou, Yucheng, et autres
Publié: (2024)
par: Zhou, Yucheng, et autres
Publié: (2024)
VGRP-Bench: Visual Grid Reasoning Puzzle Benchmark for Large Vision-Language Models
par: Ren, Yufan, et autres
Publié: (2025)
par: Ren, Yufan, et autres
Publié: (2025)
End-to-end Topographic Auditory Models Replicate Signatures of Human Auditory Cortex
par: Al-Tahan, Haider, et autres
Publié: (2025)
par: Al-Tahan, Haider, et autres
Publié: (2025)
From Linearity to Non-Linearity: How Masked Autoencoders Capture Spatial Correlations
par: Bisulco, Anthony, et autres
Publié: (2025)
par: Bisulco, Anthony, et autres
Publié: (2025)
Self-supervised Video Instance Segmentation Can Boost Geographic Entity Alignment in Historical Maps
par: Xia, Xue, et autres
Publié: (2024)
par: Xia, Xue, et autres
Publié: (2024)
UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs
par: Jiang, Houcheng, et autres
Publié: (2026)
par: Jiang, Houcheng, et autres
Publié: (2026)
Deep Networks Always Grok and Here is Why
par: Humayun, Ahmed Imtiaz, et autres
Publié: (2024)
par: Humayun, Ahmed Imtiaz, et autres
Publié: (2024)
On the Geometry of Deep Learning
par: Balestriero, Randall, et autres
Publié: (2024)
par: Balestriero, Randall, et autres
Publié: (2024)
LL-Bench: Rethinking Low-Level Vision Evaluation in the Era of Large-Scale Generative Models
par: Liu, Lu, et autres
Publié: (2026)
par: Liu, Lu, et autres
Publié: (2026)
Rethinking Visual Attribution for Chest X-ray Reasoning in Large Vision Language Models
par: Xiong, Guangzhi, et autres
Publié: (2026)
par: Xiong, Guangzhi, et autres
Publié: (2026)
UniREditBench: A Unified Reasoning-based Image Editing Benchmark
par: Han, Feng, et autres
Publié: (2025)
par: Han, Feng, et autres
Publié: (2025)
GTR-Bench: Evaluating Geo-Temporal Reasoning in Vision-Language Models
par: Xie, Qinghongbing, et autres
Publié: (2025)
par: Xie, Qinghongbing, et autres
Publié: (2025)
GPS-SSL: Guided Positive Sampling to Inject Prior Into Self-Supervised Learning
par: Feizi, Aarash, et autres
Publié: (2024)
par: Feizi, Aarash, et autres
Publié: (2024)
Gaussian Embeddings: How JEPAs Secretly Learn Your Data Density
par: Balestriero, Randall, et autres
Publié: (2025)
par: Balestriero, Randall, et autres
Publié: (2025)
Ditch the Denoiser: Emergence of Noise Robustness in Self-Supervised Learning from Data Curriculum
par: Lu, Wenquan, et autres
Publié: (2025)
par: Lu, Wenquan, et autres
Publié: (2025)
VLRS-Bench: A Vision-Language Reasoning Benchmark for Remote Sensing
par: Luo, Zhiming, et autres
Publié: (2026)
par: Luo, Zhiming, et autres
Publié: (2026)
A Lightweight Library for Energy-Based Joint-Embedding Predictive Architectures
par: Terver, Basile, et autres
Publié: (2026)
par: Terver, Basile, et autres
Publié: (2026)
UniGRPO: Unified Policy Optimization for Reasoning-Driven Visual Generation
par: Liu, Jie, et autres
Publié: (2026)
par: Liu, Jie, et autres
Publié: (2026)
The Factorization Curse: Which Tokens You Predict Underlie the Reversal Curse and More
par: Kitouni, Ouail, et autres
Publié: (2024)
par: Kitouni, Ouail, et autres
Publié: (2024)
FastDINOv2: Frequency Based Curriculum Learning Improves Robustness and Training Speed
par: Zhang, Jiaqi, et autres
Publié: (2025)
par: Zhang, Jiaqi, et autres
Publié: (2025)
VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models
par: Zhang, Ce, et autres
Publié: (2025)
par: Zhang, Ce, et autres
Publié: (2025)
ViUniT: Visual Unit Tests for More Robust Visual Programming
par: Panagopoulou, Artemis, et autres
Publié: (2024)
par: Panagopoulou, Artemis, et autres
Publié: (2024)
Documents similaires
-
The Bias of Harmful Label Associations in Vision-Language Models
par: Hazirbas, Caner, et autres
Publié: (2024) -
Understanding the Detrimental Class-level Effects of Data Augmentation
par: Kirichenko, Polina, et autres
Publié: (2023) -
$\mathbb{X}$-Sample Contrastive Loss: Improving Contrastive Learning with Sample Similarity Graphs
par: Sobal, Vlad, et autres
Publié: (2024) -
Embracing Diversity: Interpretable Zero-shot classification beyond one vector per class
par: Moayeri, Mazda, et autres
Publié: (2024) -
Beyond and Free from Diffusion: Invertible Guided Consistency Training
par: Hsu, Chia-Hong, et autres
Publié: (2025)