Visually Prompted Benchmarks Are Surprisingly Fragile
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Feng, Haiwen, Lian, Long, Dunlap, Lisa, Shu, Jiahao, Wang, XuDong, Wang, Renhao, Darrell, Trevor, Suhr, Alane, Kanazawa, Angjoo |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TULIP: Towards Unified Language-Image Pretraining
par: Tang, Zineng, et autres
Publié: (2025)
par: Tang, Zineng, et autres
Publié: (2025)
Segment Anything without Supervision
par: Wang, XuDong, et autres
Publié: (2024)
par: Wang, XuDong, et autres
Publié: (2024)
UnSAMv2: Self-Supervised Learning Enables Segment Anything at Any Granularity
par: Yu, Junwei, et autres
Publié: (2025)
par: Yu, Junwei, et autres
Publié: (2025)
St4RTrack: Simultaneous 4D Reconstruction and Tracking in the World
par: Feng, Haiwen, et autres
Publié: (2025)
par: Feng, Haiwen, et autres
Publié: (2025)
Visual Lexicon: Rich Image Features in Language Space
par: Wang, XuDong, et autres
Publié: (2024)
par: Wang, XuDong, et autres
Publié: (2024)
Reconstruction Alignment Improves Unified Multimodal Models
par: Xie, Ji, et autres
Publié: (2025)
par: Xie, Ji, et autres
Publié: (2025)
Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning
par: Yin, Shaofeng, et autres
Publié: (2026)
par: Yin, Shaofeng, et autres
Publié: (2026)
Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens
par: Qin, Yiming, et autres
Publié: (2025)
par: Qin, Yiming, et autres
Publié: (2025)
Constantly Improving Image Models Need Constantly Improving Benchmarks
par: Ge, Jiaxin, et autres
Publié: (2025)
par: Ge, Jiaxin, et autres
Publié: (2025)
Diffusion Hyperfeatures: Searching Through Time and Space for Semantic Correspondence
par: Luo, Grace, et autres
Publié: (2023)
par: Luo, Grace, et autres
Publié: (2023)
LLM-grounded Diffusion: Enhancing Prompt Understanding of Text-to-Image Diffusion Models with Large Language Models
par: Lian, Long, et autres
Publié: (2023)
par: Lian, Long, et autres
Publié: (2023)
From Audio to Photoreal Embodiment: Synthesizing Humans in Conversations
par: Ng, Evonne, et autres
Publié: (2024)
par: Ng, Evonne, et autres
Publié: (2024)
Evaluating Model Perception of Color Illusions in Photorealistic Scenes
par: Mao, Lingjun, et autres
Publié: (2024)
par: Mao, Lingjun, et autres
Publié: (2024)
Self-Improving 4D Perception via Self-Distillation
par: Huang, Nan, et autres
Publié: (2026)
par: Huang, Nan, et autres
Publié: (2026)
Splatfacto-W: A Nerfstudio Implementation of Gaussian Splatting for Unconstrained Photo Collections
par: Xu, Congrong, et autres
Publié: (2024)
par: Xu, Congrong, et autres
Publié: (2024)
AutoPresent: Designing Structured Visuals from Scratch
par: Ge, Jiaxin, et autres
Publié: (2025)
par: Ge, Jiaxin, et autres
Publié: (2025)
Grounding Language in Multi-Perspective Referential Communication
par: Tang, Zineng, et autres
Publié: (2024)
par: Tang, Zineng, et autres
Publié: (2024)
Visual Imitation Enables Contextual Humanoid Control
par: Allshire, Arthur, et autres
Publié: (2025)
par: Allshire, Arthur, et autres
Publié: (2025)
Human-level 3D shape perception emerges from multi-view learning
par: Bonnen, Tyler, et autres
Publié: (2026)
par: Bonnen, Tyler, et autres
Publié: (2026)
Rethinking Patch Dependence for Masked Autoencoders
par: Fu, Letian, et autres
Publié: (2024)
par: Fu, Letian, et autres
Publié: (2024)
SegLLM: Multi-round Reasoning Segmentation
par: Wang, XuDong, et autres
Publié: (2024)
par: Wang, XuDong, et autres
Publié: (2024)
SOAR: Self-Occluded Avatar Recovery from a Single Video In the Wild
par: Pan, Zhuoyang, et autres
Publié: (2024)
par: Pan, Zhuoyang, et autres
Publié: (2024)
VisGym: Diverse, Customizable, Scalable Environments for Multimodal Agents
par: Wang, Zirui, et autres
Publié: (2026)
par: Wang, Zirui, et autres
Publié: (2026)
Discovering Divergent Representations between Text-to-Image Models
par: Dunlap, Lisa, et autres
Publié: (2025)
par: Dunlap, Lisa, et autres
Publié: (2025)
Learning Adaptive Parallel Reasoning with Language Models
par: Pan, Jiayi, et autres
Publié: (2025)
par: Pan, Jiayi, et autres
Publié: (2025)
Agent-to-Sim: Learning Interactive Behavior Models from Casual Longitudinal Videos
par: Yang, Gengshan, et autres
Publié: (2024)
par: Yang, Gengshan, et autres
Publié: (2024)
Video Action Differencing
par: Burgess, James, et autres
Publié: (2025)
par: Burgess, James, et autres
Publié: (2025)
Continuous 3D Perception Model with Persistent State
par: Wang, Qianqian, et autres
Publié: (2025)
par: Wang, Qianqian, et autres
Publié: (2025)
Generating Continual Human Motion in Diverse 3D Scenes
par: Mir, Aymen, et autres
Publié: (2023)
par: Mir, Aymen, et autres
Publié: (2023)
NeRF-XL: Scaling NeRFs with Multiple GPUs
par: Li, Ruilong, et autres
Publié: (2024)
par: Li, Ruilong, et autres
Publié: (2024)
LLM-grounded Video Diffusion Models
par: Lian, Long, et autres
Publié: (2023)
par: Lian, Long, et autres
Publié: (2023)
VisionArena: 230K Real World User-VLM Conversations with Preference Labels
par: Chou, Christopher, et autres
Publié: (2024)
par: Chou, Christopher, et autres
Publié: (2024)
Describing Differences in Image Sets with Natural Language
par: Dunlap, Lisa, et autres
Publié: (2023)
par: Dunlap, Lisa, et autres
Publié: (2023)
Segment Any Motion in Videos
par: Huang, Nan, et autres
Publié: (2025)
par: Huang, Nan, et autres
Publié: (2025)
ThreadWeaver: Adaptive Threading for Efficient Parallel Reasoning in Language Models
par: Lian, Long, et autres
Publié: (2025)
par: Lian, Long, et autres
Publié: (2025)
The More You See in 2D, the More You Perceive in 3D
par: Han, Xinyang, et autres
Publié: (2024)
par: Han, Xinyang, et autres
Publié: (2024)
Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting
par: Sclar, Melanie, et autres
Publié: (2023)
par: Sclar, Melanie, et autres
Publié: (2023)
Decentralized Diffusion Models
par: McAllister, David, et autres
Publié: (2025)
par: McAllister, David, et autres
Publié: (2025)
Compositional Chain-of-Thought Prompting for Large Multimodal Models
par: Mitra, Chancharik, et autres
Publié: (2023)
par: Mitra, Chancharik, et autres
Publié: (2023)
PromptHub: Enhancing Multi-Prompt Visual In-Context Learning with Locality-Aware Fusion, Concentration and Alignment
par: Luo, Tianci, et autres
Publié: (2026)
par: Luo, Tianci, et autres
Publié: (2026)
Documents similaires
-
TULIP: Towards Unified Language-Image Pretraining
par: Tang, Zineng, et autres
Publié: (2025) -
Segment Anything without Supervision
par: Wang, XuDong, et autres
Publié: (2024) -
UnSAMv2: Self-Supervised Learning Enables Segment Anything at Any Granularity
par: Yu, Junwei, et autres
Publié: (2025) -
St4RTrack: Simultaneous 4D Reconstruction and Tracking in the World
par: Feng, Haiwen, et autres
Publié: (2025) -
Visual Lexicon: Rich Image Features in Language Space
par: Wang, XuDong, et autres
Publié: (2024)