Benchmark Designers Should "Train on the Test Set" to Expose Exploitable Non-Visual Shortcuts
Fuente:
arXiv
Guardado en:
| Autores principales: | Brown, Ellis, Yang, Jihan, Yang, Shusheng, Fergus, Rob, Xie, Saining |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SIMS-V: Simulated Instruction-Tuning for Spatial Video Understanding
por: Brown, Ellis, et al.
Publicado: (2025)
por: Brown, Ellis, et al.
Publicado: (2025)
V-IRL: Grounding Virtual Intelligence in Real Life
por: Yang, Jihan, et al.
Publicado: (2024)
por: Yang, Jihan, et al.
Publicado: (2024)
Scaling Text-to-Image Diffusion Transformers with Representation Autoencoders
por: Tong, Shengbang, et al.
Publicado: (2026)
por: Tong, Shengbang, et al.
Publicado: (2026)
Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs
por: Tong, Shengbang, et al.
Publicado: (2024)
por: Tong, Shengbang, et al.
Publicado: (2024)
Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces
por: Yang, Jihan, et al.
Publicado: (2024)
por: Yang, Jihan, et al.
Publicado: (2024)
Cambrian-S: Towards Spatial Supersensing in Video
por: Yang, Shusheng, et al.
Publicado: (2025)
por: Yang, Shusheng, et al.
Publicado: (2025)
Cambrian-P: Pose-Grounded Video Understanding
por: Yang, Jihan, et al.
Publicado: (2026)
por: Yang, Jihan, et al.
Publicado: (2026)
Traveling Across Languages: Benchmarking Cross-Lingual Consistency in Multimodal LLMs
por: Wang, Hao, et al.
Publicado: (2025)
por: Wang, Hao, et al.
Publicado: (2025)
Semi-Supervised Learning with Context-Conditional Generative Adversarial Networks
por: Denton, Remi, et al.
Publicado: (2016)
por: Denton, Remi, et al.
Publicado: (2016)
Improved Training Technique for Shortcut Models
por: Nguyen, Anh, et al.
Publicado: (2025)
por: Nguyen, Anh, et al.
Publicado: (2025)
Exposing Image Classifier Shortcuts with Counterfactual Frequency (CoF) Tables
por: Hinns, James, et al.
Publicado: (2024)
por: Hinns, James, et al.
Publicado: (2024)
Preventing Shortcuts in Adapter Training via Providing the Shortcuts
por: Goyal, Anujraaj Argo, et al.
Publicado: (2025)
por: Goyal, Anujraaj Argo, et al.
Publicado: (2025)
BlenderFusion: 3D-Grounded Visual Editing and Generative Compositing
por: Chen, Jiacheng, et al.
Publicado: (2025)
por: Chen, Jiacheng, et al.
Publicado: (2025)
PISA Experiments: Exploring Physics Post-Training for Video Diffusion Models by Watching Stuff Drop
por: Li, Chenyu, et al.
Publicado: (2025)
por: Li, Chenyu, et al.
Publicado: (2025)
Eyes Wide Shut? Exploring the Visual Shortcomings of Multimodal LLMs
por: Tong, Shengbang, et al.
Publicado: (2024)
por: Tong, Shengbang, et al.
Publicado: (2024)
Breaking the Visual Shortcuts in Multimodal Knowledge-Based Visual Question Answering
por: Lee, Dosung, et al.
Publicado: (2025)
por: Lee, Dosung, et al.
Publicado: (2025)
Beyond Language Modeling: An Exploration of Multimodal Pretraining
por: Tong, Shengbang, et al.
Publicado: (2026)
por: Tong, Shengbang, et al.
Publicado: (2026)
Lightweight Remote Sensing Scene Classification on Edge Devices via Knowledge Distillation and Early-exit
por: Zhao, Yang, et al.
Publicado: (2025)
por: Zhao, Yang, et al.
Publicado: (2025)
Audio-centric Video Understanding Benchmark without Text Shortcut
por: Yang, Yudong, et al.
Publicado: (2025)
por: Yang, Yudong, et al.
Publicado: (2025)
Visionary-R1: Mitigating Shortcuts in Visual Reasoning with Reinforcement Learning
por: Xia, Jiaer, et al.
Publicado: (2025)
por: Xia, Jiaer, et al.
Publicado: (2025)
FilmSceneDesigner: Chaining Set Design for Procedural Film Scene Generation
por: Xie, Zhifeng, et al.
Publicado: (2025)
por: Xie, Zhifeng, et al.
Publicado: (2025)
SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training
por: Chu, Tianzhe, et al.
Publicado: (2025)
por: Chu, Tianzhe, et al.
Publicado: (2025)
Fast Encoding and Decoding for Implicit Video Representation
por: Chen, Hao, et al.
Publicado: (2024)
por: Chen, Hao, et al.
Publicado: (2024)
Beyond Shortcuts: Mitigating Visual Illusions in Frozen VLMs via Qualitative Reasoning
por: Guo, Hao, et al.
Publicado: (2026)
por: Guo, Hao, et al.
Publicado: (2026)
GroundingME: Exposing the Visual Grounding Gap in MLLMs through Multi-Dimensional Evaluation
por: Li, Rang, et al.
Publicado: (2025)
por: Li, Rang, et al.
Publicado: (2025)
Zero-Shot Open-Vocabulary Human Motion Grounding with Test-Time Training
por: Zhou, Yunjiao, et al.
Publicado: (2025)
por: Zhou, Yunjiao, et al.
Publicado: (2025)
SpurAudio: A Benchmark for Studying Shortcut Learning in Few-Shot Audio Classification
por: Ayoub, Giries Abu, et al.
Publicado: (2026)
por: Ayoub, Giries Abu, et al.
Publicado: (2026)
Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis
por: Tang, Bingda, et al.
Publicado: (2025)
por: Tang, Bingda, et al.
Publicado: (2025)
Take A Shortcut Back: Mitigating the Gradient Vanishing for Training Spiking Neural Networks
por: Guo, Yufei, et al.
Publicado: (2024)
por: Guo, Yufei, et al.
Publicado: (2024)
The Overlooked Value of Test-time Reference Sets in Visual Place Recognition
por: Zaffar, Mubariz, et al.
Publicado: (2025)
por: Zaffar, Mubariz, et al.
Publicado: (2025)
WebSerial Vision Training for Microcontrollers: A Browser-Based Companion to On-Device CNN Training
por: Ellis, Jeremy
Publicado: (2026)
por: Ellis, Jeremy
Publicado: (2026)
Benchmarking Dependence Measures to Prevent Shortcut Learning in Medical Imaging
por: Müller, Sarah, et al.
Publicado: (2024)
por: Müller, Sarah, et al.
Publicado: (2024)
VisualQuest: A Benchmark for Abstract Visual Reasoning in MLLMs
por: Xiao, Kelaiti, et al.
Publicado: (2025)
por: Xiao, Kelaiti, et al.
Publicado: (2025)
AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark
por: Chai, Wenhao, et al.
Publicado: (2024)
por: Chai, Wenhao, et al.
Publicado: (2024)
Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think
por: Yu, Sihyun, et al.
Publicado: (2024)
por: Yu, Sihyun, et al.
Publicado: (2024)
Exposing Hallucinations To Suppress Them: VLMs Representation Editing With Generative Anchors
por: Shi, Youxu, et al.
Publicado: (2025)
por: Shi, Youxu, et al.
Publicado: (2025)
PropTest: Automatic Property Testing for Improved Visual Programming
por: Koo, Jaywon, et al.
Publicado: (2024)
por: Koo, Jaywon, et al.
Publicado: (2024)
Scaling Language-Free Visual Representation Learning
por: Fan, David, et al.
Publicado: (2025)
por: Fan, David, et al.
Publicado: (2025)
Flow Map Distillation Without Data
por: Tong, Shangyuan, et al.
Publicado: (2025)
por: Tong, Shangyuan, et al.
Publicado: (2025)
Diffusion Transformers with Representation Autoencoders
por: Zheng, Boyang, et al.
Publicado: (2025)
por: Zheng, Boyang, et al.
Publicado: (2025)
Ejemplares similares
-
SIMS-V: Simulated Instruction-Tuning for Spatial Video Understanding
por: Brown, Ellis, et al.
Publicado: (2025) -
V-IRL: Grounding Virtual Intelligence in Real Life
por: Yang, Jihan, et al.
Publicado: (2024) -
Scaling Text-to-Image Diffusion Transformers with Representation Autoencoders
por: Tong, Shengbang, et al.
Publicado: (2026) -
Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs
por: Tong, Shengbang, et al.
Publicado: (2024) -
Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces
por: Yang, Jihan, et al.
Publicado: (2024)