Constantly Improving Image Models Need Constantly Improving Benchmarks
Fuente:
arXiv
Salvato in:
| Autori principali: | Ge, Jiaxin, Luo, Grace, Lee, Heekyung, Malpani, Nishant, Lian, Long, Wang, XuDong, Holynski, Aleksander, Darrell, Trevor, Min, Sewon, Chan, David M. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Dual-Process Image Generation
di: Luo, Grace, et al.
Pubblicazione: (2025)
di: Luo, Grace, et al.
Pubblicazione: (2025)
Reconstruction Alignment Improves Unified Multimodal Models
di: Xie, Ji, et al.
Pubblicazione: (2025)
di: Xie, Ji, et al.
Pubblicazione: (2025)
Diffusion Hyperfeatures: Searching Through Time and Space for Semantic Correspondence
di: Luo, Grace, et al.
Pubblicazione: (2023)
di: Luo, Grace, et al.
Pubblicazione: (2023)
Readout Guidance: Learning Control from Diffusion Features
di: Luo, Grace, et al.
Pubblicazione: (2023)
di: Luo, Grace, et al.
Pubblicazione: (2023)
Puzzled by Puzzles: When Vision-Language Models Can't Take a Hint
di: Lee, Heekyung, et al.
Pubblicazione: (2025)
di: Lee, Heekyung, et al.
Pubblicazione: (2025)
UnSAMv2: Self-Supervised Learning Enables Segment Anything at Any Granularity
di: Yu, Junwei, et al.
Pubblicazione: (2025)
di: Yu, Junwei, et al.
Pubblicazione: (2025)
Segment Anything without Supervision
di: Wang, XuDong, et al.
Pubblicazione: (2024)
di: Wang, XuDong, et al.
Pubblicazione: (2024)
Generate, but Verify: Reducing Hallucination in Vision-Language Models with Retrospective Resampling
di: Wu, Tsung-Han, et al.
Pubblicazione: (2025)
di: Wu, Tsung-Han, et al.
Pubblicazione: (2025)
Visual Lexicon: Rich Image Features in Language Space
di: Wang, XuDong, et al.
Pubblicazione: (2024)
di: Wang, XuDong, et al.
Pubblicazione: (2024)
TULIP: Towards Unified Language-Image Pretraining
di: Tang, Zineng, et al.
Pubblicazione: (2025)
di: Tang, Zineng, et al.
Pubblicazione: (2025)
Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens
di: Qin, Yiming, et al.
Pubblicazione: (2025)
di: Qin, Yiming, et al.
Pubblicazione: (2025)
Visually Prompted Benchmarks Are Surprisingly Fragile
di: Feng, Haiwen, et al.
Pubblicazione: (2025)
di: Feng, Haiwen, et al.
Pubblicazione: (2025)
VisGym: Diverse, Customizable, Scalable Environments for Multimodal Agents
di: Wang, Zirui, et al.
Pubblicazione: (2026)
di: Wang, Zirui, et al.
Pubblicazione: (2026)
Vision-Language Models Create Cross-Modal Task Representations
di: Luo, Grace, et al.
Pubblicazione: (2024)
di: Luo, Grace, et al.
Pubblicazione: (2024)
LLM-grounded Diffusion: Enhancing Prompt Understanding of Text-to-Image Diffusion Models with Large Language Models
di: Lian, Long, et al.
Pubblicazione: (2023)
di: Lian, Long, et al.
Pubblicazione: (2023)
Improving the Leading Constant of Matrix Multiplication
di: Alman, Josh, et al.
Pubblicazione: (2024)
di: Alman, Josh, et al.
Pubblicazione: (2024)
REOrdering Patches Improves Vision Models
di: Kutscher, Declan, et al.
Pubblicazione: (2025)
di: Kutscher, Declan, et al.
Pubblicazione: (2025)
Atlas: Multi-Scale Attention Improves Long Context Image Modeling
di: Agrawal, Kumar Krishna, et al.
Pubblicazione: (2025)
di: Agrawal, Kumar Krishna, et al.
Pubblicazione: (2025)
Frustratingly Simple Retrieval Improves Challenging, Reasoning-Intensive Benchmarks
di: Lyu, Xinxi, et al.
Pubblicazione: (2025)
di: Lyu, Xinxi, et al.
Pubblicazione: (2025)
Exponentially Improved Constant in Quantum Solution Extraction
di: Rendon, Gumaro
Pubblicazione: (2025)
di: Rendon, Gumaro
Pubblicazione: (2025)
Generative Image Dynamics
di: Li, Zhengqi, et al.
Pubblicazione: (2023)
di: Li, Zhengqi, et al.
Pubblicazione: (2023)
Improving Image Quality and Decreasing SAR With High Dielectric Constant Pads in 3 T Fetal MRI
di: Zhengyang Zhu, et al.
Pubblicazione: (2025)
di: Zhengyang Zhu, et al.
Pubblicazione: (2025)
Heterogeneous Time Constants Improve Stability in Equilibrium Propagation
di: Kubo, Yoshimasa, et al.
Pubblicazione: (2026)
di: Kubo, Yoshimasa, et al.
Pubblicazione: (2026)
Automated Discovery of Improved Constant Weight Binary Codes
di: Rosin, Christopher D.
Pubblicazione: (2026)
di: Rosin, Christopher D.
Pubblicazione: (2026)
Improved Upper Bound on Brun's Constant Under GRH
di: Dunn, Lachlan
Pubblicazione: (2025)
di: Dunn, Lachlan
Pubblicazione: (2025)
SegLLM: Multi-round Reasoning Segmentation
di: Wang, XuDong, et al.
Pubblicazione: (2024)
di: Wang, XuDong, et al.
Pubblicazione: (2024)
Legal aspects of trafficking for forced labour purposes in Europe
di: Rohit Malpani
Pubblicazione: (2006)
di: Rohit Malpani
Pubblicazione: (2006)
RAG over Thinking Traces Can Improve Reasoning Tasks
di: Arabzadeh, Negar, et al.
Pubblicazione: (2026)
di: Arabzadeh, Negar, et al.
Pubblicazione: (2026)
Recursive Visual Programming
di: Ge, Jiaxin, et al.
Pubblicazione: (2023)
di: Ge, Jiaxin, et al.
Pubblicazione: (2023)
The Sinful Church and Its Need for Constant Conversion
di: Agnes Slunitschek
Pubblicazione: (2024)
di: Agnes Slunitschek
Pubblicazione: (2024)
Constant Directivity Loudspeaker Beamforming
di: Luo, Yuancheng
Pubblicazione: (2024)
di: Luo, Yuancheng
Pubblicazione: (2024)
An Improved Upper Bound for the Euclidean TSP Constant Using Band Crossovers
di: Gaudio, Julia, et al.
Pubblicazione: (2026)
di: Gaudio, Julia, et al.
Pubblicazione: (2026)
Constant Acceleration Flow
di: Park, Dogyun, et al.
Pubblicazione: (2024)
di: Park, Dogyun, et al.
Pubblicazione: (2024)
Constant Current, Constant Temperature, and Constant Voltage Charging of EV Battery
di: Suman Saurav, et al.
Pubblicazione: (2026)
di: Suman Saurav, et al.
Pubblicazione: (2026)
Towards Deterministic Algorithms for Constant-Depth Factors of Constant-Depth Circuits
di: Kumar, Mrinal, et al.
Pubblicazione: (2024)
di: Kumar, Mrinal, et al.
Pubblicazione: (2024)
Enough Coin Flips Can Make LLMs Act Bayesian
di: Gupta, Ritwik, et al.
Pubblicazione: (2025)
di: Gupta, Ritwik, et al.
Pubblicazione: (2025)
GPS as a Control Signal for Image Generation
di: Feng, Chao, et al.
Pubblicazione: (2025)
di: Feng, Chao, et al.
Pubblicazione: (2025)
Beyond Constant-Temperature Reservoirs: A Stirling Cycle with Constant Heat-Generation Rate
di: Xia, Xinshu, et al.
Pubblicazione: (2025)
di: Xia, Xinshu, et al.
Pubblicazione: (2025)
LLM-grounded Video Diffusion Models
di: Lian, Long, et al.
Pubblicazione: (2023)
di: Lian, Long, et al.
Pubblicazione: (2023)
Learning a Generative Meta-Model of LLM Activations
di: Luo, Grace, et al.
Pubblicazione: (2026)
di: Luo, Grace, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Dual-Process Image Generation
di: Luo, Grace, et al.
Pubblicazione: (2025) -
Reconstruction Alignment Improves Unified Multimodal Models
di: Xie, Ji, et al.
Pubblicazione: (2025) -
Diffusion Hyperfeatures: Searching Through Time and Space for Semantic Correspondence
di: Luo, Grace, et al.
Pubblicazione: (2023) -
Readout Guidance: Learning Control from Diffusion Features
di: Luo, Grace, et al.
Pubblicazione: (2023) -
Puzzled by Puzzles: When Vision-Language Models Can't Take a Hint
di: Lee, Heekyung, et al.
Pubblicazione: (2025)