When Do We Not Need Larger Vision Models?
Fuente:
arXiv
Salvato in:
| Autori principali: | Shi, Baifeng, Wu, Ziyang, Mao, Maolin, Wang, Xin, Darrell, Trevor |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LLM-grounded Video Diffusion Models
di: Lian, Long, et al.
Pubblicazione: (2023)
di: Lian, Long, et al.
Pubblicazione: (2023)
Recursive Visual Programming
di: Ge, Jiaxin, et al.
Pubblicazione: (2023)
di: Ge, Jiaxin, et al.
Pubblicazione: (2023)
LLARVA: Vision-Action Instruction Tuning Enhances Robot Learning
di: Niu, Dantong, et al.
Pubblicazione: (2024)
di: Niu, Dantong, et al.
Pubblicazione: (2024)
xT: Nested Tokenization for Larger Context in Large Images
di: Gupta, Ritwik, et al.
Pubblicazione: (2024)
di: Gupta, Ritwik, et al.
Pubblicazione: (2024)
Scaling Vision Pre-Training to 4K Resolution
di: Shi, Baifeng, et al.
Pubblicazione: (2025)
di: Shi, Baifeng, et al.
Pubblicazione: (2025)
Do We Need Reformer for Vision? An Experimental Comparison with Vision Transformers
di: Bellaj, Ali El, et al.
Pubblicazione: (2025)
di: Bellaj, Ali El, et al.
Pubblicazione: (2025)
Rethinking Patch Dependence for Masked Autoencoders
di: Fu, Letian, et al.
Pubblicazione: (2024)
di: Fu, Letian, et al.
Pubblicazione: (2024)
Vision-Language Models Create Cross-Modal Task Representations
di: Luo, Grace, et al.
Pubblicazione: (2024)
di: Luo, Grace, et al.
Pubblicazione: (2024)
Puzzled by Puzzles: When Vision-Language Models Can't Take a Hint
di: Lee, Heekyung, et al.
Pubblicazione: (2025)
di: Lee, Heekyung, et al.
Pubblicazione: (2025)
MambaOut: Do We Really Need Mamba for Vision?
di: Yu, Weihao, et al.
Pubblicazione: (2024)
di: Yu, Weihao, et al.
Pubblicazione: (2024)
Humanoid Locomotion as Next Token Prediction
di: Radosavovic, Ilija, et al.
Pubblicazione: (2024)
di: Radosavovic, Ilija, et al.
Pubblicazione: (2024)
Do Less, Achieve More: Do We Need Every-Step Optimization for RL Fine-tuning of Diffusion Models?
di: Yan, Renye, et al.
Pubblicazione: (2026)
di: Yan, Renye, et al.
Pubblicazione: (2026)
Generate, but Verify: Reducing Hallucination in Vision-Language Models with Retrospective Resampling
di: Wu, Tsung-Han, et al.
Pubblicazione: (2025)
di: Wu, Tsung-Han, et al.
Pubblicazione: (2025)
When Does Perceptual Alignment Benefit Vision Representations?
di: Sundaram, Shobhita, et al.
Pubblicazione: (2024)
di: Sundaram, Shobhita, et al.
Pubblicazione: (2024)
FoundationMotion: Auto-Labeling and Reasoning about Spatial Movement in Videos
di: Gan, Yulu, et al.
Pubblicazione: (2025)
di: Gan, Yulu, et al.
Pubblicazione: (2025)
Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC
di: Tao, Ming, et al.
Pubblicazione: (2024)
di: Tao, Ming, et al.
Pubblicazione: (2024)
LLM-grounded Diffusion: Enhancing Prompt Understanding of Text-to-Image Diffusion Models with Large Language Models
di: Lian, Long, et al.
Pubblicazione: (2023)
di: Lian, Long, et al.
Pubblicazione: (2023)
Do Vision Language Models Need to Process Image Tokens?
di: Ghosh, Sambit, et al.
Pubblicazione: (2026)
di: Ghosh, Sambit, et al.
Pubblicazione: (2026)
Constantly Improving Image Models Need Constantly Improving Benchmarks
di: Ge, Jiaxin, et al.
Pubblicazione: (2025)
di: Ge, Jiaxin, et al.
Pubblicazione: (2025)
What Are We Measuring When We Evaluate Large Vision-Language Models? An Analysis of Latent Factors and Biases
di: Tiong, Anthony Meng Huat, et al.
Pubblicazione: (2024)
di: Tiong, Anthony Meng Huat, et al.
Pubblicazione: (2024)
How Much of a Model Do We Need? Redundancy and Slimmability in Remote Sensing Foundation Models
di: Hackel, Leonard, et al.
Pubblicazione: (2026)
di: Hackel, Leonard, et al.
Pubblicazione: (2026)
DAVE: A VLM Vision Encoder for Document Understanding and Web Agents
di: Huang, Brandon, et al.
Pubblicazione: (2025)
di: Huang, Brandon, et al.
Pubblicazione: (2025)
Do We Need Perfect Data? Leveraging Noise for Domain Generalized Segmentation
di: Kim, Taeyeong, et al.
Pubblicazione: (2025)
di: Kim, Taeyeong, et al.
Pubblicazione: (2025)
Attend Before Attention: Efficient and Scalable Video Understanding via Autoregressive Gazing
di: Shi, Baifeng, et al.
Pubblicazione: (2026)
di: Shi, Baifeng, et al.
Pubblicazione: (2026)
REOrdering Patches Improves Vision Models
di: Kutscher, Declan, et al.
Pubblicazione: (2025)
di: Kutscher, Declan, et al.
Pubblicazione: (2025)
Visual Haystacks: A Vision-Centric Needle-In-A-Haystack Benchmark
di: Wu, Tsung-Han, et al.
Pubblicazione: (2024)
di: Wu, Tsung-Han, et al.
Pubblicazione: (2024)
Hierarchical Invariance for Robust and Interpretable Vision Tasks at Larger Scales
di: Qi, Shuren, et al.
Pubblicazione: (2024)
di: Qi, Shuren, et al.
Pubblicazione: (2024)
Segment Anything without Supervision
di: Wang, XuDong, et al.
Pubblicazione: (2024)
di: Wang, XuDong, et al.
Pubblicazione: (2024)
Do We Really Need a Complex Agent System? Distill Embodied Agent into a Single Model
di: Zhao, Zhonghan, et al.
Pubblicazione: (2024)
di: Zhao, Zhonghan, et al.
Pubblicazione: (2024)
Do We Really Need a Large Number of Visual Prompts?
di: Kim, Youngeun, et al.
Pubblicazione: (2023)
di: Kim, Youngeun, et al.
Pubblicazione: (2023)
Do We Need All the Synthetic Data? Targeted Image Augmentation via Diffusion Models
di: Nguyen, Dang, et al.
Pubblicazione: (2025)
di: Nguyen, Dang, et al.
Pubblicazione: (2025)
Do VLMs Need Vision Transformers? Evaluating State Space Models as Vision Encoders
di: Kuo, Shang-Jui Ray, et al.
Pubblicazione: (2026)
di: Kuo, Shang-Jui Ray, et al.
Pubblicazione: (2026)
Fast Image-based Neural Relighting with Translucency-Reflection Modeling
di: Zhu, Shizhan, et al.
Pubblicazione: (2023)
di: Zhu, Shizhan, et al.
Pubblicazione: (2023)
Vision Transformers Need More Than Registers
di: Shi, Cheng, et al.
Pubblicazione: (2026)
di: Shi, Cheng, et al.
Pubblicazione: (2026)
Learning to Grasp Anything by Playing with Random Toys
di: Niu, Dantong, et al.
Pubblicazione: (2025)
di: Niu, Dantong, et al.
Pubblicazione: (2025)
Readout Guidance: Learning Control from Diffusion Features
di: Luo, Grace, et al.
Pubblicazione: (2023)
di: Luo, Grace, et al.
Pubblicazione: (2023)
Do we Really Need Visual Instructions? Towards Visual Instruction-Free Fine-tuning for Large Vision-Language Models
di: Liu, Zikang, et al.
Pubblicazione: (2025)
di: Liu, Zikang, et al.
Pubblicazione: (2025)
Tracking Meets LoRA: Faster Training, Larger Model, Stronger Performance
di: Lin, Liting, et al.
Pubblicazione: (2024)
di: Lin, Liting, et al.
Pubblicazione: (2024)
Larger than memory image processing
di: Sporring, Jon, et al.
Pubblicazione: (2026)
di: Sporring, Jon, et al.
Pubblicazione: (2026)
Finding Visual Task Vectors
di: Hojel, Alberto, et al.
Pubblicazione: (2024)
di: Hojel, Alberto, et al.
Pubblicazione: (2024)
Documenti analoghi
-
LLM-grounded Video Diffusion Models
di: Lian, Long, et al.
Pubblicazione: (2023) -
Recursive Visual Programming
di: Ge, Jiaxin, et al.
Pubblicazione: (2023) -
LLARVA: Vision-Action Instruction Tuning Enhances Robot Learning
di: Niu, Dantong, et al.
Pubblicazione: (2024) -
xT: Nested Tokenization for Larger Context in Large Images
di: Gupta, Ritwik, et al.
Pubblicazione: (2024) -
Scaling Vision Pre-Training to 4K Resolution
di: Shi, Baifeng, et al.
Pubblicazione: (2025)