Efficient Test-Time Scaling for Small Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Kaya, Mehmet Onurcan, Elliott, Desmond, Papadopoulos, Dim P. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Visual Autoregressive Models Beat Diffusion Models on Inference Time Scaling
di: Riise, Erik, et al.
Pubblicazione: (2025)
di: Riise, Erik, et al.
Pubblicazione: (2025)
Boosting Unsupervised Video Instance Segmentation with Automatic Quality-Guided Self-Training
di: Lu, Kaixuan, et al.
Pubblicazione: (2025)
di: Lu, Kaixuan, et al.
Pubblicazione: (2025)
AutoQ-VIS: Improving Unsupervised Video Instance Segmentation via Automatic Quality Assessment
di: Lu, Kaixuan, et al.
Pubblicazione: (2025)
di: Lu, Kaixuan, et al.
Pubblicazione: (2025)
POEM: Precise Object-level Editing via MLLM control
di: Schouten, Marco, et al.
Pubblicazione: (2025)
di: Schouten, Marco, et al.
Pubblicazione: (2025)
DDRM-PR: Fourier Phase Retrieval using Denoising Diffusion Restoration Models
di: Kaya, Mehmet Onurcan, et al.
Pubblicazione: (2025)
di: Kaya, Mehmet Onurcan, et al.
Pubblicazione: (2025)
ImageChain: Advancing Sequential Image-to-Text Reasoning in Multimodal Large Language Models
di: Villegas, Danae Sánchez, et al.
Pubblicazione: (2025)
di: Villegas, Danae Sánchez, et al.
Pubblicazione: (2025)
I2I-PR: Deep Iterative Refinement for Phase Retrieval using Image-to-Image Diffusion Models
di: Kaya, Mehmet Onurcan, et al.
Pubblicazione: (2025)
di: Kaya, Mehmet Onurcan, et al.
Pubblicazione: (2025)
Reasoning Dynamics and the Limits of Monitoring Modality Reliance in Vision-Language Models
di: Villegas, Danae Sánchez, et al.
Pubblicazione: (2026)
di: Villegas, Danae Sánchez, et al.
Pubblicazione: (2026)
prNet: Data-Driven Phase Retrieval via Stochastic Refinement
di: Kaya, Mehmet Onurcan, et al.
Pubblicazione: (2025)
di: Kaya, Mehmet Onurcan, et al.
Pubblicazione: (2025)
Dual Prototype Evolving for Test-Time Generalization of Vision-Language Models
di: Zhang, Ce, et al.
Pubblicazione: (2024)
di: Zhang, Ce, et al.
Pubblicazione: (2024)
Shotluck Holmes: A Family of Efficient Small-Scale Large Language Vision Models For Video Captioning and Summarization
di: Luo, Richard, et al.
Pubblicazione: (2024)
di: Luo, Richard, et al.
Pubblicazione: (2024)
The Illusion of Progress? A Critical Look at Test-Time Adaptation for Vision-Language Models
di: Sheng, Lijun, et al.
Pubblicazione: (2025)
di: Sheng, Lijun, et al.
Pubblicazione: (2025)
Ramen: Robust Test-Time Adaptation of Vision-Language Models with Active Sample Selection
di: Bao, Wenxuan, et al.
Pubblicazione: (2026)
di: Bao, Wenxuan, et al.
Pubblicazione: (2026)
Fair Context Learning for Evidence-Balanced Test-Time Adaptation in Vision-Language Models
di: Yun, Sanggeon, et al.
Pubblicazione: (2026)
di: Yun, Sanggeon, et al.
Pubblicazione: (2026)
Training-Free Test-Time Adaptation with Brownian Distance Covariance in Vision-Language Models
di: Zhang, Yi, et al.
Pubblicazione: (2026)
di: Zhang, Yi, et al.
Pubblicazione: (2026)
BendVLM: Test-Time Debiasing of Vision-Language Embeddings
di: Gerych, Walter, et al.
Pubblicazione: (2024)
di: Gerych, Walter, et al.
Pubblicazione: (2024)
Test-Time Training for Visual Foresight Vision-Language-Action Models
di: Park, Sangwu, et al.
Pubblicazione: (2026)
di: Park, Sangwu, et al.
Pubblicazione: (2026)
Diversity Matters: Revisiting Test-Time Compute in Vision-Language Models
di: Tong, Yijie, et al.
Pubblicazione: (2026)
di: Tong, Yijie, et al.
Pubblicazione: (2026)
Mint: A Simple Test-Time Adaptation of Vision-Language Models against Common Corruptions
di: Bao, Wenxuan, et al.
Pubblicazione: (2025)
di: Bao, Wenxuan, et al.
Pubblicazione: (2025)
pix2pockets: Shot Suggestions in 8-Ball Pool from a Single Image in the Wild
di: Schiøtt, Jonas Myhre, et al.
Pubblicazione: (2025)
di: Schiøtt, Jonas Myhre, et al.
Pubblicazione: (2025)
Efficient Discriminative Joint Encoders for Large Scale Vision-Language Reranking
di: Taraday, Mitchell Keren, et al.
Pubblicazione: (2025)
di: Taraday, Mitchell Keren, et al.
Pubblicazione: (2025)
D-TPT: Dimensional Entropy Maximization for Calibrating Test-Time Prompt Tuning in Vision-Language Models
di: Han, Jisu, et al.
Pubblicazione: (2025)
di: Han, Jisu, et al.
Pubblicazione: (2025)
Multi-Modal Instruction-Tuning Small-Scale Language-and-Vision Assistant for Semiconductor Electron Micrograph Analysis
di: Srinivas, Sakhinana Sagar, et al.
Pubblicazione: (2024)
di: Srinivas, Sakhinana Sagar, et al.
Pubblicazione: (2024)
GRPO-TTA: Test-Time Visual Tuning for Vision-Language Models via GRPO-Driven Reinforcement Learning
di: Li, Yujun, et al.
Pubblicazione: (2026)
di: Li, Yujun, et al.
Pubblicazione: (2026)
Knowledge Transfer from Vision Foundation Models for Efficient Training of Small Task-specific Models
di: Vemulapalli, Raviteja, et al.
Pubblicazione: (2023)
di: Vemulapalli, Raviteja, et al.
Pubblicazione: (2023)
Doubly Debiased Test-Time Prompt Tuning for Vision-Language Models
di: Song, Fei, et al.
Pubblicazione: (2025)
di: Song, Fei, et al.
Pubblicazione: (2025)
Test-Time Iterative Error Correction for Efficient Diffusion Models
di: Zhong, Yunshan, et al.
Pubblicazione: (2025)
di: Zhong, Yunshan, et al.
Pubblicazione: (2025)
Attention Guided Alignment in Efficient Vision-Language Models
di: Mahajan, Shweta, et al.
Pubblicazione: (2025)
di: Mahajan, Shweta, et al.
Pubblicazione: (2025)
Development of a Neural Network Model for Currency Detection to aid visually impaired people in Nigeria
di: Nwokoye, Sochukwuma, et al.
Pubblicazione: (2025)
di: Nwokoye, Sochukwuma, et al.
Pubblicazione: (2025)
ReasonDrive: Efficient Visual Question Answering for Autonomous Vehicles with Reasoning-Enhanced Small Vision-Language Models
di: Chahe, Amirhosein, et al.
Pubblicazione: (2025)
di: Chahe, Amirhosein, et al.
Pubblicazione: (2025)
Scale, Don't Fine-tune: Guiding Multimodal LLMs for Efficient Visual Place Recognition at Test-Time
di: Cheng, Jintao, et al.
Pubblicazione: (2025)
di: Cheng, Jintao, et al.
Pubblicazione: (2025)
Pre-training of Lightweight Vision Transformers on Small Datasets with Minimally Scaled Images
di: Tan, Jen Hong
Pubblicazione: (2024)
di: Tan, Jen Hong
Pubblicazione: (2024)
Studying Image Diffusion Features for Zero-Shot Video Object Segmentation
di: Delatolas, Thanos, et al.
Pubblicazione: (2025)
di: Delatolas, Thanos, et al.
Pubblicazione: (2025)
Time-VLM: Exploring Multimodal Vision-Language Models for Augmented Time Series Forecasting
di: Zhong, Siru, et al.
Pubblicazione: (2025)
di: Zhong, Siru, et al.
Pubblicazione: (2025)
Adapting in the Dark: Efficient and Stable Test-Time Adaptation for Black-Box Models
di: Zhang, Yunbei, et al.
Pubblicazione: (2026)
di: Zhang, Yunbei, et al.
Pubblicazione: (2026)
Spurious Feature Eraser: Stabilizing Test-Time Adaptation for Vision-Language Foundation Model
di: Ma, Huan, et al.
Pubblicazione: (2024)
di: Ma, Huan, et al.
Pubblicazione: (2024)
Efficient and Long-Tailed Generalization for Pre-trained Vision-Language Model
di: Shi, Jiang-Xin, et al.
Pubblicazione: (2024)
di: Shi, Jiang-Xin, et al.
Pubblicazione: (2024)
Foundational Model for Electron Micrograph Analysis: Instruction-Tuning Small-Scale Language-and-Vision Assistant for Enterprise Adoption
di: Srinivas, Sakhinana Sagar, et al.
Pubblicazione: (2024)
di: Srinivas, Sakhinana Sagar, et al.
Pubblicazione: (2024)
Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders
di: Jiang, Yitong, et al.
Pubblicazione: (2026)
di: Jiang, Yitong, et al.
Pubblicazione: (2026)
Test-Time Spectrum-Aware Latent Steering for Zero-Shot Generalization in Vision-Language Models
di: Dafnis, Konstantinos M., et al.
Pubblicazione: (2025)
di: Dafnis, Konstantinos M., et al.
Pubblicazione: (2025)
Documenti analoghi
-
Visual Autoregressive Models Beat Diffusion Models on Inference Time Scaling
di: Riise, Erik, et al.
Pubblicazione: (2025) -
Boosting Unsupervised Video Instance Segmentation with Automatic Quality-Guided Self-Training
di: Lu, Kaixuan, et al.
Pubblicazione: (2025) -
AutoQ-VIS: Improving Unsupervised Video Instance Segmentation via Automatic Quality Assessment
di: Lu, Kaixuan, et al.
Pubblicazione: (2025) -
POEM: Precise Object-level Editing via MLLM control
di: Schouten, Marco, et al.
Pubblicazione: (2025) -
DDRM-PR: Fourier Phase Retrieval using Denoising Diffusion Restoration Models
di: Kaya, Mehmet Onurcan, et al.
Pubblicazione: (2025)