When Big Models Train Small Ones: Label-Free Model Parity Alignment for Efficient Visual Question Answering using Small VLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Penamakuri, Abhirama Subramanyam, Singh, Navlika, Arora, Piyush, Mishra, Anand |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Visual Text Matters: Improving Text-KVQA with Visual Text Entity Knowledge-aware Large Multimodal Assistant
par: Penamakuri, Abhirama Subramanyam, et autres
Publié: (2024)
par: Penamakuri, Abhirama Subramanyam, et autres
Publié: (2024)
PatientVLM Meets DocVLM: Pre-Consultation Dialogue Between Vision-Language Models for Efficient Diagnosis
par: Lokesh, K, et autres
Publié: (2026)
par: Lokesh, K, et autres
Publié: (2026)
Mind the (Language) Gap: Towards Probing Numerical and Cross-Lingual Limits of LVLMs
par: Gautam, Somraj, et autres
Publié: (2025)
par: Gautam, Somraj, et autres
Publié: (2025)
BLADE: Bias-Linked Adaptive DEbiasing
par: Arora, Piyush, et autres
Publié: (2025)
par: Arora, Piyush, et autres
Publié: (2025)
Bharat Scene Text: A Novel Comprehensive Dataset and Benchmark for Indian Language Scene Text Understanding
par: De, Anik, et autres
Publié: (2025)
par: De, Anik, et autres
Publié: (2025)
Audiopedia: Audio QA with Knowledge
par: Penamakuri, Abhirama Subramanyam, et autres
Publié: (2024)
par: Penamakuri, Abhirama Subramanyam, et autres
Publié: (2024)
AD-Relight: Training-Free Banner Relighting via Illumination Translation with Diffusion Priors
par: Mishra, Rameshwar, et autres
Publié: (2026)
par: Mishra, Rameshwar, et autres
Publié: (2026)
Towards Perceiving Small Visual Details in Zero-shot Visual Question Answering with Multimodal LLMs
par: Zhang, Jiarui, et autres
Publié: (2023)
par: Zhang, Jiarui, et autres
Publié: (2023)
ReasonDrive: Efficient Visual Question Answering for Autonomous Vehicles with Reasoning-Enhanced Small Vision-Language Models
par: Chahe, Amirhosein, et autres
Publié: (2025)
par: Chahe, Amirhosein, et autres
Publié: (2025)
SmolLM2: When Smol Goes Big -- Data-Centric Training of a Small Language Model
par: Allal, Loubna Ben, et autres
Publié: (2025)
par: Allal, Loubna Ben, et autres
Publié: (2025)
The Role of Exploration Modules in Small Language Models for Knowledge Graph Question Answering
par: Cheng, Yi-Jie, et autres
Publié: (2025)
par: Cheng, Yi-Jie, et autres
Publié: (2025)
Parameter-Efficient VLMs for Gastrointestinal Endoscopy: Medical Image Generation and Clinical Visual Question Answering
par: Peter, Ojonugwa Oluwafemi Ejiga, et autres
Publié: (2026)
par: Peter, Ojonugwa Oluwafemi Ejiga, et autres
Publié: (2026)
Small Models, Big Insights: Leveraging Slim Proxy Models To Decide When and What to Retrieve for LLMs
par: Tan, Jiejun, et autres
Publié: (2024)
par: Tan, Jiejun, et autres
Publié: (2024)
Small Languages, Big Models: A Study of Continual Training on Languages of Norway
par: Samuel, David, et autres
Publié: (2024)
par: Samuel, David, et autres
Publié: (2024)
Free Form Medical Visual Question Answering in Radiology
par: Narayanan, Abhishek, et autres
Publié: (2024)
par: Narayanan, Abhishek, et autres
Publié: (2024)
ReTraceQA: Evaluating Reasoning Traces of Small Language Models in Commonsense Question Answering
par: Molfese, Francesco Maria, et autres
Publié: (2025)
par: Molfese, Francesco Maria, et autres
Publié: (2025)
Small Models, Big Impact: Efficient Corpus and Graph-Based Adaptation of Small Multilingual Language Models for Low-Resource Languages
par: Gurgurov, Daniil, et autres
Publié: (2025)
par: Gurgurov, Daniil, et autres
Publié: (2025)
Small Towns, Big Questions: Methodological Insights into Use Case Selection for Digital Twins in Small Towns
par: Temple, Lucy, et autres
Publié: (2025)
par: Temple, Lucy, et autres
Publié: (2025)
Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones
par: Zhmoginov, Andrey, et autres
Publié: (2025)
par: Zhmoginov, Andrey, et autres
Publié: (2025)
Image Synthesis with Graph Conditioning: CLIP-Guided Diffusion Models for Scene Graphs
par: Mishra, Rameshwar, et autres
Publié: (2024)
par: Mishra, Rameshwar, et autres
Publié: (2024)
Towards Reliable and Interpretable Document Question Answering via VLMs
par: Chen, Alessio, et autres
Publié: (2025)
par: Chen, Alessio, et autres
Publié: (2025)
MedLogic-AQA: Enhancing Medical Question Answering with Abstractive Models Focusing on Logical Structures
par: Zafar, Aizan, et autres
Publié: (2024)
par: Zafar, Aizan, et autres
Publié: (2024)
Selectively Answering Visual Questions
par: Eisenschlos, Julian Martin, et autres
Publié: (2024)
par: Eisenschlos, Julian Martin, et autres
Publié: (2024)
Efficient Multimodal Planning Agent for Visual Question-Answering
par: Chen, Zhuo, et autres
Publié: (2026)
par: Chen, Zhuo, et autres
Publié: (2026)
LCV2: An Efficient Pretraining-Free Framework for Grounded Visual Question Answering
par: Chen, Yuhan, et autres
Publié: (2024)
par: Chen, Yuhan, et autres
Publié: (2024)
SmallToLarge (S2L): Scalable Data Selection for Fine-tuning Large Language Models by Summarizing Training Trajectories of Small Models
par: Yang, Yu, et autres
Publié: (2024)
par: Yang, Yu, et autres
Publié: (2024)
Large Vision-Language Models for Remote Sensing Visual Question Answering
par: Siripong, Surasakdi, et autres
Publié: (2024)
par: Siripong, Surasakdi, et autres
Publié: (2024)
CLGRPO: Reasoning Ability Enhancement for Small VLMs
par: Wang, Fanyi, et autres
Publié: (2025)
par: Wang, Fanyi, et autres
Publié: (2025)
EvidenceMap: Learning Evidence Analysis to Unleash the Power of Small Language Models for Biomedical Question Answering
par: Zong, Chang, et autres
Publié: (2025)
par: Zong, Chang, et autres
Publié: (2025)
Evaluating Small Open LLMs for Medical Question Answering: A Practical Framework
par: Buskila, Avi-ad Avraam
Publié: (2026)
par: Buskila, Avi-ad Avraam
Publié: (2026)
Training Language Models to Reason Efficiently
par: Arora, Daman, et autres
Publié: (2025)
par: Arora, Daman, et autres
Publié: (2025)
When Models Decide and When They Bind: A Two-Stage Computation for Multiple-Choice Question-Answering
par: Wong, Hugh Mee, et autres
Publié: (2026)
par: Wong, Hugh Mee, et autres
Publié: (2026)
How Small is Big Enough? Open Labeled Datasets and the Development of Deep Learning
par: Souza, Daniel, et autres
Publié: (2024)
par: Souza, Daniel, et autres
Publié: (2024)
Big Reasoning with Small Models: Instruction Retrieval at Inference Time
par: Alkiek, Kenan, et autres
Publié: (2025)
par: Alkiek, Kenan, et autres
Publié: (2025)
Human Uncertainty-Aware Data Selection and Automatic Labeling in Visual Question Answering
par: Lan, Jian, et autres
Publié: (2025)
par: Lan, Jian, et autres
Publié: (2025)
Small Drafts, Big Verdict: Information-Intensive Visual Reasoning via Speculation
par: Liu, Yuhan, et autres
Publié: (2025)
par: Liu, Yuhan, et autres
Publié: (2025)
SycoPhantasy: Quantifying Sycophancy and Hallucination in Small Open Weight VLMs for Vision-Language Scoring of Fantasy Characters
par: Shah, Arya, et autres
Publié: (2026)
par: Shah, Arya, et autres
Publié: (2026)
LaPA: Latent Prompt Assist Model For Medical Visual Question Answering
par: Gu, Tiancheng, et autres
Publié: (2024)
par: Gu, Tiancheng, et autres
Publié: (2024)
Fusion of Domain-Adapted Vision and Language Models for Medical Visual Question Answering
par: Ha, Cuong Nhat, et autres
Publié: (2024)
par: Ha, Cuong Nhat, et autres
Publié: (2024)
Prompt Sensitivity and Answer Consistency of Small Open-Source Language Models for Clinical Question Answering in Low-Resource Healthcare
par: Hariprasad, Shravani
Publié: (2026)
par: Hariprasad, Shravani
Publié: (2026)
Documents similaires
-
Visual Text Matters: Improving Text-KVQA with Visual Text Entity Knowledge-aware Large Multimodal Assistant
par: Penamakuri, Abhirama Subramanyam, et autres
Publié: (2024) -
PatientVLM Meets DocVLM: Pre-Consultation Dialogue Between Vision-Language Models for Efficient Diagnosis
par: Lokesh, K, et autres
Publié: (2026) -
Mind the (Language) Gap: Towards Probing Numerical and Cross-Lingual Limits of LVLMs
par: Gautam, Somraj, et autres
Publié: (2025) -
BLADE: Bias-Linked Adaptive DEbiasing
par: Arora, Piyush, et autres
Publié: (2025) -
Bharat Scene Text: A Novel Comprehensive Dataset and Benchmark for Indian Language Scene Text Understanding
par: De, Anik, et autres
Publié: (2025)