Enhancing Fine-Grained Image Classifications via Cascaded Vision Language Models
Fuente:
arXiv
Gespeichert in:
| 1. Verfasser: | Wei, Canshi |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
African or European Swallow? Benchmarking Large Vision-Language Models for Fine-Grained Object Classification
von: Geigle, Gregor, et al.
Veröffentlicht: (2024)
von: Geigle, Gregor, et al.
Veröffentlicht: (2024)
Finer: Investigating and Enhancing Fine-Grained Visual Concept Recognition in Large Vision Language Models
von: Kim, Jeonghwan, et al.
Veröffentlicht: (2024)
von: Kim, Jeonghwan, et al.
Veröffentlicht: (2024)
Fine-Grained Evaluation of Large Vision-Language Models in Autonomous Driving
von: Li, Yue, et al.
Veröffentlicht: (2025)
von: Li, Yue, et al.
Veröffentlicht: (2025)
Fine-Grained Verifiers: Preference Modeling as Next-token Prediction in Vision-Language Alignment
von: Cui, Chenhang, et al.
Veröffentlicht: (2024)
von: Cui, Chenhang, et al.
Veröffentlicht: (2024)
Enhancing Large Vision Language Models with Self-Training on Image Comprehension
von: Deng, Yihe, et al.
Veröffentlicht: (2024)
von: Deng, Yihe, et al.
Veröffentlicht: (2024)
LLM-based Hierarchical Concept Decomposition for Interpretable Fine-Grained Image Classification
von: Qu, Renyi, et al.
Veröffentlicht: (2024)
von: Qu, Renyi, et al.
Veröffentlicht: (2024)
Cerberus: Real-Time Video Anomaly Detection via Cascaded Vision-Language Models
von: Zheng, Yue, et al.
Veröffentlicht: (2025)
von: Zheng, Yue, et al.
Veröffentlicht: (2025)
Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models
von: Jiang, Jiachen, et al.
Veröffentlicht: (2025)
von: Jiang, Jiachen, et al.
Veröffentlicht: (2025)
Improving Brain-to-Image Reconstruction via Fine-Grained Text Bridging
von: Xia, Runze, et al.
Veröffentlicht: (2025)
von: Xia, Runze, et al.
Veröffentlicht: (2025)
Zero-Shot Fine-Grained Image Classification Using Large Vision-Language Models
von: Atabuzzaman, Md., et al.
Veröffentlicht: (2025)
von: Atabuzzaman, Md., et al.
Veröffentlicht: (2025)
MedRCube: A Multidimensional Framework for Fine-Grained and In-Depth Evaluation of MLLMs in Medical Imaging
von: Bao, Zhijie, et al.
Veröffentlicht: (2026)
von: Bao, Zhijie, et al.
Veröffentlicht: (2026)
Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization
von: Song, Yuhang, et al.
Veröffentlicht: (2024)
von: Song, Yuhang, et al.
Veröffentlicht: (2024)
UniFine: A Unified and Fine-grained Approach for Zero-shot Vision-Language Understanding
von: Wang, Zhecan, et al.
Veröffentlicht: (2023)
von: Wang, Zhecan, et al.
Veröffentlicht: (2023)
Pseudo-Prompt Generating in Pre-trained Vision-Language Models for Multi-Label Medical Image Classification
von: Ye, Yaoqin, et al.
Veröffentlicht: (2024)
von: Ye, Yaoqin, et al.
Veröffentlicht: (2024)
FineBench: Benchmarking and Enhancing Vision-Language Models for Fine-grained Human Activity Understanding
von: Faure, Gueter Josmy, et al.
Veröffentlicht: (2026)
von: Faure, Gueter Josmy, et al.
Veröffentlicht: (2026)
Detecting and Mitigating Hallucination in Large Vision Language Models via Fine-Grained AI Feedback
von: Xiao, Wenyi, et al.
Veröffentlicht: (2024)
von: Xiao, Wenyi, et al.
Veröffentlicht: (2024)
Do Vision Encoders Truly Explain Object Hallucination?: Mitigating Object Hallucination via Simple Fine-Grained CLIPScore
von: Oh, Hongseok, et al.
Veröffentlicht: (2025)
von: Oh, Hongseok, et al.
Veröffentlicht: (2025)
LEGO Co-builder: Exploring Fine-Grained Vision-Language Modeling for Multimodal LEGO Assembly Assistants
von: Huang, Haochen, et al.
Veröffentlicht: (2025)
von: Huang, Haochen, et al.
Veröffentlicht: (2025)
FGAIF: Aligning Large Vision-Language Models with Fine-grained AI Feedback
von: Jing, Liqiang, et al.
Veröffentlicht: (2024)
von: Jing, Liqiang, et al.
Veröffentlicht: (2024)
Look Again, Think Slowly: Enhancing Visual Reflection in Vision-Language Models
von: Jian, Pu, et al.
Veröffentlicht: (2025)
von: Jian, Pu, et al.
Veröffentlicht: (2025)
You May Speak Freely: Improving the Fine-Grained Visual Recognition Capabilities of Multimodal Large Language Models with Answer Extraction
von: Lawrence, Logan, et al.
Veröffentlicht: (2025)
von: Lawrence, Logan, et al.
Veröffentlicht: (2025)
Dynamic Embedding of Hierarchical Visual Features for Efficient Vision-Language Fine-Tuning
von: Wei, Xinyu, et al.
Veröffentlicht: (2025)
von: Wei, Xinyu, et al.
Veröffentlicht: (2025)
Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features
von: Mitra, Chancharik, et al.
Veröffentlicht: (2024)
von: Mitra, Chancharik, et al.
Veröffentlicht: (2024)
VisionPangu: A Compact and Fine-Grained Multimodal Assistant with 1.7B Parameters
von: Fan, Jiaxin, et al.
Veröffentlicht: (2026)
von: Fan, Jiaxin, et al.
Veröffentlicht: (2026)
Beyond Accuracy Optimization: Computer Vision Losses for Large Language Model Fine-Tuning
von: Cambrin, Daniele Rege, et al.
Veröffentlicht: (2024)
von: Cambrin, Daniele Rege, et al.
Veröffentlicht: (2024)
Aligning Modalities in Vision Large Language Models via Preference Fine-tuning
von: Zhou, Yiyang, et al.
Veröffentlicht: (2024)
von: Zhou, Yiyang, et al.
Veröffentlicht: (2024)
Benchmarking Large Language Models for Image Classification of Marine Mammals
von: Qi, Yijiashun, et al.
Veröffentlicht: (2024)
von: Qi, Yijiashun, et al.
Veröffentlicht: (2024)
IdealGPT: Iteratively Decomposing Vision and Language Reasoning via Large Language Models
von: You, Haoxuan, et al.
Veröffentlicht: (2023)
von: You, Haoxuan, et al.
Veröffentlicht: (2023)
VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training
von: Zhang, Jipeng, et al.
Veröffentlicht: (2025)
von: Zhang, Jipeng, et al.
Veröffentlicht: (2025)
Enhancing Abnormality Grounding for Vision Language Models with Knowledge Descriptions
von: Li, Jun, et al.
Veröffentlicht: (2025)
von: Li, Jun, et al.
Veröffentlicht: (2025)
An Explainable Biomedical Foundation Model via Large-Scale Concept-Enhanced Vision-Language Pre-training
von: Nie, Yuxiang, et al.
Veröffentlicht: (2025)
von: Nie, Yuxiang, et al.
Veröffentlicht: (2025)
Medical Image Synthesis via Fine-Grained Image-Text Alignment and Anatomy-Pathology Prompting
von: Chen, Wenting, et al.
Veröffentlicht: (2024)
von: Chen, Wenting, et al.
Veröffentlicht: (2024)
Expressive and Generalizable Low-rank Adaptation for Large Models via Slow Cascaded Learning
von: Li, Siwei, et al.
Veröffentlicht: (2024)
von: Li, Siwei, et al.
Veröffentlicht: (2024)
Dream-VL & Dream-VLA: Open Vision-Language and Vision-Language-Action Models with Diffusion Language Model Backbone
von: Ye, Jiacheng, et al.
Veröffentlicht: (2025)
von: Ye, Jiacheng, et al.
Veröffentlicht: (2025)
Seeing No Evil: Blinding Large Vision-Language Models to Safety Instructions via Adversarial Attention Hijacking
von: Li, Jingru, et al.
Veröffentlicht: (2026)
von: Li, Jingru, et al.
Veröffentlicht: (2026)
Cyclic Vision-Language Manipulator: Towards Reliable and Fine-Grained Image Interpretation for Automated Report Generation
von: Fang, Yingying, et al.
Veröffentlicht: (2024)
von: Fang, Yingying, et al.
Veröffentlicht: (2024)
PEFT A2Z: Parameter-Efficient Fine-Tuning Survey for Large Language and Vision Models
von: Prottasha, Nusrat Jahan, et al.
Veröffentlicht: (2025)
von: Prottasha, Nusrat Jahan, et al.
Veröffentlicht: (2025)
VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models
von: Kumar, Gokul Karthik, et al.
Veröffentlicht: (2025)
von: Kumar, Gokul Karthik, et al.
Veröffentlicht: (2025)
NAVIG: Natural Language-guided Analysis with Vision Language Models for Image Geo-localization
von: Zhang, Zheyuan, et al.
Veröffentlicht: (2025)
von: Zhang, Zheyuan, et al.
Veröffentlicht: (2025)
Glo-VLMs: Leveraging Vision-Language Models for Fine-Grained Diseased Glomerulus Classification
von: Guo, Zhenhao, et al.
Veröffentlicht: (2025)
von: Guo, Zhenhao, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
African or European Swallow? Benchmarking Large Vision-Language Models for Fine-Grained Object Classification
von: Geigle, Gregor, et al.
Veröffentlicht: (2024) -
Finer: Investigating and Enhancing Fine-Grained Visual Concept Recognition in Large Vision Language Models
von: Kim, Jeonghwan, et al.
Veröffentlicht: (2024) -
Fine-Grained Evaluation of Large Vision-Language Models in Autonomous Driving
von: Li, Yue, et al.
Veröffentlicht: (2025) -
Fine-Grained Verifiers: Preference Modeling as Next-token Prediction in Vision-Language Alignment
von: Cui, Chenhang, et al.
Veröffentlicht: (2024) -
Enhancing Large Vision Language Models with Self-Training on Image Comprehension
von: Deng, Yihe, et al.
Veröffentlicht: (2024)