Data Adaptive Traceback for Vision-Language Foundation Models in Image Classification
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Peng, Wenshuo, Zhang, Kaipeng, Yang, Yue, Zhang, Hao, Qiao, Yu |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
T3M: Text Guided 3D Human Motion Synthesis from Speech
par: Peng, Wenshuo, et autres
Publié: (2024)
par: Peng, Wenshuo, et autres
Publié: (2024)
TransMed: Large Language Models Enhance Vision Transformer for Biomedical Image Classification
par: Zheng, Kaipeng, et autres
Publié: (2023)
par: Zheng, Kaipeng, et autres
Publié: (2023)
PyVision-RL: Forging Open Agentic Vision Models via RL
par: Zhao, Shitian, et autres
Publié: (2026)
par: Zhao, Shitian, et autres
Publié: (2026)
Dynamic Multimodal Evaluation with Flexible Complexity by Vision-Language Bootstrapping
par: Yang, Yue, et autres
Publié: (2024)
par: Yang, Yue, et autres
Publié: (2024)
SVBench: Evaluation of Video Generation Models on Social Reasoning
par: Peng, Wenshuo, et autres
Publié: (2025)
par: Peng, Wenshuo, et autres
Publié: (2025)
Dynamic Traceback Learning for Medical Report Generation
par: Ye, Shuchang, et autres
Publié: (2024)
par: Ye, Shuchang, et autres
Publié: (2024)
B-AVIBench: Towards Evaluating the Robustness of Large Vision-Language Model on Black-box Adversarial Visual-Instructions
par: Zhang, Hao, et autres
Publié: (2024)
par: Zhang, Hao, et autres
Publié: (2024)
ChartAssisstant: A Universal Chart Multimodal Language Model via Chart-to-Table Pre-training and Multitask Instruction Tuning
par: Meng, Fanqing, et autres
Publié: (2024)
par: Meng, Fanqing, et autres
Publié: (2024)
MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models
par: Meng, Fanqing, et autres
Publié: (2024)
par: Meng, Fanqing, et autres
Publié: (2024)
MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI
par: Ying, Kaining, et autres
Publié: (2024)
par: Ying, Kaining, et autres
Publié: (2024)
Towards Vision-Language Geo-Foundation Model: A Survey
par: Zhou, Yue, et autres
Publié: (2024)
par: Zhou, Yue, et autres
Publié: (2024)
WildWorld: A Large-Scale Dataset for Dynamic World Modeling with Actions and Explicit State toward Generative ARPG
par: Li, Zhen, et autres
Publié: (2026)
par: Li, Zhen, et autres
Publié: (2026)
PhyBench: A Physical Commonsense Benchmark for Evaluating Text-to-Image Models
par: Meng, Fanqing, et autres
Publié: (2024)
par: Meng, Fanqing, et autres
Publié: (2024)
Look Before Acting: Enhancing Vision Foundation Representations for Vision-Language-Action Models
par: Luo, Yulin, et autres
Publié: (2026)
par: Luo, Yulin, et autres
Publié: (2026)
TransAgent: Transfer Vision-Language Foundation Models with Heterogeneous Agent Collaboration
par: Guo, Yiwei, et autres
Publié: (2024)
par: Guo, Yiwei, et autres
Publié: (2024)
Vision-and-Language Navigation Today and Tomorrow: A Survey in the Era of Foundation Models
par: Zhang, Yue, et autres
Publié: (2024)
par: Zhang, Yue, et autres
Publié: (2024)
TinyLVLM-eHub: Towards Comprehensive and Efficient Evaluation for Large Vision-Language Models
par: Shao, Wenqi, et autres
Publié: (2023)
par: Shao, Wenqi, et autres
Publié: (2023)
Fusion of Foundation and Vision Transformer Model Features for Dermatoscopic Image Classification
par: Mahbod, Amirreza, et autres
Publié: (2025)
par: Mahbod, Amirreza, et autres
Publié: (2025)
Vision Foundation Models as Generalist Tokenizers for Image Generation
par: Zheng, Anlin, et autres
Publié: (2026)
par: Zheng, Anlin, et autres
Publié: (2026)
All-in-One: Transferring Vision Foundation Models into Stereo Matching
par: Zhou, Jingyi, et autres
Publié: (2024)
par: Zhou, Jingyi, et autres
Publié: (2024)
ViSpec: Accelerating Vision-Language Models with Vision-Aware Speculative Decoding
par: Kang, Jialiang, et autres
Publié: (2025)
par: Kang, Jialiang, et autres
Publié: (2025)
Yume: An Interactive World Generation Model
par: Mao, Xiaofeng, et autres
Publié: (2025)
par: Mao, Xiaofeng, et autres
Publié: (2025)
Zero-Shot Fine-Grained Image Classification Using Large Vision-Language Models
par: Atabuzzaman, Md., et autres
Publié: (2025)
par: Atabuzzaman, Md., et autres
Publié: (2025)
Position: Towards Implicit Prompt For Text-To-Image Models
par: Yang, Yue, et autres
Publié: (2024)
par: Yang, Yue, et autres
Publié: (2024)
Frequency-Aware Vision-Language Multimodality Generalization Network for Remote Sensing Image Classification
par: Zhang, Junjie, et autres
Publié: (2025)
par: Zhang, Junjie, et autres
Publié: (2025)
Image Fusion via Vision-Language Model
par: Zhao, Zixiang, et autres
Publié: (2024)
par: Zhao, Zixiang, et autres
Publié: (2024)
VLM-CPL: Consensus Pseudo Labels from Vision-Language Models for Annotation-Free Pathological Image Classification
par: Zhong, Lanfeng, et autres
Publié: (2024)
par: Zhong, Lanfeng, et autres
Publié: (2024)
VisionCLIP: An Med-AIGC based Ethical Language-Image Foundation Model for Generalizable Retina Image Analysis
par: Wei, Hao, et autres
Publié: (2024)
par: Wei, Hao, et autres
Publié: (2024)
InternSpatial: A Comprehensive Dataset for Spatial Reasoning in Vision-Language Models
par: Deng, Nianchen, et autres
Publié: (2025)
par: Deng, Nianchen, et autres
Publié: (2025)
WMVLM: Evaluating Diffusion Model Image Watermarking via Vision-Language Models
par: Yang, Zijin, et autres
Publié: (2026)
par: Yang, Zijin, et autres
Publié: (2026)
CLIP-Adapter: Better Vision-Language Models with Feature Adapters
par: Gao, Peng, et autres
Publié: (2021)
par: Gao, Peng, et autres
Publié: (2021)
Lightweight Adaptive Feature De-drifting for Compressed Image Classification
par: Peng, Long, et autres
Publié: (2024)
par: Peng, Long, et autres
Publié: (2024)
Zero-shot Shape Classification of Nanoparticles in SEM Images using Vision Foundation Models
par: Barnatan, Freida, et autres
Publié: (2025)
par: Barnatan, Freida, et autres
Publié: (2025)
SearchLVLMs: A Plug-and-Play Framework for Augmenting Large Vision-Language Models by Searching Up-to-Date Internet Knowledge
par: Li, Chuanhao, et autres
Publié: (2024)
par: Li, Chuanhao, et autres
Publié: (2024)
Vision-Language Semantic Aggregation Leveraging Foundation Model for Generalizable Medical Image Segmentation
par: Yu, Wenjun, et autres
Publié: (2025)
par: Yu, Wenjun, et autres
Publié: (2025)
Boosting Medical Image Classification with Segmentation Foundation Model
par: Gu, Pengfei, et autres
Publié: (2024)
par: Gu, Pengfei, et autres
Publié: (2024)
Rethinking Human Evaluation Protocol for Text-to-Video Models: Enhancing Reliability,Reproducibility, and Practicality
par: Zhang, Tianle, et autres
Publié: (2024)
par: Zhang, Tianle, et autres
Publié: (2024)
Text-Only Data Synthesis for Vision Language Model Training
par: Yu, Xiaomin, et autres
Publié: (2025)
par: Yu, Xiaomin, et autres
Publié: (2025)
Large Language Models Facilitate Vision Reflection in Image Classification
par: An, Guoyuan, et autres
Publié: (2025)
par: An, Guoyuan, et autres
Publié: (2025)
HydraPrompt: An Adaptive and Asymmetric Framework of Vision-Language Models for Synthetic Image Detection
par: Shi, Senyuan, et autres
Publié: (2026)
par: Shi, Senyuan, et autres
Publié: (2026)
Documents similaires
-
T3M: Text Guided 3D Human Motion Synthesis from Speech
par: Peng, Wenshuo, et autres
Publié: (2024) -
TransMed: Large Language Models Enhance Vision Transformer for Biomedical Image Classification
par: Zheng, Kaipeng, et autres
Publié: (2023) -
PyVision-RL: Forging Open Agentic Vision Models via RL
par: Zhao, Shitian, et autres
Publié: (2026) -
Dynamic Multimodal Evaluation with Flexible Complexity by Vision-Language Bootstrapping
par: Yang, Yue, et autres
Publié: (2024) -
SVBench: Evaluation of Video Generation Models on Social Reasoning
par: Peng, Wenshuo, et autres
Publié: (2025)