Rule-Based Reinforcement Learning for Document Image Classification with Vision Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Jungo, Michael, Fischer, Andreas |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Zero-Shot Prompting and Few-Shot Fine-Tuning: Revisiting Document Image Classification Using Large Language Models
di: Scius-Bertrand, Anna, et al.
Pubblicazione: (2024)
di: Scius-Bertrand, Anna, et al.
Pubblicazione: (2024)
DocThinker: Explainable Multimodal Large Language Models with Rule-based Reinforcement Learning for Document Understanding
di: Yu, Wenwen, et al.
Pubblicazione: (2025)
di: Yu, Wenwen, et al.
Pubblicazione: (2025)
Large Language Models Facilitate Vision Reflection in Image Classification
di: An, Guoyuan, et al.
Pubblicazione: (2025)
di: An, Guoyuan, et al.
Pubblicazione: (2025)
Unified Reinforcement and Imitation Learning for Vision-Language Models
di: Lee, Byung-Kwan, et al.
Pubblicazione: (2025)
di: Lee, Byung-Kwan, et al.
Pubblicazione: (2025)
Data Adaptive Traceback for Vision-Language Foundation Models in Image Classification
di: Peng, Wenshuo, et al.
Pubblicazione: (2024)
di: Peng, Wenshuo, et al.
Pubblicazione: (2024)
Leveraging Vision-Language Models for Improving Domain Generalization in Image Classification
di: Addepalli, Sravanti, et al.
Pubblicazione: (2023)
di: Addepalli, Sravanti, et al.
Pubblicazione: (2023)
Queryable Prototype Multiple Instance Learning with Vision-Language Models for Incremental Whole Slide Image Classification
di: Gou, Jiaxiang, et al.
Pubblicazione: (2024)
di: Gou, Jiaxiang, et al.
Pubblicazione: (2024)
DIVA-DAF: A Deep Learning Framework for Historical Document Image Analysis
di: Vögtlin, Lars, et al.
Pubblicazione: (2022)
di: Vögtlin, Lars, et al.
Pubblicazione: (2022)
DocXplain: A Novel Model-Agnostic Explainability Method for Document Image Classification
di: Saifullah, Saifullah, et al.
Pubblicazione: (2024)
di: Saifullah, Saifullah, et al.
Pubblicazione: (2024)
Learning Concept-Driven Logical Rules for Interpretable and Generalizable Medical Image Classification
di: Gao, Yibo, et al.
Pubblicazione: (2025)
di: Gao, Yibo, et al.
Pubblicazione: (2025)
Image Classification with Deep Reinforcement Active Learning
di: Jiu, Mingyuan, et al.
Pubblicazione: (2024)
di: Jiu, Mingyuan, et al.
Pubblicazione: (2024)
TTRV: Test-Time Reinforcement Learning for Vision Language Models
di: Singh, Akshit, et al.
Pubblicazione: (2025)
di: Singh, Akshit, et al.
Pubblicazione: (2025)
GlobalDoc: A Cross-Modal Vision-Language Framework for Real-World Document Image Retrieval and Classification
di: Bakkali, Souhail, et al.
Pubblicazione: (2023)
di: Bakkali, Souhail, et al.
Pubblicazione: (2023)
Language-Guided Token Compression with Reinforcement Learning in Large Vision-Language Models
di: Cao, Sihan, et al.
Pubblicazione: (2026)
di: Cao, Sihan, et al.
Pubblicazione: (2026)
Zero-Shot Fine-Grained Image Classification Using Large Vision-Language Models
di: Atabuzzaman, Md., et al.
Pubblicazione: (2025)
di: Atabuzzaman, Md., et al.
Pubblicazione: (2025)
TransMed: Large Language Models Enhance Vision Transformer for Biomedical Image Classification
di: Zheng, Kaipeng, et al.
Pubblicazione: (2023)
di: Zheng, Kaipeng, et al.
Pubblicazione: (2023)
Boosting the Generalization and Reasoning of Vision Language Models with Curriculum Reinforcement Learning
di: Deng, Huilin, et al.
Pubblicazione: (2025)
di: Deng, Huilin, et al.
Pubblicazione: (2025)
Degradation-Aware Image Enhancement via Vision-Language Classification
di: Cai, Jie, et al.
Pubblicazione: (2025)
di: Cai, Jie, et al.
Pubblicazione: (2025)
OpenPath: Open-Set Active Learning for Pathology Image Classification via Pre-trained Vision-Language Models
di: Zhong, Lanfeng, et al.
Pubblicazione: (2025)
di: Zhong, Lanfeng, et al.
Pubblicazione: (2025)
Multi-View Synergistic Learning with Vision-Language Adaption for Low-Resource Biomedical Image Classification
di: Luo, Xiaoliu, et al.
Pubblicazione: (2026)
di: Luo, Xiaoliu, et al.
Pubblicazione: (2026)
Recognition through Reasoning: Reinforcing Image Geo-localization with Large Vision-Language Models
di: Li, Ling, et al.
Pubblicazione: (2025)
di: Li, Ling, et al.
Pubblicazione: (2025)
Enhancing Fine-Grained Image Classifications via Cascaded Vision Language Models
di: Wei, Canshi
Pubblicazione: (2024)
di: Wei, Canshi
Pubblicazione: (2024)
A Reinforcement Learning-Based Automatic Video Editing Method Using Pre-trained Vision-Language Model
di: Hu, Panwen, et al.
Pubblicazione: (2024)
di: Hu, Panwen, et al.
Pubblicazione: (2024)
Vision-Language Model Based Multi-Expert Fusion for CT Image Classification
di: Bai, Jianfa, et al.
Pubblicazione: (2026)
di: Bai, Jianfa, et al.
Pubblicazione: (2026)
Few-Shot Image Classification and Segmentation as Visual Question Answering Using Vision-Language Models
di: Meng, Tian, et al.
Pubblicazione: (2024)
di: Meng, Tian, et al.
Pubblicazione: (2024)
DocVCE: Diffusion-based Visual Counterfactual Explanations for Document Image Classification
di: Saifullah, Saifullah, et al.
Pubblicazione: (2025)
di: Saifullah, Saifullah, et al.
Pubblicazione: (2025)
ReCAD: Reinforcement Learning Enhanced Parametric CAD Model Generation with Vision-Language Models
di: Li, Jiahao, et al.
Pubblicazione: (2025)
di: Li, Jiahao, et al.
Pubblicazione: (2025)
Hierarchical Vision Transformer with Prototypes for Interpretable Medical Image Classification
di: Gallée, Luisa, et al.
Pubblicazione: (2025)
di: Gallée, Luisa, et al.
Pubblicazione: (2025)
MIRL: Mutual Information-Guided Reinforcement Learning for Vision-Language Models
di: Zhang, Yin, et al.
Pubblicazione: (2026)
di: Zhang, Yin, et al.
Pubblicazione: (2026)
Small Language Model Meets with Reinforced Vision Vocabulary
di: Wei, Haoran, et al.
Pubblicazione: (2024)
di: Wei, Haoran, et al.
Pubblicazione: (2024)
Reinforcement Learning Friendly Vision-Language Model for Minecraft
di: Jiang, Haobin, et al.
Pubblicazione: (2023)
di: Jiang, Haobin, et al.
Pubblicazione: (2023)
Cropper: Vision-Language Model for Image Cropping through In-Context Learning
di: Lee, Seung Hyun, et al.
Pubblicazione: (2024)
di: Lee, Seung Hyun, et al.
Pubblicazione: (2024)
Med-R1: Reinforcement Learning for Generalizable Medical Reasoning in Vision-Language Models
di: Lai, Yuxiang, et al.
Pubblicazione: (2025)
di: Lai, Yuxiang, et al.
Pubblicazione: (2025)
Intersectional Fairness in Vision-Language Models for Medical Image Disease Classification
di: Zhang, Yupeng, et al.
Pubblicazione: (2025)
di: Zhang, Yupeng, et al.
Pubblicazione: (2025)
ViLa-MIL: Dual-scale Vision-Language Multiple Instance Learning for Whole Slide Image Classification
di: Shi, Jiangbo, et al.
Pubblicazione: (2025)
di: Shi, Jiangbo, et al.
Pubblicazione: (2025)
ZeroSlide: Is Zero-Shot Classification Adequate for Lifelong Learning in Whole-Slide Image Analysis in the Era of Pathology Vision-Language Foundation Models?
di: Bui, Doanh C., et al.
Pubblicazione: (2025)
di: Bui, Doanh C., et al.
Pubblicazione: (2025)
VLM-CPL: Consensus Pseudo Labels from Vision-Language Models for Annotation-Free Pathological Image Classification
di: Zhong, Lanfeng, et al.
Pubblicazione: (2024)
di: Zhong, Lanfeng, et al.
Pubblicazione: (2024)
Accelerating Conditional Prompt Learning via Masked Image Modeling for Vision-Language Models
di: Bui, Phuoc-Nguyen, et al.
Pubblicazione: (2025)
di: Bui, Phuoc-Nguyen, et al.
Pubblicazione: (2025)
Fusion of Foundation and Vision Transformer Model Features for Dermatoscopic Image Classification
di: Mahbod, Amirreza, et al.
Pubblicazione: (2025)
di: Mahbod, Amirreza, et al.
Pubblicazione: (2025)
G1: Bootstrapping Perception and Reasoning Abilities of Vision-Language Model via Reinforcement Learning
di: Chen, Liang, et al.
Pubblicazione: (2025)
di: Chen, Liang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Zero-Shot Prompting and Few-Shot Fine-Tuning: Revisiting Document Image Classification Using Large Language Models
di: Scius-Bertrand, Anna, et al.
Pubblicazione: (2024) -
DocThinker: Explainable Multimodal Large Language Models with Rule-based Reinforcement Learning for Document Understanding
di: Yu, Wenwen, et al.
Pubblicazione: (2025) -
Large Language Models Facilitate Vision Reflection in Image Classification
di: An, Guoyuan, et al.
Pubblicazione: (2025) -
Unified Reinforcement and Imitation Learning for Vision-Language Models
di: Lee, Byung-Kwan, et al.
Pubblicazione: (2025) -
Data Adaptive Traceback for Vision-Language Foundation Models in Image Classification
di: Peng, Wenshuo, et al.
Pubblicazione: (2024)