Improve Vision Language Model Chain-of-thought Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Ruohong, Zhang, Bowen, Li, Yanghao, Zhang, Haotian, Sun, Zhiqing, Gan, Zhe, Yang, Yinfei, Pang, Ruoming, Yang, Yiming |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
How Well Do Vision-Language Models Understand Sequential Driving Scenes? A Sensitivity Study
par: Brusnicki, Roberto, et autres
Publié: (2026)
par: Brusnicki, Roberto, et autres
Publié: (2026)
MedAD-R1: Eliciting Consistent Reasoning in Interpretible Medical Anomaly Detection via Consistency-Reinforced Policy Optimization
par: Zhang, Haitao, et autres
Publié: (2026)
par: Zhang, Haitao, et autres
Publié: (2026)
POA: Pre-training Once for Models of All Sizes
par: Zhang, Yingying, et autres
Publié: (2024)
par: Zhang, Yingying, et autres
Publié: (2024)
Beyond Color and Lines: Zero-Shot Style-Specific Image Variations with Coordinated Semantics
par: Hu, Jinghao, et autres
Publié: (2024)
par: Hu, Jinghao, et autres
Publié: (2024)
JVLGS: Joint Vision-Language Gas Leak Segmentation
par: Zhao, Xinlong, et autres
Publié: (2025)
par: Zhao, Xinlong, et autres
Publié: (2025)
Masked Attention as a Mechanism for Improving Interpretability of Vision Transformers
par: Grisi, Clément, et autres
Publié: (2024)
par: Grisi, Clément, et autres
Publié: (2024)
Saliency-Aware Multi-Route Thinking: Revisiting Vision-Language Reasoning
par: Shi, Mingjia, et autres
Publié: (2026)
par: Shi, Mingjia, et autres
Publié: (2026)
Attention Maps in 3D Shape Classification for Dental Stage Estimation with Class Node Graph Attention Networks
par: Buyukcakir, Barkin, et autres
Publié: (2025)
par: Buyukcakir, Barkin, et autres
Publié: (2025)
MIRNet: Integrating Constrained Graph-Based Reasoning with Pre-training for Diagnostic Medical Imaging
par: Kong, Shufeng, et autres
Publié: (2025)
par: Kong, Shufeng, et autres
Publié: (2025)
Isolated Sign Language Recognition with Segmentation and Pose Estimation
par: Perkins, Daniel, et autres
Publié: (2025)
par: Perkins, Daniel, et autres
Publié: (2025)
Interactive Image Selection and Training for Brain Tumor Segmentation Network
par: Cerqueira, Matheus A., et autres
Publié: (2024)
par: Cerqueira, Matheus A., et autres
Publié: (2024)
Performance Decay in Deepfake Detection: The Limitations of Training on Outdated Data
par: Richings, Jack, et autres
Publié: (2025)
par: Richings, Jack, et autres
Publié: (2025)
TWIG: Two-Step Image Generation using Segmentation Masks in Diffusion Models
par: Rakib, Mazharul Islam, et autres
Publié: (2025)
par: Rakib, Mazharul Islam, et autres
Publié: (2025)
Perception-Consistency Multimodal Large Language Models Reasoning via Caption-Regularized Policy Optimization
par: Tu, Songjun, et autres
Publié: (2025)
par: Tu, Songjun, et autres
Publié: (2025)
TG-LMM: Enhancing Medical Image Segmentation Accuracy through Text-Guided Large Multi-Modal Model
par: Zhao, Yihao, et autres
Publié: (2024)
par: Zhao, Yihao, et autres
Publié: (2024)
Uncertainty and Prediction Quality Estimation for Semantic Segmentation via Graph Neural Networks
par: Heinert, Edgar, et autres
Publié: (2024)
par: Heinert, Edgar, et autres
Publié: (2024)
Steerable Pyramid Weighted Loss: Multi-Scale Adaptive Weighting for Semantic Segmentation
par: Lu, Renhao
Publié: (2025)
par: Lu, Renhao
Publié: (2025)
Few-shot crack image classification using clip based on bayesian optimization
par: Zhang, Yingchao, et autres
Publié: (2025)
par: Zhang, Yingchao, et autres
Publié: (2025)
Unlocking UML Class Diagram Understanding in Vision Language Models
par: Naboichenko, Artem, et autres
Publié: (2026)
par: Naboichenko, Artem, et autres
Publié: (2026)
Motion Consistency Loss for Monocular Visual Odometry with Attention-Based Deep Learning
par: Françani, André O., et autres
Publié: (2024)
par: Françani, André O., et autres
Publié: (2024)
MaizeEar-SAM: Zero-Shot Maize Ear Phenotyping
par: Zaremehrjerdi, Hossein, et autres
Publié: (2025)
par: Zaremehrjerdi, Hossein, et autres
Publié: (2025)
Combiner and HyperCombiner Networks: Rules to Combine Multimodality MR Images for Prostate Cancer Localisation
par: Yan, Wen, et autres
Publié: (2023)
par: Yan, Wen, et autres
Publié: (2023)
Computational Imaging Priors for Wireless Capsule Endoscopy: Monte Carlo-Guided Hemoglobin Mapping for Rare-Anomaly Detection
par: Yang, Chengshuai, et autres
Publié: (2026)
par: Yang, Chengshuai, et autres
Publié: (2026)
Faster Vision Mamba is Rebuilt in Minutes via Merged Token Re-training
par: Shi, Mingjia, et autres
Publié: (2024)
par: Shi, Mingjia, et autres
Publié: (2024)
Z-Order Transformer for Feed-Forward Gaussian Splatting
par: Wang, Can, et autres
Publié: (2026)
par: Wang, Can, et autres
Publié: (2026)
EatGAN: An Edge-Attention Guided Generative Adversarial Network for Single Image Super-Resolution
par: Rao, Penghao, et autres
Publié: (2025)
par: Rao, Penghao, et autres
Publié: (2025)
HelloMeme: Integrating Spatial Knitting Attentions to Embed High-Level and Fidelity-Rich Conditions in Diffusion Models
par: Zhang, Shengkai, et autres
Publié: (2024)
par: Zhang, Shengkai, et autres
Publié: (2024)
ViTNF: Leveraging Neural Fields to Boost Vision Transformers in Generalized Category Discovery
par: Su, Jiayi, et autres
Publié: (2025)
par: Su, Jiayi, et autres
Publié: (2025)
An Autoencoder and Vision Transformer-based Interpretability Analysis of the Differences in Automated Staging of Second and Third Molars
par: Buyukcakir, Barkin, et autres
Publié: (2025)
par: Buyukcakir, Barkin, et autres
Publié: (2025)
3D Convolutional Neural Networks for Improved Detection of Intracranial bleeding in CT Imaging
par: Subramanian, Bargava, et autres
Publié: (2025)
par: Subramanian, Bargava, et autres
Publié: (2025)
Enhancing Small Object Detection with YOLO: A Novel Framework for Improved Accuracy and Efficiency
par: Moghadami, Mahila, et autres
Publié: (2025)
par: Moghadami, Mahila, et autres
Publié: (2025)
Transformer-Based Model for Monocular Visual Odometry: A Video Understanding Approach
par: Françani, André O., et autres
Publié: (2023)
par: Françani, André O., et autres
Publié: (2023)
Poisson Flow Consistency Training
par: Zhang, Anthony, et autres
Publié: (2025)
par: Zhang, Anthony, et autres
Publié: (2025)
Deep Learning From Routine Histology Improves Risk Stratification for Biochemical Recurrence in Prostate Cancer
par: Grisi, Clément, et autres
Publié: (2026)
par: Grisi, Clément, et autres
Publié: (2026)
Point, Detect, Count: Multi-Task Medical Image Understanding with Instruction-Tuned Vision-Language Models
par: Gautam, Sushant, et autres
Publié: (2025)
par: Gautam, Sushant, et autres
Publié: (2025)
Classification of Diabetic Retinopathy using Pre-Trained Deep Learning Models
par: Al-Kamachy, Inas, et autres
Publié: (2024)
par: Al-Kamachy, Inas, et autres
Publié: (2024)
Context-Aware Multimodal Representation Learning for Spatio-Temporally Explicit Environmental Modelling
par: Peters, Julia, et autres
Publié: (2025)
par: Peters, Julia, et autres
Publié: (2025)
Ada-adapter:Fast Few-shot Style Personlization of Diffusion Model with Pre-trained Image Encoder
par: Liu, Jia, et autres
Publié: (2024)
par: Liu, Jia, et autres
Publié: (2024)
A Physics-Inspired Deep Learning Framework with Polar Coordinate Attention for Ptychographic Imaging
par: Yue, Han, et autres
Publié: (2024)
par: Yue, Han, et autres
Publié: (2024)
Building Brain Tumor Segmentation Networks with User-Assisted Filter Estimation and Selection
par: Cerqueira, Matheus A., et autres
Publié: (2024)
par: Cerqueira, Matheus A., et autres
Publié: (2024)
Documents similaires
-
How Well Do Vision-Language Models Understand Sequential Driving Scenes? A Sensitivity Study
par: Brusnicki, Roberto, et autres
Publié: (2026) -
MedAD-R1: Eliciting Consistent Reasoning in Interpretible Medical Anomaly Detection via Consistency-Reinforced Policy Optimization
par: Zhang, Haitao, et autres
Publié: (2026) -
POA: Pre-training Once for Models of All Sizes
par: Zhang, Yingying, et autres
Publié: (2024) -
Beyond Color and Lines: Zero-Shot Style-Specific Image Variations with Coordinated Semantics
par: Hu, Jinghao, et autres
Publié: (2024) -
JVLGS: Joint Vision-Language Gas Leak Segmentation
par: Zhao, Xinlong, et autres
Publié: (2025)