PathVLM-R1: A Reinforcement Learning-Driven Reasoning Model for Pathology Visual-Language Tasks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Jianyu, Yang, Hao, Zeng, Xinhua, He, Guibing, Chen, Zhiyu, Li, Zihui, Zhang, Xiaochuan, Ma, Yangyang, Fang, Run, Liu, Yang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MMC: Iterative Refinement of VLM Reasoning via MCTS-based Multimodal Critique
par: Liu, Shuhang, et autres
Publié: (2025)
par: Liu, Shuhang, et autres
Publié: (2025)
EmoVLM-KD: Fusing Distilled Expertise with Vision-Language Models for Visual Emotion Analysis
par: Lee, SangEun, et autres
Publié: (2025)
par: Lee, SangEun, et autres
Publié: (2025)
MM-InstructEval: Zero-Shot Evaluation of (Multimodal) Large Language Models on Multimodal Reasoning Tasks
par: Yang, Xiaocui, et autres
Publié: (2024)
par: Yang, Xiaocui, et autres
Publié: (2024)
GoT-R1: Unleashing Reasoning Capability of MLLM for Visual Generation with Reinforcement Learning
par: Duan, Chengqi, et autres
Publié: (2025)
par: Duan, Chengqi, et autres
Publié: (2025)
FakeSV-VLM: Taming VLM for Detecting Fake Short-Video News via Progressive Mixture-Of-Experts Adapter
par: Wang, Junxi, et autres
Publié: (2025)
par: Wang, Junxi, et autres
Publié: (2025)
ShieldVLM: Safeguarding the Multimodal Implicit Toxicity via Deliberative Reasoning with LVLMs
par: Cui, Shiyao, et autres
Publié: (2025)
par: Cui, Shiyao, et autres
Publié: (2025)
UniPath: Adaptive Coordination of Understanding and Generation for Unified Multimodal Reasoning
par: Bai, Hayes, et autres
Publié: (2026)
par: Bai, Hayes, et autres
Publié: (2026)
Feedback-Driven Rate Control for Learned Video Compression
par: Xu, Zhiheng, et autres
Publié: (2026)
par: Xu, Zhiheng, et autres
Publié: (2026)
MORE-R1: Guiding LVLM for Multimodal Object-Entity Relation Extraction via Stepwise Reasoning with Reinforcement Learning
par: Yuan, Xiang, et autres
Publié: (2026)
par: Yuan, Xiang, et autres
Publié: (2026)
MCSC-Bench: Multimodal Context-to-Script Creation for Realistic Video Production
par: Hu, Huanran, et autres
Publié: (2026)
par: Hu, Huanran, et autres
Publié: (2026)
Identity-Aware Vision-Language Model for Explainable Face Forgery Detection
par: Xu, Junhao, et autres
Publié: (2025)
par: Xu, Junhao, et autres
Publié: (2025)
EyEar: Learning Audio Synchronized Human Gaze Trajectory Based on Physics-Informed Dynamics
par: Liu, Xiaochuan, et autres
Publié: (2025)
par: Liu, Xiaochuan, et autres
Publié: (2025)
PathAsst: A Generative Foundation AI Assistant Towards Artificial General Intelligence of Pathology
par: Sun, Yuxuan, et autres
Publié: (2023)
par: Sun, Yuxuan, et autres
Publié: (2023)
VSpeechLM: A Visual Speech Language Model for Visual Text-to-Speech Task
par: Wang, Yuyue, et autres
Publié: (2025)
par: Wang, Yuyue, et autres
Publié: (2025)
AVID: A Benchmark for Omni-Modal Audio-Visual Inconsistency Understanding via Agent-Driven Construction
par: Chen, Zixuan, et autres
Publié: (2026)
par: Chen, Zixuan, et autres
Publié: (2026)
MMESGBench: Pioneering Multimodal Understanding and Complex Reasoning Benchmark for ESG Tasks
par: Zhang, Lei, et autres
Publié: (2025)
par: Zhang, Lei, et autres
Publié: (2025)
Enhancing Video Music Recommendation with Transformer-Driven Audio-Visual Embeddings
par: Liu, Shimiao, et autres
Publié: (2025)
par: Liu, Shimiao, et autres
Publié: (2025)
Dark Side of Modalities: Reinforced Multimodal Distillation for Multimodal Knowledge Graph Reasoning
par: Zhao, Yu, et autres
Publié: (2025)
par: Zhao, Yu, et autres
Publié: (2025)
Not Just What's There: Enabling CLIP to Comprehend Negated Visual Descriptions Without Fine-tuning
par: Xiao, Junhao, et autres
Publié: (2026)
par: Xiao, Junhao, et autres
Publié: (2026)
Towards Unified Representation of Multi-Modal Pre-training for 3D Understanding via Differentiable Rendering
par: Fei, Ben, et autres
Publié: (2024)
par: Fei, Ben, et autres
Publié: (2024)
MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding
par: Fang, Pengcheng, et autres
Publié: (2026)
par: Fang, Pengcheng, et autres
Publié: (2026)
LungCURE: Benchmarking Multimodal Real-World Clinical Reasoning for Precision Lung Cancer Diagnosis and Treatment
par: Hao, Fangyu, et autres
Publié: (2026)
par: Hao, Fangyu, et autres
Publié: (2026)
SCI-Reason: A Dataset with Chain-of-Thought Rationales for Complex Multimodal Reasoning in Academic Areas
par: Ma, Chenghao, et autres
Publié: (2025)
par: Ma, Chenghao, et autres
Publié: (2025)
TPIFM: A Task-Aware Model for Evaluating Perceptual Interaction Fluency in Remote AR Collaboration
par: Song, Jiarun, et autres
Publié: (2026)
par: Song, Jiarun, et autres
Publié: (2026)
MAR3: Multi-Agent Recognition, Reasoning, and Reflection for Reference Audio-Visual Segmentation
par: Zhao, Yuan, et autres
Publié: (2026)
par: Zhao, Yuan, et autres
Publié: (2026)
MViR: Multi-View Visual-Semantic Representation for Fake News Detection
par: Liang, Haochen, et autres
Publié: (2026)
par: Liang, Haochen, et autres
Publié: (2026)
History-Guided Iterative Visual Reasoning with Self-Correction
par: Yang, Xinglong, et autres
Publié: (2026)
par: Yang, Xinglong, et autres
Publié: (2026)
VRAgent-R1: Boosting Video Recommendation with MLLM-based Agents via Reinforcement Learning
par: Chen, Siran, et autres
Publié: (2025)
par: Chen, Siran, et autres
Publié: (2025)
Multimodal Semantic Communication for Generative Audio-Driven Video Conferencing
par: Tong, Haonan, et autres
Publié: (2024)
par: Tong, Haonan, et autres
Publié: (2024)
StyleSpeaker: Audio-Enhanced Fine-Grained Style Modeling for Speech-Driven 3D Facial Animation
par: Yang, An, et autres
Publié: (2025)
par: Yang, An, et autres
Publié: (2025)
Fully Automatic Content-Aware Tiling Pipeline for Pathology Whole Slide Images
par: Jabar, Falah, et autres
Publié: (2024)
par: Jabar, Falah, et autres
Publié: (2024)
Compact Visual Data Representation for Green Multimedia -- A Human Visual System Perspective
par: Chen, Peilin, et autres
Publié: (2024)
par: Chen, Peilin, et autres
Publié: (2024)
Manipulated Regions Localization For Partially Deepfake Audio: A Survey
par: He, Jiayi, et autres
Publié: (2025)
par: He, Jiayi, et autres
Publié: (2025)
Is One-Shot In-Context Learning Helpful for Data Selection in Task-Specific Fine-Tuning of Multimodal LLMs?
par: An, Xiao, et autres
Publié: (2026)
par: An, Xiao, et autres
Publié: (2026)
HumanVLM: Foundation for Human-Scene Vision-Language Model
par: Dai, Dawei, et autres
Publié: (2024)
par: Dai, Dawei, et autres
Publié: (2024)
MG-Former: A Transformer-Based Framework for Music-Driven 3D Conducting Gesture Generation
par: Qiu, Ke, et autres
Publié: (2026)
par: Qiu, Ke, et autres
Publié: (2026)
Federated Multi-Task Clustering
par: Dai, Suyan, et autres
Publié: (2025)
par: Dai, Suyan, et autres
Publié: (2025)
PRM-BAS: Enhancing Multimodal Reasoning through PRM-guided Beam Annealing Search
par: Hu, Pengfei, et autres
Publié: (2025)
par: Hu, Pengfei, et autres
Publié: (2025)
Dual-Stream Decoupled Learning for Temporal Consistency and Speaker Interaction in AVSD
par: Xiao, Junhao, et autres
Publié: (2025)
par: Xiao, Junhao, et autres
Publié: (2025)
The Interspeech 2026 Audio Reasoning Challenge: Evaluating Reasoning Process Quality for Audio Reasoning Models and Agents
par: Ma, Ziyang, et autres
Publié: (2026)
par: Ma, Ziyang, et autres
Publié: (2026)
Documents similaires
-
MMC: Iterative Refinement of VLM Reasoning via MCTS-based Multimodal Critique
par: Liu, Shuhang, et autres
Publié: (2025) -
EmoVLM-KD: Fusing Distilled Expertise with Vision-Language Models for Visual Emotion Analysis
par: Lee, SangEun, et autres
Publié: (2025) -
MM-InstructEval: Zero-Shot Evaluation of (Multimodal) Large Language Models on Multimodal Reasoning Tasks
par: Yang, Xiaocui, et autres
Publié: (2024) -
GoT-R1: Unleashing Reasoning Capability of MLLM for Visual Generation with Reinforcement Learning
par: Duan, Chengqi, et autres
Publié: (2025) -
FakeSV-VLM: Taming VLM for Detecting Fake Short-Video News via Progressive Mixture-Of-Experts Adapter
par: Wang, Junxi, et autres
Publié: (2025)