Difference Feedback: Generating Multimodal Process-Level Supervision for VLM Reinforcement Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Feiding, Zhang, Yongkang, Liao, Yuhao, Zeng, Zijian, Zhu, Chunzheng, Zheng, Yaozong, Liu, Yafei, Peng, Yeling, Wang, Youwei, Wang, Sibo, Yang, Huiming, Liao, Linglin, Yang, Shunzhi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Rethinking the Comparison Unit in Sequence-Level Reinforcement Learning: An Equal-Length Paired Training Framework from Loss Correction to Sample Construction
di: Ding, Fei, et al.
Pubblicazione: (2026)
di: Ding, Fei, et al.
Pubblicazione: (2026)
Internalizing Outcome Supervision into Process Supervision: A New Paradigm for Reinforcement Learning for Reasoning
di: Ding, Fei, et al.
Pubblicazione: (2026)
di: Ding, Fei, et al.
Pubblicazione: (2026)
PoseStreamer: A Multi-modal Framework for 3D Tracking of Unseen Moving Objects
di: Yang, Huiming, et al.
Pubblicazione: (2025)
di: Yang, Huiming, et al.
Pubblicazione: (2025)
DexSim2Real: Foundation Model-Guided Sim-to-Real Transfer for Generalizable Dexterous Manipulation
di: Zeng, Zijian, et al.
Pubblicazione: (2026)
di: Zeng, Zijian, et al.
Pubblicazione: (2026)
Reducing Credit Assignment Variance via Counterfactual Reasoning Paths
di: Ding, Fei, et al.
Pubblicazione: (2026)
di: Ding, Fei, et al.
Pubblicazione: (2026)
Spatial-aware Symmetric Alignment for Text-guided Medical Image Segmentation
di: Liao, Linglin, et al.
Pubblicazione: (2025)
di: Liao, Linglin, et al.
Pubblicazione: (2025)
Robust Accelerated Adaptive Search: High-Probability Complexity Bounds under Bounded-Moment Stochastic Oracles
di: Zhang, Shunzhi, et al.
Pubblicazione: (2026)
di: Zhang, Shunzhi, et al.
Pubblicazione: (2026)
Multi-Layer GRPO: Enhancing Reasoning and Self-Correction in Large Language Models
di: Ding, Fei, et al.
Pubblicazione: (2025)
di: Ding, Fei, et al.
Pubblicazione: (2025)
HELM: Harness-Enhanced Long-horizon Memory for Vision-Language-Action Manipulation
di: Zeng, Zijian, et al.
Pubblicazione: (2026)
di: Zeng, Zijian, et al.
Pubblicazione: (2026)
Design Conditions for Intra-Group Learning of Sequence-Level Rewards: Token Gradient Cancellation
di: Ding, Fei, et al.
Pubblicazione: (2026)
di: Ding, Fei, et al.
Pubblicazione: (2026)
Robust Insurance Pricing and Liquidity Management
di: Pang, Shunzhi
Pubblicazione: (2025)
di: Pang, Shunzhi
Pubblicazione: (2025)
Robust Investment-Driven Insurance Pricing under Correlation Ambiguity
di: Pang, Shunzhi
Pubblicazione: (2026)
di: Pang, Shunzhi
Pubblicazione: (2026)
Robust insurance pricing and liquidity management
di: Shunzhi Pang
Pubblicazione: (2026)
di: Shunzhi Pang
Pubblicazione: (2026)
CrossRay3D: Geometry and Distribution Guidance for Efficient Multimodal 3D Detection
di: Yang, Huiming, et al.
Pubblicazione: (2025)
di: Yang, Huiming, et al.
Pubblicazione: (2025)
Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning
di: Zhang, Di, et al.
Pubblicazione: (2024)
di: Zhang, Di, et al.
Pubblicazione: (2024)
Data-Incremental Continual Offline Reinforcement Learning
di: Gai, Sibo, et al.
Pubblicazione: (2024)
di: Gai, Sibo, et al.
Pubblicazione: (2024)
MM-SAP: A Comprehensive Benchmark for Assessing Self-Awareness of Multimodal Large Language Models in Perception
di: Wang, Yuhao, et al.
Pubblicazione: (2024)
di: Wang, Yuhao, et al.
Pubblicazione: (2024)
AlphaMath Almost Zero: Process Supervision without Process
di: Chen, Guoxin, et al.
Pubblicazione: (2024)
di: Chen, Guoxin, et al.
Pubblicazione: (2024)
RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback
di: Wang, Yufei, et al.
Pubblicazione: (2024)
di: Wang, Yufei, et al.
Pubblicazione: (2024)
VLM-Loc: Localization in Point Cloud Maps via Vision-Language Models
di: Kang, Shuhao, et al.
Pubblicazione: (2026)
di: Kang, Shuhao, et al.
Pubblicazione: (2026)
PEER: Unified Process-Outcome Reinforcement Learning for Structured Empathetic Reasoning
di: Wang, Yunxiao, et al.
Pubblicazione: (2025)
di: Wang, Yunxiao, et al.
Pubblicazione: (2025)
The equivalent condition for GRL codes to be MDS, AMDS or self-dual
di: Liang, Zhonghao, et al.
Pubblicazione: (2025)
di: Liang, Zhonghao, et al.
Pubblicazione: (2025)
The asymptotic estimation for two classes of generalized Fibonacci sub-sequences
di: Wan, Yongkang, et al.
Pubblicazione: (2025)
di: Wan, Yongkang, et al.
Pubblicazione: (2025)
The inverse of the (alternating) infinite sum of the reciprocal of the weighted sum for generalized Fibonacci sub-sequences
di: Wan, Yongkang, et al.
Pubblicazione: (2025)
di: Wan, Yongkang, et al.
Pubblicazione: (2025)
Boosting Self-Supervised Tracking with Contextual Prompts and Noise Learning
di: Zheng, Yaozong, et al.
Pubblicazione: (2026)
di: Zheng, Yaozong, et al.
Pubblicazione: (2026)
VLM-FO1: Bridging the Gap Between High-Level Reasoning and Fine-Grained Perception in VLMs
di: Liu, Peng, et al.
Pubblicazione: (2025)
di: Liu, Peng, et al.
Pubblicazione: (2025)
MedSynapse-V: Bridging Visual Perception and Clinical Intuition via Latent Memory Evolution
di: Zhu, Chunzheng, et al.
Pubblicazione: (2026)
di: Zhu, Chunzheng, et al.
Pubblicazione: (2026)
NeuSO: Neural Optimizer for Subgraph Queries
di: Yang, Linglin, et al.
Pubblicazione: (2025)
di: Yang, Linglin, et al.
Pubblicazione: (2025)
Anatomy-Anchored Self-Supervision: Distilling Vision Foundation Models for Invariant Ultrasound Representation
di: Zhu, Chunzheng, et al.
Pubblicazione: (2026)
di: Zhu, Chunzheng, et al.
Pubblicazione: (2026)
LLM-FK: Multi-Agent LLM Reasoning for Foreign Key Detection in Large-Scale Complex Databases
di: Tang, Zijian, et al.
Pubblicazione: (2026)
di: Tang, Zijian, et al.
Pubblicazione: (2026)
Hierarchical Cross-modal Prompt Learning for Vision-Language Models
di: Zheng, Hao, et al.
Pubblicazione: (2025)
di: Zheng, Hao, et al.
Pubblicazione: (2025)
VLM-CPL: Consensus Pseudo Labels from Vision-Language Models for Annotation-Free Pathological Image Classification
di: Zhong, Lanfeng, et al.
Pubblicazione: (2024)
di: Zhong, Lanfeng, et al.
Pubblicazione: (2024)
Hive: A Multi-Agent Infrastructure for Algorithm- and Task-Level Scaling
di: Luo, Zizhang, et al.
Pubblicazione: (2026)
di: Luo, Zizhang, et al.
Pubblicazione: (2026)
Mobile Recording Device Recognition Based Cross-Scale and Multi-Level Representation Learning
di: Zeng, Chunyan, et al.
Pubblicazione: (2024)
di: Zeng, Chunyan, et al.
Pubblicazione: (2024)
GrabS: Generative Embodied Agent for 3D Object Segmentation without Scene Supervision
di: Zhang, Zihui, et al.
Pubblicazione: (2025)
di: Zhang, Zihui, et al.
Pubblicazione: (2025)
A new class of self-orthogonal linear codes and their applications
di: Zhang, Yaozong, et al.
Pubblicazione: (2023)
di: Zhang, Yaozong, et al.
Pubblicazione: (2023)
Effect of Hydrogen Bonding Interaction on Kinetics of Cyclopentanol Reaction With Hydroperoxyl Radical at Atmospheric and Combustion Temperatures: A Theoretical Study
di: Yaozong Duan, et al.
Pubblicazione: (2025)
di: Yaozong Duan, et al.
Pubblicazione: (2025)
FlashVLM: Text-Guided Visual Token Selection for Large Multimodal Models
di: Cai, Kaitong, et al.
Pubblicazione: (2025)
di: Cai, Kaitong, et al.
Pubblicazione: (2025)
Effects and Mechanisms of Extracellular Vesicles in Different Models of Acute Kidney Injury
di: Weidong Wang, et al.
Pubblicazione: (2025)
di: Weidong Wang, et al.
Pubblicazione: (2025)
WebGen-Agent: Enhancing Interactive Website Generation with Multi-Level Feedback and Step-Level Reinforcement Learning
di: Lu, Zimu, et al.
Pubblicazione: (2025)
di: Lu, Zimu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Rethinking the Comparison Unit in Sequence-Level Reinforcement Learning: An Equal-Length Paired Training Framework from Loss Correction to Sample Construction
di: Ding, Fei, et al.
Pubblicazione: (2026) -
Internalizing Outcome Supervision into Process Supervision: A New Paradigm for Reinforcement Learning for Reasoning
di: Ding, Fei, et al.
Pubblicazione: (2026) -
PoseStreamer: A Multi-modal Framework for 3D Tracking of Unseen Moving Objects
di: Yang, Huiming, et al.
Pubblicazione: (2025) -
DexSim2Real: Foundation Model-Guided Sim-to-Real Transfer for Generalizable Dexterous Manipulation
di: Zeng, Zijian, et al.
Pubblicazione: (2026) -
Reducing Credit Assignment Variance via Counterfactual Reasoning Paths
di: Ding, Fei, et al.
Pubblicazione: (2026)