Learning What Matters: Dynamic Dimension Selection and Aggregation for Interpretable Vision-Language Reward Modeling
Fuente:
arXiv
Saved in:
| Main Authors: | Chen, Qiyuan, Huang, Hongsen, Chen, Jiahe, Shao, Qian, Chen, Jintai, Xu, Hongxia, Hua, Renjie, Ren, Chuan, Wu, Jian |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Icon$^{2}$: Aligning Large Language Models Using Self-Synthetic Preference Data via Inherent Regulation
by: Chen, Qiyuan, et al.
Published: (2025)
by: Chen, Qiyuan, et al.
Published: (2025)
CC-GSEO-Bench: A Content-Centric Benchmark for Measuring Source Influence in Generative Search Engines
by: Chen, Qiyuan, et al.
Published: (2025)
by: Chen, Qiyuan, et al.
Published: (2025)
Curing Semantic Drift: A Dynamic Approach to Grounding Generation in Large Vision-Language Models
by: Chen, Jiahe, et al.
Published: (2025)
by: Chen, Jiahe, et al.
Published: (2025)
Towards Clinical Practice in CT-Based Pulmonary Disease Screening: An Efficient and Reliable Framework
by: Shao, Qian, et al.
Published: (2024)
by: Shao, Qian, et al.
Published: (2024)
Mind's Mirror: Distilling Self-Evaluation Capability and Comprehensive Thinking from Large Language Models
by: Liu, Weize, et al.
Published: (2023)
by: Liu, Weize, et al.
Published: (2023)
Enhancing Semi-Supervised Learning via Representative and Diverse Sample Selection
by: Shao, Qian, et al.
Published: (2024)
by: Shao, Qian, et al.
Published: (2024)
MM-DADM: Multimodal Drug-Aware Diffusion Model for Virtual Clinical Trials
by: Shao, Qian, et al.
Published: (2025)
by: Shao, Qian, et al.
Published: (2025)
Saliency-R1: Enforcing Interpretable and Faithful Vision-language Reasoning via Saliency-map Alignment Reward
by: Gong, Shizhan, et al.
Published: (2026)
by: Gong, Shizhan, et al.
Published: (2026)
LKM-UNet: Large Kernel Vision Mamba UNet for Medical Image Segmentation
by: Wang, Jinhong, et al.
Published: (2024)
by: Wang, Jinhong, et al.
Published: (2024)
Multi-rater Prompting for Ambiguous Medical Image Segmentation
by: Wang, Jinhong, et al.
Published: (2024)
by: Wang, Jinhong, et al.
Published: (2024)
Unraveling Babel: Exploring Multilingual Activation Patterns of LLMs and Their Applications
by: Liu, Weize, et al.
Published: (2024)
by: Liu, Weize, et al.
Published: (2024)
Making Pre-trained Language Models Great on Tabular Prediction
by: Yan, Jiahuan, et al.
Published: (2024)
by: Yan, Jiahuan, et al.
Published: (2024)
Med-Scout: Curing MLLMs' Geometric Blindness in Medical Perception via Geometry-Aware RL Post-Training
by: Liu, Anglin, et al.
Published: (2026)
by: Liu, Anglin, et al.
Published: (2026)
TeleOR: Real-time Telemedicine System for Full-Scene Operating Room
by: Wu, Yixuan, et al.
Published: (2024)
by: Wu, Yixuan, et al.
Published: (2024)
Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey
by: Liu, Qiyuan, et al.
Published: (2025)
by: Liu, Qiyuan, et al.
Published: (2025)
ARIA: Training Language Agents with Intention-Driven Reward Aggregation
by: Yang, Ruihan, et al.
Published: (2025)
by: Yang, Ruihan, et al.
Published: (2025)
Interpretability Transfer from Language to Vision via Sparse Autoencoders
by: Kravets, Alexey, et al.
Published: (2026)
by: Kravets, Alexey, et al.
Published: (2026)
STORM: Benchmarking Visual Rating of MLLMs with a Comprehensive Ordinal Regression Dataset
by: Wang, Jinhong, et al.
Published: (2025)
by: Wang, Jinhong, et al.
Published: (2025)
Alleviating Hallucination in Large Vision-Language Models with Active Retrieval Augmentation
by: Qu, Xiaoye, et al.
Published: (2024)
by: Qu, Xiaoye, et al.
Published: (2024)
OrderChain: Towards General Instruct-Tuning for Stimulating the Ordinal Understanding Ability of MLLM
by: Wang, Jinhong, et al.
Published: (2025)
by: Wang, Jinhong, et al.
Published: (2025)
Efficient Safety Alignment of Large Language Models via Preference Re-ranking and Representation-based Reward Modeling
by: Deng, Qiyuan, et al.
Published: (2025)
by: Deng, Qiyuan, et al.
Published: (2025)
A base change framework for tensor functions
by: Chen, Qiyuan
Published: (2026)
by: Chen, Qiyuan
Published: (2026)
Regionalized Metric Framework: A Novel Approach for Evaluating Multimodal Multi-Objective Optimization Algorithms
by: Chen, Jintai, et al.
Published: (2025)
by: Chen, Jintai, et al.
Published: (2025)
Calibrated Self-Rewarding Vision Language Models
by: Zhou, Yiyang, et al.
Published: (2024)
by: Zhou, Yiyang, et al.
Published: (2024)
URPO: A Unified Reward & Policy Optimization Framework for Large Language Models
by: Lu, Songshuo, et al.
Published: (2025)
by: Lu, Songshuo, et al.
Published: (2025)
ClinicalAgent: Clinical Trial Multi-Agent System with Large Language Model-based Reasoning
by: Yue, Ling, et al.
Published: (2024)
by: Yue, Ling, et al.
Published: (2024)
TrialEnroll: Predicting Clinical Trial Enrollment Success with Deep & Cross Network and Large Language Models
by: Yue, Ling, et al.
Published: (2024)
by: Yue, Ling, et al.
Published: (2024)
ViLBench: A Suite for Vision-Language Process Reward Modeling
by: Tu, Haoqin, et al.
Published: (2025)
by: Tu, Haoqin, et al.
Published: (2025)
Unveiling Chain of Step Reasoning for Vision-Language Models with Fine-grained Rewards
by: Chen, Honghao, et al.
Published: (2025)
by: Chen, Honghao, et al.
Published: (2025)
A quasi-optimal lower bound for skew polynomial multiplication
by: Chen, Qiyuan, et al.
Published: (2024)
by: Chen, Qiyuan, et al.
Published: (2024)
A Survey on Ordinal Regression: Applications, Advances and Prospects
by: Wang, Jinhong, et al.
Published: (2025)
by: Wang, Jinhong, et al.
Published: (2025)
Revisiting Cross-Architecture Distillation: Adaptive Dual-Teacher Transfer for Lightweight Video Models
by: Peng, Ying, et al.
Published: (2025)
by: Peng, Ying, et al.
Published: (2025)
Simultaneous 3D Object Segmentation and 6-DOF Pose Estimation
by: Liu, Hongsen
Published: (2019)
by: Liu, Hongsen
Published: (2019)
What Matters in Building Vision-Language-Action Models for Generalist Robots
by: Li, Xinghang, et al.
Published: (2024)
by: Li, Xinghang, et al.
Published: (2024)
Through the Valley: Path to Effective Long CoT Training for Small Language Models
by: Luo, Renjie, et al.
Published: (2025)
by: Luo, Renjie, et al.
Published: (2025)
Seeing What Matters: Empowering CLIP with Patch Generation-to-Selection
by: Pei, Gensheng, et al.
Published: (2025)
by: Pei, Gensheng, et al.
Published: (2025)
DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers
by: Ren, Li, et al.
Published: (2025)
by: Ren, Li, et al.
Published: (2025)
Look Again, Think Slowly: Enhancing Visual Reflection in Vision-Language Models
by: Jian, Pu, et al.
Published: (2025)
by: Jian, Pu, et al.
Published: (2025)
What elements should we focus when designing immersive virtual nature? A preliminary user study
by: Ma, Lin, et al.
Published: (2025)
by: Ma, Lin, et al.
Published: (2025)
DavIR: Data Selection via Implicit Reward for Large Language Models
by: Zhou, Haotian, et al.
Published: (2023)
by: Zhou, Haotian, et al.
Published: (2023)
Similar Items
-
Icon$^{2}$: Aligning Large Language Models Using Self-Synthetic Preference Data via Inherent Regulation
by: Chen, Qiyuan, et al.
Published: (2025) -
CC-GSEO-Bench: A Content-Centric Benchmark for Measuring Source Influence in Generative Search Engines
by: Chen, Qiyuan, et al.
Published: (2025) -
Curing Semantic Drift: A Dynamic Approach to Grounding Generation in Large Vision-Language Models
by: Chen, Jiahe, et al.
Published: (2025) -
Towards Clinical Practice in CT-Based Pulmonary Disease Screening: An Efficient and Reliable Framework
by: Shao, Qian, et al.
Published: (2024) -
Mind's Mirror: Distilling Self-Evaluation Capability and Comprehensive Thinking from Large Language Models
by: Liu, Weize, et al.
Published: (2023)