Gespeichert in:
| Hauptverfasser: | Wang, Xiaokun, Wang, Peiyu, Pei, Jiangbo, Shen, Wei, Peng, Yi, Hao, Yunzhuo, Qiu, Weijie, Jian, Ai, Xie, Tianyidan, Song, Xuchen, Liu, Yang, Zhou, Yahui |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | https://arxiv.org/abs/2505.07263 |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Skywork R1V2: Multimodal Hybrid Reinforcement Learning for Reasoning
von: Wang, Peiyu, et al.
Veröffentlicht: (2025)
von: Wang, Peiyu, et al.
Veröffentlicht: (2025)
Skywork R1V: Pioneering Multimodal Reasoning with Chain-of-Thought
von: Peng, Yi, et al.
Veröffentlicht: (2025)
von: Peng, Yi, et al.
Veröffentlicht: (2025)
CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs
von: Jian, Ai, et al.
Veröffentlicht: (2025)
von: Jian, Ai, et al.
Veröffentlicht: (2025)
Skywork-R1V3 Technical Report
von: Shen, Wei, et al.
Veröffentlicht: (2025)
von: Shen, Wei, et al.
Veröffentlicht: (2025)
Skywork-R1V4: Toward Agentic Multimodal Intelligence through Interleaved Thinking with Images and DeepResearch
von: Zhang, Yifan, et al.
Veröffentlicht: (2025)
von: Zhang, Yifan, et al.
Veröffentlicht: (2025)
Skywork UniPic: Unified Autoregressive Modeling for Visual Understanding and Generation
von: Wang, Peiyu, et al.
Veröffentlicht: (2025)
von: Wang, Peiyu, et al.
Veröffentlicht: (2025)
Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs
von: Liu, Chris Yuhao, et al.
Veröffentlicht: (2024)
von: Liu, Chris Yuhao, et al.
Veröffentlicht: (2024)
Skywork UniPic 3.0: Unified Multi-Image Composition via Sequence Modeling
von: Wei, Hongyang, et al.
Veröffentlicht: (2026)
von: Wei, Hongyang, et al.
Veröffentlicht: (2026)
Skywork-Reward-V2: Scaling Preference Data Curation via Human-AI Synergy
von: Liu, Chris Yuhao, et al.
Veröffentlicht: (2025)
von: Liu, Chris Yuhao, et al.
Veröffentlicht: (2025)
Skywork UniPic 2.0: Building Kontext Model with Online RL for Unified Multimodal Model
von: Wei, Hongyang, et al.
Veröffentlicht: (2025)
von: Wei, Hongyang, et al.
Veröffentlicht: (2025)
Skywork Open Reasoner 1 Technical Report
von: He, Jujie, et al.
Veröffentlicht: (2025)
von: He, Jujie, et al.
Veröffentlicht: (2025)
VL-RewardBench: A Challenging Benchmark for Vision-Language Generative Reward Models
von: Li, Lei, et al.
Veröffentlicht: (2024)
von: Li, Lei, et al.
Veröffentlicht: (2024)
Skywork-SWE: Unveiling Data Scaling Laws for Software Engineering in LLMs
von: Zeng, Liang, et al.
Veröffentlicht: (2025)
von: Zeng, Liang, et al.
Veröffentlicht: (2025)
Unified Reward Model for Multimodal Understanding and Generation
von: Wang, Yibin, et al.
Veröffentlicht: (2025)
von: Wang, Yibin, et al.
Veröffentlicht: (2025)
VisualPRM: An Effective Process Reward Model for Multimodal Reasoning
von: Wang, Weiyun, et al.
Veröffentlicht: (2025)
von: Wang, Weiyun, et al.
Veröffentlicht: (2025)
SophiaVL-R1: Reinforcing MLLMs Reasoning with Thinking Reward
von: Fan, Kaixuan, et al.
Veröffentlicht: (2025)
von: Fan, Kaixuan, et al.
Veröffentlicht: (2025)
Unveiling Chain of Step Reasoning for Vision-Language Models with Fine-grained Rewards
von: Chen, Honghao, et al.
Veröffentlicht: (2025)
von: Chen, Honghao, et al.
Veröffentlicht: (2025)
DiffusionReward: Enhancing Blind Face Restoration through Reward Feedback Learning
von: Wu, Bin, et al.
Veröffentlicht: (2025)
von: Wu, Bin, et al.
Veröffentlicht: (2025)
Skywork-MoE: A Deep Dive into Training Techniques for Mixture-of-Experts Language Models
von: Wei, Tianwen, et al.
Veröffentlicht: (2024)
von: Wei, Tianwen, et al.
Veröffentlicht: (2024)
VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding
von: Zhang, Zhihong, et al.
Veröffentlicht: (2025)
von: Zhang, Zhihong, et al.
Veröffentlicht: (2025)
Multi-Agent Collaborative Reward Design for Enhancing Reasoning in Reinforcement Learning
von: Yang, Pei, et al.
Veröffentlicht: (2025)
von: Yang, Pei, et al.
Veröffentlicht: (2025)
DreamPRM: Domain-Reweighted Process Reward Model for Multimodal Reasoning
von: Cao, Qi, et al.
Veröffentlicht: (2025)
von: Cao, Qi, et al.
Veröffentlicht: (2025)
Exploring Reasoning Reward Model for Agents
von: Fan, Kaixuan, et al.
Veröffentlicht: (2026)
von: Fan, Kaixuan, et al.
Veröffentlicht: (2026)
Learning to Generate via Understanding: Understanding-Driven Intrinsic Rewarding for Unified Multimodal Models
von: Pan, Jiadong, et al.
Veröffentlicht: (2026)
von: Pan, Jiadong, et al.
Veröffentlicht: (2026)
Entropy-Guided Data-Efficient Training for Multimodal Reasoning Reward Models
von: Yang, Shidong, et al.
Veröffentlicht: (2026)
von: Yang, Shidong, et al.
Veröffentlicht: (2026)
Spatial Preference Rewarding for MLLMs Spatial Understanding
von: Qiu, Han, et al.
Veröffentlicht: (2025)
von: Qiu, Han, et al.
Veröffentlicht: (2025)
ReARTeR: Retrieval-Augmented Reasoning with Trustworthy Process Rewarding
von: Sun, Zhongxiang, et al.
Veröffentlicht: (2025)
von: Sun, Zhongxiang, et al.
Veröffentlicht: (2025)
Uncertainty-aware Reward Model: Teaching Reward Models to Know What is Unknown
von: Lou, Xingzhou, et al.
Veröffentlicht: (2024)
von: Lou, Xingzhou, et al.
Veröffentlicht: (2024)
PhysCodeBench: Benchmarking Physics-Aware Symbolic Simulation of 3D Scenes via Self-Corrective Multi-Agent Refinement
von: Xie, Tianyidan, et al.
Veröffentlicht: (2026)
von: Xie, Tianyidan, et al.
Veröffentlicht: (2026)
BaseReward: A Strong Baseline for Multimodal Reward Model
von: Zhang, Yi-Fan, et al.
Veröffentlicht: (2025)
von: Zhang, Yi-Fan, et al.
Veröffentlicht: (2025)
KairosVL: Orchestrating Time Series and Semantics for Unified Reasoning
von: Si, Haotian, et al.
Veröffentlicht: (2026)
von: Si, Haotian, et al.
Veröffentlicht: (2026)
Skywork-Math: Data Scaling Laws for Mathematical Reasoning in Large Language Models -- The Story Goes On
von: Zeng, Liang, et al.
Veröffentlicht: (2024)
von: Zeng, Liang, et al.
Veröffentlicht: (2024)
Reward-Robust RLHF in LLMs
von: Yan, Yuzi, et al.
Veröffentlicht: (2024)
von: Yan, Yuzi, et al.
Veröffentlicht: (2024)
Unlocking Multimodal Mathematical Reasoning via Process Reward Model
von: Luo, Ruilin, et al.
Veröffentlicht: (2025)
von: Luo, Ruilin, et al.
Veröffentlicht: (2025)
WildReward: Learning Reward Models from In-the-Wild Human Interactions
von: Peng, Hao, et al.
Veröffentlicht: (2026)
von: Peng, Hao, et al.
Veröffentlicht: (2026)
Causal Reward Adjustment: Mitigating Reward Hacking in External Reasoning via Backdoor Correction
von: Song, Ruike, et al.
Veröffentlicht: (2025)
von: Song, Ruike, et al.
Veröffentlicht: (2025)
On Designing Effective RL Reward at Training Time for LLM Reasoning
von: Gao, Jiaxuan, et al.
Veröffentlicht: (2024)
von: Gao, Jiaxuan, et al.
Veröffentlicht: (2024)
RewardMap: Tackling Sparse Rewards in Fine-grained Visual Reasoning via Multi-Stage Reinforcement Learning
von: Feng, Sicheng, et al.
Veröffentlicht: (2025)
von: Feng, Sicheng, et al.
Veröffentlicht: (2025)
Reward Collapse in Aligning Large Language Models
von: Song, Ziang, et al.
Veröffentlicht: (2023)
von: Song, Ziang, et al.
Veröffentlicht: (2023)
InternVL-U: Democratizing Unified Multimodal Models for Understanding, Reasoning, Generation and Editing
von: Tian, Changyao, et al.
Veröffentlicht: (2026)
von: Tian, Changyao, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Skywork R1V2: Multimodal Hybrid Reinforcement Learning for Reasoning
von: Wang, Peiyu, et al.
Veröffentlicht: (2025) -
Skywork R1V: Pioneering Multimodal Reasoning with Chain-of-Thought
von: Peng, Yi, et al.
Veröffentlicht: (2025) -
CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs
von: Jian, Ai, et al.
Veröffentlicht: (2025) -
Skywork-R1V3 Technical Report
von: Shen, Wei, et al.
Veröffentlicht: (2025) -
Skywork-R1V4: Toward Agentic Multimodal Intelligence through Interleaved Thinking with Images and DeepResearch
von: Zhang, Yifan, et al.
Veröffentlicht: (2025)