OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles
Fuente:
arXiv
Salvato in:
| Autori principali: | Deng, Yihe, Bansal, Hritik, Yin, Fan, Peng, Nanyun, Wang, Wei, Chang, Kai-Wei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
OpenVLThinkerV2: A Generalist Multimodal Reasoning Model for Multi-domain Visual Tasks
di: Hu, Wenbo, et al.
Pubblicazione: (2026)
di: Hu, Wenbo, et al.
Pubblicazione: (2026)
Comparing Bad Apples to Good Oranges: Aligning Large Language Models via Joint Preference Optimization
di: Bansal, Hritik, et al.
Pubblicazione: (2024)
di: Bansal, Hritik, et al.
Pubblicazione: (2024)
On Asymmetric Optimization of Reasoning and Perception in Vision-Language Model Post-Training
di: Wu, Xueqing, et al.
Pubblicazione: (2026)
di: Wu, Xueqing, et al.
Pubblicazione: (2026)
ConTextual: Evaluating Context-Sensitive Text-Rich Visual Reasoning in Large Multimodal Models
di: Wadhawan, Rohan, et al.
Pubblicazione: (2024)
di: Wadhawan, Rohan, et al.
Pubblicazione: (2024)
Medical Vision-Language Pre-Training for Brain Abnormalities
di: Monajatipoor, Masoud, et al.
Pubblicazione: (2024)
di: Monajatipoor, Masoud, et al.
Pubblicazione: (2024)
Enhancing Large Vision Language Models with Self-Training on Image Comprehension
di: Deng, Yihe, et al.
Pubblicazione: (2024)
di: Deng, Yihe, et al.
Pubblicazione: (2024)
IdealGPT: Iteratively Decomposing Vision and Language Reasoning via Large Language Models
di: You, Haoxuan, et al.
Pubblicazione: (2023)
di: You, Haoxuan, et al.
Pubblicazione: (2023)
BRIEF: Bridging Retrieval and Inference for Multi-hop Reasoning via Compression
di: Li, Yuankai, et al.
Pubblicazione: (2024)
di: Li, Yuankai, et al.
Pubblicazione: (2024)
Control Large Language Models via Divide and Conquer
di: Li, Bingxuan, et al.
Pubblicazione: (2024)
di: Li, Bingxuan, et al.
Pubblicazione: (2024)
SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models
di: Chen, Hardy, et al.
Pubblicazione: (2025)
di: Chen, Hardy, et al.
Pubblicazione: (2025)
Synchronous Faithfulness Monitoring for Trustworthy Retrieval-Augmented Generation
di: Wu, Di, et al.
Pubblicazione: (2024)
di: Wu, Di, et al.
Pubblicazione: (2024)
REAL Sampling: Boosting Factuality and Diversity of Open-Ended Generation via Asymptotic Entropy
di: Chang, Haw-Shiuan, et al.
Pubblicazione: (2024)
di: Chang, Haw-Shiuan, et al.
Pubblicazione: (2024)
Guiding Through Complexity: What Makes Good Supervision for Hard Math Reasoning Tasks?
di: He, Xuan, et al.
Pubblicazione: (2024)
di: He, Xuan, et al.
Pubblicazione: (2024)
Improving Event Definition Following For Zero-Shot Event Detection
di: Cai, Zefan, et al.
Pubblicazione: (2024)
di: Cai, Zefan, et al.
Pubblicazione: (2024)
Peeking Behind Closed Doors: Risks of LLM Evaluation by Private Data Curators
di: Bansal, Hritik, et al.
Pubblicazione: (2025)
di: Bansal, Hritik, et al.
Pubblicazione: (2025)
Beyond Two-Stage Training: Cooperative SFT and RL for LLM Reasoning
di: Chen, Liang, et al.
Pubblicazione: (2025)
di: Chen, Liang, et al.
Pubblicazione: (2025)
Matryoshka Query Transformer for Large Vision-Language Models
di: Hu, Wenbo, et al.
Pubblicazione: (2024)
di: Hu, Wenbo, et al.
Pubblicazione: (2024)
DiCoRe: Enhancing Zero-shot Event Detection via Divergent-Convergent LLM Reasoning
di: Parekh, Tanmay, et al.
Pubblicazione: (2025)
di: Parekh, Tanmay, et al.
Pubblicazione: (2025)
When To Solve, When To Verify: Compute-Optimal Problem Solving and Generative Verification for LLM Reasoning
di: Singhi, Nishad, et al.
Pubblicazione: (2025)
di: Singhi, Nishad, et al.
Pubblicazione: (2025)
CoKe: Customizable Fine-Grained Story Evaluation via Chain-of-Keyword Rationalization
di: Joshi, Brihi, et al.
Pubblicazione: (2025)
di: Joshi, Brihi, et al.
Pubblicazione: (2025)
Parallel-SFT: Improving Zero-Shot Cross-Programming-Language Transfer for Code RL
di: Wu, Zhaofeng, et al.
Pubblicazione: (2026)
di: Wu, Zhaofeng, et al.
Pubblicazione: (2026)
VISCO: Benchmarking Fine-Grained Critique and Correction Towards Self-Improvement in Visual Reasoning
di: Wu, Xueqing, et al.
Pubblicazione: (2024)
di: Wu, Xueqing, et al.
Pubblicazione: (2024)
Self-Routing RAG: Binding Selective Retrieval with Knowledge Verbalization
di: Wu, Di, et al.
Pubblicazione: (2025)
di: Wu, Di, et al.
Pubblicazione: (2025)
BRIEF-Pro: Universal Context Compression with Short-to-Long Synthesis for Fast and Accurate Multi-Hop Reasoning
di: Gu, Jia-Chen, et al.
Pubblicazione: (2025)
di: Gu, Jia-Chen, et al.
Pubblicazione: (2025)
GenEARL: A Training-Free Generative Framework for Multimodal Event Argument Role Labeling
di: Bansal, Hritik, et al.
Pubblicazione: (2024)
di: Bansal, Hritik, et al.
Pubblicazione: (2024)
Re-ReST: Reflection-Reinforced Self-Training for Language Agents
di: Dou, Zi-Yi, et al.
Pubblicazione: (2024)
di: Dou, Zi-Yi, et al.
Pubblicazione: (2024)
Peering Through Preferences: Unraveling Feedback Acquisition for Aligning Large Language Models
di: Bansal, Hritik, et al.
Pubblicazione: (2023)
di: Bansal, Hritik, et al.
Pubblicazione: (2023)
DeReason: A Difficulty-Aware Curriculum Improves Decoupled SFT-then-RL Training for General Reasoning
di: Hu, Hanxu, et al.
Pubblicazione: (2026)
di: Hu, Hanxu, et al.
Pubblicazione: (2026)
AceReason-Nemotron 1.1: Advancing Math and Code Reasoning through SFT and RL Synergy
di: Liu, Zihan, et al.
Pubblicazione: (2025)
di: Liu, Zihan, et al.
Pubblicazione: (2025)
Smaller, Weaker, Yet Better: Training LLM Reasoners via Compute-Optimal Sampling
di: Bansal, Hritik, et al.
Pubblicazione: (2024)
di: Bansal, Hritik, et al.
Pubblicazione: (2024)
DeepEdit: Knowledge Editing as Decoding with Constraints
di: Wang, Yiwei, et al.
Pubblicazione: (2024)
di: Wang, Yiwei, et al.
Pubblicazione: (2024)
Con-ReCall: Detecting Pre-training Data in LLMs via Contrastive Decoding
di: Wang, Cheng, et al.
Pubblicazione: (2024)
di: Wang, Cheng, et al.
Pubblicazione: (2024)
SafeWorld: Geo-Diverse Safety Alignment
di: Yin, Da, et al.
Pubblicazione: (2024)
di: Yin, Da, et al.
Pubblicazione: (2024)
SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning
di: Limozin, Alexis, et al.
Pubblicazione: (2026)
di: Limozin, Alexis, et al.
Pubblicazione: (2026)
QUDSELECT: Selective Decoding for Questions Under Discussion Parsing
di: Suvarna, Ashima, et al.
Pubblicazione: (2024)
di: Suvarna, Ashima, et al.
Pubblicazione: (2024)
Characterizing Truthfulness in Large Language Model Generations with Local Intrinsic Dimension
di: Yin, Fan, et al.
Pubblicazione: (2024)
di: Yin, Fan, et al.
Pubblicazione: (2024)
The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs
di: Chen, Jierun, et al.
Pubblicazione: (2025)
di: Chen, Jierun, et al.
Pubblicazione: (2025)
DuoGuard: A Two-Player RL-Driven Framework for Multilingual LLM Guardrails
di: Deng, Yihe, et al.
Pubblicazione: (2025)
di: Deng, Yihe, et al.
Pubblicazione: (2025)
On Prompt-Driven Safeguarding for Large Language Models
di: Zheng, Chujie, et al.
Pubblicazione: (2024)
di: Zheng, Chujie, et al.
Pubblicazione: (2024)
First SFT, Second RL, Third UPT: Continual Improving Multi-Modal LLM Reasoning via Unsupervised Post-Training
di: Wei, Lai, et al.
Pubblicazione: (2025)
di: Wei, Lai, et al.
Pubblicazione: (2025)
Documenti analoghi
-
OpenVLThinkerV2: A Generalist Multimodal Reasoning Model for Multi-domain Visual Tasks
di: Hu, Wenbo, et al.
Pubblicazione: (2026) -
Comparing Bad Apples to Good Oranges: Aligning Large Language Models via Joint Preference Optimization
di: Bansal, Hritik, et al.
Pubblicazione: (2024) -
On Asymmetric Optimization of Reasoning and Perception in Vision-Language Model Post-Training
di: Wu, Xueqing, et al.
Pubblicazione: (2026) -
ConTextual: Evaluating Context-Sensitive Text-Rich Visual Reasoning in Large Multimodal Models
di: Wadhawan, Rohan, et al.
Pubblicazione: (2024) -
Medical Vision-Language Pre-Training for Brain Abnormalities
di: Monajatipoor, Masoud, et al.
Pubblicazione: (2024)