Beyond Multiple Choice: Verifiable OpenQA for Robust Vision-Language RFT
Fuente:
arXiv
Saved in:
| Main Authors: | Liu, Yesheng, Li, Hao, Xu, Haiyu, Pei, Baoqi, Wang, Jiahao, Zhao, Mingxuan, Zheng, Jingshu, He, Zheqi, Yao, JG, Qin, Bowen, Yang, Xi, Zhang, Jiajun |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Do Vision-Language Models Measure Up? Benchmarking Visual Measurement Reading with MeasureBench
by: Lin, Fenfen, et al.
Published: (2025)
by: Lin, Fenfen, et al.
Published: (2025)
Building Efficient and Effective OpenQA Systems for Low-Resource Languages
by: Budur, Emrah, et al.
Published: (2024)
by: Budur, Emrah, et al.
Published: (2024)
FlagEvalMM: A Flexible Framework for Comprehensive Multimodal Model Evaluation
by: He, Zheqi, et al.
Published: (2025)
by: He, Zheqi, et al.
Published: (2025)
VLA-RFT: Vision-Language-Action Reinforcement Fine-tuning with Verified Rewards in World Simulators
by: Li, Hengtao, et al.
Published: (2025)
by: Li, Hengtao, et al.
Published: (2025)
Extending RLVR to Open-Ended Tasks via Verifiable Multiple-Choice Reformulation
by: Zhang, Mengyu, et al.
Published: (2025)
by: Zhang, Mengyu, et al.
Published: (2025)
When Choices Become Priors: Contrastive Decoding for Scientific Figure Multiple-Choice QA
by: Roh, Taeyun, et al.
Published: (2026)
by: Roh, Taeyun, et al.
Published: (2026)
AutoDrive-QA: A Multiple-Choice Benchmark for Vision-Language Evaluation in Urban Autonomous Driving
by: Khalili, Boshra, et al.
Published: (2025)
by: Khalili, Boshra, et al.
Published: (2025)
Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
by: Tan, Huajie, et al.
Published: (2025)
by: Tan, Huajie, et al.
Published: (2025)
Effects of Low-Dose Recombinant Human Brain Natriuretic Peptide on Anterior Myocardial Infarction Complicated by Cardiogenic Shock
by: Yesheng Pan
Published: (2017)
by: Yesheng Pan
Published: (2017)
From Multiple-Choice to Extractive QA: A Case Study for English and Arabic
by: Lynn, Teresa, et al.
Published: (2024)
by: Lynn, Teresa, et al.
Published: (2024)
Boosting Process-Correct CoT Reasoning by Modeling Solvability of Multiple-Choice QA
by: Schumann, Raphael, et al.
Published: (2025)
by: Schumann, Raphael, et al.
Published: (2025)
Listening to the Wise Few: Select-and-Copy Attention Heads for Multiple-Choice QA
by: Tulchinskii, Eduard, et al.
Published: (2024)
by: Tulchinskii, Eduard, et al.
Published: (2024)
Multiple-Choice Questions are Efficient and Robust LLM Evaluators
by: Zhang, Ziyin, et al.
Published: (2024)
by: Zhang, Ziyin, et al.
Published: (2024)
Large Language Models Are Not Robust Multiple Choice Selectors
by: Zheng, Chujie, et al.
Published: (2023)
by: Zheng, Chujie, et al.
Published: (2023)
FlagEval Findings Report: A Preliminary Evaluation of Large Reasoning Models on Automatically Verifiable Textual and Visual Questions
by: Qin, Bowen, et al.
Published: (2025)
by: Qin, Bowen, et al.
Published: (2025)
Scientific QA System with Verifiable Answers
by: Ljajić, Adela, et al.
Published: (2024)
by: Ljajić, Adela, et al.
Published: (2024)
When Choices Become Risks: Safety Failures of Large Language Models under Multiple-Choice Constraints
by: Chen, Yuheng, et al.
Published: (2026)
by: Chen, Yuheng, et al.
Published: (2026)
Beyond Multiple Choice: Evaluating Steering Vectors for Summarization
by: Braun, Joschka, et al.
Published: (2025)
by: Braun, Joschka, et al.
Published: (2025)
Beyond Prompting: An Autonomous Framework for Systematic Factor Investing via Agentic AI
by: Huang, Allen Yikuan, et al.
Published: (2026)
by: Huang, Allen Yikuan, et al.
Published: (2026)
Test-Time Degradation Adaptation for Open-Set Image Restoration
by: Gou, Yuanbiao, et al.
Published: (2023)
by: Gou, Yuanbiao, et al.
Published: (2023)
OpenRFT: Adapting Reasoning Foundation Model for Domain-specific Tasks with Reinforcement Fine-Tuning
by: Zhang, Yuxiang, et al.
Published: (2024)
by: Zhang, Yuxiang, et al.
Published: (2024)
Accurate and Nuanced Open-QA Evaluation Through Textual Entailment
by: Yao, Peiran, et al.
Published: (2024)
by: Yao, Peiran, et al.
Published: (2024)
Visual-RFT: Visual Reinforcement Fine-Tuning
by: Liu, Ziyu, et al.
Published: (2025)
by: Liu, Ziyu, et al.
Published: (2025)
Structuring GUI Elements through Vision Language Models: Towards Action Space Generation
by: Xu, Yi, et al.
Published: (2025)
by: Xu, Yi, et al.
Published: (2025)
Searching from Area to Point: A Hierarchical Framework for Semantic-Geometric Combined Feature Matching
by: Zhang, Yesheng, et al.
Published: (2023)
by: Zhang, Yesheng, et al.
Published: (2023)
MESA: Matching Everything by Segmenting Anything
by: Zhang, Yesheng, et al.
Published: (2024)
by: Zhang, Yesheng, et al.
Published: (2024)
ConsistentRFT: Reducing Visual Hallucinations in Flow-based Reinforcement Fine-Tuning
by: Tan, Xiaofeng, et al.
Published: (2026)
by: Tan, Xiaofeng, et al.
Published: (2026)
Beyond MCQ: An Open-Ended Arabic Cultural QA Benchmark with Dialect Variants
by: Bhatti, Hunzalah Hassan, et al.
Published: (2025)
by: Bhatti, Hunzalah Hassan, et al.
Published: (2025)
An improved educational competition optimizer with multi-covariance learning operators for global optimization problems
by: Zhao, Baoqi, et al.
Published: (2025)
by: Zhao, Baoqi, et al.
Published: (2025)
Leveraging Large Language Models for Command Injection Vulnerability Analysis in Python: An Empirical Study on Popular Open-Source Projects
by: Wang, Yuxuan, et al.
Published: (2025)
by: Wang, Yuxuan, et al.
Published: (2025)
Emergent symmetries at criticality in multi field RFT/DP
by: Bartels, Jochen, et al.
Published: (2024)
by: Bartels, Jochen, et al.
Published: (2024)
Too Easily Fooled? Prompt Injection Breaks LLMs on Frustratingly Simple Multiple-Choice Questions
by: Guo, Xuyang, et al.
Published: (2025)
by: Guo, Xuyang, et al.
Published: (2025)
Wait, that's not an option: LLMs Robustness with Incorrect Multiple-Choice Options
by: Góral, Gracjan, et al.
Published: (2024)
by: Góral, Gracjan, et al.
Published: (2024)
CO-RFT: Efficient Fine-Tuning of Vision-Language-Action Models through Chunked Offline Reinforcement Learning
by: Huang, Dongchi, et al.
Published: (2025)
by: Huang, Dongchi, et al.
Published: (2025)
Hierarchical Vision-Language Reasoning for Multimodal Multiple-Choice Question Answering
by: Zhou, Ao, et al.
Published: (2025)
by: Zhou, Ao, et al.
Published: (2025)
Real‐world glycaemic outcomes of automated insulin delivery in type 1 diabetes: A meta‐analysis
by: Qin Yang, et al.
Published: (2024)
by: Qin Yang, et al.
Published: (2024)
ExpertGenQA: Open-ended QA generation in Specialized Domains
by: Shahgir, Haz Sameen, et al.
Published: (2025)
by: Shahgir, Haz Sameen, et al.
Published: (2025)
MedConceptsQA: Open Source Medical Concepts QA Benchmark
by: Shoham, Ofir Ben, et al.
Published: (2024)
by: Shoham, Ofir Ben, et al.
Published: (2024)
Robust Discrete Pricing Optimization via Multiple-Choice Knapsack Reductions
by: Shao, Zi Yuan Eric
Published: (2026)
by: Shao, Zi Yuan Eric
Published: (2026)
Opt-Verifier: Unleashing the Power of LLMs for Optimization Modeling via Dual-Side Verification
by: Liu, Haoyang, et al.
Published: (2026)
by: Liu, Haoyang, et al.
Published: (2026)
Similar Items
-
Do Vision-Language Models Measure Up? Benchmarking Visual Measurement Reading with MeasureBench
by: Lin, Fenfen, et al.
Published: (2025) -
Building Efficient and Effective OpenQA Systems for Low-Resource Languages
by: Budur, Emrah, et al.
Published: (2024) -
FlagEvalMM: A Flexible Framework for Comprehensive Multimodal Model Evaluation
by: He, Zheqi, et al.
Published: (2025) -
VLA-RFT: Vision-Language-Action Reinforcement Fine-tuning with Verified Rewards in World Simulators
by: Li, Hengtao, et al.
Published: (2025) -
Extending RLVR to Open-Ended Tasks via Verifiable Multiple-Choice Reformulation
by: Zhang, Mengyu, et al.
Published: (2025)