Saved in:
| Main Authors: | Lin, Fenfen, Liu, Yesheng, Xu, Haiyu, Yue, Chen, He, Zheqi, Zhao, Mingxuan, Chen, Miguel Hu, Liu, Jiakang, Yao, JG, Yang, Xi |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2510.26865 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Beyond Multiple Choice: Verifiable OpenQA for Robust Vision-Language RFT
by: Liu, Yesheng, et al.
Published: (2025)
by: Liu, Yesheng, et al.
Published: (2025)
ReadBench: Measuring the Dense Text Visual Reading Ability of Vision-Language Models
by: Clavié, Benjamin, et al.
Published: (2025)
by: Clavié, Benjamin, et al.
Published: (2025)
AutoResearchBench: Benchmarking AI Agents on Complex Scientific Literature Discovery
by: Xiong, Lei, et al.
Published: (2026)
by: Xiong, Lei, et al.
Published: (2026)
Measuring the Measurers: Quality Evaluation of Hallucination Benchmarks for Large Vision-Language Models
by: Yan, Bei, et al.
Published: (2024)
by: Yan, Bei, et al.
Published: (2024)
How Do You Measure Up?
by: Miller, Marilyn L., et al.
Published: (1999)
by: Miller, Marilyn L., et al.
Published: (1999)
Structuring GUI Elements through Vision Language Models: Towards Action Space Generation
by: Xu, Yi, et al.
Published: (2025)
by: Xu, Yi, et al.
Published: (2025)
FlagEval Findings Report: A Preliminary Evaluation of Large Reasoning Models on Automatically Verifiable Textual and Visual Questions
by: Qin, Bowen, et al.
Published: (2025)
by: Qin, Bowen, et al.
Published: (2025)
FlagEvalMM: A Flexible Framework for Comprehensive Multimodal Model Evaluation
by: He, Zheqi, et al.
Published: (2025)
by: He, Zheqi, et al.
Published: (2025)
Video-SafetyBench: A Benchmark for Safety Evaluation of Video LVLMs
by: Liu, Xuannan, et al.
Published: (2025)
by: Liu, Xuannan, et al.
Published: (2025)
VLind-Bench: Measuring Language Priors in Large Vision-Language Models
by: Lee, Kang-il, et al.
Published: (2024)
by: Lee, Kang-il, et al.
Published: (2024)
DUAL-Bench: Measuring Over-Refusal and Robustness in Vision-Language Models
by: Ren, Kaixuan, et al.
Published: (2025)
by: Ren, Kaixuan, et al.
Published: (2025)
JsDeObsBench: Measuring and Benchmarking LLMs for JavaScript Deobfuscation
by: Chen, Guoqiang, et al.
Published: (2025)
by: Chen, Guoqiang, et al.
Published: (2025)
The Role of Model Confidence on Bias Effects in Measured Uncertainties for Vision-Language Models
by: Liu, Xinyi, et al.
Published: (2025)
by: Liu, Xinyi, et al.
Published: (2025)
EffiBench-X: A Multi-Language Benchmark for Measuring Efficiency of LLM-Generated Code
by: Qing, Yuhao, et al.
Published: (2025)
by: Qing, Yuhao, et al.
Published: (2025)
Inside-Out: Measuring Generalization in Vision Transformers Through Inner Workings
by: Peng, Yunxiang, et al.
Published: (2026)
by: Peng, Yunxiang, et al.
Published: (2026)
Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models
by: Yadav, Ankit, et al.
Published: (2025)
by: Yadav, Ankit, et al.
Published: (2025)
Guidelines for Educational Media Programs. How Do You Measure Up?
Published: (1976)
Published: (1976)
AEQ-Bench: Measuring Empathy of Omni-Modal Large Models
by: Luo, Xuan, et al.
Published: (2026)
by: Luo, Xuan, et al.
Published: (2026)
CDH-Bench: A Commonsense-Driven Hallucination Benchmark for Evaluating Visual Fidelity in Vision-Language Models
by: Chen, Kesheng, et al.
Published: (2026)
by: Chen, Kesheng, et al.
Published: (2026)
VISTA-Bench: Do Vision-Language Models Really Understand Visualized Text as Well as Pure Text?
by: Liu, Qing'an, et al.
Published: (2026)
by: Liu, Qing'an, et al.
Published: (2026)
Do You "Trust" This Visualization? An Inventory to Measure Trust in Visualizations
by: Wang, Huichen Will, et al.
Published: (2025)
by: Wang, Huichen Will, et al.
Published: (2025)
Allegory of the Cave: Measurement-Grounded Vision-Language Learning
by: Xu, Kepeng, et al.
Published: (2026)
by: Xu, Kepeng, et al.
Published: (2026)
Suppressing Measurement Noise in Logical Qubits Through Measurement Scheduling
by: Xu, Xiao-Yue, et al.
Published: (2025)
by: Xu, Xiao-Yue, et al.
Published: (2025)
BBOPlace-Bench: Benchmarking Black-Box Optimization for Chip Placement
by: Xue, Ke, et al.
Published: (2025)
by: Xue, Ke, et al.
Published: (2025)
CC-GSEO-Bench: A Content-Centric Benchmark for Measuring Source Influence in Generative Search Engines
by: Chen, Qiyuan, et al.
Published: (2025)
by: Chen, Qiyuan, et al.
Published: (2025)
LaoBench: A Large-Scale Multidimensional Lao Benchmark for Large Language Models
by: Gao, Jian, et al.
Published: (2025)
by: Gao, Jian, et al.
Published: (2025)
DFlash: Block Diffusion for Flash Speculative Decoding
by: Chen, Jian, et al.
Published: (2026)
by: Chen, Jian, et al.
Published: (2026)
MMDocBench: Benchmarking Large Vision-Language Models for Fine-Grained Visual Document Understanding
by: Zhu, Fengbin, et al.
Published: (2024)
by: Zhu, Fengbin, et al.
Published: (2024)
Bullen Reading Attitude Measure.
by: Bullen, Gertrude F.
Published: (1972)
by: Bullen, Gertrude F.
Published: (1972)
How Do You Measure Up? Guidelines for School Library Media Programs.
Published: (1989)
Published: (1989)
Causal Discovery by Kernel Deviance Measures with Heterogeneous Transforms
by: Tse, Tim, et al.
Published: (2024)
by: Tse, Tim, et al.
Published: (2024)
SD-VLM: Spatial Measuring and Understanding with Depth-Encoded Vision-Language Models
by: Chen, Pingyi, et al.
Published: (2025)
by: Chen, Pingyi, et al.
Published: (2025)
CleanUpBench: Embodied Sweeping and Grasping Benchmark
by: Li, Wenbo, et al.
Published: (2025)
by: Li, Wenbo, et al.
Published: (2025)
Measuring Audio's Impact on Correctness: Audio-Contribution-Aware Post-Training of Large Audio Language Models
by: He, Haolin, et al.
Published: (2025)
by: He, Haolin, et al.
Published: (2025)
Measuring and Improving Chain-of-Thought Reasoning in Vision-Language Models
by: Chen, Yangyi, et al.
Published: (2023)
by: Chen, Yangyi, et al.
Published: (2023)
Measuring the Unspoken: A Disentanglement Model and Benchmark for Psychological Analysis in the Wild
by: Feng, Yigui, et al.
Published: (2025)
by: Feng, Yigui, et al.
Published: (2025)
When Is the Same Model Not the Same Service? A Measurement Study of Hosted Open-Weight LLM APIs
by: Li, Haorui, et al.
Published: (2026)
by: Li, Haorui, et al.
Published: (2026)
Incipient Slip-Based Rotation Measurement via Visuotactile Sensing During In-Hand Object Pivoting
by: Li, Mingxuan, et al.
Published: (2023)
by: Li, Mingxuan, et al.
Published: (2023)
SenseBench: A Benchmark for Remote Sensing Low-Level Visual Perception and Description in Large Vision-Language Models
by: Zhong, Chen, et al.
Published: (2026)
by: Zhong, Chen, et al.
Published: (2026)
LAB-Bench: Measuring Capabilities of Language Models for Biology Research
by: Laurent, Jon M., et al.
Published: (2024)
by: Laurent, Jon M., et al.
Published: (2024)
Similar Items
-
Beyond Multiple Choice: Verifiable OpenQA for Robust Vision-Language RFT
by: Liu, Yesheng, et al.
Published: (2025) -
ReadBench: Measuring the Dense Text Visual Reading Ability of Vision-Language Models
by: Clavié, Benjamin, et al.
Published: (2025) -
AutoResearchBench: Benchmarking AI Agents on Complex Scientific Literature Discovery
by: Xiong, Lei, et al.
Published: (2026) -
Measuring the Measurers: Quality Evaluation of Hallucination Benchmarks for Large Vision-Language Models
by: Yan, Bei, et al.
Published: (2024) -
How Do You Measure Up?
by: Miller, Marilyn L., et al.
Published: (1999)