SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lai, Peichao, Zhang, Kexuan, Lin, Yi, Zhang, Linyihan, Ye, Feiyang, Yan, Jinhao, Xu, Yanwei, He, Conghui, Wang, Yilei, Zhang, Wentao, Cui, Bin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
WebRenderBench: Enhancing Web Interface Generation through Layout-Style Consistency and Reinforcement Learning
par: Lai, Peichao, et autres
Publié: (2025)
par: Lai, Peichao, et autres
Publié: (2025)
Improving Low-Resource Sequence Labeling with Knowledge Fusion and Contextual Label Explanations
par: Lai, Peichao, et autres
Publié: (2025)
par: Lai, Peichao, et autres
Publié: (2025)
Enhancing Unsupervised Sentence Embeddings via Knowledge-Driven Data Augmentation and Gaussian-Decayed Contrastive Learning
par: Lai, Peichao, et autres
Publié: (2024)
par: Lai, Peichao, et autres
Publié: (2024)
FB-Bench: A Fine-Grained Multi-Task Benchmark for Evaluating LLMs' Responsiveness to Human Feedback
par: Li, Youquan, et autres
Publié: (2024)
par: Li, Youquan, et autres
Publié: (2024)
DOCR-Inspector: Fine-Grained and Automated Evaluation of Document Parsing with VLM
par: Zhang, Qintong, et autres
Publié: (2025)
par: Zhang, Qintong, et autres
Publié: (2025)
EvoCodeBench: A Human-Performance Benchmark for Self-Evolving LLM-Driven Coding Systems
par: Zhang, Wentao, et autres
Publié: (2026)
par: Zhang, Wentao, et autres
Publié: (2026)
CT-FineBench: A Diagnostic Fidelity Benchmark for Fine-Grained Evaluation of CT Report Generation
par: Yuan, Ruifeng, et autres
Publié: (2026)
par: Yuan, Ruifeng, et autres
Publié: (2026)
AlphaForgeBench: Benchmarking End-to-End Trading Strategy Design with Large Language Models
par: Zhang, Wentao, et autres
Publié: (2026)
par: Zhang, Wentao, et autres
Publié: (2026)
SKA-Bench: A Fine-Grained Benchmark for Evaluating Structured Knowledge Understanding of LLMs
par: Liu, Zhiqiang, et autres
Publié: (2025)
par: Liu, Zhiqiang, et autres
Publié: (2025)
FAVOR-Bench: A Comprehensive Benchmark for Fine-Grained Video Motion Understanding
par: Tu, Chongjun, et autres
Publié: (2025)
par: Tu, Chongjun, et autres
Publié: (2025)
UrBench: A Comprehensive Benchmark for Evaluating Large Multimodal Models in Multi-View Urban Scenarios
par: Zhou, Baichuan, et autres
Publié: (2024)
par: Zhou, Baichuan, et autres
Publié: (2024)
EPIC-Bench: A Perception-Centric Benchmark for Fine-Grained Embodied Visual Grounding in Vision-Language Models
par: Shan, Haozhe, et autres
Publié: (2026)
par: Shan, Haozhe, et autres
Publié: (2026)
Factcheck-Bench: Fine-Grained Evaluation Benchmark for Automatic Fact-checkers
par: Wang, Yuxia, et autres
Publié: (2023)
par: Wang, Yuxia, et autres
Publié: (2023)
SAS: Simulated Attention Score
par: Zheng, Chuanyang, et autres
Publié: (2025)
par: Zheng, Chuanyang, et autres
Publié: (2025)
Aggregating Large-Scale Generalized Energy Storages to Participate in Energy Market and Regulation Market
par: Yao, Yao, et autres
Publié: (2019)
par: Yao, Yao, et autres
Publié: (2019)
FineState-Bench: A Comprehensive Benchmark for Fine-Grained State Control in GUI Agents
par: Ji, Fengxian, et autres
Publié: (2025)
par: Ji, Fengxian, et autres
Publié: (2025)
VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation
par: Zhang, Shi-Xue, et autres
Publié: (2025)
par: Zhang, Shi-Xue, et autres
Publié: (2025)
MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues
par: Bai, Ge, et autres
Publié: (2024)
par: Bai, Ge, et autres
Publié: (2024)
VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains
par: Li, Xuzhao, et autres
Publié: (2025)
par: Li, Xuzhao, et autres
Publié: (2025)
C-FAITH: A Chinese Fine-Grained Benchmark for Automated Hallucination Evaluation
par: Zhang, Xu, et autres
Publié: (2025)
par: Zhang, Xu, et autres
Publié: (2025)
Gradual Learning: Optimizing Fine-Tuning with Partially Mastered Knowledge in Large Language Models
par: Li, Bozhou, et autres
Publié: (2024)
par: Li, Bozhou, et autres
Publié: (2024)
SongBench: A Fine-Grained Multi-Aspect Benchmark for Song Quality Assessment
par: Wu, Dapeng, et autres
Publié: (2026)
par: Wu, Dapeng, et autres
Publié: (2026)
Beyond Scores: Diagnostic LLM Evaluation via Fine-Grained Abilities
par: Zhang, Xu, et autres
Publié: (2026)
par: Zhang, Xu, et autres
Publié: (2026)
HammerBench: Fine-Grained Function-Calling Evaluation in Real Mobile Device Scenarios
par: Wang, Jun, et autres
Publié: (2024)
par: Wang, Jun, et autres
Publié: (2024)
SysBench: Can Large Language Models Follow System Messages?
par: Qin, Yanzhao, et autres
Publié: (2024)
par: Qin, Yanzhao, et autres
Publié: (2024)
Vision Mamba Distillation for Low-resolution Fine-grained Image Classification
par: Chen, Yao, et autres
Publié: (2024)
par: Chen, Yao, et autres
Publié: (2024)
Consensus or Conflict? Fine-Grained Evaluation of Conflicting Answers in Question-Answering
par: Nachshoni, Eviatar, et autres
Publié: (2025)
par: Nachshoni, Eviatar, et autres
Publié: (2025)
Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning
par: Bai, Tianyi, et autres
Publié: (2025)
par: Bai, Tianyi, et autres
Publié: (2025)
MMDocBench: Benchmarking Large Vision-Language Models for Fine-Grained Visual Document Understanding
par: Zhu, Fengbin, et autres
Publié: (2024)
par: Zhu, Fengbin, et autres
Publié: (2024)
Evaluating the Efficacy of Large Language Models for Generating Fine-Grained Visual Privacy Policies in Homes
par: Zhang, Shuning, et autres
Publié: (2025)
par: Zhang, Shuning, et autres
Publié: (2025)
SynthVLM: Towards High-Quality and Efficient Synthesis of Image-Caption Datasets for Vision-Language Models
par: Liu, Zheng, et autres
Publié: (2024)
par: Liu, Zheng, et autres
Publié: (2024)
RoadBench: Benchmarking MLLMs on Fine-Grained Spatial Understanding and Reasoning under Urban Road Scenarios
par: Zhang, Jun, et autres
Publié: (2025)
par: Zhang, Jun, et autres
Publié: (2025)
StreamProfileBench: A Benchmark for Fine-Grained User Profile Inference in Real-World Streaming Scenarios
par: Wang, Sizhe, et autres
Publié: (2026)
par: Wang, Sizhe, et autres
Publié: (2026)
TARAZ: Persian Short-Answer Question Benchmark for Cultural Evaluation of Language Models
par: Iranmanesh, Reihaneh, et autres
Publié: (2026)
par: Iranmanesh, Reihaneh, et autres
Publié: (2026)
DynaCode: A Dynamic Complexity-Aware Code Benchmark for Evaluating Large Language Models in Code Generation
par: Hu, Wenhao, et autres
Publié: (2025)
par: Hu, Wenhao, et autres
Publié: (2025)
Musical Score Understanding Benchmark: Evaluating Large Language Models' Comprehension of Complete Musical Scores
par: Dai, Congren, et autres
Publié: (2025)
par: Dai, Congren, et autres
Publié: (2025)
DecompileBench: A Comprehensive Benchmark for Evaluating Decompilers in Real-World Scenarios
par: Gao, Zeyu, et autres
Publié: (2025)
par: Gao, Zeyu, et autres
Publié: (2025)
ReasonAudio: A Benchmark for Evaluating Reasoning Beyond Matching in Text-Audio Retrieval
par: Zhang, Honglei, et autres
Publié: (2026)
par: Zhang, Honglei, et autres
Publié: (2026)
ScoringBench: A Benchmark for Evaluating Tabular Foundation Models with Proper Scoring Rules
par: Landsgesell, Jonas, et autres
Publié: (2026)
par: Landsgesell, Jonas, et autres
Publié: (2026)
Heterogeneous Adaptive Policy Optimization: Tailoring Optimization to Every Token's Nature
par: Liu, Zheng, et autres
Publié: (2025)
par: Liu, Zheng, et autres
Publié: (2025)
Documents similaires
-
WebRenderBench: Enhancing Web Interface Generation through Layout-Style Consistency and Reinforcement Learning
par: Lai, Peichao, et autres
Publié: (2025) -
Improving Low-Resource Sequence Labeling with Knowledge Fusion and Contextual Label Explanations
par: Lai, Peichao, et autres
Publié: (2025) -
Enhancing Unsupervised Sentence Embeddings via Knowledge-Driven Data Augmentation and Gaussian-Decayed Contrastive Learning
par: Lai, Peichao, et autres
Publié: (2024) -
FB-Bench: A Fine-Grained Multi-Task Benchmark for Evaluating LLMs' Responsiveness to Human Feedback
par: Li, Youquan, et autres
Publié: (2024) -
DOCR-Inspector: Fine-Grained and Automated Evaluation of Document Parsing with VLM
par: Zhang, Qintong, et autres
Publié: (2025)