SiMing-Bench: Evaluating Procedural Correctness from Continuous Interactions in Clinical Skill Videos
Fuente:
arXiv
Salvato in:
| Autori principali: | Huang, Xiyang, Lin, Jiawei, Wu, Keying, Huang, Jiaxin, Yang, Kailai, Wei, Renxiong, zeng, Cheng, Xiang, Jiayi, Kuang, Ziyan, Peng, Min, Xie, Qianqian, Ananiadou, Sophia |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Overview of the ClinicalSkillQA 2026 Shared Task on Continuous Perception and Procedural Reasoning in Clinical Skill Assessment
di: Huang, Xiyang, et al.
Pubblicazione: (2026)
di: Huang, Xiyang, et al.
Pubblicazione: (2026)
MentaLLaMA: Interpretable Mental Health Analysis on Social Media with Large Language Models
di: Yang, Kailai, et al.
Pubblicazione: (2023)
di: Yang, Kailai, et al.
Pubblicazione: (2023)
Towards Interpretable Mental Health Analysis with Large Language Models
di: Yang, Kailai, et al.
Pubblicazione: (2023)
di: Yang, Kailai, et al.
Pubblicazione: (2023)
MMAFFBen: A Multilingual and Multimodal Affective Analysis Benchmark for Evaluating LLMs and VLMs
di: Liu, Zhiwei, et al.
Pubblicazione: (2025)
di: Liu, Zhiwei, et al.
Pubblicazione: (2025)
FMDLlama: Financial Misinformation Detection based on Large Language Models
di: Liu, Zhiwei, et al.
Pubblicazione: (2024)
di: Liu, Zhiwei, et al.
Pubblicazione: (2024)
EmoLLMs: A Series of Emotional Large Language Models and Annotation Tools for Comprehensive Affective Analysis
di: Liu, Zhiwei, et al.
Pubblicazione: (2024)
di: Liu, Zhiwei, et al.
Pubblicazione: (2024)
MetaAligner: Towards Generalizable Multi-Objective Alignment of Language Models
di: Yang, Kailai, et al.
Pubblicazione: (2024)
di: Yang, Kailai, et al.
Pubblicazione: (2024)
Selective Preference Optimization via Token-Level Reward Function Estimation
di: Yang, Kailai, et al.
Pubblicazione: (2024)
di: Yang, Kailai, et al.
Pubblicazione: (2024)
Rumor Detection by Multi-task Suffix Learning based on Time-series Dual Sentiments
di: Liu, Zhiwei, et al.
Pubblicazione: (2025)
di: Liu, Zhiwei, et al.
Pubblicazione: (2025)
From Scores to Skills: A Cognitive Diagnosis Framework for Evaluating Financial Large Language Models
di: Kuang, Ziyan, et al.
Pubblicazione: (2025)
di: Kuang, Ziyan, et al.
Pubblicazione: (2025)
RAEmoLLM: Retrieval Augmented LLMs for Cross-Domain Misinformation Detection Using In-Context Learning Based on Emotional Information
di: Liu, Zhiwei, et al.
Pubblicazione: (2024)
di: Liu, Zhiwei, et al.
Pubblicazione: (2024)
MentraSuite: Post-Training Large Language Models for Mental Health Reasoning and Assessment
di: Xiao, Mengxi, et al.
Pubblicazione: (2025)
di: Xiao, Mengxi, et al.
Pubblicazione: (2025)
Factual consistency evaluation of summarization in the Era of large language models
di: Luo, Zheheng, et al.
Pubblicazione: (2024)
di: Luo, Zheheng, et al.
Pubblicazione: (2024)
The Lay Person's Guide to Biomedicine: Orchestrating Large Language Models
di: Luo, Zheheng, et al.
Pubblicazione: (2024)
di: Luo, Zheheng, et al.
Pubblicazione: (2024)
ConspEmoLLM: Conspiracy Theory Detection Using an Emotion-Based Large Language Model
di: Liu, Zhiwei, et al.
Pubblicazione: (2024)
di: Liu, Zhiwei, et al.
Pubblicazione: (2024)
HealMe: Harnessing Cognitive Reframing in Large Language Models for Psychotherapy
di: Xiao, Mengxi, et al.
Pubblicazione: (2024)
di: Xiao, Mengxi, et al.
Pubblicazione: (2024)
Are Large Language Models True Healthcare Jacks-of-All-Trades? Benchmarking Across Health Professions Beyond Physician Exams
di: Luo, Zheheng, et al.
Pubblicazione: (2024)
di: Luo, Zheheng, et al.
Pubblicazione: (2024)
Emotion Detection for Misinformation: A Review
di: Liu, Zhiwei, et al.
Pubblicazione: (2023)
di: Liu, Zhiwei, et al.
Pubblicazione: (2023)
Implicit Graph, Explicit Retrieval: Towards Efficient and Interpretable Long-horizon Memory for Large Language Models
di: Zhang, Xin, et al.
Pubblicazione: (2026)
di: Zhang, Xin, et al.
Pubblicazione: (2026)
DITING: A Multi-Agent Evaluation Framework for Benchmarking Web Novel Translation
di: Zhang, Enze, et al.
Pubblicazione: (2025)
di: Zhang, Enze, et al.
Pubblicazione: (2025)
Interpreting Arithmetic Mechanism in Large Language Models through Comparative Neuron Analysis
di: Yu, Zeping, et al.
Pubblicazione: (2024)
di: Yu, Zeping, et al.
Pubblicazione: (2024)
Understanding Multimodal LLMs: the Mechanistic Interpretability of Llava in Visual Question Answering
di: Yu, Zeping, et al.
Pubblicazione: (2024)
di: Yu, Zeping, et al.
Pubblicazione: (2024)
Understanding and Mitigating Gender Bias in LLMs via Interpretable Neuron Editing
di: Yu, Zeping, et al.
Pubblicazione: (2025)
di: Yu, Zeping, et al.
Pubblicazione: (2025)
Locate-then-Merge: Neuron-Level Parameter Fusion for Mitigating Catastrophic Forgetting in Multimodal LLMs
di: Yu, Zeping, et al.
Pubblicazione: (2025)
di: Yu, Zeping, et al.
Pubblicazione: (2025)
Exploring Safety Alignment Evaluation of LLMs in Chinese Mental Health Dialogues via LLM-as-Judge
di: Cai, Yunna, et al.
Pubblicazione: (2025)
di: Cai, Yunna, et al.
Pubblicazione: (2025)
LongDocFACTScore: Evaluating the Factuality of Long Document Abstractive Summarisation
di: Bishop, Jennifer A, et al.
Pubblicazione: (2023)
di: Bishop, Jennifer A, et al.
Pubblicazione: (2023)
XCR-Bench: A Multi-Task Benchmark for Evaluating Cultural Reasoning in LLMs
di: Kabir, Mohsinul, et al.
Pubblicazione: (2026)
di: Kabir, Mohsinul, et al.
Pubblicazione: (2026)
How do Large Language Models Learn In-Context? Query and Key Matrices of In-Context Heads are Two Towers for Metric Learning
di: Yu, Zeping, et al.
Pubblicazione: (2024)
di: Yu, Zeping, et al.
Pubblicazione: (2024)
Neuron-Level Knowledge Attribution in Large Language Models
di: Yu, Zeping, et al.
Pubblicazione: (2023)
di: Yu, Zeping, et al.
Pubblicazione: (2023)
Break the Checkbox: Challenging Closed-Style Evaluations of Cultural Alignment in LLMs
di: Kabir, Mohsinul, et al.
Pubblicazione: (2025)
di: Kabir, Mohsinul, et al.
Pubblicazione: (2025)
Language Shapes Mental Health Evaluations in Large Language Models
di: Xu, Jiayi, et al.
Pubblicazione: (2026)
di: Xu, Jiayi, et al.
Pubblicazione: (2026)
Back Attention: Understanding and Enhancing Multi-Hop Reasoning in Large Language Models
di: Yu, Zeping, et al.
Pubblicazione: (2025)
di: Yu, Zeping, et al.
Pubblicazione: (2025)
Disentangled VAD Representations via a Variational Framework for Political Stance Detection
di: Xu, Beiyu, et al.
Pubblicazione: (2025)
di: Xu, Beiyu, et al.
Pubblicazione: (2025)
No Language is an Island: Unifying Chinese and English in Financial Large Language Models, Instruction Data, and Benchmarks
di: Hu, Gang, et al.
Pubblicazione: (2024)
di: Hu, Gang, et al.
Pubblicazione: (2024)
Natural Language Processing for Cardiology: A Narrative Review
di: Yang, Kailai, et al.
Pubblicazione: (2025)
di: Yang, Kailai, et al.
Pubblicazione: (2025)
Appear2Meaning: A Cross-Cultural Benchmark for Structured Cultural Metadata Inference from Images
di: Jiang, Yuechen, et al.
Pubblicazione: (2026)
di: Jiang, Yuechen, et al.
Pubblicazione: (2026)
Ming-UniVision: Joint Image Understanding and Generation with a Unified Continuous Tokenizer
di: Huang, Ziyuan, et al.
Pubblicazione: (2025)
di: Huang, Ziyuan, et al.
Pubblicazione: (2025)
ProSkill: Segment-Level Skill Assessment in Procedural Videos
di: Mazzamuto, Michele, et al.
Pubblicazione: (2026)
di: Mazzamuto, Michele, et al.
Pubblicazione: (2026)
RAAR: Retrieval Augmented Agentic Reasoning for Cross-Domain Misinformation Detection
di: Liu, Zhiwei, et al.
Pubblicazione: (2026)
di: Liu, Zhiwei, et al.
Pubblicazione: (2026)
THCM-CAL: Temporal-Hierarchical Causal Modelling with Conformal Calibration for Clinical Risk Prediction
di: Zhang, Xin, et al.
Pubblicazione: (2025)
di: Zhang, Xin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Overview of the ClinicalSkillQA 2026 Shared Task on Continuous Perception and Procedural Reasoning in Clinical Skill Assessment
di: Huang, Xiyang, et al.
Pubblicazione: (2026) -
MentaLLaMA: Interpretable Mental Health Analysis on Social Media with Large Language Models
di: Yang, Kailai, et al.
Pubblicazione: (2023) -
Towards Interpretable Mental Health Analysis with Large Language Models
di: Yang, Kailai, et al.
Pubblicazione: (2023) -
MMAFFBen: A Multilingual and Multimodal Affective Analysis Benchmark for Evaluating LLMs and VLMs
di: Liu, Zhiwei, et al.
Pubblicazione: (2025) -
FMDLlama: Financial Misinformation Detection based on Large Language Models
di: Liu, Zhiwei, et al.
Pubblicazione: (2024)