Human-Centric Evaluation for Foundation Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Guo, Yijin, Ji, Kaiyuan, Zhu, Xiaorong, Wang, Junying, Wen, Farong, Li, Chunyi, Zhang, Zicheng, Zhai, Guangtao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
QoNext: Towards Next-generation QoE for Foundation Models
por: Guo, Yijin, et al.
Publicado: (2025)
por: Guo, Yijin, et al.
Publicado: (2025)
A Multi-To-One Interview Paradigm for Efficient MLLM Evaluation
por: Shen, Ye, et al.
Publicado: (2025)
por: Shen, Ye, et al.
Publicado: (2025)
Improve MLLM Benchmark Efficiency through Interview
por: Wen, Farong, et al.
Publicado: (2025)
por: Wen, Farong, et al.
Publicado: (2025)
The Ever-Evolving Science Exam
por: Wang, Junying, et al.
Publicado: (2025)
por: Wang, Junying, et al.
Publicado: (2025)
Affordance Benchmark for MLLMs
por: Wang, Junying, et al.
Publicado: (2025)
por: Wang, Junying, et al.
Publicado: (2025)
Q-Mirror: Unlocking the Multi-Modal Potential of Scientific Text-Only QA Pairs
por: Wang, Junying, et al.
Publicado: (2025)
por: Wang, Junying, et al.
Publicado: (2025)
EvolMem: A Cognitive-Driven Benchmark for Multi-Session Dialogue Memory
por: Shen, Ye, et al.
Publicado: (2026)
por: Shen, Ye, et al.
Publicado: (2026)
SIQA: Toward Reliable Scientific Image Quality Assessment
por: Li, Wenzhe, et al.
Publicado: (2026)
por: Li, Wenzhe, et al.
Publicado: (2026)
User-centric Subjective Leaderboard by Customizable Reward Modeling
por: Jia, Qi, et al.
Publicado: (2025)
por: Jia, Qi, et al.
Publicado: (2025)
MEMO-Bench: A Multiple Benchmark for Text-to-Image and Multimodal Large Language Models on Human Emotion Analysis
por: Zhou, Yingjie, et al.
Publicado: (2024)
por: Zhou, Yingjie, et al.
Publicado: (2024)
MedOmni-45°: A Safety-Performance Benchmark for Reasoning-Oriented LLMs in Medicine
por: Ji, Kaiyuan, et al.
Publicado: (2025)
por: Ji, Kaiyuan, et al.
Publicado: (2025)
Sycophancy under Pressure: Evaluating and Mitigating Sycophantic Bias via Adversarial Dialogues in Scientific QA
por: Zhang, Kaiwei, et al.
Publicado: (2025)
por: Zhang, Kaiwei, et al.
Publicado: (2025)
SafetyFlow: An Agent-Flow System for Automated LLM Safety Benchmarking
por: Zhu, Xiangyang, et al.
Publicado: (2025)
por: Zhu, Xiangyang, et al.
Publicado: (2025)
STAR : Bridging Statistical and Agentic Reasoning for Large Model Performance Prediction
por: Wang, Xiaoxiao, et al.
Publicado: (2026)
por: Wang, Xiaoxiao, et al.
Publicado: (2026)
Redundancy Principles for MLLMs Benchmarks
por: Zhang, Zicheng, et al.
Publicado: (2025)
por: Zhang, Zicheng, et al.
Publicado: (2025)
Information Density Principle for MLLM Benchmarks
por: Li, Chunyi, et al.
Publicado: (2025)
por: Li, Chunyi, et al.
Publicado: (2025)
Evaluating from Benign to Dynamic Adversarial: A Squid Game for Large Language Models
por: Chen, Zijian, et al.
Publicado: (2025)
por: Chen, Zijian, et al.
Publicado: (2025)
UniDial-EvalKit: A Unified Toolkit for Evaluating Multi-Faceted Conversational Abilities
por: Jia, Qi, et al.
Publicado: (2026)
por: Jia, Qi, et al.
Publicado: (2026)
Image Quality Assessment for Embodied AI
por: Li, Chunyi, et al.
Publicado: (2025)
por: Li, Chunyi, et al.
Publicado: (2025)
Quality Assessment in the Era of Large Models: A Survey
por: Zhang, Zicheng, et al.
Publicado: (2024)
por: Zhang, Zicheng, et al.
Publicado: (2024)
Towards All-in-One Medical Image Re-Identification
por: Tian, Yuan, et al.
Publicado: (2025)
por: Tian, Yuan, et al.
Publicado: (2025)
Automated Safety Benchmarking: A Multi-agent Pipeline for LVLMs
por: Zhu, Xiangyang, et al.
Publicado: (2026)
por: Zhu, Xiangyang, et al.
Publicado: (2026)
Beyond Cosine Similarity: Zero-Initialized Residual Complex Projection for Aspect-Based Sentiment Analysis
por: Wang, Yijin, et al.
Publicado: (2026)
por: Wang, Yijin, et al.
Publicado: (2026)
The Science of Evaluating Foundation Models
por: Yuan, Jiayi, et al.
Publicado: (2025)
por: Yuan, Jiayi, et al.
Publicado: (2025)
MirrorBench: Evaluating Self-centric Intelligence in MLLMs by Introducing a Mirror
por: Guo, Shengyu, et al.
Publicado: (2026)
por: Guo, Shengyu, et al.
Publicado: (2026)
Enabling Doctor-Centric Medical AI with LLMs through Workflow-Aligned Tasks and Benchmarks
por: Xie, Wenya, et al.
Publicado: (2025)
por: Xie, Wenya, et al.
Publicado: (2025)
3DGCQA: A Quality Assessment Database for 3D AI-Generated Contents
por: Zhou, Yingjie, et al.
Publicado: (2024)
por: Zhou, Yingjie, et al.
Publicado: (2024)
Q-Bench+: A Benchmark for Multi-modal Foundation Models on Low-level Vision from Single Images to Pairs
por: Zhang, Zicheng, et al.
Publicado: (2024)
por: Zhang, Zicheng, et al.
Publicado: (2024)
A Human-Centric Pipeline for Aligning Large Language Models with Chinese Medical Ethics
por: Jin, Haoan, et al.
Publicado: (2026)
por: Jin, Haoan, et al.
Publicado: (2026)
HazeCLIP: Towards Language Guided Real-World Image Dehazing
por: Wang, Ruiyi, et al.
Publicado: (2024)
por: Wang, Ruiyi, et al.
Publicado: (2024)
Learning Hazing to Dehazing: Towards Realistic Haze Generation for Real-World Image Dehazing
por: Wang, Ruiyi, et al.
Publicado: (2025)
por: Wang, Ruiyi, et al.
Publicado: (2025)
Q-Bench: A Benchmark for General-Purpose Foundation Models on Low-level Vision
por: Wu, Haoning, et al.
Publicado: (2023)
por: Wu, Haoning, et al.
Publicado: (2023)
Feel the Difference? A Comparative Analysis of Emotional Arcs in Real and LLM-Generated CBT Sessions
por: Wang, Xiaoyi, et al.
Publicado: (2025)
por: Wang, Xiaoyi, et al.
Publicado: (2025)
EgoDyn-Bench: Evaluating Ego-Motion Understanding in Vision-Centric Foundation Models for Autonomous Driving
por: Schäfer, Finn Rasmus, et al.
Publicado: (2026)
por: Schäfer, Finn Rasmus, et al.
Publicado: (2026)
Do Large Language Models Judge Error Severity Like Humans?
por: Sun, Diege, et al.
Publicado: (2025)
por: Sun, Diege, et al.
Publicado: (2025)
Learning to Reason via Self-Iterative Process Feedback for Small Language Models
por: Chen, Kaiyuan, et al.
Publicado: (2024)
por: Chen, Kaiyuan, et al.
Publicado: (2024)
Source Code Foundation Models are Transferable Binary Analysis Knowledge Bases
por: Su, Zian, et al.
Publicado: (2024)
por: Su, Zian, et al.
Publicado: (2024)
A Survey on Human-Centric LLMs
por: Wang, Jing Yi, et al.
Publicado: (2024)
por: Wang, Jing Yi, et al.
Publicado: (2024)
A User-Centric Multi-Intent Benchmark for Evaluating Large Language Models
por: Wang, Jiayin, et al.
Publicado: (2024)
por: Wang, Jiayin, et al.
Publicado: (2024)
Using GUI Agent for Electronic Design Automation
por: Li, Chunyi, et al.
Publicado: (2025)
por: Li, Chunyi, et al.
Publicado: (2025)
Ejemplares similares
-
QoNext: Towards Next-generation QoE for Foundation Models
por: Guo, Yijin, et al.
Publicado: (2025) -
A Multi-To-One Interview Paradigm for Efficient MLLM Evaluation
por: Shen, Ye, et al.
Publicado: (2025) -
Improve MLLM Benchmark Efficiency through Interview
por: Wen, Farong, et al.
Publicado: (2025) -
The Ever-Evolving Science Exam
por: Wang, Junying, et al.
Publicado: (2025) -
Affordance Benchmark for MLLMs
por: Wang, Junying, et al.
Publicado: (2025)