Judge Like Human Examiners: A Weighted Importance Multi-Point Evaluation Framework for Generative Tasks with Long-form Answers
Fuente:
arXiv
Guardado en:
| Autores principales: | Yu, Guoxin, Zhou, Chulun, Liu, Lemao, Wang, Qi, Yu, Mo, Tang, Jialong, Yang, Baosong, Ao, Xiang, Lam, Wai, Yu, Yue |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
HGMEM: Hypergraph-based Working Memory to Improve Multi-step RAG for Long-Context Complex Relational Modeling
por: Zhou, Chulun, et al.
Publicado: (2025)
por: Zhou, Chulun, et al.
Publicado: (2025)
Large Language Models Can Self-Improve in Long-context Reasoning
por: Li, Siheng, et al.
Publicado: (2024)
por: Li, Siheng, et al.
Publicado: (2024)
CultureSynth: A Hierarchical Taxonomy-Guided and Retrieval-Augmented Framework for Cultural Question-Answer Synthesis
por: Zhang, Xinyu, et al.
Publicado: (2025)
por: Zhang, Xinyu, et al.
Publicado: (2025)
Understanding LLMs' Fluid Intelligence Deficiency: An Analysis of the ARC Task
por: Wu, Junjie, et al.
Publicado: (2025)
por: Wu, Junjie, et al.
Publicado: (2025)
The Essence of Contextual Understanding in Theory of Mind: A Study on Question Answering with Story Characters
por: Zhou, Chulun, et al.
Publicado: (2025)
por: Zhou, Chulun, et al.
Publicado: (2025)
DivLogicEval: A Framework for Benchmarking Logical Reasoning Evaluation in Large Language Models
por: Chung, Tsz Ting, et al.
Publicado: (2025)
por: Chung, Tsz Ting, et al.
Publicado: (2025)
Pullback of symplectic forms to the space of circle patterns
por: Lam, Wai Yeung
Publicado: (2024)
por: Lam, Wai Yeung
Publicado: (2024)
Space of circle patterns on tori and its symplectic form
por: Lam, Wai Yeung
Publicado: (2024)
por: Lam, Wai Yeung
Publicado: (2024)
GDCNet: Generative Discrepancy Comparison Network for Multimodal Sarcasm Detection
por: Zhang, Shuguang, et al.
Publicado: (2026)
por: Zhang, Shuguang, et al.
Publicado: (2026)
Fed-PISA: Federated Voice Cloning via Personalized Identity-Style Adaptation
por: Wang, Qi, et al.
Publicado: (2025)
por: Wang, Qi, et al.
Publicado: (2025)
"From the Autistic Human Books' Stories, I Understand Their Mindset and Thoughts": Pilot Development and Participatory Realist Evaluation of Human Library to Enhance Public Understanding of Autism
por: Gary Yu Hin Lam, et al.
Publicado: (2026)
por: Gary Yu Hin Lam, et al.
Publicado: (2026)
Not All Languages are Equal: Insights into Multilingual Retrieval-Augmented Generation
por: Wu, Suhang, et al.
Publicado: (2024)
por: Wu, Suhang, et al.
Publicado: (2024)
Correlation Decay for Maximum Weight Matchings on Sparse Graphs
por: Lam, Wai-Kit, et al.
Publicado: (2025)
por: Lam, Wai-Kit, et al.
Publicado: (2025)
Indefinite Linear-Quadratic Optimal Control Problems of Backward Stochastic Differential Equations with Partial Information
por: Li, Jialong, et al.
Publicado: (2025)
por: Li, Jialong, et al.
Publicado: (2025)
Towards Cross-lingual Values Judgment: A Consensus-Pluralism Perspective
por: Chen, Yukun, et al.
Publicado: (2026)
por: Chen, Yukun, et al.
Publicado: (2026)
How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding
por: Yu, Zhuoran, et al.
Publicado: (2025)
por: Yu, Zhuoran, et al.
Publicado: (2025)
SitEmb-v1.5: Improved Context-Aware Dense Retrieval for Semantic Association and Long Story Comprehension
por: Wu, Junjie, et al.
Publicado: (2025)
por: Wu, Junjie, et al.
Publicado: (2025)
Examining Reasoning LLMs-as-Judges in Non-Verifiable LLM Post-Training
por: Liu, Yixin, et al.
Publicado: (2026)
por: Liu, Yixin, et al.
Publicado: (2026)
PRELUDE: A Benchmark Designed to Require Global Comprehension and Reasoning over Long Contexts
por: Yu, Mo, et al.
Publicado: (2025)
por: Yu, Mo, et al.
Publicado: (2025)
A Claim Decomposition Benchmark for Long-form Answer Verification
por: Zhang, Zhihao, et al.
Publicado: (2024)
por: Zhang, Zhihao, et al.
Publicado: (2024)
EFSA: Towards Event-Level Financial Sentiment Analysis
por: Chen, Tianyu, et al.
Publicado: (2024)
por: Chen, Tianyu, et al.
Publicado: (2024)
Efficient Quantum Digital Signatures over Long Distances with Likely Bit Strings
por: Qin, Ji-Qian, et al.
Publicado: (2024)
por: Qin, Ji-Qian, et al.
Publicado: (2024)
Language as a Latent Variable for Reasoning Optimization
por: Wu, Linjuan, et al.
Publicado: (2026)
por: Wu, Linjuan, et al.
Publicado: (2026)
Shape-Constrained Distributional Optimization via Importance-Weighted Sample Average Approximation
por: Lam, Henry, et al.
Publicado: (2024)
por: Lam, Henry, et al.
Publicado: (2024)
When AIs Judge AIs: The Rise of Agent-as-a-Judge Evaluation for LLMs
por: Yu, Fangyi
Publicado: (2025)
por: Yu, Fangyi
Publicado: (2025)
XLinear: Frequency-Enhanced MLP with CrossFilter for Robust Long-Range Forecasting
por: Ao, Xiang
Publicado: (2026)
por: Ao, Xiang
Publicado: (2026)
Multi-LLM Collaborative Search for Complex Problem Solving
por: Yang, Sen, et al.
Publicado: (2025)
por: Yang, Sen, et al.
Publicado: (2025)
Direct Simultaneous Translation Activation for Large Audio-Language Models
por: Zhang, Pei, et al.
Publicado: (2025)
por: Zhang, Pei, et al.
Publicado: (2025)
RFWD2 Mitigates AD ‐Like Cognitive Impairments via the JNK – SGK1 Signaling Pathway in Mice
por: Mengjiao Ying, et al.
Publicado: (2026)
por: Mengjiao Ying, et al.
Publicado: (2026)
Importance Weighted Score Matching for Diffusion Samplers with Enhanced Mode Coverage
por: Wang, Chenguang, et al.
Publicado: (2025)
por: Wang, Chenguang, et al.
Publicado: (2025)
Best Arm Identification with LLM Judges and Limited Human
por: Ao, Ruicheng, et al.
Publicado: (2026)
por: Ao, Ruicheng, et al.
Publicado: (2026)
Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks
por: Yu, Yang
Publicado: (2025)
por: Yu, Yang
Publicado: (2025)
Do Large Language Models Judge Error Severity Like Humans?
por: Sun, Diege, et al.
Publicado: (2025)
por: Sun, Diege, et al.
Publicado: (2025)
Weighted Codebook Scheme for RIS-Assisted Point-to-Point MIMO Communications
por: Yu, Zhiheng, et al.
Publicado: (2025)
por: Yu, Zhiheng, et al.
Publicado: (2025)
Formally Solving Answer-Construction Problems in Lean
por: Sun, Jialiang, et al.
Publicado: (2025)
por: Sun, Jialiang, et al.
Publicado: (2025)
TeamLLM: A Human-Like Team-Oriented Collaboration Framework for Multi-Step Contextualized Tasks
por: Wang, Xiangyu, et al.
Publicado: (2026)
por: Wang, Xiangyu, et al.
Publicado: (2026)
InfiniteICL: Breaking the Limit of Context Window Size via Long Short-term Memory Transformation
por: Cao, Bowen, et al.
Publicado: (2025)
por: Cao, Bowen, et al.
Publicado: (2025)
Table-Critic: A Multi-Agent Framework for Collaborative Criticism and Refinement in Table Reasoning
por: Yu, Peiying, et al.
Publicado: (2025)
por: Yu, Peiying, et al.
Publicado: (2025)
A Survey on the Honesty of Large Language Models
por: Li, Siheng, et al.
Publicado: (2024)
por: Li, Siheng, et al.
Publicado: (2024)
Meissner-Like Currents of Photons in Anomalous Superradiant Phases
por: Li, Linjun, et al.
Publicado: (2025)
por: Li, Linjun, et al.
Publicado: (2025)
Ejemplares similares
-
HGMEM: Hypergraph-based Working Memory to Improve Multi-step RAG for Long-Context Complex Relational Modeling
por: Zhou, Chulun, et al.
Publicado: (2025) -
Large Language Models Can Self-Improve in Long-context Reasoning
por: Li, Siheng, et al.
Publicado: (2024) -
CultureSynth: A Hierarchical Taxonomy-Guided and Retrieval-Augmented Framework for Cultural Question-Answer Synthesis
por: Zhang, Xinyu, et al.
Publicado: (2025) -
Understanding LLMs' Fluid Intelligence Deficiency: An Analysis of the ARC Task
por: Wu, Junjie, et al.
Publicado: (2025) -
The Essence of Contextual Understanding in Theory of Mind: A Study on Question Answering with Story Characters
por: Zhou, Chulun, et al.
Publicado: (2025)