Saved in:
| Main Authors: | Li, Ruosen, Li, Ruochen, Wang, Barry, Du, Xinya |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2408.13545 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
PRD: Peer Rank and Discussion Improve Large Language Model based Evaluations
by: Li, Ruosen, et al.
Published: (2023)
by: Li, Ruosen, et al.
Published: (2023)
FG-PRM: Fine-grained Hallucination Detection and Mitigation in Language Model Mathematical Reasoning
by: Li, Ruosen, et al.
Published: (2024)
by: Li, Ruosen, et al.
Published: (2024)
AALC: Large Language Model Efficient Reasoning via Adaptive Accuracy-Length Control
by: Li, Ruosen, et al.
Published: (2025)
by: Li, Ruosen, et al.
Published: (2025)
Document-level Causal Relation Extraction with Knowledge-guided Binary Question Answering
by: Wang, Zimu, et al.
Published: (2024)
by: Wang, Zimu, et al.
Published: (2024)
MLR-Copilot: Autonomous Machine Learning Research based on Large Language Models Agents
by: Li, Ruochen, et al.
Published: (2024)
by: Li, Ruochen, et al.
Published: (2024)
FaithScore: Fine-grained Evaluations of Hallucinations in Large Vision-Language Models
by: Jing, Liqiang, et al.
Published: (2023)
by: Jing, Liqiang, et al.
Published: (2023)
A Semantic-Sampling Framework for Evaluating Calibration in Open-Ended Question Answering
by: Wang, Zhanliang, et al.
Published: (2026)
by: Wang, Zhanliang, et al.
Published: (2026)
CLUE: Non-parametric Verification from Experience via Hidden-State Clustering
by: Liang, Zhenwen, et al.
Published: (2025)
by: Liang, Zhenwen, et al.
Published: (2025)
LDC: Learning to Generate Research Idea with Dynamic Control
by: Li, Ruochen, et al.
Published: (2024)
by: Li, Ruochen, et al.
Published: (2024)
CLEAN-EVAL: Clean Evaluation on Contaminated Large Language Models
by: Zhu, Wenhong, et al.
Published: (2023)
by: Zhu, Wenhong, et al.
Published: (2023)
AC-EVAL: Evaluating Ancient Chinese Language Understanding in Large Language Models
by: Wei, Yuting, et al.
Published: (2024)
by: Wei, Yuting, et al.
Published: (2024)
Automatic Dataset Generation for Knowledge Intensive Question Answering Tasks
by: Yuen, Sizhe, et al.
Published: (2025)
by: Yuen, Sizhe, et al.
Published: (2025)
AskQE: Question Answering as Automatic Evaluation for Machine Translation
by: Ki, Dayeon, et al.
Published: (2025)
by: Ki, Dayeon, et al.
Published: (2025)
Automatic Evaluation of Healthcare LLMs Beyond Question-Answering
by: Arias-Duart, Anna, et al.
Published: (2025)
by: Arias-Duart, Anna, et al.
Published: (2025)
Internal and External Knowledge Interactive Refinement Framework for Knowledge-Intensive Question Answering
by: Du, Haowei, et al.
Published: (2024)
by: Du, Haowei, et al.
Published: (2024)
E-EVAL: A Comprehensive Chinese K-12 Education Evaluation Benchmark for Large Language Models
by: Hou, Jinchang, et al.
Published: (2024)
by: Hou, Jinchang, et al.
Published: (2024)
VALOR-EVAL: Holistic Coverage and Faithfulness Evaluation of Large Vision-Language Models
by: Qiu, Haoyi, et al.
Published: (2024)
by: Qiu, Haoyi, et al.
Published: (2024)
Leveraging Inter-Chunk Interactions for Enhanced Retrieval in Large Language Model-Based Question Answering
by: Guo, Tiezheng, et al.
Published: (2024)
by: Guo, Tiezheng, et al.
Published: (2024)
FGAIF: Aligning Large Vision-Language Models with Fine-grained AI Feedback
by: Jing, Liqiang, et al.
Published: (2024)
by: Jing, Liqiang, et al.
Published: (2024)
WTU-EVAL: A Whether-or-Not Tool Usage Evaluation Benchmark for Large Language Models
by: Ning, Kangyun, et al.
Published: (2024)
by: Ning, Kangyun, et al.
Published: (2024)
Long-Span Question-Answering: Automatic Question Generation and QA-System Ranking via Side-by-Side Evaluation
by: Bohnet, Bernd, et al.
Published: (2024)
by: Bohnet, Bernd, et al.
Published: (2024)
Automatic Answerability Evaluation for Question Generation
by: Wang, Zifan, et al.
Published: (2023)
by: Wang, Zifan, et al.
Published: (2023)
Evaluating Large Language Models for Evidence-Based Clinical Question Answering
by: Wang, Can, et al.
Published: (2025)
by: Wang, Can, et al.
Published: (2025)
Trustworthy Medical Question Answering: An Evaluation-Centric Survey
by: Wang, Yinuo, et al.
Published: (2025)
by: Wang, Yinuo, et al.
Published: (2025)
Consistency-Aware Parameter-Preserving Knowledge Editing Framework for Multi-Hop Question Answering
by: Deng, Lingwen, et al.
Published: (2025)
by: Deng, Lingwen, et al.
Published: (2025)
Question Calibration and Multi-Hop Modeling for Temporal Question Answering
by: Xue, Chao, et al.
Published: (2024)
by: Xue, Chao, et al.
Published: (2024)
Evaluating Fine-Tuning Efficiency of Human-Inspired Learning Strategies in Medical Question Answering
by: Yang, Yushi, et al.
Published: (2024)
by: Yang, Yushi, et al.
Published: (2024)
CPG-EVAL: A Multi-Tiered Benchmark for Evaluating the Chinese Pedagogical Grammar Competence of Large Language Models
by: Wang, Dong
Published: (2025)
by: Wang, Dong
Published: (2025)
Atomic Fact Decomposition Helps Attributed Question Answering
by: Yan, Zhichao, et al.
Published: (2024)
by: Yan, Zhichao, et al.
Published: (2024)
A Comprehensive Evaluation of GPT-4V on Knowledge-Intensive Visual Question Answering
by: Li, Yunxin, et al.
Published: (2023)
by: Li, Yunxin, et al.
Published: (2023)
DisastQA: A Comprehensive Benchmark for Evaluating Question Answering in Disaster Management
by: Chen, Zhitong, et al.
Published: (2026)
by: Chen, Zhitong, et al.
Published: (2026)
An Entity Linking Agent for Question Answering
by: Luo, Yajie, et al.
Published: (2025)
by: Luo, Yajie, et al.
Published: (2025)
Prompting Large Language Models with Partial Knowledge for Answering Questions with Unseen Entities
by: Yan, Zhichao, et al.
Published: (2025)
by: Yan, Zhichao, et al.
Published: (2025)
Continual Learning for Temporal-Sensitive Question Answering
by: Yang, Wanqi, et al.
Published: (2024)
by: Yang, Wanqi, et al.
Published: (2024)
UniOQA: A Unified Framework for Knowledge Graph Question Answering with Large Language Models
by: Li, Zhuoyang, et al.
Published: (2024)
by: Li, Zhuoyang, et al.
Published: (2024)
PRIV-QA: Privacy-Preserving Question Answering for Cloud Large Language Models
by: Li, Guangwei, et al.
Published: (2025)
by: Li, Guangwei, et al.
Published: (2025)
Intelligent Legal Assistant: An Interactive Clarification System for Legal Question Answering
by: Yao, Rujing, et al.
Published: (2025)
by: Yao, Rujing, et al.
Published: (2025)
Conversational Question Answering with Reformulations over Knowledge Graph
by: Liu, Lihui, et al.
Published: (2023)
by: Liu, Lihui, et al.
Published: (2023)
Evaluating Correctness and Faithfulness of Instruction-Following Models for Question Answering
by: Adlakha, Vaibhav, et al.
Published: (2023)
by: Adlakha, Vaibhav, et al.
Published: (2023)
DebateQA: Evaluating Question Answering on Debatable Knowledge
by: Xu, Rongwu, et al.
Published: (2024)
by: Xu, Rongwu, et al.
Published: (2024)
Similar Items
-
PRD: Peer Rank and Discussion Improve Large Language Model based Evaluations
by: Li, Ruosen, et al.
Published: (2023) -
FG-PRM: Fine-grained Hallucination Detection and Mitigation in Language Model Mathematical Reasoning
by: Li, Ruosen, et al.
Published: (2024) -
AALC: Large Language Model Efficient Reasoning via Adaptive Accuracy-Length Control
by: Li, Ruosen, et al.
Published: (2025) -
Document-level Causal Relation Extraction with Knowledge-guided Binary Question Answering
by: Wang, Zimu, et al.
Published: (2024) -
MLR-Copilot: Autonomous Machine Learning Research based on Large Language Models Agents
by: Li, Ruochen, et al.
Published: (2024)