Rationale-Aware Answer Verification by Pairwise Self-Evaluation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kawabata, Akira, Sugawara, Saku |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
C2: Scalable Rubric-Augmented Reward Modeling from Binary Preferences
par: Kawabata, Akira, et autres
Publié: (2026)
par: Kawabata, Akira, et autres
Publié: (2026)
Specification-Aware Machine Translation and Evaluation for Purpose Alignment
par: Kayano, Yoko, et autres
Publié: (2025)
par: Kayano, Yoko, et autres
Publié: (2025)
CxMP: A Linguistic Minimal-Pair Benchmark for Evaluating Constructional Understanding in Language Models
par: Oba, Miyu, et autres
Publié: (2026)
par: Oba, Miyu, et autres
Publié: (2026)
What Makes Language Models Good-enough?
par: Asami, Daiki, et autres
Publié: (2024)
par: Asami, Daiki, et autres
Publié: (2024)
A Dual-Task Paradigm to Investigate Sentence Comprehension Strategies in Language Models
par: Emura, Rei, et autres
Publié: (2026)
par: Emura, Rei, et autres
Publié: (2026)
Automatic Feedback Generation for Short Answer Questions using Answer Diagnostic Graphs
par: Furuhashi, Momoka, et autres
Publié: (2025)
par: Furuhashi, Momoka, et autres
Publié: (2025)
Are Checklists Really Useful for Automatic Evaluation of Generative Tasks?
par: Furuhashi, Momoka, et autres
Publié: (2025)
par: Furuhashi, Momoka, et autres
Publié: (2025)
From Answers to Rationales: Self-Aligning Multimodal Reasoning with Answer-Oriented Chain-of-Thought
par: Tan, Wentao, et autres
Publié: (2025)
par: Tan, Wentao, et autres
Publié: (2025)
TactfulToM: Do LLMs Have the Theory of Mind Ability to Understand White Lies?
par: Liu, Yiwei, et autres
Publié: (2025)
par: Liu, Yiwei, et autres
Publié: (2025)
Seeing the Reasoning: How LLM Rationales Influence User Trust and Decision-Making in Factual Verification Tasks
par: Sun, Xin, et autres
Publié: (2026)
par: Sun, Xin, et autres
Publié: (2026)
MoreHopQA: More Than Multi-hop Reasoning
par: Schnitzler, Julian, et autres
Publié: (2024)
par: Schnitzler, Julian, et autres
Publié: (2024)
Which Feedback Works for Whom? Differential Effects of LLM-Generated Feedback Elements Across Learner Profiles
par: Furuhashi, Momoka, et autres
Publié: (2026)
par: Furuhashi, Momoka, et autres
Publié: (2026)
Persuasiveness of Generated Free-Text Rationales in Subjective Decisions: A Case Study on Pairwise Argument Ranking
par: Elaraby, Mohamed, et autres
Publié: (2024)
par: Elaraby, Mohamed, et autres
Publié: (2024)
Can Language Models Induce Grammatical Knowledge from Indirect Evidence?
par: Oba, Miyu, et autres
Publié: (2024)
par: Oba, Miyu, et autres
Publié: (2024)
Label Effects: Shared Heuristic Reliance in Trust Assessment by Humans and LLM-as-a-Judge
par: Sun, Xin, et autres
Publié: (2026)
par: Sun, Xin, et autres
Publié: (2026)
Enhancing Relation Extraction via Supervised Rationale Verification and Feedback
par: Li, Yongqi, et autres
Publié: (2024)
par: Li, Yongqi, et autres
Publié: (2024)
Verbosity-Aware Rationale Reduction: Effective Reduction of Redundant Rationale via Principled Criteria
par: Jang, Joonwon, et autres
Publié: (2024)
par: Jang, Joonwon, et autres
Publié: (2024)
Measuring Human Involvement in AI-Generated Text: A Case Study on Academic Writing
par: Guo, Yuchen, et autres
Publié: (2025)
par: Guo, Yuchen, et autres
Publié: (2025)
RORA: Robust Free-Text Rationale Evaluation
par: Jiang, Zhengping, et autres
Publié: (2024)
par: Jiang, Zhengping, et autres
Publié: (2024)
Self-Explaining Hate Speech Detection with Moral Rationales
par: Vargas, Francielle, et autres
Publié: (2026)
par: Vargas, Francielle, et autres
Publié: (2026)
MedScore: Generalizable Factuality Evaluation of Free-Form Medical Answers by Domain-adapted Claim Decomposition and Verification
par: Huang, Heyuan, et autres
Publié: (2025)
par: Huang, Heyuan, et autres
Publié: (2025)
Towards Efficient CoT Distillation: Self-Guided Rationale Selector for Better Performance with Fewer Rationales
par: Yan, Jianzhi, et autres
Publié: (2025)
par: Yan, Jianzhi, et autres
Publié: (2025)
EvolvR: Self-Evolving Pairwise Reasoning for Story Evaluation to Enhance Generation
par: Wang, Xinda, et autres
Publié: (2025)
par: Wang, Xinda, et autres
Publié: (2025)
A Claim Decomposition Benchmark for Long-form Answer Verification
par: Zhang, Zhihao, et autres
Publié: (2024)
par: Zhang, Zhihao, et autres
Publié: (2024)
Rethinking Human Preference Evaluation of LLM Rationales
par: Li, Ziang, et autres
Publié: (2025)
par: Li, Ziang, et autres
Publié: (2025)
Towards Rationale-Answer Alignment of LVLMs via Self-Rationale Calibration
par: Wu, Yuanchen, et autres
Publié: (2025)
par: Wu, Yuanchen, et autres
Publié: (2025)
Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability
par: Zhu, Chiwei, et autres
Publié: (2025)
par: Zhu, Chiwei, et autres
Publié: (2025)
Enhancing Event Causality Identification with Rationale and Structure-Aware Causal Question Answering
par: Zhang, Baiyan, et autres
Publié: (2024)
par: Zhang, Baiyan, et autres
Publié: (2024)
PairEval: Open-domain Dialogue Evaluation with Pairwise Comparison
par: Park, ChaeHun, et autres
Publié: (2024)
par: Park, ChaeHun, et autres
Publié: (2024)
PEAR: Pairwise Evaluation for Automatic Relative Scoring in Machine Translation
par: Proietti, Lorenzo, et autres
Publié: (2026)
par: Proietti, Lorenzo, et autres
Publié: (2026)
Evaluating Webcam-based Gaze Data as an Alternative for Human Rationale Annotations
par: Brandl, Stephanie, et autres
Publié: (2024)
par: Brandl, Stephanie, et autres
Publié: (2024)
Self-Training Meets Consistency: Improving LLMs' Reasoning with Consistency-Driven Rationale Evaluation
par: Lee, Jaehyeok, et autres
Publié: (2024)
par: Lee, Jaehyeok, et autres
Publié: (2024)
Disagreeing Rationales: Rethinking Classification and Explainability Evaluation in Hate Speech Detection
par: Muscato, Benedetta, et autres
Publié: (2026)
par: Muscato, Benedetta, et autres
Publié: (2026)
Evaluating Human Alignment and Model Faithfulness of LLM Rationale
par: Fayyaz, Mohsen, et autres
Publié: (2024)
par: Fayyaz, Mohsen, et autres
Publié: (2024)
MAPLE: Micro Analysis of Pairwise Language Evolution for Few-Shot Claim Verification
par: Zeng, Xia, et autres
Publié: (2024)
par: Zeng, Xia, et autres
Publié: (2024)
Towards Self-Contained Answers: Entity-Based Answer Rewriting in Conversational Search
par: Sekulić, Ivan, et autres
Publié: (2024)
par: Sekulić, Ivan, et autres
Publié: (2024)
Not All Explanations Simulate Equally: Comparing Verbalized Feature Attributions and Self-Generated Rationales
par: Hong, Pingjun, et autres
Publié: (2026)
par: Hong, Pingjun, et autres
Publié: (2026)
Keyword-Centric Prompting for One-Shot Event Detection with Self-Generated Rationale Enhancements
par: Li, Ziheng, et autres
Publié: (2025)
par: Li, Ziheng, et autres
Publié: (2025)
Quality Text, Robust Vision: The Role of Language in Enhancing Visual Robustness of Vision-Language Models
par: Waseda, Futa, et autres
Publié: (2025)
par: Waseda, Futa, et autres
Publié: (2025)
MARE: Multi-Aspect Rationale Extractor on Unsupervised Rationale Extraction
par: Jiang, Han, et autres
Publié: (2024)
par: Jiang, Han, et autres
Publié: (2024)
Documents similaires
-
C2: Scalable Rubric-Augmented Reward Modeling from Binary Preferences
par: Kawabata, Akira, et autres
Publié: (2026) -
Specification-Aware Machine Translation and Evaluation for Purpose Alignment
par: Kayano, Yoko, et autres
Publié: (2025) -
CxMP: A Linguistic Minimal-Pair Benchmark for Evaluating Constructional Understanding in Language Models
par: Oba, Miyu, et autres
Publié: (2026) -
What Makes Language Models Good-enough?
par: Asami, Daiki, et autres
Publié: (2024) -
A Dual-Task Paradigm to Investigate Sentence Comprehension Strategies in Language Models
par: Emura, Rei, et autres
Publié: (2026)