AbsPyramid: Benchmarking the Abstraction Ability of Language Models with a Unified Entailment Graph
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Zhaowei, Shi, Haochen, Wang, Weiqi, Fang, Tianqing, Zhang, Hongming, Choi, Sehyun, Liu, Xin, Song, Yangqiu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AbsInstruct: Eliciting Abstraction Ability from LLMs through Explanation Tuning with Plausibility Estimation
por: Wang, Zhaowei, et al.
Publicado: (2024)
por: Wang, Zhaowei, et al.
Publicado: (2024)
CKBP v2: Better Annotation and Reasoning for Commonsense Knowledge Base Population
por: Fang, Tianqing, et al.
Publicado: (2023)
por: Fang, Tianqing, et al.
Publicado: (2023)
MARS: Benchmarking the Metaphysical Reasoning Abilities of Language Models with a Multi-task Evaluation Dataset
por: Wang, Weiqi, et al.
Publicado: (2024)
por: Wang, Weiqi, et al.
Publicado: (2024)
Concept-Reversed Winograd Schema Challenge: Evaluating and Improving Robust Reasoning in Large Language Models via Abstraction
por: Han, Kaiqiao, et al.
Publicado: (2024)
por: Han, Kaiqiao, et al.
Publicado: (2024)
EntailE: Introducing Textual Entailment in Commonsense Knowledge Graph Completion
por: Su, Ying, et al.
Publicado: (2024)
por: Su, Ying, et al.
Publicado: (2024)
ConKE: Conceptualization-Augmented Knowledge Editing in Large Language Models for Commonsense Reasoning
por: Zhang, Liyu, et al.
Publicado: (2024)
por: Zhang, Liyu, et al.
Publicado: (2024)
Acquiring and Modelling Abstract Commonsense Knowledge via Conceptualization
por: He, Mutian, et al.
Publicado: (2022)
por: He, Mutian, et al.
Publicado: (2022)
Getting Sick After Seeing a Doctor? Diagnosing and Mitigating Knowledge Conflicts in Event Temporal Reasoning
por: Fang, Tianqing, et al.
Publicado: (2023)
por: Fang, Tianqing, et al.
Publicado: (2023)
CANDLE: Iterative Conceptualization and Instantiation Distillation from Large Language Models for Commonsense Reasoning
por: Wang, Weiqi, et al.
Publicado: (2024)
por: Wang, Weiqi, et al.
Publicado: (2024)
ConstraintChecker: A Plugin for Large Language Models to Reason on Commonsense Knowledge Bases
por: Do, Quyet V., et al.
Publicado: (2024)
por: Do, Quyet V., et al.
Publicado: (2024)
ActPlan-1K: Benchmarking the Procedural Planning Ability of Visual Language Models in Household Activities
por: Su, Ying, et al.
Publicado: (2024)
por: Su, Ying, et al.
Publicado: (2024)
The Cognitive Bandwidth Bottleneck: Shifting Long-Horizon Agent from Planning with Actions to Planning with Schemas
por: Xu, Baixuan, et al.
Publicado: (2025)
por: Xu, Baixuan, et al.
Publicado: (2025)
IntentionQA: A Benchmark for Evaluating Purchase Intention Comprehension Abilities of Language Models in E-commerce
por: Ding, Wenxuan, et al.
Publicado: (2024)
por: Ding, Wenxuan, et al.
Publicado: (2024)
DivScene: Towards Open-Vocabulary Object Navigation with Large Vision Language Models in Diverse Scenes
por: Wang, Zhaowei, et al.
Publicado: (2024)
por: Wang, Zhaowei, et al.
Publicado: (2024)
On-the-fly Denoising for Data Augmentation in Natural Language Understanding
por: Fang, Tianqing, et al.
Publicado: (2022)
por: Fang, Tianqing, et al.
Publicado: (2022)
ChatGPT Evaluation on Sentence Level Relations: A Focus on Temporal, Causal, and Discourse Relations
por: Chan, Chunkit, et al.
Publicado: (2023)
por: Chan, Chunkit, et al.
Publicado: (2023)
Complex Reasoning over Logical Queries on Commonsense Knowledge Graphs
por: Fang, Tianqing, et al.
Publicado: (2024)
por: Fang, Tianqing, et al.
Publicado: (2024)
On the Role of Entity and Event Level Conceptualization in Generalizable Reasoning: A Survey of Tasks, Methods, Applications, and Future Directions
por: Wang, Weiqi, et al.
Publicado: (2024)
por: Wang, Weiqi, et al.
Publicado: (2024)
Neutralizing Bias in LLM Reasoning using Entailment Graphs
por: Cheng, Liang, et al.
Publicado: (2025)
por: Cheng, Liang, et al.
Publicado: (2025)
Revisiting Epistemic Markers in Confidence Estimation: Can Markers Accurately Reflect Large Language Models' Uncertainty?
por: Liu, Jiayu, et al.
Publicado: (2025)
por: Liu, Jiayu, et al.
Publicado: (2025)
CritiCal: Can Critique Help LLM Uncertainty or Confidence Calibration?
por: Zong, Qing, et al.
Publicado: (2025)
por: Zong, Qing, et al.
Publicado: (2025)
CodeGraph: Enhancing Graph Reasoning of LLMs with Code
por: Cai, Qiaolong, et al.
Publicado: (2024)
por: Cai, Qiaolong, et al.
Publicado: (2024)
EcomEdit: An Automated E-commerce Knowledge Editing Framework for Enhanced Product and Purchase Intention Understanding
por: Lau, Ching Ming Samuel, et al.
Publicado: (2024)
por: Lau, Ching Ming Samuel, et al.
Publicado: (2024)
CLR-Fact: Evaluating the Complex Logical Reasoning Capability of Large Language Models over Factual Knowledge
por: Zheng, Tianshi, et al.
Publicado: (2024)
por: Zheng, Tianshi, et al.
Publicado: (2024)
Enhancing Transformers for Generalizable First-Order Logical Entailment
por: Zheng, Tianshi, et al.
Publicado: (2025)
por: Zheng, Tianshi, et al.
Publicado: (2025)
GoldCoin: Grounding Large Language Models in Privacy Laws via Contextual Integrity Theory
por: Fan, Wei, et al.
Publicado: (2024)
por: Fan, Wei, et al.
Publicado: (2024)
NegotiationToM: A Benchmark for Stress-testing Machine Theory of Mind on Negotiation Surrounding
por: Chan, Chunkit, et al.
Publicado: (2024)
por: Chan, Chunkit, et al.
Publicado: (2024)
MIND: Multimodal Shopping Intention Distillation from Large Vision-language Models for E-commerce Purchase Understanding
por: Xu, Baixuan, et al.
Publicado: (2024)
por: Xu, Baixuan, et al.
Publicado: (2024)
arXiv2Table: Toward Realistic Benchmarking and Evaluation for LLM-Based Literature-Review Table Generation
por: Wang, Weiqi, et al.
Publicado: (2025)
por: Wang, Weiqi, et al.
Publicado: (2025)
KNOWCOMP POKEMON Team at DialAM-2024: A Two-Stage Pipeline for Detecting Relations in Dialogical Argument Mining
por: Zheng, Zihao, et al.
Publicado: (2024)
por: Zheng, Zihao, et al.
Publicado: (2024)
MIKO: Multimodal Intention Knowledge Distillation from Large Language Models for Social-Media Commonsense Discovery
por: Lu, Feihong, et al.
Publicado: (2024)
por: Lu, Feihong, et al.
Publicado: (2024)
From Automation to Autonomy: A Survey on Large Language Models in Scientific Discovery
por: Zheng, Tianshi, et al.
Publicado: (2025)
por: Zheng, Tianshi, et al.
Publicado: (2025)
Entailed Opinion Matters: Improving the Fact-Checking Performance of Language Models by Relying on their Entailment Ability
por: Kumar, Gaurav, et al.
Publicado: (2025)
por: Kumar, Gaurav, et al.
Publicado: (2025)
ComparisonQA: Evaluating Factuality Robustness of LLMs Through Knowledge Frequency Control and Uncertainty
por: Zong, Qing, et al.
Publicado: (2024)
por: Zong, Qing, et al.
Publicado: (2024)
Cross-Architecture Transfer Learning for Linear-Cost Inference Transformers
por: Choi, Sehyun
Publicado: (2024)
por: Choi, Sehyun
Publicado: (2024)
INFERENCEDYNAMICS: Efficient Routing Across LLMs through Structured Capability and Knowledge Profiling
por: Shi, Haochen, et al.
Publicado: (2025)
por: Shi, Haochen, et al.
Publicado: (2025)
Entailment-Preserving First-order Logic Representations in Natural Language Entailment
por: Lee, Jinu, et al.
Publicado: (2025)
por: Lee, Jinu, et al.
Publicado: (2025)
Abstraction-of-Thought Makes Language Models Better Reasoners
por: Hong, Ruixin, et al.
Publicado: (2024)
por: Hong, Ruixin, et al.
Publicado: (2024)
KnowShiftQA: How Robust are RAG Systems when Textbook Knowledge Shifts in K-12 Education?
por: Zheng, Tianshi, et al.
Publicado: (2024)
por: Zheng, Tianshi, et al.
Publicado: (2024)
Towards Multi-Agent Reasoning Systems for Collaborative Expertise Delegation: An Exploratory Design Study
por: Xu, Baixuan, et al.
Publicado: (2025)
por: Xu, Baixuan, et al.
Publicado: (2025)
Ejemplares similares
-
AbsInstruct: Eliciting Abstraction Ability from LLMs through Explanation Tuning with Plausibility Estimation
por: Wang, Zhaowei, et al.
Publicado: (2024) -
CKBP v2: Better Annotation and Reasoning for Commonsense Knowledge Base Population
por: Fang, Tianqing, et al.
Publicado: (2023) -
MARS: Benchmarking the Metaphysical Reasoning Abilities of Language Models with a Multi-task Evaluation Dataset
por: Wang, Weiqi, et al.
Publicado: (2024) -
Concept-Reversed Winograd Schema Challenge: Evaluating and Improving Robust Reasoning in Large Language Models via Abstraction
por: Han, Kaiqiao, et al.
Publicado: (2024) -
EntailE: Introducing Textual Entailment in Commonsense Knowledge Graph Completion
por: Su, Ying, et al.
Publicado: (2024)