Saved in:
| Main Authors: | Küçük, Dilek, Can, Fazli |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2503.04305 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MiDe22: An Annotated Multi-Event Tweet Dataset for Misinformation Detection
by: Toraman, Cagri, et al.
Published: (2022)
by: Toraman, Cagri, et al.
Published: (2022)
OAEI-LLM: A Benchmark Dataset for Understanding Large Language Model Hallucinations in Ontology Matching
by: Qiang, Zhangcheng, et al.
Published: (2024)
by: Qiang, Zhangcheng, et al.
Published: (2024)
TransLaw: A Large-Scale Dataset and Multi-Agent Benchmark Simulating Professional Translation of Hong Kong Case Law
by: Xuan, Xi, et al.
Published: (2025)
by: Xuan, Xi, et al.
Published: (2025)
OAEI-LLM-T: A TBox Benchmark Dataset for Understanding Large Language Model Hallucinations in Ontology Matching
by: Qiang, Zhangcheng, et al.
Published: (2025)
by: Qiang, Zhangcheng, et al.
Published: (2025)
Learning to Explain: Prototype-Based Surrogate Models for LLM Classification
by: Wei, Bowen, et al.
Published: (2025)
by: Wei, Bowen, et al.
Published: (2025)
AnnoCaseLaw: A Richly-Annotated Dataset For Benchmarking Explainable Legal Judgment Prediction
by: Sesodia, Magnus, et al.
Published: (2025)
by: Sesodia, Magnus, et al.
Published: (2025)
Ontology for Policing: Conceptual Knowledge Learning for Semantic Understanding and Reasoning in Law Enforcement Reports
by: Srbinovska, Anita, et al.
Published: (2026)
by: Srbinovska, Anita, et al.
Published: (2026)
ReGATE: Learning Faster and Better with Fewer Tokens in MLLMs
by: Li, Chaoyu, et al.
Published: (2025)
by: Li, Chaoyu, et al.
Published: (2025)
Turkish Delights: a Dataset on Turkish Euphemisms
by: Biyik, Hasan Can, et al.
Published: (2024)
by: Biyik, Hasan Can, et al.
Published: (2024)
ADAB: Arabic Dataset for Automated Politeness Benchmarking -- A Large-Scale Resource for Computational Sociopragmatics
by: Al-Khalifa, Hend, et al.
Published: (2026)
by: Al-Khalifa, Hend, et al.
Published: (2026)
Self-Improving LLM Agents at Test-Time
by: Acikgoz, Emre Can, et al.
Published: (2025)
by: Acikgoz, Emre Can, et al.
Published: (2025)
ReSpAct: Harmonizing Reasoning, Speaking, and Acting Towards Building Large Language Model-Based Conversational AI Agents
by: Dongre, Vardhan, et al.
Published: (2024)
by: Dongre, Vardhan, et al.
Published: (2024)
LegalBench.PT: A Benchmark for Portuguese Law
by: Canaverde, Beatriz, et al.
Published: (2025)
by: Canaverde, Beatriz, et al.
Published: (2025)
OntoURL: A Benchmark for Evaluating Large Language Models on Symbolic Ontological Understanding, Reasoning and Learning
by: Zhang, Xiao, et al.
Published: (2025)
by: Zhang, Xiao, et al.
Published: (2025)
LaMPilot: An Open Benchmark Dataset for Autonomous Driving with Language Model Programs
by: Ma, Yunsheng, et al.
Published: (2023)
by: Ma, Yunsheng, et al.
Published: (2023)
Ontology Enhanced Claim Detection
by: Hüsünbeyi, Zehra Melce, et al.
Published: (2024)
by: Hüsünbeyi, Zehra Melce, et al.
Published: (2024)
The Cambridge Law Corpus: A Dataset for Legal AI Research
by: Östling, Andreas, et al.
Published: (2023)
by: Östling, Andreas, et al.
Published: (2023)
TD-EVAL: Revisiting Task-Oriented Dialogue Evaluation by Combining Turn-Level Precision with Dialogue-Level Comparisons
by: Acikgoz, Emre Can, et al.
Published: (2025)
by: Acikgoz, Emre Can, et al.
Published: (2025)
TRIDENT: Benchmarking LLM Safety in Finance, Medicine, and Law
by: Hui, Zheng, et al.
Published: (2025)
by: Hui, Zheng, et al.
Published: (2025)
MulCogBench: A Multi-modal Cognitive Benchmark Dataset for Evaluating Chinese and English Computational Language Models
by: Zhang, Yunhao, et al.
Published: (2024)
by: Zhang, Yunhao, et al.
Published: (2024)
Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!
by: Imam, Mohamed Fazli, et al.
Published: (2025)
by: Imam, Mohamed Fazli, et al.
Published: (2025)
Scaling Laws for Agent Harnesses via Effective Feedback Compute
by: Zhang, Xuanliang, et al.
Published: (2026)
by: Zhang, Xuanliang, et al.
Published: (2026)
Fine-grained Claim-level RAG Benchmark for Law
by: Das, Souvick, et al.
Published: (2026)
by: Das, Souvick, et al.
Published: (2026)
From Fact to Judgment: Investigating the Impact of Task Framing on LLM Conviction in Dialogue Systems
by: Rabbani, Parisa, et al.
Published: (2025)
by: Rabbani, Parisa, et al.
Published: (2025)
Mitigating Hallucination in Large Vision-Language Models via Adaptive Attention Calibration
by: Fazli, Mehrdad, et al.
Published: (2025)
by: Fazli, Mehrdad, et al.
Published: (2025)
Open Ontologies: Tool-Augmented Ontology Engineering with Stable Matching Alignment
by: Rovai, Fabio
Published: (2026)
by: Rovai, Fabio
Published: (2026)
Ontology-Free General-Domain Knowledge Graph-to-Text Generation Dataset Synthesis using Large Language Model
by: Kim, Daehee, et al.
Published: (2024)
by: Kim, Daehee, et al.
Published: (2024)
ATOD: An Evaluation Framework and Benchmark for Agentic Task-Oriented Dialogue Systems
by: Zhang, Yifei, et al.
Published: (2026)
by: Zhang, Yifei, et al.
Published: (2026)
Neural Networks for Learnable and Scalable Influence Estimation of Instruction Fine-Tuning Data
by: Agarwal, Ishika, et al.
Published: (2025)
by: Agarwal, Ishika, et al.
Published: (2025)
Do LLMs Encode Functional Importance of Reasoning Tokens?
by: Singh, Janvijay, et al.
Published: (2026)
by: Singh, Janvijay, et al.
Published: (2026)
Embodied Multi-Agent Coordination by Aligning World Models Through Dialogue
by: Dongre, Vardhan, et al.
Published: (2026)
by: Dongre, Vardhan, et al.
Published: (2026)
OM4OV: Leveraging Ontology Matching for Ontology Versioning
by: Qiang, Zhangcheng, et al.
Published: (2024)
by: Qiang, Zhangcheng, et al.
Published: (2024)
A Dataset and Benchmark for Consumer Healthcare Question Summarization
by: Basu, Abhishek, et al.
Published: (2025)
by: Basu, Abhishek, et al.
Published: (2025)
Sāmayik: A Benchmark and Dataset for English-Sanskrit Translation
by: Maheshwari, Ayush, et al.
Published: (2023)
by: Maheshwari, Ayush, et al.
Published: (2023)
A Desideratum for Conversational Agents: Capabilities, Challenges, and Future Directions
by: Acikgoz, Emre Can, et al.
Published: (2025)
by: Acikgoz, Emre Can, et al.
Published: (2025)
A Survey of Ontology Expansion for Conversational Understanding
by: Liang, Jinggui, et al.
Published: (2024)
by: Liang, Jinggui, et al.
Published: (2024)
Data-driven Coreference-based Ontology Building
by: Ashury-Tahan, Shir, et al.
Published: (2024)
by: Ashury-Tahan, Shir, et al.
Published: (2024)
Do LLMs Dream of Ontologies?
by: Bombieri, Marco, et al.
Published: (2024)
by: Bombieri, Marco, et al.
Published: (2024)
Ontology Population using LLMs
by: Norouzi, Sanaz Saki, et al.
Published: (2024)
by: Norouzi, Sanaz Saki, et al.
Published: (2024)
Beyond Sample-Level Feedback: Using Reference-Level Feedback to Guide Data Synthesis
by: Mehri, Shuhaib, et al.
Published: (2025)
by: Mehri, Shuhaib, et al.
Published: (2025)
Similar Items
-
MiDe22: An Annotated Multi-Event Tweet Dataset for Misinformation Detection
by: Toraman, Cagri, et al.
Published: (2022) -
OAEI-LLM: A Benchmark Dataset for Understanding Large Language Model Hallucinations in Ontology Matching
by: Qiang, Zhangcheng, et al.
Published: (2024) -
TransLaw: A Large-Scale Dataset and Multi-Agent Benchmark Simulating Professional Translation of Hong Kong Case Law
by: Xuan, Xi, et al.
Published: (2025) -
OAEI-LLM-T: A TBox Benchmark Dataset for Understanding Large Language Model Hallucinations in Ontology Matching
by: Qiang, Zhangcheng, et al.
Published: (2025) -
Learning to Explain: Prototype-Based Surrogate Models for LLM Classification
by: Wei, Bowen, et al.
Published: (2025)