OARelatedWork: A Large-Scale Dataset of Related Work Sections with Full-texts from Open Access Sources
Fuente:
arXiv
Saved in:
| Main Authors: | Docekal, Martin, Fajcik, Martin, Smrz, Pavel |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
IDIAPers @ Causal News Corpus 2022: Efficient Causal Relation Identification Through a Prompt-based Few-shot Approach
by: Burdisso, Sergio, et al.
Published: (2022)
by: Burdisso, Sergio, et al.
Published: (2022)
On Recipe Memorization and Creativity in Large Language Models: Is Your Model a Creative Cook, a Bad Cook, or Merely a Plagiator?
by: Kvapil, Jan, et al.
Published: (2025)
by: Kvapil, Jan, et al.
Published: (2025)
BenCzechMark : A Czech-centric Multitask and Multimetric Benchmark for Large Language Models with Duel Scoring Mechanism
by: Fajcik, Martin, et al.
Published: (2024)
by: Fajcik, Martin, et al.
Published: (2024)
FGR-ColBERT: Identifying Fine-Grained Relevance Tokens During Retrieval
by: Jarolím, Antonín, et al.
Published: (2026)
by: Jarolím, Antonín, et al.
Published: (2026)
CzechTopic: A Benchmark for Zero-Shot Topic Localization in Historical Czech Documents
by: Kostelník, Martin, et al.
Published: (2026)
by: Kostelník, Martin, et al.
Published: (2026)
Can LLMs extract human-like fine-grained evidence for evidence-based fact-checking?
by: Jarolím, Antonín, et al.
Published: (2025)
by: Jarolím, Antonín, et al.
Published: (2025)
Examining the Metrics for Document-Level Claim Extraction in Czech and Slovak
by: Makaiova, Lucia, et al.
Published: (2025)
by: Makaiova, Lucia, et al.
Published: (2025)
CORWA: A Citation-Oriented Related Work Annotation Dataset
by: Li, Xiangci, et al.
Published: (2022)
by: Li, Xiangci, et al.
Published: (2022)
Select, Read, and Write: A Multi-Agent Framework of Full-Text-based Related Work Generation
by: Liu, Xiaochuan, et al.
Published: (2025)
by: Liu, Xiaochuan, et al.
Published: (2025)
Toward Human-Centered AI-Assisted Terminology Work
by: Martin, Antonio San
Published: (2025)
by: Martin, Antonio San
Published: (2025)
CMNEE: A Large-Scale Document-Level Event Extraction Dataset based on Open-Source Chinese Military News
by: Zhu, Mengna, et al.
Published: (2024)
by: Zhu, Mengna, et al.
Published: (2024)
Shallow Synthesis of Knowledge in GPT-Generated Texts: A Case Study in Automatic Related Work Composition
by: Martin-Boyle, Anna, et al.
Published: (2024)
by: Martin-Boyle, Anna, et al.
Published: (2024)
Related Work and Citation Text Generation: A Survey
by: Li, Xiangci, et al.
Published: (2024)
by: Li, Xiangci, et al.
Published: (2024)
KazQAD: Kazakh Open-Domain Question Answering Dataset
by: Yeshpanov, Rustem, et al.
Published: (2024)
by: Yeshpanov, Rustem, et al.
Published: (2024)
The Elephant in the Coreference Room: Resolving Coreference in Full-Length French Fiction Works
by: Bourgois, Antoine, et al.
Published: (2025)
by: Bourgois, Antoine, et al.
Published: (2025)
Using Large Language Models to Generate Authentic Multi-agent Knowledge Work Datasets
by: Heim, Desiree, et al.
Published: (2024)
by: Heim, Desiree, et al.
Published: (2024)
Expert Preference-based Evaluation of Automated Related Work Generation
by: Şahinuç, Furkan, et al.
Published: (2025)
by: Şahinuç, Furkan, et al.
Published: (2025)
Chain of Correction for Full-text Speech Recognition with Large Language Models
by: Tang, Zhiyuan, et al.
Published: (2025)
by: Tang, Zhiyuan, et al.
Published: (2025)
1.4 Million Open-Source Distilled Reasoning Dataset to Empower Large Language Model Training
by: Zhao, Han, et al.
Published: (2025)
by: Zhao, Han, et al.
Published: (2025)
TIM: A Large-Scale Dataset and large Timeline Intelligence Model for Open-domain Timeline Summarization
by: Hu, Chuanrui, et al.
Published: (2025)
by: Hu, Chuanrui, et al.
Published: (2025)
Full-text Error Correction for Chinese Speech Recognition with Large Language Model
by: Tang, Zhiyuan, et al.
Published: (2024)
by: Tang, Zhiyuan, et al.
Published: (2024)
Small Scale Reflection for the Working Lean User
by: Gladshtein, Vladimir, et al.
Published: (2024)
by: Gladshtein, Vladimir, et al.
Published: (2024)
OpenNER 1.0: Standardized Open-Access Named Entity Recognition Datasets in 50+ Languages
by: Palen-Michel, Chester, et al.
Published: (2024)
by: Palen-Michel, Chester, et al.
Published: (2024)
BiblioPage: A Dataset of Scanned Title Pages for Bibliographic Metadata Extraction
by: Kohút, Jan, et al.
Published: (2025)
by: Kohút, Jan, et al.
Published: (2025)
Do Membership Inference Attacks Work on Large Language Models?
by: Duan, Michael, et al.
Published: (2024)
by: Duan, Michael, et al.
Published: (2024)
CareBot: A Pioneering Full-Process Open-Source Medical Language Model
by: Zhao, Lulu, et al.
Published: (2024)
by: Zhao, Lulu, et al.
Published: (2024)
MultiCW: A Large-Scale Balanced Benchmark Dataset for Training Robust Check-Worthiness Detection Models
by: Hyben, Martin, et al.
Published: (2026)
by: Hyben, Martin, et al.
Published: (2026)
A Multi-lingual Dataset of Classified Paragraphs from Open Access Scientific Publications
by: Jeangirard, Eric
Published: (2025)
by: Jeangirard, Eric
Published: (2025)
Aya Dataset: An Open-Access Collection for Multilingual Instruction Tuning
by: Singh, Shivalika, et al.
Published: (2024)
by: Singh, Shivalika, et al.
Published: (2024)
PrExMe! Large Scale Prompt Exploration of Open Source LLMs for Machine Translation and Summarization Evaluation
by: Leiter, Christoph, et al.
Published: (2024)
by: Leiter, Christoph, et al.
Published: (2024)
Towards Uncovering How Large Language Model Works: An Explainability Perspective
by: Zhao, Haiyan, et al.
Published: (2024)
by: Zhao, Haiyan, et al.
Published: (2024)
OpenEthics: A Comprehensive Ethical Evaluation of Open-Source Generative Large Language Models
by: Özen, Yıldırım, et al.
Published: (2025)
by: Özen, Yıldırım, et al.
Published: (2025)
Do Influence Functions Work on Large Language Models?
by: Li, Zhe, et al.
Published: (2024)
by: Li, Zhe, et al.
Published: (2024)
Empowering Working Memory for Large Language Model Agents
by: Guo, Jing, et al.
Published: (2023)
by: Guo, Jing, et al.
Published: (2023)
Aqulia-Med LLM: Pioneering Full-Process Open-Source Medical Language Models
by: Zhao, Lulu, et al.
Published: (2024)
by: Zhao, Lulu, et al.
Published: (2024)
RETQA: A Large-Scale Open-Domain Tabular Question Answering Dataset for Real Estate Sector
by: Wang, Zhensheng, et al.
Published: (2024)
by: Wang, Zhensheng, et al.
Published: (2024)
One Task Vector is not Enough: A Large-Scale Study for In-Context Learning
by: Tikhonov, Pavel, et al.
Published: (2025)
by: Tikhonov, Pavel, et al.
Published: (2025)
WorkRB: A Community-Driven Evaluation Framework for AI in the Work Domain
by: De Lange, Matthias, et al.
Published: (2026)
by: De Lange, Matthias, et al.
Published: (2026)
A Large-Scale Vision-Language Dataset Derived from Open Scientific Literature to Advance Biomedical Generalist AI
by: Lozano, Alejandro, et al.
Published: (2025)
by: Lozano, Alejandro, et al.
Published: (2025)
OpenThaiGPT 1.5: A Thai-Centric Open Source Large Language Model
by: Yuenyong, Sumeth, et al.
Published: (2024)
by: Yuenyong, Sumeth, et al.
Published: (2024)
Similar Items
-
IDIAPers @ Causal News Corpus 2022: Efficient Causal Relation Identification Through a Prompt-based Few-shot Approach
by: Burdisso, Sergio, et al.
Published: (2022) -
On Recipe Memorization and Creativity in Large Language Models: Is Your Model a Creative Cook, a Bad Cook, or Merely a Plagiator?
by: Kvapil, Jan, et al.
Published: (2025) -
BenCzechMark : A Czech-centric Multitask and Multimetric Benchmark for Large Language Models with Duel Scoring Mechanism
by: Fajcik, Martin, et al.
Published: (2024) -
FGR-ColBERT: Identifying Fine-Grained Relevance Tokens During Retrieval
by: Jarolím, Antonín, et al.
Published: (2026) -
CzechTopic: A Benchmark for Zero-Shot Topic Localization in Historical Czech Documents
by: Kostelník, Martin, et al.
Published: (2026)