The 2021 Tokyo Olympics Multilingual News Article Dataset
Fuente:
arXiv
Saved in:
| Main Authors: | Novak, Erik, Calcina, Erik, Mladenić, Dunja, Grobelnik, Marko |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
A Commonsense-Infused Language-Agnostic Learning Framework for Enhancing Prediction of Political Polarity in Multilingual News Headlines
by: Swati, Swati, et al.
Published: (2022)
by: Swati, Swati, et al.
Published: (2022)
BAR-Analytics: A Web-based Platform for Analyzing Information Spreading Barriers in News: Comparative Analysis Across Multiple Barriers and Events
by: Sittar, Abdul, et al.
Published: (2025)
by: Sittar, Abdul, et al.
Published: (2025)
Beyond Catalogue Counts: the Dataset Visibility Asymmetry in Low-Resource Multilingual NLP
by: Tan, Zhiyin, et al.
Published: (2026)
by: Tan, Zhiyin, et al.
Published: (2026)
WebFAQ: A Multilingual Collection of Natural Q&A Datasets for Dense Retrieval
by: Dinzinger, Michael, et al.
Published: (2025)
by: Dinzinger, Michael, et al.
Published: (2025)
WebFAQ 2.0: A Multilingual QA Dataset with Mined Hard Negatives for Dense Retrieval
by: Dinzinger, Michael, et al.
Published: (2026)
by: Dinzinger, Michael, et al.
Published: (2026)
Are LLMs Truly Multilingual? Exploring Zero-Shot Multilingual Capability of LLMs for Information Retrieval: An Italian Healthcare Use Case
by: Kembu, Vignesh Kumar, et al.
Published: (2025)
by: Kembu, Vignesh Kumar, et al.
Published: (2025)
MMTEB: Massive Multilingual Text Embedding Benchmark
by: Enevoldsen, Kenneth, et al.
Published: (2025)
by: Enevoldsen, Kenneth, et al.
Published: (2025)
Multilingual Information Retrieval with a Monolingual Knowledge Base
by: Zhuang, Yingying, et al.
Published: (2025)
by: Zhuang, Yingying, et al.
Published: (2025)
Generative Query Expansion with Multilingual LLMs for Cross-Lingual Information Retrieval
by: Macmillan-Scott, Olivia, et al.
Published: (2025)
by: Macmillan-Scott, Olivia, et al.
Published: (2025)
RDF-Based Structured Quality Assessment Representation of Multilingual LLM Evaluations
by: Gwozdz, Jonas, et al.
Published: (2025)
by: Gwozdz, Jonas, et al.
Published: (2025)
Enhancing Multilingual Embeddings via Multi-Way Parallel Text Alignment
by: Fazili, Barah, et al.
Published: (2026)
by: Fazili, Barah, et al.
Published: (2026)
Multi-EuP: The Multilingual European Parliament Dataset for Analysis of Bias in Information Retrieval
by: Yang, Jinrui, et al.
Published: (2023)
by: Yang, Jinrui, et al.
Published: (2023)
Bridging Language Gaps: Advances in Cross-Lingual Information Retrieval with Multilingual LLMs
by: Goworek, Roksana, et al.
Published: (2025)
by: Goworek, Roksana, et al.
Published: (2025)
What Drives Cross-lingual Ranking? Retrieval Approaches with Multilingual Language Models
by: Goworek, Roksana, et al.
Published: (2025)
by: Goworek, Roksana, et al.
Published: (2025)
Faux Polyglot: A Study on Information Disparity in Multilingual Large Language Models
by: Sharma, Nikhil, et al.
Published: (2024)
by: Sharma, Nikhil, et al.
Published: (2024)
Analysis and Detection of Multilingual Hate Speech Using Transformer Based Deep Learning
by: Das, Arijit, et al.
Published: (2024)
by: Das, Arijit, et al.
Published: (2024)
Leveraging LLMs for Synthesizing Training Data Across Many Languages in Multilingual Dense Retrieval
by: Thakur, Nandan, et al.
Published: (2023)
by: Thakur, Nandan, et al.
Published: (2023)
LEMUR: A Corpus for Robust Fine-Tuning of Multilingual Law Embedding Models for Retrieval
by: Ahmadi, Narges Baba, et al.
Published: (2026)
by: Ahmadi, Narges Baba, et al.
Published: (2026)
Efficient and Versatile Model for Multilingual Information Retrieval of Islamic Text: Development and Deployment in Real-World Scenarios
by: Pavlova, Vera, et al.
Published: (2025)
by: Pavlova, Vera, et al.
Published: (2025)
Overview of the TREC 2021 deep learning track
by: Craswell, Nick, et al.
Published: (2025)
by: Craswell, Nick, et al.
Published: (2025)
fact check AI at SemEval-2025 Task 7: Multilingual and Crosslingual Fact-checked Claim Retrieval
by: Rastogi, Pranshu
Published: (2025)
by: Rastogi, Pranshu
Published: (2025)
CLEF HIPE-2026: Evaluating Accurate and Efficient Person-Place Relation Extraction from Multilingual Historical Texts
by: Opitz, Juri, et al.
Published: (2026)
by: Opitz, Juri, et al.
Published: (2026)
Text-to-SPARQL Goes Beyond English: Multilingual Question Answering Over Knowledge Graphs through Human-Inspired Reasoning
by: Perevalov, Aleksandr, et al.
Published: (2025)
by: Perevalov, Aleksandr, et al.
Published: (2025)
Paraphrase Identification with Deep Learning: A Review of Datasets and Methods
by: Zhou, Chao, et al.
Published: (2022)
by: Zhou, Chao, et al.
Published: (2022)
Evaluating Structured Decoding for Text-to-Table Generation: Evidence from Three Datasets
by: Oestreich, Julian, et al.
Published: (2025)
by: Oestreich, Julian, et al.
Published: (2025)
PeerQA: A Scientific Question Answering Dataset from Peer Reviews
by: Baumgärtner, Tim, et al.
Published: (2025)
by: Baumgärtner, Tim, et al.
Published: (2025)
ScIRGen: Synthesize Realistic and Large-Scale RAG Dataset for Scientific Research
by: Lin, Junyong, et al.
Published: (2025)
by: Lin, Junyong, et al.
Published: (2025)
ConfReady: A RAG based Assistant and Dataset for Conference Checklist Responses
by: Galarnyk, Michael, et al.
Published: (2024)
by: Galarnyk, Michael, et al.
Published: (2024)
SCARV: Structure-Constrained Aggregation for Stable Sample Ranking in Redundant NLP Datasets
by: Zheng, Xu, et al.
Published: (2026)
by: Zheng, Xu, et al.
Published: (2026)
ScrapeGraphAI-100k: Dataset for Schema-Constrained LLM Generation
by: Brach, William, et al.
Published: (2026)
by: Brach, William, et al.
Published: (2026)
FinAgentBench: A Benchmark Dataset for Agentic Retrieval in Financial Question Answering
by: Choi, Chanyeol, et al.
Published: (2025)
by: Choi, Chanyeol, et al.
Published: (2025)
OAEI-LLM: A Benchmark Dataset for Understanding Large Language Model Hallucinations in Ontology Matching
by: Qiang, Zhangcheng, et al.
Published: (2024)
by: Qiang, Zhangcheng, et al.
Published: (2024)
When do Generative Query and Document Expansions Fail? A Comprehensive Study Across Methods, Retrievers, and Datasets
by: Weller, Orion, et al.
Published: (2023)
by: Weller, Orion, et al.
Published: (2023)
PerLTQA: A Personal Long-Term Memory Dataset for Memory Classification, Retrieval, and Synthesis in Question Answering
by: Du, Yiming, et al.
Published: (2024)
by: Du, Yiming, et al.
Published: (2024)
LFQA-HP-1M: A Large-Scale Human Preference Dataset for Long-Form Question Answering
by: Jahan, Rafid Ishrak, et al.
Published: (2026)
by: Jahan, Rafid Ishrak, et al.
Published: (2026)
Attribution in Scientific Literature: New Benchmark and Methods
by: Saxena, Yash, et al.
Published: (2024)
by: Saxena, Yash, et al.
Published: (2024)
Cognitive Biases in Large Language Models for News Recommendation
by: Lyu, Yougang, et al.
Published: (2024)
by: Lyu, Yougang, et al.
Published: (2024)
Large Language Model Agent for Fake News Detection
by: Li, Xinyi, et al.
Published: (2024)
by: Li, Xinyi, et al.
Published: (2024)
Inference Gap in Domain Expertise and Machine Intelligence in Named Entity Recognition: Creation of and Insights from a Substance Use-related Dataset
by: Dey, Sumon Kanti, et al.
Published: (2025)
by: Dey, Sumon Kanti, et al.
Published: (2025)
Can LLM Substitute Human Labeling? A Case Study of Fine-grained Chinese Address Entity Recognition Dataset for UAV Delivery
by: Yao, Yuxuan, et al.
Published: (2024)
by: Yao, Yuxuan, et al.
Published: (2024)
Similar Items
-
A Commonsense-Infused Language-Agnostic Learning Framework for Enhancing Prediction of Political Polarity in Multilingual News Headlines
by: Swati, Swati, et al.
Published: (2022) -
BAR-Analytics: A Web-based Platform for Analyzing Information Spreading Barriers in News: Comparative Analysis Across Multiple Barriers and Events
by: Sittar, Abdul, et al.
Published: (2025) -
Beyond Catalogue Counts: the Dataset Visibility Asymmetry in Low-Resource Multilingual NLP
by: Tan, Zhiyin, et al.
Published: (2026) -
WebFAQ: A Multilingual Collection of Natural Q&A Datasets for Dense Retrieval
by: Dinzinger, Michael, et al.
Published: (2025) -
WebFAQ 2.0: A Multilingual QA Dataset with Mined Hard Negatives for Dense Retrieval
by: Dinzinger, Michael, et al.
Published: (2026)