MessIRve: A Large-Scale Spanish Information Retrieval Dataset
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Valentini, Francisco, Cotik, Viviana, Furman, Damián, Bercovich, Ivan, Altszyler, Edgar, Pérez, Juan Manuel |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Exploring Large Language Models for Hate Speech Detection in Rioplatense Spanish
par: Pérez, Juan Manuel, et autres
Publié: (2024)
par: Pérez, Juan Manuel, et autres
Publié: (2024)
Seventeenth-Century Spanish American Notary Records for Fine-Tuning Spanish Large Language Models
par: Sarker, Shraboni, et autres
Publié: (2024)
par: Sarker, Shraboni, et autres
Publié: (2024)
Mining Reasons For And Against Vaccination From Unstructured Data Using Nichesourcing and AI Data Augmentation
par: Furman, Damián Ariel, et autres
Publié: (2024)
par: Furman, Damián Ariel, et autres
Publié: (2024)
OCR or Not? Rethinking Document Information Extraction in the MLLMs Era with Real-World Large-Scale Datasets
par: Shen, Jiyuan, et autres
Publié: (2026)
par: Shen, Jiyuan, et autres
Publié: (2026)
What Makes a Good Terminal-Agent Benchmark Task: A Guideline for Adversarial, Difficult, and Legible Evaluation Design
par: Bercovich, Ivan
Publié: (2026)
par: Bercovich, Ivan
Publié: (2026)
Indigenous Languages Spoken in Argentina: A Survey of NLP and Speech Resources
par: Ticona, Belu, et autres
Publié: (2025)
par: Ticona, Belu, et autres
Publié: (2025)
NoticIA: A Clickbait Article Summarization Dataset in Spanish
par: García-Ferrero, Iker, et autres
Publié: (2024)
par: García-Ferrero, Iker, et autres
Publié: (2024)
A Large-Scale Dataset and Citation Intent Classification in Turkish with LLMs
par: Karaca, Kemal Sami, et autres
Publié: (2025)
par: Karaca, Kemal Sami, et autres
Publié: (2025)
BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset
par: Xi, Zhiheng, et autres
Publié: (2025)
par: Xi, Zhiheng, et autres
Publié: (2025)
SlovKE: A Large-Scale Dataset and LLM Evaluation for Slovak Keyphrase Extraction
par: Števaňák, David, et autres
Publié: (2026)
par: Števaňák, David, et autres
Publié: (2026)
VietLyrics: A Large-Scale Dataset and Models for Vietnamese Automatic Lyrics Transcription
par: Nguyen, Quoc Anh, et autres
Publié: (2025)
par: Nguyen, Quoc Anh, et autres
Publié: (2025)
SwitchLingua: The First Large-Scale Multilingual and Multi-Ethnic Code-Switching Dataset
par: Xie, Peng, et autres
Publié: (2025)
par: Xie, Peng, et autres
Publié: (2025)
SPACE-IDEAS: A Dataset for Salient Information Detection in Space Innovation
par: García-Silva, Andrés, et autres
Publié: (2024)
par: García-Silva, Andrés, et autres
Publié: (2024)
LengClaro2023: A Dataset of Administrative Texts in Spanish with Plain Language adaptations
par: Agüera-Marco, Belén, et autres
Publié: (2025)
par: Agüera-Marco, Belén, et autres
Publié: (2025)
The Hot Mess of AI: How Does Misalignment Scale With Model Intelligence and Task Complexity?
par: Hägele, Alexander, et autres
Publié: (2026)
par: Hägele, Alexander, et autres
Publié: (2026)
Can LLMs Clean Up Your Mess? A Survey of Application-Ready Data Preparation with LLMs
par: Zhou, Wei, et autres
Publié: (2026)
par: Zhou, Wei, et autres
Publié: (2026)
Retrieval-Augmented Large Language Models for Schema-Constrained Clinical Information Extraction
par: Karim, A H M Rezaul, et autres
Publié: (2026)
par: Karim, A H M Rezaul, et autres
Publié: (2026)
JMultiWOZ: A Large-Scale Japanese Multi-Domain Task-Oriented Dialogue Dataset
par: Ohashi, Atsumoto, et autres
Publié: (2024)
par: Ohashi, Atsumoto, et autres
Publié: (2024)
LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset
par: Zheng, Lianmin, et autres
Publié: (2023)
par: Zheng, Lianmin, et autres
Publié: (2023)
PersianPunc: A Large-Scale Dataset and BERT-Based Approach for Persian Punctuation Restoration
par: Kalahroodi, Mohammad Javad Ranjbar, et autres
Publié: (2026)
par: Kalahroodi, Mohammad Javad Ranjbar, et autres
Publié: (2026)
CRoCoDiL: Continuous and Robust Conditioned Diffusion for Language
par: Uziel, Roy, et autres
Publié: (2026)
par: Uziel, Roy, et autres
Publié: (2026)
Self-Retrieval: End-to-End Information Retrieval with One Large Language Model
par: Tang, Qiaoyu, et autres
Publié: (2024)
par: Tang, Qiaoyu, et autres
Publié: (2024)
MuSeD: A Multimodal Spanish Dataset for Sexism Detection in Social Media Videos
par: De Grazia, Laura, et autres
Publié: (2025)
par: De Grazia, Laura, et autres
Publié: (2025)
"What's Up, Doc?": Analyzing How Users Seek Health Information in Large-Scale Conversational AI Datasets
par: Paruchuri, Akshay, et autres
Publié: (2025)
par: Paruchuri, Akshay, et autres
Publié: (2025)
Exploiting Instruction-Following Retrievers for Malicious Information Retrieval
par: BehnamGhader, Parishad, et autres
Publié: (2025)
par: BehnamGhader, Parishad, et autres
Publié: (2025)
CDTP: A Large-Scale Chinese Data-Text Pair Dataset for Comprehensive Evaluation of Chinese LLMs
par: Wu, Chengwei, et autres
Publié: (2025)
par: Wu, Chengwei, et autres
Publié: (2025)
COMI-LINGUA: Expert Annotated Large-Scale Dataset for Multitask NLP in Hindi-English Code-Mixing
par: Sheth, Rajvee, et autres
Publié: (2025)
par: Sheth, Rajvee, et autres
Publié: (2025)
RETQA: A Large-Scale Open-Domain Tabular Question Answering Dataset for Real Estate Sector
par: Wang, Zhensheng, et autres
Publié: (2024)
par: Wang, Zhensheng, et autres
Publié: (2024)
Explainable machine learning multi-label classification of Spanish legal judgements
par: de Arriba-Pérez, Francisco, et autres
Publié: (2024)
par: de Arriba-Pérez, Francisco, et autres
Publié: (2024)
FMI@SU ToxHabits: Evaluating LLMs Performance on Toxic Habit Extraction in Spanish Clinical Texts
par: Vassileva, Sylvia, et autres
Publié: (2026)
par: Vassileva, Sylvia, et autres
Publié: (2026)
DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning
par: He, Zhiwei, et autres
Publié: (2025)
par: He, Zhiwei, et autres
Publié: (2025)
Unraveling and Mitigating Retriever Inconsistencies in Retrieval-Augmented Large Language Models
par: Li, Mingda, et autres
Publié: (2024)
par: Li, Mingda, et autres
Publié: (2024)
Imperfect Language, Artificial Intelligence, and the Human Mind: An Interdisciplinary Approach to Linguistic Errors in Native Spanish Speakers
par: López, Francisco Portillo
Publié: (2025)
par: López, Francisco Portillo
Publié: (2025)
BengaliSent140: A Large-Scale Bengali Binary Sentiment Dataset for Hate and Non-Hate Speech Classification
par: Islam, Akif, et autres
Publié: (2026)
par: Islam, Akif, et autres
Publié: (2026)
CRED-SQL: Enhancing Real-world Large Scale Database Text-to-SQL Parsing through Cluster Retrieval and Execution Description
par: Duan, Shaoming, et autres
Publié: (2025)
par: Duan, Shaoming, et autres
Publié: (2025)
ScIRGen: Synthesize Realistic and Large-Scale RAG Dataset for Scientific Research
par: Lin, Junyong, et autres
Publié: (2025)
par: Lin, Junyong, et autres
Publié: (2025)
BookSQL: A Large Scale Text-to-SQL Dataset for Accounting Domain
par: Kumar, Rahul, et autres
Publié: (2024)
par: Kumar, Rahul, et autres
Publié: (2024)
Harnessing Large Language Models for Precision Querying and Retrieval-Augmented Knowledge Extraction in Clinical Data Science
par: Jan, Juan Jose Rubio, et autres
Publié: (2026)
par: Jan, Juan Jose Rubio, et autres
Publié: (2026)
Knots: A Large-Scale Multi-Agent Enhanced Expert-Annotated Dataset and LLM Prompt Optimization for NOTAM Semantic Parsing
par: Liu, Maoqi, et autres
Publié: (2025)
par: Liu, Maoqi, et autres
Publié: (2025)
Evaluating the Retrieval Robustness of Large Language Models
par: Cao, Shuyang, et autres
Publié: (2025)
par: Cao, Shuyang, et autres
Publié: (2025)
Documents similaires
-
Exploring Large Language Models for Hate Speech Detection in Rioplatense Spanish
par: Pérez, Juan Manuel, et autres
Publié: (2024) -
Seventeenth-Century Spanish American Notary Records for Fine-Tuning Spanish Large Language Models
par: Sarker, Shraboni, et autres
Publié: (2024) -
Mining Reasons For And Against Vaccination From Unstructured Data Using Nichesourcing and AI Data Augmentation
par: Furman, Damián Ariel, et autres
Publié: (2024) -
OCR or Not? Rethinking Document Information Extraction in the MLLMs Era with Real-World Large-Scale Datasets
par: Shen, Jiyuan, et autres
Publié: (2026) -
What Makes a Good Terminal-Agent Benchmark Task: A Guideline for Adversarial, Difficult, and Legible Evaluation Design
par: Bercovich, Ivan
Publié: (2026)