LEMUR: A Corpus for Robust Fine-Tuning of Multilingual Law Embedding Models for Retrieval
Fuente:
arXiv
Salvato in:
| Autori principali: | Ahmadi, Narges Baba, Strich, Jan, Semmann, Martin, Biemann, Chris |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
EncouRAGe: Evaluating RAG Local, Fast, and Reliable
di: Strich, Jan, et al.
Pubblicazione: (2025)
di: Strich, Jan, et al.
Pubblicazione: (2025)
Comprehensive Comparison of RAG Methods Across Multi-Domain Conversational QA
di: Alushi, Klejda, et al.
Pubblicazione: (2026)
di: Alushi, Klejda, et al.
Pubblicazione: (2026)
CollEX -- A Multimodal Agentic RAG System Enabling Interactive Exploration of Scientific Collections
di: Schneider, Florian, et al.
Pubblicazione: (2025)
di: Schneider, Florian, et al.
Pubblicazione: (2025)
T$^2$-RAGBench: Text-and-Table Benchmark for Evaluating Retrieval-Augmented Generation
di: Strich, Jan, et al.
Pubblicazione: (2025)
di: Strich, Jan, et al.
Pubblicazione: (2025)
NUDGE: Lightweight Non-Parametric Fine-Tuning of Embeddings for Retrieval
di: Zeighami, Sepanta, et al.
Pubblicazione: (2024)
di: Zeighami, Sepanta, et al.
Pubblicazione: (2024)
MMTEB: Massive Multilingual Text Embedding Benchmark
di: Enevoldsen, Kenneth, et al.
Pubblicazione: (2025)
di: Enevoldsen, Kenneth, et al.
Pubblicazione: (2025)
Robustness Risk of Conversational Retrieval: Identifying and Mitigating Noise Sensitivity in Qwen3-Embedding Model
di: Chen, Weishu, et al.
Pubblicazione: (2026)
di: Chen, Weishu, et al.
Pubblicazione: (2026)
What Drives Cross-lingual Ranking? Retrieval Approaches with Multilingual Language Models
di: Goworek, Roksana, et al.
Pubblicazione: (2025)
di: Goworek, Roksana, et al.
Pubblicazione: (2025)
Multilingual Information Retrieval with a Monolingual Knowledge Base
di: Zhuang, Yingying, et al.
Pubblicazione: (2025)
di: Zhuang, Yingying, et al.
Pubblicazione: (2025)
Enhancing Multilingual Embeddings via Multi-Way Parallel Text Alignment
di: Fazili, Barah, et al.
Pubblicazione: (2026)
di: Fazili, Barah, et al.
Pubblicazione: (2026)
Are LLMs Truly Multilingual? Exploring Zero-Shot Multilingual Capability of LLMs for Information Retrieval: An Italian Healthcare Use Case
di: Kembu, Vignesh Kumar, et al.
Pubblicazione: (2025)
di: Kembu, Vignesh Kumar, et al.
Pubblicazione: (2025)
Generative Query Expansion with Multilingual LLMs for Cross-Lingual Information Retrieval
di: Macmillan-Scott, Olivia, et al.
Pubblicazione: (2025)
di: Macmillan-Scott, Olivia, et al.
Pubblicazione: (2025)
Efficient and Versatile Model for Multilingual Information Retrieval of Islamic Text: Development and Deployment in Real-World Scenarios
di: Pavlova, Vera, et al.
Pubblicazione: (2025)
di: Pavlova, Vera, et al.
Pubblicazione: (2025)
An Open-Source Dual-Loss Embedding Model for Semantic Retrieval in Higher Education
di: Sajja, Ramteja, et al.
Pubblicazione: (2025)
di: Sajja, Ramteja, et al.
Pubblicazione: (2025)
Bagging-Based Model Merging for Robust General Text Embeddings
di: Zhang, Hengran, et al.
Pubblicazione: (2026)
di: Zhang, Hengran, et al.
Pubblicazione: (2026)
NER Retriever: Zero-Shot Named Entity Retrieval with Type-Aware Embeddings
di: Shachar, Or, et al.
Pubblicazione: (2025)
di: Shachar, Or, et al.
Pubblicazione: (2025)
Bridging Language Gaps: Advances in Cross-Lingual Information Retrieval with Multilingual LLMs
di: Goworek, Roksana, et al.
Pubblicazione: (2025)
di: Goworek, Roksana, et al.
Pubblicazione: (2025)
One Model Is Enough: Native Retrieval Embeddings from LLM Agent Hidden States
di: Jiang, Bo
Pubblicazione: (2026)
di: Jiang, Bo
Pubblicazione: (2026)
Spectral Tempering for Embedding Compression in Dense Passage Retrieval
di: Li, Yongkang, et al.
Pubblicazione: (2026)
di: Li, Yongkang, et al.
Pubblicazione: (2026)
WebFAQ: A Multilingual Collection of Natural Q&A Datasets for Dense Retrieval
di: Dinzinger, Michael, et al.
Pubblicazione: (2025)
di: Dinzinger, Michael, et al.
Pubblicazione: (2025)
Leveraging LLMs for Synthesizing Training Data Across Many Languages in Multilingual Dense Retrieval
di: Thakur, Nandan, et al.
Pubblicazione: (2023)
di: Thakur, Nandan, et al.
Pubblicazione: (2023)
GPT vs RETRO: Exploring the Intersection of Retrieval and Parameter-Efficient Fine-Tuning
di: Ficek, Aleksander, et al.
Pubblicazione: (2024)
di: Ficek, Aleksander, et al.
Pubblicazione: (2024)
RetroLLM: Empowering Large Language Models to Retrieve Fine-grained Evidence within Generation
di: Li, Xiaoxi, et al.
Pubblicazione: (2024)
di: Li, Xiaoxi, et al.
Pubblicazione: (2024)
Going over Fine Web with a Fine-Tooth Comb: Technical Report of Indexing Fine Web for Problematic Content Search and Retrieval
di: Marinas, Inés Altemir, et al.
Pubblicazione: (2025)
di: Marinas, Inés Altemir, et al.
Pubblicazione: (2025)
Improving Embedding Accuracy for Document Retrieval Using Entity Relationship Maps and Model-Aware Contrastive Sampling
di: Aviss, Thea
Pubblicazione: (2024)
di: Aviss, Thea
Pubblicazione: (2024)
Leveraging Fine-Tuned Large Language Models for Interpretable Pancreatic Cystic Lesion Feature Extraction and Risk Categorization
di: Rasromani, Ebrahim, et al.
Pubblicazione: (2025)
di: Rasromani, Ebrahim, et al.
Pubblicazione: (2025)
WebFAQ 2.0: A Multilingual QA Dataset with Mined Hard Negatives for Dense Retrieval
di: Dinzinger, Michael, et al.
Pubblicazione: (2026)
di: Dinzinger, Michael, et al.
Pubblicazione: (2026)
fact check AI at SemEval-2025 Task 7: Multilingual and Crosslingual Fact-checked Claim Retrieval
di: Rastogi, Pranshu
Pubblicazione: (2025)
di: Rastogi, Pranshu
Pubblicazione: (2025)
Is It Novel and Why? Fine-Grained Patent Novelty Prediction Based on Passage Retrieval
di: Knappich, Valentin, et al.
Pubblicazione: (2026)
di: Knappich, Valentin, et al.
Pubblicazione: (2026)
IL-PCSR: Legal Corpus for Prior Case and Statute Retrieval
di: Paul, Shounak, et al.
Pubblicazione: (2025)
di: Paul, Shounak, et al.
Pubblicazione: (2025)
Tabular Embedding Model (TEM): Finetuning Embedding Models For Tabular RAG Applications
di: Khanna, Sujit, et al.
Pubblicazione: (2024)
di: Khanna, Sujit, et al.
Pubblicazione: (2024)
Leveraging the Power of LLMs: A Fine-Tuning Approach for High-Quality Aspect-Based Summarization
di: Mullick, Ankan, et al.
Pubblicazione: (2024)
di: Mullick, Ankan, et al.
Pubblicazione: (2024)
Arctic-Embed: Scalable, Efficient, and Accurate Text Embedding Models
di: Merrick, Luke, et al.
Pubblicazione: (2024)
di: Merrick, Luke, et al.
Pubblicazione: (2024)
Creating a Taxonomy for Retrieval Augmented Generation Applications
di: Nikishina, Irina, et al.
Pubblicazione: (2024)
di: Nikishina, Irina, et al.
Pubblicazione: (2024)
Knowledge Compression via Question Generation: Enhancing Multihop Document Retrieval without Fine-tuning
di: Eponon, Anvi Alex, et al.
Pubblicazione: (2025)
di: Eponon, Anvi Alex, et al.
Pubblicazione: (2025)
Benchmarking Information Retrieval Models on Complex Retrieval Tasks
di: Killingback, Julian, et al.
Pubblicazione: (2025)
di: Killingback, Julian, et al.
Pubblicazione: (2025)
FineTuneBench: How well do commercial fine-tuning APIs infuse knowledge into LLMs?
di: Wu, Eric, et al.
Pubblicazione: (2024)
di: Wu, Eric, et al.
Pubblicazione: (2024)
Self-Calibrating Language Models via Test-Time Discriminative Distillation
di: Hedna, Mohamed Rissal, et al.
Pubblicazione: (2026)
di: Hedna, Mohamed Rissal, et al.
Pubblicazione: (2026)
Optimizing What Matters: AUC-Driven Learning for Robust Neural Retrieval
di: Sheikholeslami, Nima, et al.
Pubblicazione: (2025)
di: Sheikholeslami, Nima, et al.
Pubblicazione: (2025)
Advancing Chart Question Answering with Robust Chart Component Recognition
di: Zheng, Hanwen, et al.
Pubblicazione: (2024)
di: Zheng, Hanwen, et al.
Pubblicazione: (2024)
Documenti analoghi
-
EncouRAGe: Evaluating RAG Local, Fast, and Reliable
di: Strich, Jan, et al.
Pubblicazione: (2025) -
Comprehensive Comparison of RAG Methods Across Multi-Domain Conversational QA
di: Alushi, Klejda, et al.
Pubblicazione: (2026) -
CollEX -- A Multimodal Agentic RAG System Enabling Interactive Exploration of Scientific Collections
di: Schneider, Florian, et al.
Pubblicazione: (2025) -
T$^2$-RAGBench: Text-and-Table Benchmark for Evaluating Retrieval-Augmented Generation
di: Strich, Jan, et al.
Pubblicazione: (2025) -
NUDGE: Lightweight Non-Parametric Fine-Tuning of Embeddings for Retrieval
di: Zeighami, Sepanta, et al.
Pubblicazione: (2024)