Enhancing Plagiarism Detection in Marathi with a Weighted Ensemble of TF-IDF and BERT Embeddings for Low-Resource Language Processing
Fuente:
arXiv
Saved in:
| Main Authors: | Mutsaddi, Atharva, Choudhary, Aditya |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Evaluation of Chunking Strategies for Effective Text Embedding in Low-Resource Language on Agricultural Documents
by: Chhoun, Sovandara, et al.
Published: (2026)
by: Chhoun, Sovandara, et al.
Published: (2026)
BERTopic for Topic Modeling of Hindi Short Texts: A Comparative Study
by: Mutsaddi, Atharva, et al.
Published: (2025)
by: Mutsaddi, Atharva, et al.
Published: (2025)
Semantic Reconstruction of Adversarial Plagiarism: A Context-Aware Framework for Detecting and Restoring "Tortured Phrases" in Scientific Literature
by: Maiti, Agniva, et al.
Published: (2025)
by: Maiti, Agniva, et al.
Published: (2025)
An Interpretable Ensemble of Graph and Language Models for Improving Search Relevance in E-Commerce
by: Choudhary, Nurendra, et al.
Published: (2024)
by: Choudhary, Nurendra, et al.
Published: (2024)
NameBERT: Scaling Name-Based Nationality Classification with LLM-Augmented Open Academic Data
by: Ming, Cong, et al.
Published: (2026)
by: Ming, Cong, et al.
Published: (2026)
2024 Google Scholar Research Interest Ranking for Top 3260 Computer Science Authors
by: Rasane, Atharva
Published: (2024)
by: Rasane, Atharva
Published: (2024)
Benchmarking Google Embeddings 2 against Open-Source Models for Multilingual Dense Retrieval and RAG Systems
by: Cirillo, Stefano, et al.
Published: (2026)
by: Cirillo, Stefano, et al.
Published: (2026)
FACTUM: Mechanistic Detection of Citation Hallucination in Long-Form RAG
by: Dassen, Maxime, et al.
Published: (2026)
by: Dassen, Maxime, et al.
Published: (2026)
IndoBERT-Sentiment: Context-Conditioned Sentiment Classification for Indonesian Text
by: Saputra, Muhammad Apriandito Arya, et al.
Published: (2026)
by: Saputra, Muhammad Apriandito Arya, et al.
Published: (2026)
A Comparative Study of Language Models for Khmer Retrieval-Augmented Question Answering
by: Ros, Sereiwathna, et al.
Published: (2026)
by: Ros, Sereiwathna, et al.
Published: (2026)
IndoBERT-Relevancy: A Context-Conditioned Relevancy Classifier for Indonesian Text
by: Saputra, Muhammad Apriandito Arya, et al.
Published: (2026)
by: Saputra, Muhammad Apriandito Arya, et al.
Published: (2026)
CardioEmbed: Domain-Specialized Text Embeddings for Clinical Cardiology
by: Young, Richard J., et al.
Published: (2025)
by: Young, Richard J., et al.
Published: (2025)
Generative Query Reformulation Using Ensemble Prompting, Document Fusion, and Relevance Feedback
by: Dhole, Kaustubh D., et al.
Published: (2024)
by: Dhole, Kaustubh D., et al.
Published: (2024)
Flippi: End To End GenAI Assistant for E-Commerce
by: Rajasekar, Anand A., et al.
Published: (2025)
by: Rajasekar, Anand A., et al.
Published: (2025)
NewsScope: Schema-Grounded Cross-Domain News Claim Extraction with Open Models
by: Pandya, Nidhi
Published: (2025)
by: Pandya, Nidhi
Published: (2025)
Stage-Audit: Auditable Source-Frontier Discovery for Cross-Wiki Tables
by: Shen, Chen
Published: (2026)
by: Shen, Chen
Published: (2026)
Towards Adaptive Context Management for Intelligent Conversational Question Answering
by: Perera, Manoj Madushanka, et al.
Published: (2025)
by: Perera, Manoj Madushanka, et al.
Published: (2025)
Local Hybrid Retrieval-Augmented Document QA
by: Astrino, Paolo
Published: (2025)
by: Astrino, Paolo
Published: (2025)
Contextually Aware E-Commerce Product Question Answering using RAG
by: Tangarajan, Praveen, et al.
Published: (2025)
by: Tangarajan, Praveen, et al.
Published: (2025)
NCTB-QA: A Large-Scale Bangla Educational Question Answering Dataset and Benchmarking Performance
by: Eyasir, Abrar, et al.
Published: (2026)
by: Eyasir, Abrar, et al.
Published: (2026)
Extending AI for Research to the Humanities: A Multi-Agent Framework for Evidence-Grounded Scholarship
by: Pan, Yating, et al.
Published: (2026)
by: Pan, Yating, et al.
Published: (2026)
FinBERT-QA: Financial Question Answering with pre-trained BERT Language Models
by: Yuan, Bithiah
Published: (2025)
by: Yuan, Bithiah
Published: (2025)
Mitigating Hallucinations in Large Language Models via Self-Refinement-Enhanced Knowledge Retrieval
by: Niu, Mengjia, et al.
Published: (2024)
by: Niu, Mengjia, et al.
Published: (2024)
Can You Detect the Difference?
by: Tarım, İsmail, et al.
Published: (2025)
by: Tarım, İsmail, et al.
Published: (2025)
Topic Is Not Agenda: A Citation-Community Audit of Text Embeddings
by: Yoo, Junseon
Published: (2026)
by: Yoo, Junseon
Published: (2026)
Memory Architectures for Multi-Turn Text-to-SQL: A Benchmark and Empirical Study
by: Tummalapenta, Ravi Kumar, et al.
Published: (2026)
by: Tummalapenta, Ravi Kumar, et al.
Published: (2026)
BALI: Enhancing Biomedical Language Representations through Knowledge Graph and Language Model Alignment
by: Sakhovskiy, Andrey, et al.
Published: (2025)
by: Sakhovskiy, Andrey, et al.
Published: (2025)
Enhancing Long-term RAG Chatbots with Psychological Models of Memory Importance and Forgetting
by: Sumida, Ryuichi, et al.
Published: (2024)
by: Sumida, Ryuichi, et al.
Published: (2024)
ArcheType: A Novel Framework for Open-Source Column Type Annotation using Large Language Models
by: Feuer, Benjamin, et al.
Published: (2023)
by: Feuer, Benjamin, et al.
Published: (2023)
Prompt Perturbation in Retrieval-Augmented Generation based Large Language Models
by: Hu, Zhibo, et al.
Published: (2024)
by: Hu, Zhibo, et al.
Published: (2024)
Session Context Embedding for Intent Understanding in Product Search
by: Mehrdad, Navid, et al.
Published: (2024)
by: Mehrdad, Navid, et al.
Published: (2024)
BudgetMem: Learning Selective Memory Policies for Cost-Efficient Long-Context Processing in Language Models
by: Alla, Chandra Vamsi Krishna, et al.
Published: (2025)
by: Alla, Chandra Vamsi Krishna, et al.
Published: (2025)
From Native Memes to Global Moderation: Cross-Cultural Evaluation of Vision-Language Models for Hateful Meme Detection
by: Wang, Mo, et al.
Published: (2026)
by: Wang, Mo, et al.
Published: (2026)
LLM-as-a-Judge: Rapid Evaluation of Legal Document Recommendation for Retrieval-Augmented Generation
by: Pradhan, Anu, et al.
Published: (2025)
by: Pradhan, Anu, et al.
Published: (2025)
Real-World En Call Center Transcripts Dataset with PII Redaction
by: Dao, Ha, et al.
Published: (2025)
by: Dao, Ha, et al.
Published: (2025)
Prompt-RAG: Pioneering Vector Embedding-Free Retrieval-Augmented Generation in Niche Domains, Exemplified by Korean Medicine
by: Kang, Bongsu, et al.
Published: (2024)
by: Kang, Bongsu, et al.
Published: (2024)
Exploring new Approaches for Information Retrieval through Natural Language Processing
by: Raj, Manak, et al.
Published: (2025)
by: Raj, Manak, et al.
Published: (2025)
REIS: A High-Performance and Energy-Efficient Retrieval System with In-Storage Processing
by: Chen, Kangqi, et al.
Published: (2025)
by: Chen, Kangqi, et al.
Published: (2025)
AI-Friendly LaTeX: Using LaTeX Code as a Knowledge Source for Retrieval-Augmented Generation
by: Verhoeff, Tom
Published: (2026)
by: Verhoeff, Tom
Published: (2026)
Self-Aware Vector Embeddings for Retrieval-Augmented Generation: A Neuroscience-Inspired Framework for Temporal, Confidence-Weighted, and Relational Knowledge
by: Xu, Naizhong
Published: (2026)
by: Xu, Naizhong
Published: (2026)
Similar Items
-
Evaluation of Chunking Strategies for Effective Text Embedding in Low-Resource Language on Agricultural Documents
by: Chhoun, Sovandara, et al.
Published: (2026) -
BERTopic for Topic Modeling of Hindi Short Texts: A Comparative Study
by: Mutsaddi, Atharva, et al.
Published: (2025) -
Semantic Reconstruction of Adversarial Plagiarism: A Context-Aware Framework for Detecting and Restoring "Tortured Phrases" in Scientific Literature
by: Maiti, Agniva, et al.
Published: (2025) -
An Interpretable Ensemble of Graph and Language Models for Improving Search Relevance in E-Commerce
by: Choudhary, Nurendra, et al.
Published: (2024) -
NameBERT: Scaling Name-Based Nationality Classification with LLM-Augmented Open Academic Data
by: Ming, Cong, et al.
Published: (2026)