COMI-LINGUA: Expert Annotated Large-Scale Dataset for Multitask NLP in Hindi-English Code-Mixing
Fuente:
arXiv
Salvato in:
| Autori principali: | Sheth, Rajvee, Beniwal, Himanshu, Singh, Mayank |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
COMMENTATOR: A Code-mixed Multilingual Text Annotation Framework
di: Sheth, Rajvee, et al.
Pubblicazione: (2024)
di: Sheth, Rajvee, et al.
Pubblicazione: (2024)
Beyond Monolingual Assumptions: A Survey of Code-Switched NLP in the Era of Large Language Models across Modalities
di: Sheth, Rajvee, et al.
Pubblicazione: (2025)
di: Sheth, Rajvee, et al.
Pubblicazione: (2025)
PythonSaga: Redefining the Benchmark to Evaluate Code Generating LLMs
di: Yadav, Ankit, et al.
Pubblicazione: (2024)
di: Yadav, Ankit, et al.
Pubblicazione: (2024)
Where Does Toxicity Live? Mechanistic Localization and Targeted Suppression in Language Models
di: Beniwal, Himanshu, et al.
Pubblicazione: (2026)
di: Beniwal, Himanshu, et al.
Pubblicazione: (2026)
Cross-lingual Editing in Multilingual Language Models
di: Beniwal, Himanshu, et al.
Pubblicazione: (2024)
di: Beniwal, Himanshu, et al.
Pubblicazione: (2024)
Char-mander Use mBackdoor! A Study of Cross-lingual Backdoor Attacks in Multilingual LLMs
di: Beniwal, Himanshu, et al.
Pubblicazione: (2025)
di: Beniwal, Himanshu, et al.
Pubblicazione: (2025)
Remember This Event That Year? Assessing Temporal Information and Reasoning in Large Language Models
di: Beniwal, Himanshu, et al.
Pubblicazione: (2024)
di: Beniwal, Himanshu, et al.
Pubblicazione: (2024)
MedSumm: A Multimodal Approach to Summarizing Code-Mixed Hindi-English Clinical Queries
di: Ghosh, Akash, et al.
Pubblicazione: (2024)
di: Ghosh, Akash, et al.
Pubblicazione: (2024)
Eka-Eval: An Evaluation Framework for Low-Resource Multilingual Large Language Models
di: Sinha, Samridhi Raj, et al.
Pubblicazione: (2025)
di: Sinha, Samridhi Raj, et al.
Pubblicazione: (2025)
HindiLLM: Large Language Model for Hindi
di: Chouhan, Sanjay, et al.
Pubblicazione: (2024)
di: Chouhan, Sanjay, et al.
Pubblicazione: (2024)
One Instruction Does Not Fit All: How Well Do Embeddings Align Personas and Instructions in Low-Resource Indian Languages?
di: Shah, Arya, et al.
Pubblicazione: (2026)
di: Shah, Arya, et al.
Pubblicazione: (2026)
Bridging the Data Gap: Creating a Hindi Text Summarization Dataset from the English XSUM
di: Katwe, Praveenkumar, et al.
Pubblicazione: (2026)
di: Katwe, Praveenkumar, et al.
Pubblicazione: (2026)
AIMA at SemEval-2024 Task 10: History-Based Emotion Recognition in Hindi-English Code-Mixed Conversations
di: Abootorabi, Mohammad Mahdi, et al.
Pubblicazione: (2025)
di: Abootorabi, Mohammad Mahdi, et al.
Pubblicazione: (2025)
UNITYAI-GUARD: Pioneering Toxicity Detection Across Low-Resource Indian Languages
di: Beniwal, Himanshu, et al.
Pubblicazione: (2025)
di: Beniwal, Himanshu, et al.
Pubblicazione: (2025)
Knots: A Large-Scale Multi-Agent Enhanced Expert-Annotated Dataset and LLM Prompt Optimization for NOTAM Semantic Parsing
di: Liu, Maoqi, et al.
Pubblicazione: (2025)
di: Liu, Maoqi, et al.
Pubblicazione: (2025)
Multilingual Mathematical Reasoning: Advancing Open-Source LLMs in Hindi and English
di: Anand, Avinash, et al.
Pubblicazione: (2024)
di: Anand, Avinash, et al.
Pubblicazione: (2024)
Who Annotates in NLP? A Large-scale Assessment of Human Annotation Reporting between 2018 and 2025
di: Kunilovskaya, Maria, et al.
Pubblicazione: (2026)
di: Kunilovskaya, Maria, et al.
Pubblicazione: (2026)
Breaking mBad! Supervised Fine-tuning for Cross-Lingual Detoxification
di: Beniwal, Himanshu, et al.
Pubblicazione: (2025)
di: Beniwal, Himanshu, et al.
Pubblicazione: (2025)
An Under-Explored Application for Explainable Multimodal Misogyny Detection in code-mixed Hindi-English
di: Yadav, Sargam, et al.
Pubblicazione: (2026)
di: Yadav, Sargam, et al.
Pubblicazione: (2026)
ChiEngMixBench: Evaluating Large Language Models on Spontaneous and Natural Chinese-English Code-Mixed Generation
di: Yang, Qingyan, et al.
Pubblicazione: (2026)
di: Yang, Qingyan, et al.
Pubblicazione: (2026)
A Parameter-Efficient Transfer Learning Approach through Multitask Prompt Distillation and Decomposition for Clinical NLP
di: Peng, Cheng, et al.
Pubblicazione: (2026)
di: Peng, Cheng, et al.
Pubblicazione: (2026)
DEPART: DEcomposing PARiTy across Multilingual LLMs
di: Uppadhyay, Manan, et al.
Pubblicazione: (2026)
di: Uppadhyay, Manan, et al.
Pubblicazione: (2026)
Building pre-train LLM Dataset for the INDIC Languages: a case study on Hindi
di: Parida, Shantipriya, et al.
Pubblicazione: (2024)
di: Parida, Shantipriya, et al.
Pubblicazione: (2024)
Suvach -- Generated Hindi QA benchmark
di: Narayanan, Vaishak, et al.
Pubblicazione: (2024)
di: Narayanan, Vaishak, et al.
Pubblicazione: (2024)
Text Annotation via Inductive Coding: Comparing Human Experts to LLMs in Qualitative Data Analysis
di: Parfenova, Angelina, et al.
Pubblicazione: (2025)
di: Parfenova, Angelina, et al.
Pubblicazione: (2025)
Exploring Cross-Cultural Differences in English Hate Speech Annotations: From Dataset Construction to Analysis
di: Lee, Nayeon, et al.
Pubblicazione: (2023)
di: Lee, Nayeon, et al.
Pubblicazione: (2023)
Revealing the impact of synthetic native samples and multi-tasking strategies in Hindi-English code-mixed humour and sarcasm detection
di: Mazumder, Debajyoti, et al.
Pubblicazione: (2024)
di: Mazumder, Debajyoti, et al.
Pubblicazione: (2024)
SwitchLingua: The First Large-Scale Multilingual and Multi-Ethnic Code-Switching Dataset
di: Xie, Peng, et al.
Pubblicazione: (2025)
di: Xie, Peng, et al.
Pubblicazione: (2025)
Advantages of Domain Knowledge Injection for Legal Document Summarization: A Case Study on Summarizing Indian Court Judgments in English and Hindi
di: Datta, Debtanu, et al.
Pubblicazione: (2026)
di: Datta, Debtanu, et al.
Pubblicazione: (2026)
Airavata: Introducing Hindi Instruction-tuned LLM
di: Gala, Jay, et al.
Pubblicazione: (2024)
di: Gala, Jay, et al.
Pubblicazione: (2024)
EmoMix-3L: A Code-Mixed Dataset for Bangla-English-Hindi Emotion Detection
di: Raihan, Nishat, et al.
Pubblicazione: (2024)
di: Raihan, Nishat, et al.
Pubblicazione: (2024)
Enhancing Hindi NER in Low Context: A Comparative study of Transformer-based models with vs. without Retrieval Augmentation
di: Singh, Sumit, et al.
Pubblicazione: (2025)
di: Singh, Sumit, et al.
Pubblicazione: (2025)
Multi-class Regret Detection in Hindi Devanagari Script
di: Sharma, Renuka, et al.
Pubblicazione: (2024)
di: Sharma, Renuka, et al.
Pubblicazione: (2024)
Human-1 by Josh Talks: A Full-Duplex Conversational Modeling Framework in Hindi using Real-World Conversations
di: Singh, Bhaskar, et al.
Pubblicazione: (2026)
di: Singh, Bhaskar, et al.
Pubblicazione: (2026)
Leveraging Weakly Annotated Data for Hate Speech Detection in Code-Mixed Hinglish: A Feasibility-Driven Transfer Learning Approach with Large Language Models
di: Yadav, Sargam, et al.
Pubblicazione: (2024)
di: Yadav, Sargam, et al.
Pubblicazione: (2024)
Flexible and Effective Mixing of Large Language Models into a Mixture of Domain Experts
di: Lee, Rhui Dih, et al.
Pubblicazione: (2024)
di: Lee, Rhui Dih, et al.
Pubblicazione: (2024)
Enhancing Assamese NLP Capabilities: Introducing a Centralized Dataset Repository
di: Tamang, S., et al.
Pubblicazione: (2024)
di: Tamang, S., et al.
Pubblicazione: (2024)
HALO: An Ontology for Representing and Categorizing Hallucinations in Large Language Models
di: Nananukul, Navapat, et al.
Pubblicazione: (2023)
di: Nananukul, Navapat, et al.
Pubblicazione: (2023)
Humanlike Cognitive Patterns as Emergent Phenomena in Large Language Models
di: Tang, Zhisheng, et al.
Pubblicazione: (2024)
di: Tang, Zhisheng, et al.
Pubblicazione: (2024)
Survey of Pseudonymization, Abstractive Summarization & Spell Checker for Hindi and Marathi
di: Ransing, Rasika, et al.
Pubblicazione: (2024)
di: Ransing, Rasika, et al.
Pubblicazione: (2024)
Documenti analoghi
-
COMMENTATOR: A Code-mixed Multilingual Text Annotation Framework
di: Sheth, Rajvee, et al.
Pubblicazione: (2024) -
Beyond Monolingual Assumptions: A Survey of Code-Switched NLP in the Era of Large Language Models across Modalities
di: Sheth, Rajvee, et al.
Pubblicazione: (2025) -
PythonSaga: Redefining the Benchmark to Evaluate Code Generating LLMs
di: Yadav, Ankit, et al.
Pubblicazione: (2024) -
Where Does Toxicity Live? Mechanistic Localization and Targeted Suppression in Language Models
di: Beniwal, Himanshu, et al.
Pubblicazione: (2026) -
Cross-lingual Editing in Multilingual Language Models
di: Beniwal, Himanshu, et al.
Pubblicazione: (2024)