Multi-Stage Training for Abusive Comment Detection in Indic Languages
Fuente:
arXiv
Guardado en:
| Autores principales: | Rastogi, Pranshu, Mathur, Madhav, S, Ramaneswaran, Mohan, Kshitij |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
IndicSQuAD: A Comprehensive Multilingual Question Answering Dataset for Indic Languages
por: Endait, Sharvi, et al.
Publicado: (2025)
por: Endait, Sharvi, et al.
Publicado: (2025)
Overview of the 2023 ICON Shared Task on Gendered Abuse Detection in Indic Languages
por: Vaidya, Aatman, et al.
Publicado: (2024)
por: Vaidya, Aatman, et al.
Publicado: (2024)
L3Cube-IndicNews: News-based Short Text and Long Document Classification Datasets in Indic Languages
por: Mirashi, Aishwarya, et al.
Publicado: (2024)
por: Mirashi, Aishwarya, et al.
Publicado: (2024)
fact check AI at SemEval-2025 Task 7: Multilingual and Crosslingual Fact-checked Claim Retrieval
por: Rastogi, Pranshu
Publicado: (2025)
por: Rastogi, Pranshu
Publicado: (2025)
IndicMedDialog: A Parallel Multi-Turn Medical Dialogue Dataset for Accessible Healthcare in Indic Languages
por: Nigam, Shubham Kumar, et al.
Publicado: (2026)
por: Nigam, Shubham Kumar, et al.
Publicado: (2026)
Retrieval-Augmented Detection of Potentially Abusive Clauses in Chilean Terms of Service
por: Loeffler, Christoffer, et al.
Publicado: (2026)
por: Loeffler, Christoffer, et al.
Publicado: (2026)
IndicSentEval: How Effectively do Multilingual Transformer Models encode Linguistic Properties for Indic Languages?
por: Aravapalli, Akhilesh, et al.
Publicado: (2024)
por: Aravapalli, Akhilesh, et al.
Publicado: (2024)
L3Cube-IndicQuest: A Benchmark Question Answering Dataset for Evaluating Knowledge of LLMs in Indic Context
por: Rohera, Pritika, et al.
Publicado: (2024)
por: Rohera, Pritika, et al.
Publicado: (2024)
Parallel Corpora for Machine Translation in Low-resource Indic Languages: A Comprehensive Review
por: Raja, Rahul, et al.
Publicado: (2025)
por: Raja, Rahul, et al.
Publicado: (2025)
Embedding-Based Approaches to Hyperpartisan News Detection
por: Mohan, Karthik
Publicado: (2025)
por: Mohan, Karthik
Publicado: (2025)
L3Cube-IndicHeadline-ID: A Dataset for Headline Identification and Semantic Evaluation in Low-Resource Indian Languages
por: Tanksale, Nishant, et al.
Publicado: (2025)
por: Tanksale, Nishant, et al.
Publicado: (2025)
Large Language Models for Cross-lingual Emotion Detection
por: Kadiyala, Ram Mohan Rao
Publicado: (2024)
por: Kadiyala, Ram Mohan Rao
Publicado: (2024)
Robust Multi-Objective Preference Alignment with Online DPO
por: Gupta, Raghav, et al.
Publicado: (2025)
por: Gupta, Raghav, et al.
Publicado: (2025)
Decoding the Diversity: A Review of the Indic AI Research Landscape
por: KJ, Sankalp, et al.
Publicado: (2024)
por: KJ, Sankalp, et al.
Publicado: (2024)
What if I ask in \textit{alia lingua}? Measuring Functional Similarity Across Languages
por: Mishra, Debangan, et al.
Publicado: (2025)
por: Mishra, Debangan, et al.
Publicado: (2025)
Creating and Evaluating Code-Mixed Nepali-English and Telugu-English Datasets for Abusive Language Detection Using Traditional and Deep Learning Models
por: Pandey, Manish, et al.
Publicado: (2025)
por: Pandey, Manish, et al.
Publicado: (2025)
Optimizing RLHF Training for Large Language Models with Stage Fusion
por: Zhong, Yinmin, et al.
Publicado: (2024)
por: Zhong, Yinmin, et al.
Publicado: (2024)
From Graphs to Hypergraphs: Enhancing Aspect-Based Sentiment Analysis via Multi-Level Relational Modeling
por: Kashyap, Omkar Mahesh, et al.
Publicado: (2025)
por: Kashyap, Omkar Mahesh, et al.
Publicado: (2025)
IndicVoices-R: Unlocking a Massive Multilingual Multi-speaker Speech Corpus for Scaling Indian TTS
por: Sankar, Ashwin, et al.
Publicado: (2024)
por: Sankar, Ashwin, et al.
Publicado: (2024)
Revisiting the Robustness of Watermarking to Paraphrasing Attacks
por: Rastogi, Saksham, et al.
Publicado: (2024)
por: Rastogi, Saksham, et al.
Publicado: (2024)
HMS-BERT: Hybrid Multi-Task Self-Training for Multilingual and Multi-Label Cyberbullying Detection
por: Feng, Zixin, et al.
Publicado: (2026)
por: Feng, Zixin, et al.
Publicado: (2026)
Optimizing Multi-Stage Language Models for Effective Text Retrieval
por: Trung, Quang Hoang, et al.
Publicado: (2024)
por: Trung, Quang Hoang, et al.
Publicado: (2024)
Optimizing Instructions and Demonstrations for Multi-Stage Language Model Programs
por: Opsahl-Ong, Krista, et al.
Publicado: (2024)
por: Opsahl-Ong, Krista, et al.
Publicado: (2024)
Cyber-Attack Technique Classification Using Two-Stage Trained Large Language Models
por: You, Weiqiu, et al.
Publicado: (2024)
por: You, Weiqiu, et al.
Publicado: (2024)
Escaping the Mode Lottery: Multi-Response Training Improves Language Model Generalization
por: Amin, Hasan, et al.
Publicado: (2026)
por: Amin, Hasan, et al.
Publicado: (2026)
Deep Prompt Multi-task Network for Abuse Language Detection
por: Zhu, Jian, et al.
Publicado: (2024)
por: Zhu, Jian, et al.
Publicado: (2024)
Min-K%++: Improved Baseline for Detecting Pre-Training Data from Large Language Models
por: Zhang, Jingyang, et al.
Publicado: (2024)
por: Zhang, Jingyang, et al.
Publicado: (2024)
Competitive Audio-Language Models with Data-Efficient Single-Stage Training on Public Data
por: Kumar, Gokul Karthik, et al.
Publicado: (2025)
por: Kumar, Gokul Karthik, et al.
Publicado: (2025)
STAMP Your Content: Proving Dataset Membership via Watermarked Rephrasings
por: Rastogi, Saksham, et al.
Publicado: (2025)
por: Rastogi, Saksham, et al.
Publicado: (2025)
BrahmicTokenizer-131K: An Indic-Capable Drop-In Replacement for o200k_base
por: Shravan, Rohan
Publicado: (2026)
por: Shravan, Rohan
Publicado: (2026)
SOI Matters: Analyzing Multi-Setting Training Dynamics in Pretrained Language Models via Subsets of Interest
por: Vassef, Shayan, et al.
Publicado: (2025)
por: Vassef, Shayan, et al.
Publicado: (2025)
An Empirical Study of Multi-Generation Sampling for Jailbreak Detection in Large Language Models
por: Luo, Hanrui, et al.
Publicado: (2026)
por: Luo, Hanrui, et al.
Publicado: (2026)
Dual-Modality Multi-Stage Adversarial Safety Training: Robustifying Multimodal Web Agents Against Cross-Modal Attacks
por: Liu, Haoyu, et al.
Publicado: (2026)
por: Liu, Haoyu, et al.
Publicado: (2026)
MultiGPrompt for Multi-Task Pre-Training and Prompting on Graphs
por: Yu, Xingtong, et al.
Publicado: (2023)
por: Yu, Xingtong, et al.
Publicado: (2023)
Training Language Models on the Knowledge Graph: Insights on Hallucinations and Their Detectability
por: Hron, Jiri, et al.
Publicado: (2024)
por: Hron, Jiri, et al.
Publicado: (2024)
Cascade-Aware Training of Language Models
por: Wang, Congchao, et al.
Publicado: (2024)
por: Wang, Congchao, et al.
Publicado: (2024)
Training Language Models to Reason Efficiently
por: Arora, Daman, et al.
Publicado: (2025)
por: Arora, Daman, et al.
Publicado: (2025)
Beyond a Single Perspective: Text Anomaly Detection with Multi-View Language Representations
por: Liu, Yixin, et al.
Publicado: (2026)
por: Liu, Yixin, et al.
Publicado: (2026)
Improve Mathematical Reasoning in Language Models by Automated Process Supervision
por: Luo, Liangchen, et al.
Publicado: (2024)
por: Luo, Liangchen, et al.
Publicado: (2024)
When Inverse Data Outperforms: Exploring the Pitfalls of Mixed Data in Multi-Stage Fine-Tuning
por: Deng, Mengyi, et al.
Publicado: (2025)
por: Deng, Mengyi, et al.
Publicado: (2025)
Ejemplares similares
-
IndicSQuAD: A Comprehensive Multilingual Question Answering Dataset for Indic Languages
por: Endait, Sharvi, et al.
Publicado: (2025) -
Overview of the 2023 ICON Shared Task on Gendered Abuse Detection in Indic Languages
por: Vaidya, Aatman, et al.
Publicado: (2024) -
L3Cube-IndicNews: News-based Short Text and Long Document Classification Datasets in Indic Languages
por: Mirashi, Aishwarya, et al.
Publicado: (2024) -
fact check AI at SemEval-2025 Task 7: Multilingual and Crosslingual Fact-checked Claim Retrieval
por: Rastogi, Pranshu
Publicado: (2025) -
IndicMedDialog: A Parallel Multi-Turn Medical Dialogue Dataset for Accessible Healthcare in Indic Languages
por: Nigam, Shubham Kumar, et al.
Publicado: (2026)