K/DA: Automated Data Generation Pipeline for Detoxifying Implicitly Offensive Language in Korean
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jeon, Minkyeong, Jeong, Hyemin, Kim, Yerang, Kim, Jiyoung, Cho, Jae Hyeon, Lee, Byung-Jun |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Obfuscation Rules for Detecting and Detoxifying Korean Toxicity
par: Lee, Yejin, et autres
Publié: (2025)
par: Lee, Yejin, et autres
Publié: (2025)
Structured Language Generation Model: Loss Calibration and Formatted Decoding for Robust Structure Prediction and Knowledge Retrieval
par: Lee, Minho, et autres
Publié: (2024)
par: Lee, Minho, et autres
Publié: (2024)
VPO: Leveraging the Number of Votes in Preference Optimization
par: Cho, Jae Hyeon, et autres
Publié: (2024)
par: Cho, Jae Hyeon, et autres
Publié: (2024)
From Ground Trust to Truth: Disparities in Offensive Language Judgments on Contemporary Korean Political Discourse
par: Yu, Seunguk, et autres
Publié: (2025)
par: Yu, Seunguk, et autres
Publié: (2025)
OffensiveLang: A Community Based Implicit Offensive Language Dataset
par: Das, Amit, et autres
Publié: (2024)
par: Das, Amit, et autres
Publié: (2024)
Rethinking DPO: The Role of Rejected Responses in Preference Misalignment
par: Cho, Jay Hyeon, et autres
Publié: (2025)
par: Cho, Jay Hyeon, et autres
Publié: (2025)
KorNAT: LLM Alignment Benchmark for Korean Social Values and Common Knowledge
par: Lee, Jiyoung, et autres
Publié: (2024)
par: Lee, Jiyoung, et autres
Publié: (2024)
KoACD: The First Korean Adolescent Dataset for Cognitive Distortion Analysis via Role-Switching Multi-LLM Negotiation
par: Kim, JunSeo, et autres
Publié: (2025)
par: Kim, JunSeo, et autres
Publié: (2025)
RefineBench: Evaluating Refinement Capability of Language Models via Checklists
par: Lee, Young-Jun, et autres
Publié: (2025)
par: Lee, Young-Jun, et autres
Publié: (2025)
Handling Korean Out-of-Vocabulary Words with Phoneme Representation Learning
par: Kim, Nayeon, et autres
Publié: (2025)
par: Kim, Nayeon, et autres
Publié: (2025)
K-BrowseComp: A Web Browsing Agent Benchmark Grounded in Korean Contexts
par: Lee, Nahyun, et autres
Publié: (2026)
par: Lee, Nahyun, et autres
Publié: (2026)
DialogCC: An Automated Pipeline for Creating High-Quality Multi-Modal Dialogue Dataset
par: Lee, Young-Jun, et autres
Publié: (2022)
par: Lee, Young-Jun, et autres
Publié: (2022)
A Survey on Inference Engines for Large Language Models: Perspectives on Optimization and Efficiency
par: Park, Sihyeong, et autres
Publié: (2025)
par: Park, Sihyeong, et autres
Publié: (2025)
Enhancing Psychotherapy Counseling: A Data Augmentation Pipeline Leveraging Large Language Models for Counseling Conversations
par: Kim, Jun-Woo, et autres
Publié: (2024)
par: Kim, Jun-Woo, et autres
Publié: (2024)
Making Qwen3 Think in Korean with Reinforcement Learning
par: Lee, Jungyup, et autres
Publié: (2025)
par: Lee, Jungyup, et autres
Publié: (2025)
Open Ko-LLM Leaderboard: Evaluating Large Language Models in Korean with Ko-H5 Benchmark
par: Park, Chanjun, et autres
Publié: (2024)
par: Park, Chanjun, et autres
Publié: (2024)
LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models
par: Kim, Yungi, et autres
Publié: (2024)
par: Kim, Yungi, et autres
Publié: (2024)
Polishing Every Facet of the GEM: Testing Linguistic Competence of LLMs and Humans in Korean
par: Kim, SungHo, et autres
Publié: (2025)
par: Kim, SungHo, et autres
Publié: (2025)
DSG-KD: Knowledge Distillation from Domain-Specific to General Language Models
par: Cho, Sangyeon, et autres
Publié: (2024)
par: Cho, Sangyeon, et autres
Publié: (2024)
K-Act2Emo: Korean Commonsense Knowledge Graph for Indirect Emotional Expression
par: Kim, Kyuhee, et autres
Publié: (2024)
par: Kim, Kyuhee, et autres
Publié: (2024)
Voice-Interactive Surgical Agent for Multimodal Patient Data Control
par: Park, Hyeryun, et autres
Publié: (2025)
par: Park, Hyeryun, et autres
Publié: (2025)
Two-step Automated Cybercrime Coded Word Detection using Multi-level Representation Learning
par: Kim, Yongyeon, et autres
Publié: (2024)
par: Kim, Yongyeon, et autres
Publié: (2024)
HAE-RAE Bench: Evaluation of Korean Knowledge in Language Models
par: Son, Guijin, et autres
Publié: (2023)
par: Son, Guijin, et autres
Publié: (2023)
Leveraging the Interplay Between Syntactic and Acoustic Cues for Optimizing Korean TTS Pause Formation
par: Jeon, Yejin, et autres
Publié: (2024)
par: Jeon, Yejin, et autres
Publié: (2024)
L4Q: Parameter Efficient Quantization-Aware Fine-Tuning on Large Language Models
par: Jeon, Hyesung, et autres
Publié: (2024)
par: Jeon, Hyesung, et autres
Publié: (2024)
Subgraph-Aware Training of Language Models for Knowledge Graph Completion Using Structure-Aware Contrastive Learning
par: Ko, Youmin, et autres
Publié: (2024)
par: Ko, Youmin, et autres
Publié: (2024)
Optimizing Language Augmentation for Multilingual Large Language Models: A Case Study on Korean
par: Choi, ChangSu, et autres
Publié: (2024)
par: Choi, ChangSu, et autres
Publié: (2024)
Expanding Foundational Language Capabilities in Open-Source LLMs through a Korean Case Study
par: Lim, Junghwan, et autres
Publié: (2025)
par: Lim, Junghwan, et autres
Publié: (2025)
GECKO: Generative Language Model for English, Code and Korean
par: Oh, Sungwoo, et autres
Publié: (2024)
par: Oh, Sungwoo, et autres
Publié: (2024)
QWHA: Quantization-Aware Walsh-Hadamard Adaptation for Parameter-Efficient Fine-Tuning on Large Language Models
par: Jeon, Hyesung, et autres
Publié: (2025)
par: Jeon, Hyesung, et autres
Publié: (2025)
Contrastive Perplexity for Controlled Generation: An Application in Detoxifying Large Language Models
par: Klein, Tassilo, et autres
Publié: (2024)
par: Klein, Tassilo, et autres
Publié: (2024)
Building Resource-Constrained Language Agents: A Korean Case Study on Chemical Toxicity Information
par: Cho, Hojun, et autres
Publié: (2025)
par: Cho, Hojun, et autres
Publié: (2025)
Beyond RAG vs. Long-Context: Learning Distraction-Aware Retrieval for Efficient Knowledge Grounding
par: Shim, Seongwoong, et autres
Publié: (2025)
par: Shim, Seongwoong, et autres
Publié: (2025)
Thunder-LLM: Efficiently Adapting LLMs to Korean with Minimal Resources
par: Kim, Jinpyo, et autres
Publié: (2025)
par: Kim, Jinpyo, et autres
Publié: (2025)
Pragmatic Competence Evaluation of Large Language Models for the Korean Language
par: Park, Dojun, et autres
Publié: (2024)
par: Park, Dojun, et autres
Publié: (2024)
AutoRAG: Automated Framework for optimization of Retrieval Augmented Generation Pipeline
par: Kim, Dongkyu, et autres
Publié: (2024)
par: Kim, Dongkyu, et autres
Publié: (2024)
Towards Generalized Offensive Language Identification
par: Dmonte, Alphaeus, et autres
Publié: (2024)
par: Dmonte, Alphaeus, et autres
Publié: (2024)
Safeguarding RAG Pipelines with GMTP: A Gradient-based Masked Token Probability Method for Poisoned Document Detection
par: Kim, San, et autres
Publié: (2025)
par: Kim, San, et autres
Publié: (2025)
Linguistically Informed Graph Model and Semantic Contrastive Learning for Korean Short Text Classification
par: Yoo, JaeGeon, et autres
Publié: (2026)
par: Yoo, JaeGeon, et autres
Publié: (2026)
SAIF: A Comprehensive Framework for Evaluating the Risks of Generative AI in the Public Sector
par: Lee, Kyeongryul, et autres
Publié: (2025)
par: Lee, Kyeongryul, et autres
Publié: (2025)
Documents similaires
-
Obfuscation Rules for Detecting and Detoxifying Korean Toxicity
par: Lee, Yejin, et autres
Publié: (2025) -
Structured Language Generation Model: Loss Calibration and Formatted Decoding for Robust Structure Prediction and Knowledge Retrieval
par: Lee, Minho, et autres
Publié: (2024) -
VPO: Leveraging the Number of Votes in Preference Optimization
par: Cho, Jae Hyeon, et autres
Publié: (2024) -
From Ground Trust to Truth: Disparities in Offensive Language Judgments on Contemporary Korean Political Discourse
par: Yu, Seunguk, et autres
Publié: (2025) -
OffensiveLang: A Community Based Implicit Offensive Language Dataset
par: Das, Amit, et autres
Publié: (2024)