DAPI: Domain Adaptive Toxicity Probe Vector Intervention for Fine-Grained Detoxification
Fuente:
arXiv
Salvato in:
| Autori principali: | Hyeonsu, Cho, Kim, Dooyoung, Ko, Youngjoong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ECO Decoding: Entropy-Based Control for Controllability and Fluency in Controllable Dialogue Generation
di: Shin, Seungmin, et al.
Pubblicazione: (2025)
di: Shin, Seungmin, et al.
Pubblicazione: (2025)
ylmmcl at Multilingual Text Detoxification 2025: Lexicon-Guided Detoxification and Classifier-Gated Rewriting
di: Lai-Lopez, Nicole, et al.
Pubblicazione: (2025)
di: Lai-Lopez, Nicole, et al.
Pubblicazione: (2025)
Dependency Parsing with the Structuralized Prompt Template
di: Kim, Keunha, et al.
Pubblicazione: (2025)
di: Kim, Keunha, et al.
Pubblicazione: (2025)
Adaptive Task Vectors for Large Language Models
di: Kang, Joonseong, et al.
Pubblicazione: (2025)
di: Kang, Joonseong, et al.
Pubblicazione: (2025)
DetoxLLM: A Framework for Detoxification with Explanations
di: Khondaker, Md Tawkat Islam, et al.
Pubblicazione: (2024)
di: Khondaker, Md Tawkat Islam, et al.
Pubblicazione: (2024)
UniDetox: Universal Detoxification of Large Language Models via Dataset Distillation
di: Lu, Huimin, et al.
Pubblicazione: (2025)
di: Lu, Huimin, et al.
Pubblicazione: (2025)
SS-MPC: A Sequence-Structured Multi-Party Conversation System
di: Jang, Yoonjin, et al.
Pubblicazione: (2025)
di: Jang, Yoonjin, et al.
Pubblicazione: (2025)
ixi-GEN: Efficient Industrial sLLMs through Domain Adaptive Continual Pretraining
di: Kim, Seonwu, et al.
Pubblicazione: (2025)
di: Kim, Seonwu, et al.
Pubblicazione: (2025)
Test-Time Detoxification without Training or Learning Anything
di: Saglam, Baturay, et al.
Pubblicazione: (2026)
di: Saglam, Baturay, et al.
Pubblicazione: (2026)
Relational Knowledge Distillation Using Fine-tuned Function Vectors
di: Kang, Andrea, et al.
Pubblicazione: (2026)
di: Kang, Andrea, et al.
Pubblicazione: (2026)
Beyond Steering Vector: Flow-based Activation Steering for Inference-Time Intervention
di: Jin, Zehao, et al.
Pubblicazione: (2026)
di: Jin, Zehao, et al.
Pubblicazione: (2026)
How Reliable are Causal Probing Interventions?
di: Canby, Marc, et al.
Pubblicazione: (2024)
di: Canby, Marc, et al.
Pubblicazione: (2024)
Beyond Independent Passages: Adaptive Passage Combination Retrieval for Retrieval Augmented Open-Domain Question Answering
di: Ko, Ting-Wen, et al.
Pubblicazione: (2025)
di: Ko, Ting-Wen, et al.
Pubblicazione: (2025)
Revisiting Adaptive Rounding with Vectorized Reparameterization for LLM Quantization
di: Zhou, Yuli, et al.
Pubblicazione: (2026)
di: Zhou, Yuli, et al.
Pubblicazione: (2026)
Text Detoxification: Data Efficiency, Semantic Preservation and Model Generalization
di: Yu, Jing, et al.
Pubblicazione: (2025)
di: Yu, Jing, et al.
Pubblicazione: (2025)
Prometheus: Inducing Fine-grained Evaluation Capability in Language Models
di: Kim, Seungone, et al.
Pubblicazione: (2023)
di: Kim, Seungone, et al.
Pubblicazione: (2023)
Decoding Dense Embeddings: Sparse Autoencoders for Interpreting and Discretizing Dense Retrieval
di: Park, Seongwan, et al.
Pubblicazione: (2025)
di: Park, Seongwan, et al.
Pubblicazione: (2025)
QEFT: Quantization for Efficient Fine-Tuning of LLMs
di: Lee, Changhun, et al.
Pubblicazione: (2024)
di: Lee, Changhun, et al.
Pubblicazione: (2024)
Parameter-Efficient Fine-Tuning of LLaMA for the Clinical Domain
di: Gema, Aryo Pradipta, et al.
Pubblicazione: (2023)
di: Gema, Aryo Pradipta, et al.
Pubblicazione: (2023)
Instruction Fine-Tuning: Does Prompt Loss Matter?
di: Huerta-Enochian, Mathew, et al.
Pubblicazione: (2024)
di: Huerta-Enochian, Mathew, et al.
Pubblicazione: (2024)
On the Loss of Context-awareness in General Instruction Fine-tuning
di: Wang, Yihan, et al.
Pubblicazione: (2024)
di: Wang, Yihan, et al.
Pubblicazione: (2024)
Domain-Adaptive Pre-Training for Arabic Aspect-Based Sentiment Analysis: A Comparative Study of Domain Adaptation and Fine-Tuning Strategies
di: Alyami, Salha, et al.
Pubblicazione: (2025)
di: Alyami, Salha, et al.
Pubblicazione: (2025)
SVFT: Parameter-Efficient Fine-Tuning with Singular Vectors
di: Lingam, Vijay, et al.
Pubblicazione: (2024)
di: Lingam, Vijay, et al.
Pubblicazione: (2024)
CHAMP: A Competition-level Dataset for Fine-Grained Analyses of LLMs' Mathematical Reasoning Capabilities
di: Mao, Yujun, et al.
Pubblicazione: (2024)
di: Mao, Yujun, et al.
Pubblicazione: (2024)
RAVEN++: Pinpointing Fine-Grained Violations in Advertisement Videos with Active Reinforcement Reasoning
di: Ji, Deyi, et al.
Pubblicazione: (2025)
di: Ji, Deyi, et al.
Pubblicazione: (2025)
Fine-tuning Large Language Models for Domain-specific Machine Translation
di: Zheng, Jiawei, et al.
Pubblicazione: (2024)
di: Zheng, Jiawei, et al.
Pubblicazione: (2024)
Outcome-Grounded Advantage Reshaping for Fine-Grained Credit Assignment in Mathematical Reasoning
di: Li, Ziheng, et al.
Pubblicazione: (2026)
di: Li, Ziheng, et al.
Pubblicazione: (2026)
Revealing Fine-Grained Values and Opinions in Large Language Models
di: Wright, Dustin, et al.
Pubblicazione: (2024)
di: Wright, Dustin, et al.
Pubblicazione: (2024)
Can We Use Probing to Better Understand Fine-tuning and Knowledge Distillation of the BERT NLU?
di: Hościłowicz, Jakub, et al.
Pubblicazione: (2023)
di: Hościłowicz, Jakub, et al.
Pubblicazione: (2023)
MEUV: Achieving Fine-Grained Capability Activation in Large Language Models via Mutually Exclusive Unlock Vectors
di: Tong, Xin, et al.
Pubblicazione: (2025)
di: Tong, Xin, et al.
Pubblicazione: (2025)
Hyperdimensional Probe: Decoding LLM Representations via Vector Symbolic Architectures
di: Bronzini, Marco, et al.
Pubblicazione: (2025)
di: Bronzini, Marco, et al.
Pubblicazione: (2025)
Fine-Grained Modeling of Narrative Context: A Coherence Perspective via Retrospective Questions
di: Xu, Liyan, et al.
Pubblicazione: (2024)
di: Xu, Liyan, et al.
Pubblicazione: (2024)
On the Utility of Domain-Adjacent Fine-Tuned Model Ensembles for Few-shot Problems
di: Alam, Md Ibrahim Ibne, et al.
Pubblicazione: (2024)
di: Alam, Md Ibrahim Ibne, et al.
Pubblicazione: (2024)
Scaling Laws for Fine-Grained Mixture of Experts
di: Krajewski, Jakub, et al.
Pubblicazione: (2024)
di: Krajewski, Jakub, et al.
Pubblicazione: (2024)
Domain-Adaptive Continued Pre-Training of Small Language Models
di: Faroz, Salman
Pubblicazione: (2025)
di: Faroz, Salman
Pubblicazione: (2025)
XMoE: Sparse Models with Fine-grained and Adaptive Expert Selection
di: Yang, Yuanhang, et al.
Pubblicazione: (2024)
di: Yang, Yuanhang, et al.
Pubblicazione: (2024)
DiaTool-DPO: Multi-Turn Direct Preference Optimization for Tool-Augmented Large Language Models
di: Jung, Sunghee, et al.
Pubblicazione: (2025)
di: Jung, Sunghee, et al.
Pubblicazione: (2025)
Attention Illuminates LLM Reasoning: The Preplan-and-Anchor Rhythm Enables Fine-Grained Policy Optimization
di: Li, Yang, et al.
Pubblicazione: (2025)
di: Li, Yang, et al.
Pubblicazione: (2025)
HELEA: Hard-Negative Benchmark and LLM-based Reranking for Robust Entity Alignment
di: Jang, Yoonjin, et al.
Pubblicazione: (2026)
di: Jang, Yoonjin, et al.
Pubblicazione: (2026)
Domain-Adaptive Small Language Models for Structured Tax Code Prediction
di: Nath, Souvik, et al.
Pubblicazione: (2025)
di: Nath, Souvik, et al.
Pubblicazione: (2025)
Documenti analoghi
-
ECO Decoding: Entropy-Based Control for Controllability and Fluency in Controllable Dialogue Generation
di: Shin, Seungmin, et al.
Pubblicazione: (2025) -
ylmmcl at Multilingual Text Detoxification 2025: Lexicon-Guided Detoxification and Classifier-Gated Rewriting
di: Lai-Lopez, Nicole, et al.
Pubblicazione: (2025) -
Dependency Parsing with the Structuralized Prompt Template
di: Kim, Keunha, et al.
Pubblicazione: (2025) -
Adaptive Task Vectors for Large Language Models
di: Kang, Joonseong, et al.
Pubblicazione: (2025) -
DetoxLLM: A Framework for Detoxification with Explanations
di: Khondaker, Md Tawkat Islam, et al.
Pubblicazione: (2024)