KLAAD: Refining Attention Mechanisms to Reduce Societal Bias in Generative Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Kim, Seorin, Lee, Dongyoung, Lee, Jaejin |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SEDD: Scalable and Efficient Dataset Deduplication with GPUs
by: Son, Youngjun, et al.
Published: (2025)
by: Son, Youngjun, et al.
Published: (2025)
Smoothie-Qwen: Post-Hoc Smoothing to Reduce Language Bias in Multilingual LLMs
by: Ji, SeungWon, et al.
Published: (2025)
by: Ji, SeungWon, et al.
Published: (2025)
Models Know Models Best: Evaluation via Model-Preferred Formats
by: Lee, Joonhak, et al.
Published: (2026)
by: Lee, Joonhak, et al.
Published: (2026)
ArchCode: Incorporating Software Requirements in Code Generation with Large Language Models
by: Han, Hojae, et al.
Published: (2024)
by: Han, Hojae, et al.
Published: (2024)
Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models
by: Cho, Gyeongje, et al.
Published: (2025)
by: Cho, Gyeongje, et al.
Published: (2025)
Red-Teaming for Inducing Societal Bias in Large Language Models
by: Luo, Chu Fei, et al.
Published: (2024)
by: Luo, Chu Fei, et al.
Published: (2024)
RefineBench: Evaluating Refinement Capability of Language Models via Checklists
by: Lee, Young-Jun, et al.
Published: (2025)
by: Lee, Young-Jun, et al.
Published: (2025)
Assessing Socio-Cultural Alignment and Technical Safety of Sovereign LLMs
by: Chae, Kyubyung, et al.
Published: (2025)
by: Chae, Kyubyung, et al.
Published: (2025)
Thunder-DeID: Accurate and Efficient De-identification Framework for Korean Court Judgments
by: Hahm, Sungeun, et al.
Published: (2025)
by: Hahm, Sungeun, et al.
Published: (2025)
Reasoning by Commented Code for Table Question Answering
by: Pyo, Seho, et al.
Published: (2026)
by: Pyo, Seho, et al.
Published: (2026)
Spread Preference Annotation: Direct Preference Judgment for Efficient LLM Alignment
by: Kim, Dongyoung, et al.
Published: (2024)
by: Kim, Dongyoung, et al.
Published: (2024)
A Unified Framework and Dataset for Assessing Societal Bias in Vision-Language Models
by: Sathe, Ashutosh, et al.
Published: (2024)
by: Sathe, Ashutosh, et al.
Published: (2024)
Mitigating Attention Localization in Small Scale: Self-Attention Refinement via One-step Belief Propagation
by: Lee, Nakyung, et al.
Published: (2025)
by: Lee, Nakyung, et al.
Published: (2025)
CUE-M: Contextual Understanding and Enhanced Search with Multimodal Large Language Model
by: Go, Dongyoung, et al.
Published: (2024)
by: Go, Dongyoung, et al.
Published: (2024)
Unsupervised Extractive Dialogue Summarization in Hyperdimensional Space
by: Park, Seongmin, et al.
Published: (2024)
by: Park, Seongmin, et al.
Published: (2024)
On The Conceptualization and Societal Impact of Cross-Cultural Bias
by: Bhandari, Vitthal
Published: (2025)
by: Bhandari, Vitthal
Published: (2025)
DuET: Dual Execution for Test Output Prediction with Generated Code and Pseudocode
by: Han, Hojae, et al.
Published: (2026)
by: Han, Hojae, et al.
Published: (2026)
Thunder-KoNUBench: A Corpus-Aligned Benchmark for Korean Negation Understanding
by: Jung, Sungmok, et al.
Published: (2026)
by: Jung, Sungmok, et al.
Published: (2026)
Instructive Decoding: Instruction-Tuned Large Language Models are Self-Refiner from Noisy Instructions
by: Kim, Taehyeon, et al.
Published: (2023)
by: Kim, Taehyeon, et al.
Published: (2023)
Choices Speak Louder than Questions
by: Cho, Gyeongje, et al.
Published: (2025)
by: Cho, Gyeongje, et al.
Published: (2025)
Thunder-NUBench: A Benchmark for LLMs' Sentence-Level Negation Understanding
by: So, Yeonkyoung, et al.
Published: (2025)
by: So, Yeonkyoung, et al.
Published: (2025)
Bias Attribution in Filipino Language Models: Extending a Bias Interpretability Metric for Application on Agglutinative Languages
by: Gamboa, Lance Calvin Lim, et al.
Published: (2025)
by: Gamboa, Lance Calvin Lim, et al.
Published: (2025)
PERC: Plan-As-Query Example Retrieval for Underrepresented Code Generation
by: Yoo, Jaeseok, et al.
Published: (2024)
by: Yoo, Jaeseok, et al.
Published: (2024)
Guard Vector: Beyond English LLM Guardrails with Task-Vector Composition and Streaming-Aware Prefix SFT
by: Lee, Wonhyuk, et al.
Published: (2025)
by: Lee, Wonhyuk, et al.
Published: (2025)
Detecting Bias in Large Language Models: Fine-tuned KcBERT
by: Lee, J. K., et al.
Published: (2024)
by: Lee, J. K., et al.
Published: (2024)
Social Bias in Multilingual Language Models: A Survey
by: Gamboa, Lance Calvin Lim, et al.
Published: (2025)
by: Gamboa, Lance Calvin Lim, et al.
Published: (2025)
Learning to Reduce: Optimal Representations of Structured Data in Prompting Large Language Models
by: Lee, Younghun, et al.
Published: (2024)
by: Lee, Younghun, et al.
Published: (2024)
Learning to Reduce: Towards Improving Performance of Large Language Models on Structured Data
by: Lee, Younghun, et al.
Published: (2024)
by: Lee, Younghun, et al.
Published: (2024)
Bias A-head? Analyzing Bias in Transformer-Based Language Model Attention Heads
by: Yang, Yi, et al.
Published: (2023)
by: Yang, Yi, et al.
Published: (2023)
Robust Bias Evaluation with FilBBQ: A Filipino Bias Benchmark for Question-Answering Language Models
by: Gamboa, Lance Calvin Lim, et al.
Published: (2026)
by: Gamboa, Lance Calvin Lim, et al.
Published: (2026)
Interpreting Bias in Large Language Models: A Feature-Based Approach
by: Prakash, Nirmalendu, et al.
Published: (2024)
by: Prakash, Nirmalendu, et al.
Published: (2024)
Structured Language Generation Model: Loss Calibration and Formatted Decoding for Robust Structure Prediction and Knowledge Retrieval
by: Lee, Minho, et al.
Published: (2024)
by: Lee, Minho, et al.
Published: (2024)
Small Language Models are Equation Reasoners
by: Kim, Bumjun, et al.
Published: (2024)
by: Kim, Bumjun, et al.
Published: (2024)
Large Language Models as Search Engines: Societal Challenges
by: Sadeddine, Zacchary, et al.
Published: (2025)
by: Sadeddine, Zacchary, et al.
Published: (2025)
Refining Time Series Anomaly Detectors using Large Language Models
by: Yang, Alan, et al.
Published: (2025)
by: Yang, Alan, et al.
Published: (2025)
SeDi-Instruct: Enhancing Alignment of Language Models through Self-Directed Instruction Generation
by: Kim, Jungwoo, et al.
Published: (2025)
by: Kim, Jungwoo, et al.
Published: (2025)
Thunder-LLM: Efficiently Adapting LLMs to Korean with Minimal Resources
by: Kim, Jinpyo, et al.
Published: (2025)
by: Kim, Jinpyo, et al.
Published: (2025)
Correcting Negative Bias in Large Language Models through Negative Attention Score Alignment
by: Yu, Sangwon, et al.
Published: (2024)
by: Yu, Sangwon, et al.
Published: (2024)
Deontological Keyword Bias: The Impact of Modal Expressions on Normative Judgments of Language Models
by: Park, Bumjin, et al.
Published: (2025)
by: Park, Bumjin, et al.
Published: (2025)
Selective Generation for Controllable Language Models
by: Lee, Minjae, et al.
Published: (2023)
by: Lee, Minjae, et al.
Published: (2023)
Similar Items
-
SEDD: Scalable and Efficient Dataset Deduplication with GPUs
by: Son, Youngjun, et al.
Published: (2025) -
Smoothie-Qwen: Post-Hoc Smoothing to Reduce Language Bias in Multilingual LLMs
by: Ji, SeungWon, et al.
Published: (2025) -
Models Know Models Best: Evaluation via Model-Preferred Formats
by: Lee, Joonhak, et al.
Published: (2026) -
ArchCode: Incorporating Software Requirements in Code Generation with Large Language Models
by: Han, Hojae, et al.
Published: (2024) -
Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models
by: Cho, Gyeongje, et al.
Published: (2025)