MPF: Aligning and Debiasing Language Models post Deployment via Multi Perspective Fusion
Fuente:
arXiv
Guardado en:
| Autores principales: | Guan, Xin, Lin, PeiHsin, Wu, Zekun, Wang, Ze, Zhang, Ruibo, Kazim, Emre, Koshiyama, Adriano |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Assessing Bias in Metric Models for LLM Open-Ended Generation Bias Benchmarks
por: Demchak, Nathaniel, et al.
Publicado: (2024)
por: Demchak, Nathaniel, et al.
Publicado: (2024)
HEARTS: A Holistic Framework for Explainable, Sustainable and Robust Text Stereotype Detection
por: King, Theo, et al.
Publicado: (2024)
por: King, Theo, et al.
Publicado: (2024)
SAGED: A Holistic Bias-Benchmarking Pipeline for Language Models with Customisable Fairness Calibration
por: Guan, Xin, et al.
Publicado: (2024)
por: Guan, Xin, et al.
Publicado: (2024)
From Text to Emoji: How PEFT-Driven Personality Manipulation Unleashes the Emoji Potential in LLMs
por: Jain, Navya, et al.
Publicado: (2024)
por: Jain, Navya, et al.
Publicado: (2024)
LibVulnWatch: A Deep Assessment Agent System and Leaderboard for Uncovering Hidden Vulnerabilities in Open-Source AI Libraries
por: Wu, Zekun, et al.
Publicado: (2025)
por: Wu, Zekun, et al.
Publicado: (2025)
THaMES: An End-to-End Tool for Hallucination Mitigation and Evaluation in Large Language Models
por: Liang, Mengfei, et al.
Publicado: (2024)
por: Liang, Mengfei, et al.
Publicado: (2024)
Knowledge Collapse in LLMs: When Fluency Survives but Facts Fail under Recursive Synthetic Training
por: Keisha, Figarri, et al.
Publicado: (2025)
por: Keisha, Figarri, et al.
Publicado: (2025)
CorrSteer: Generation-Time LLM Steering via Correlated Sparse Autoencoder Features
por: Cho, Seonglae, et al.
Publicado: (2025)
por: Cho, Seonglae, et al.
Publicado: (2025)
Control Reinforcement Learning: Interpretable Token-Level Steering of LLMs via Sparse Autoencoder Features
por: Cho, Seonglae, et al.
Publicado: (2026)
por: Cho, Seonglae, et al.
Publicado: (2026)
Eliciting Personality Traits in Large Language Models
por: Hilliard, Airlie, et al.
Publicado: (2024)
por: Hilliard, Airlie, et al.
Publicado: (2024)
Personality as a Probe for LLM Evaluation: Method Trade-offs and Downstream Effects
por: Handa, Gunmay, et al.
Publicado: (2025)
por: Handa, Gunmay, et al.
Publicado: (2025)
The Confidence Manifold: Geometric Structure of Correctness Representations in Language Models
por: Cho, Seonglae, et al.
Publicado: (2026)
por: Cho, Seonglae, et al.
Publicado: (2026)
JobFair: A Framework for Benchmarking Gender Hiring Bias in Large Language Models
por: Wang, Ze, et al.
Publicado: (2024)
por: Wang, Ze, et al.
Publicado: (2024)
Tool Calling is Linearly Readable and Steerable in Language Models
por: Wu, Zekun, et al.
Publicado: (2026)
por: Wu, Zekun, et al.
Publicado: (2026)
Stereotype Detection in LLMs: A Multiclass, Explainable, and Benchmark-Driven Approach
por: Wu, Zekun, et al.
Publicado: (2024)
por: Wu, Zekun, et al.
Publicado: (2024)
Mind the Gap: Evaluating Model- and Agentic-Level Vulnerabilities in LLMs with Action Graphs
por: Wicaksono, Ilham, et al.
Publicado: (2025)
por: Wicaksono, Ilham, et al.
Publicado: (2025)
Bias Amplification: Large Language Models as Increasingly Biased Media
por: Wang, Ze, et al.
Publicado: (2024)
por: Wang, Ze, et al.
Publicado: (2024)
Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing
por: Tran, Thien Q., et al.
Publicado: (2025)
por: Tran, Thien Q., et al.
Publicado: (2025)
General Phrase Debiaser: Debiasing Masked Language Models at a Multi-Token Level
por: Shi, Bingkang, et al.
Publicado: (2023)
por: Shi, Bingkang, et al.
Publicado: (2023)
Large Language Model-Based Knowledge Graph System Construction for Sustainable Development Goals: An AI-Based Speculative Design Perspective
por: Lin, Yi-De, et al.
Publicado: (2025)
por: Lin, Yi-De, et al.
Publicado: (2025)
Enhancing Multilingual RAG Systems with Debiased Language Preference-Guided Query Fusion
por: Park, Jeonghyun, et al.
Publicado: (2026)
por: Park, Jeonghyun, et al.
Publicado: (2026)
NormCode: A Semi-Formal Language for Auditable AI Planning
por: Guan, Xin, et al.
Publicado: (2025)
por: Guan, Xin, et al.
Publicado: (2025)
Social Debiasing for Fair Multi-modal LLMs
por: Cheng, Harry, et al.
Publicado: (2024)
por: Cheng, Harry, et al.
Publicado: (2024)
Latent Preference Coding: Aligning Large Language Models via Discrete Latent Codes
por: Gong, Zhuocheng, et al.
Publicado: (2025)
por: Gong, Zhuocheng, et al.
Publicado: (2025)
HyPA-RAG: A Hybrid Parameter Adaptive Retrieval-Augmented Generation System for AI Legal and Policy Applications
por: Kalra, Rishi, et al.
Publicado: (2024)
por: Kalra, Rishi, et al.
Publicado: (2024)
BiasEdit: Debiasing Stereotyped Language Models via Model Editing
por: Xu, Xin, et al.
Publicado: (2025)
por: Xu, Xin, et al.
Publicado: (2025)
Teacher-Student Training for Debiasing: General Permutation Debiasing for Large Language Models
por: Liusie, Adian, et al.
Publicado: (2024)
por: Liusie, Adian, et al.
Publicado: (2024)
Rethinking Prompt-based Debiasing in Large Language Models
por: Yang, Xinyi, et al.
Publicado: (2025)
por: Yang, Xinyi, et al.
Publicado: (2025)
Collaborative Distillation Strategies for Parameter-Efficient Language Model Deployment
por: Meng, Xiandong, et al.
Publicado: (2025)
por: Meng, Xiandong, et al.
Publicado: (2025)
Efficient Low-Resource Language Adaptation via Multi-Source Dynamic Logit Fusion
por: Zhang, Chen, et al.
Publicado: (2026)
por: Zhang, Chen, et al.
Publicado: (2026)
Deploying Multi-task Online Server with Large Language Model
por: Qu, Yincen, et al.
Publicado: (2024)
por: Qu, Yincen, et al.
Publicado: (2024)
LLM4Rec: Large Language Models for Multimodal Generative Recommendation with Causal Debiasing
por: Ma, Bo, et al.
Publicado: (2025)
por: Ma, Bo, et al.
Publicado: (2025)
Beyond Spurious Signals: Debiasing Multimodal Large Language Models via Counterfactual Inference and Adaptive Expert Routing
por: Wu, Zichen, et al.
Publicado: (2025)
por: Wu, Zichen, et al.
Publicado: (2025)
Empathy by Design: Aligning Large Language Models for Healthcare Dialogue
por: Umucu, Emre, et al.
Publicado: (2025)
por: Umucu, Emre, et al.
Publicado: (2025)
HateDebias: On the Diversity and Variability of Hate Speech Debiasing
por: Wu, Hongyan, et al.
Publicado: (2024)
por: Wu, Hongyan, et al.
Publicado: (2024)
NormCode Canvas: Making LLM Agentic Workflows Development Sustainable via Case-Based Reasoning
por: Guan, Xin, et al.
Publicado: (2026)
por: Guan, Xin, et al.
Publicado: (2026)
MathFusion: Enhancing Mathematical Problem-solving of LLM through Instruction Fusion
por: Pei, Qizhi, et al.
Publicado: (2025)
por: Pei, Qizhi, et al.
Publicado: (2025)
LayAlign: Enhancing Multilingual Reasoning in Large Language Models via Layer-Wise Adaptive Fusion and Alignment Strategy
por: Ruan, Zhiwen, et al.
Publicado: (2025)
por: Ruan, Zhiwen, et al.
Publicado: (2025)
Mitigating Distribution Sharpening in Math RLVR via Distribution-Aligned Hint Synthesis and Backward Hint Annealing
por: Xie, Pei-Xi, et al.
Publicado: (2026)
por: Xie, Pei-Xi, et al.
Publicado: (2026)
Aligning Large Language Models via Fully Self-Synthetic Data
por: Yin, Shangjian, et al.
Publicado: (2025)
por: Yin, Shangjian, et al.
Publicado: (2025)
Ejemplares similares
-
Assessing Bias in Metric Models for LLM Open-Ended Generation Bias Benchmarks
por: Demchak, Nathaniel, et al.
Publicado: (2024) -
HEARTS: A Holistic Framework for Explainable, Sustainable and Robust Text Stereotype Detection
por: King, Theo, et al.
Publicado: (2024) -
SAGED: A Holistic Bias-Benchmarking Pipeline for Language Models with Customisable Fairness Calibration
por: Guan, Xin, et al.
Publicado: (2024) -
From Text to Emoji: How PEFT-Driven Personality Manipulation Unleashes the Emoji Potential in LLMs
por: Jain, Navya, et al.
Publicado: (2024) -
LibVulnWatch: A Deep Assessment Agent System and Leaderboard for Uncovering Hidden Vulnerabilities in Open-Source AI Libraries
por: Wu, Zekun, et al.
Publicado: (2025)