On Optimal Steering to Achieve Exact Fairness
Fuente:
arXiv
Guardado en:
| Autores principales: | Sharma, Mohit, Deshpande, Amit Jayant, Bhattacharyya, Chiranjib, Shah, Rajiv Ratn |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
How Far Can Fairness Constraints Help Recover From Biased Data?
por: Sharma, Mohit, et al.
Publicado: (2023)
por: Sharma, Mohit, et al.
Publicado: (2023)
Cost Efficient Fairness Audit Under Partial Feedback
por: Das, Nirjhar, et al.
Publicado: (2025)
por: Das, Nirjhar, et al.
Publicado: (2025)
Multilingual Non-Factoid Question Answering with Answer Paragraph Selection
por: Mishra, Ritwik, et al.
Publicado: (2024)
por: Mishra, Ritwik, et al.
Publicado: (2024)
Enhancing LLMs for Physics Problem-Solving using Reinforcement Learning with Human-AI Feedback
por: Anand, Avinash, et al.
Publicado: (2024)
por: Anand, Avinash, et al.
Publicado: (2024)
Med-CoDE: Medical Critique based Disagreement Evaluation Framework
por: Gupta, Mohit, et al.
Publicado: (2025)
por: Gupta, Mohit, et al.
Publicado: (2025)
NICE: To Optimize In-Context Examples or Not?
por: Srivastava, Pragya, et al.
Publicado: (2024)
por: Srivastava, Pragya, et al.
Publicado: (2024)
MidSteer: Optimal Affine Framework for Steering Generative Models
por: Gaintseva, Tatiana, et al.
Publicado: (2026)
por: Gaintseva, Tatiana, et al.
Publicado: (2026)
FERI: A Multitask-based Fairness Achieving Algorithm with Applications to Fair Organ Transplantation
por: Li, Can, et al.
Publicado: (2023)
por: Li, Can, et al.
Publicado: (2023)
Achieving Approximate Symmetry Is Exponentially Easier than Exact Symmetry
por: Tahmasebi, Behrooz, et al.
Publicado: (2025)
por: Tahmasebi, Behrooz, et al.
Publicado: (2025)
MLLMEraser: Achieving Test-Time Unlearning in Multimodal Large Language Models through Activation Steering
por: Ding, Chenlu, et al.
Publicado: (2025)
por: Ding, Chenlu, et al.
Publicado: (2025)
RConE: Rough Cone Embedding for Multi-Hop Logical Query Answering on Multi-Modal Knowledge Graphs
por: Kharbanda, Mayank, et al.
Publicado: (2024)
por: Kharbanda, Mayank, et al.
Publicado: (2024)
Multi-Attribute Steering of Language Models via Targeted Intervention
por: Nguyen, Duy, et al.
Publicado: (2025)
por: Nguyen, Duy, et al.
Publicado: (2025)
COLD-Steer: Steering Large Language Models via In-Context One-step Learning Dynamics
por: Sharma, Kartik, et al.
Publicado: (2026)
por: Sharma, Kartik, et al.
Publicado: (2026)
BMFT: Achieving Fairness via Bias-based Weight Masking Fine-tuning
por: Xue, Yuyang, et al.
Publicado: (2024)
por: Xue, Yuyang, et al.
Publicado: (2024)
Actor-Critics Can Achieve Optimal Sample Efficiency
por: Tan, Kevin, et al.
Publicado: (2025)
por: Tan, Kevin, et al.
Publicado: (2025)
GF-Score: Certified Class-Conditional Robustness Evaluation with Fairness Guarantees
por: Shah, Arya, et al.
Publicado: (2026)
por: Shah, Arya, et al.
Publicado: (2026)
Demystifying the Optimal Fair Classifier in Multi-Class Classification
por: Zhang, Li, et al.
Publicado: (2026)
por: Zhang, Li, et al.
Publicado: (2026)
Operationalizing Fairness: Post-Hoc Threshold Optimization Under Hard Resource Limits
por: Singh, Moirangthem Tiken, et al.
Publicado: (2026)
por: Singh, Moirangthem Tiken, et al.
Publicado: (2026)
Programming Refusal with Conditional Activation Steering
por: Lee, Bruce W., et al.
Publicado: (2024)
por: Lee, Bruce W., et al.
Publicado: (2024)
To Steer or Not to Steer? Mechanistic Error Reduction with Abstention for Language Models
por: Hedström, Anna, et al.
Publicado: (2025)
por: Hedström, Anna, et al.
Publicado: (2025)
BarrierSteer: LLM Safety via Learning Barrier Steering
por: Tran, Thanh Q., et al.
Publicado: (2026)
por: Tran, Thanh Q., et al.
Publicado: (2026)
FairPOT: Balancing AUC Performance and Fairness with Proportional Optimal Transport
por: Liu, Pengxi, et al.
Publicado: (2025)
por: Liu, Pengxi, et al.
Publicado: (2025)
Playing Along: Learning a Double-Agent Defender for Belief Steering via Theory of Mind
por: Xiao, Hanqi, et al.
Publicado: (2026)
por: Xiao, Hanqi, et al.
Publicado: (2026)
Representational Alignment Across Model Layers and Brain Regions with Multi-Level Optimal Transport
por: Shah, Shaan, et al.
Publicado: (2025)
por: Shah, Shaan, et al.
Publicado: (2025)
Self-Adaptive Graph Mixture of Models
por: Meena, Mohit, et al.
Publicado: (2025)
por: Meena, Mohit, et al.
Publicado: (2025)
Achieving Fairness in Predictive Process Analytics via Adversarial Learning (Extended Version)
por: de Leoni, Massimiliano, et al.
Publicado: (2024)
por: de Leoni, Massimiliano, et al.
Publicado: (2024)
Adversarial Machine Learning Threats to Spacecraft
por: Thummala, Rajiv, et al.
Publicado: (2024)
por: Thummala, Rajiv, et al.
Publicado: (2024)
Spiritual-LLM : Gita Inspired Mental Health Therapy In the Era of LLMs
por: Kapuriya, Janak, et al.
Publicado: (2025)
por: Kapuriya, Janak, et al.
Publicado: (2025)
Modeling the Data-Generating Process is Necessary for Out-of-Distribution Generalization
por: Kaur, Jivat Neet, et al.
Publicado: (2022)
por: Kaur, Jivat Neet, et al.
Publicado: (2022)
Efficient Embedding-based Synthetic Data Generation for Complex Reasoning Tasks
por: Jayaraman, Srideepika, et al.
Publicado: (2026)
por: Jayaraman, Srideepika, et al.
Publicado: (2026)
Exemplar-condensed Federated Class-incremental Learning
por: Sun, Rui, et al.
Publicado: (2024)
por: Sun, Rui, et al.
Publicado: (2024)
ARDDQN: Attention Recurrent Double Deep Q-Network for UAV Coverage Path Planning and Data Harvesting
por: Kumar, Praveen, et al.
Publicado: (2024)
por: Kumar, Praveen, et al.
Publicado: (2024)
Global Evolutionary Steering: Refining Activation Steering Control via Cross-Layer Consistency
por: Jiang, Xinyan, et al.
Publicado: (2026)
por: Jiang, Xinyan, et al.
Publicado: (2026)
FairACE: Achieving Degree Fairness in Graph Neural Networks via Contrastive and Adversarial Group-Balanced Training
por: Liu, Jiaxin, et al.
Publicado: (2025)
por: Liu, Jiaxin, et al.
Publicado: (2025)
Dynamically Scaled Activation Steering
por: Ferrando, Alex, et al.
Publicado: (2025)
por: Ferrando, Alex, et al.
Publicado: (2025)
First-See-Then-Design: A Multi-Stakeholder View for Optimal Performance-Fairness Trade-Offs
por: Gupta, Kavya, et al.
Publicado: (2026)
por: Gupta, Kavya, et al.
Publicado: (2026)
LangFair: A Python Package for Assessing Bias and Fairness in Large Language Model Use Cases
por: Bouchard, Dylan, et al.
Publicado: (2025)
por: Bouchard, Dylan, et al.
Publicado: (2025)
SAMOSA: Sharpness Aware Minimization for Open Set Active learning
por: Kim, Young In, et al.
Publicado: (2025)
por: Kim, Young In, et al.
Publicado: (2025)
Dataset Distillation-based Hybrid Federated Learning on Non-IID Data
por: Shi, Xiufang, et al.
Publicado: (2024)
por: Shi, Xiufang, et al.
Publicado: (2024)
Activation Steering for Chain-of-Thought Compression
por: Azizi, Seyedarmin, et al.
Publicado: (2025)
por: Azizi, Seyedarmin, et al.
Publicado: (2025)
Ejemplares similares
-
How Far Can Fairness Constraints Help Recover From Biased Data?
por: Sharma, Mohit, et al.
Publicado: (2023) -
Cost Efficient Fairness Audit Under Partial Feedback
por: Das, Nirjhar, et al.
Publicado: (2025) -
Multilingual Non-Factoid Question Answering with Answer Paragraph Selection
por: Mishra, Ritwik, et al.
Publicado: (2024) -
Enhancing LLMs for Physics Problem-Solving using Reinforcement Learning with Human-AI Feedback
por: Anand, Avinash, et al.
Publicado: (2024) -
Med-CoDE: Medical Critique based Disagreement Evaluation Framework
por: Gupta, Mohit, et al.
Publicado: (2025)